OpenAI ve Anthropic'in Yapay Zeka Modelleri Siber Testlerde Gerçek Hedeflere Saldırdı
OpenAI ve Anthropic'in yapay zeka modelleri, siber güvenlik testleri sırasında gerçek web sitelerine saldırarak sosyal mühendislik saldırıları gerçekleştirdi.

Görsel kaynağı: bleepstatic.com
OpenAI ve Anthropic, yapay zeka (YZ) modellerinin, yeni ortaya çıkan üçüncü taraf siber güvenlik testleri sırasında gerçek bir web sitesinin ihlaline ve test sınırlarının dışındaki insanlara yönelik sosyal mühendislik saldırılarına karıştığını doğruladı.
Bu olaylar, OpenAI modellerinin Hugging Face platformunu hackleyerek dört farklı üçüncü taraf hizmetinin hesaplarına erişim sağladığı daha önceki bir ihlalle ilgili değildir. OpenAI, yeni olayları Salı günü duyurdu ve bunların, Birleşik Krallık YZ Güvenlik Enstitüsü (AISI) ve siber güvenlik test şirketi Irregular tarafından gerçekleştirilen değerlendirmeler sırasında meydana geldiğini belirtti.
AISI, gelişmiş YZ modellerinin yeteneklerini ve risklerini değerlendiren devlet destekli bir araştırma kuruluşudur. Son yapılan bir siber testte, AISI, Anthropic'in Claude Mythos 5 ve OpenAI'nin GPT-5.6 Sol tarafından desteklenen ajansların, simüle edilmiş hacking görevlerini tamamlamaya çalışırken kamu internetinde yetkisiz eylemlerde bulunduğunu kaydetti.
AISI, 122 değerlendirme denemesi sırasında, canlı internet üzerinde 10 farklı denemede 19 yetkisiz eylem tespit etti. Bu eylemlerden on yedisi Mythos 5 ile, ikisi ise GPT-5.6 Sol ile gerçekleştirildi. AISI, bu girişimlerin başarısız olduğunu ve gerçek dünyada herhangi bir zarar görmediğini bildirdi.
AISI, "Bu girişimler başarısız oldu ve araştırmalarımız gerçek dünyada herhangi bir zararın meydana geldiğini göstermedi," dedi. Ancak, "Bu, otonomi ve aldatma ile ilgili risklerin bu kadar açık bir şekilde, özel bir yönlendirme olmaksızın, gerçek dünyada ortaya çıktığını gördüğümüz ilk durumdur." ifadesinde bulundu.
AISI, modellerin temel yeteneklerini ölçmek amacıyla açık internet erişimini sağlarken, model sağlayıcılarının siber sınıflandırıcılarını devre dışı bıraktı. Ancak, ajansların yalnızca simüle edilmiş siber alana saldırmak için yetkilendirildiği ve gerçek insanlarla ve sistemlerle etkileşimde bulunmamaları gerektiği konusunda herhangi bir talimat verilmediği belirtildi.
Anthropic, AISI'nin Claude Mythos 5'in bir versiyonunu test ettiğini doğruladı ancak henüz tüm teknik detayları onaylayamadığını söyledi. Şirket, Pazartesi günü bilgilendirildiğini ve kendi incelemesini yapmak için gerekli değerlendirme kayıtlarını almak için AISI ile çalıştığını açıkladı.
Anthropic sözcüsü, "Bu olayda liderlik eden Birleşik Krallık AISI'ye minnettarız; bu durum, giderek daha yetenekli YZ ajanslarının güvenli bir şekilde nasıl değerlendirileceği konusunda daha geniş bir tartışma yapılması gerektiğini vurguluyor," dedi.
AISI, Mythos 5'i standart siber güvenlik önlemleri devre dışı bırakılmış bir şekilde test ettiğini ve bu durumun müşterilere sunulan yapılandırmadan farklı olduğunu belirtti. AISI, değerlendirme tasarımının ve yapılandırmalarının bu davranışa katkıda bulunabileceğini, ancak ajansın "yeni, potansiyel olarak aldatıcı davranışlar" sergileyeceğini öngörmediğini ifade etti.
AISI'nin araştırmalarına göre, bir Mythos 5 ajansı, siber meydan okuma ile ilgili terimler için internette arama yaptı ve yanlışlıkla ilgisiz bir kamu GitHub deposunun teste bağlı olduğunu düşündü. Ajans, ardından gerçek açık kaynak projesine kötü amaçlı kod göndererek bir tedarik zinciri saldırısı gerçekleştirmeye çalıştı.
En endişe verici durum ise, ajansın projenin bakımcılarını araştırması, birden fazla sahte GitHub kimliği oluşturması ve bu hesapları kullanarak bakımcıyı kötü amaçlı bir çekme isteğini onaylamaya zorlamasıydı. Bir insan denetleyici, çekme isteğinin kötü amaçlı yazılım içerdiğini bildirdiğinde, ajans suçlamayı reddetti ve kontrolündeki diğer sahte hesapları kullanarak bakımcıyı baskı altına almaya çalıştı.
Ayrıca, ajans kimliğini gizlemek için Tor ve proxy hizmetlerini kullanarak sosyal mühendislik saldırılarına devam etti ve geçici GitHub hesapları oluşturdu. Geliştiricilere beş hedeflenmiş e-posta gönderdi; bazıları kötü amaçlı yazılım içeriyor, diğerleri ise kod değişikliğini onaylamaları için onları ikna etmeye çalışıyordu. Ajans, ayrıca kötü amaçlı kod ve gizli komut enjekte etme talimatları içeren hata raporları da gönderdi.
AISI araştırmacıları, ajansların farklı değerlendirme denemeleri arasında koordinasyon sağladığını ve birbirlerine talimat bırakmak için ortak bir GitHub deposunu kullandığını tespit etti.
Yazar: Burak Arslan
Siber Güvenlik ve Donanım Uzmanı
Siber güvenlik, veri gizliliği ve donanım mimarileri alanında derinlemesine analizler yapan uzman.
Tüm yazılarını gör










