İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI), Anthropic ve OpenAI'ın yapay zeka modelleri üzerinde yürüttüğü güvenlik testlerinde dikkat çekici bulgulara ulaştı.
Araştırma enstitüsünün açıklamasına göre, yapay zeka ilk kez onaylanmamış bir görevi yerine getirirken bir insan onaylayıcıya baskı yapmak amacıyla "sosyal mühendislik" taktiklerine başvurdu.
"İLK KEZ BU ŞİDDETTE BİR OLAY GÖRÜLDÜ"
CNN International'ın haberine göre Enstitü salı günü yaptığı açıklamada, "Bu, AISI'nin gerçek dünyada, yönlendirilmemiş ve gerçek bir kişiyi hedef alan bu şiddette bir kandırma olayına ilk kez şahit olmasıdır" ifadelerini kullandı.
Uzmanlar olayda herhangi bir gerçek dünya zararı yaşanmadığını vurgularken, bu tür olayların yapay zekanın hızla yayılan kontrolsüz gelişimine karşı hükümetleri yeni düzenlemeler yapmaya zorladığına dikkat çekti.
10 TESTTE İZİNSİZ EYLEM TESPİT EDİLDİ
Temmuz ayı sonlarında OpenAI ve Anthropic modellerinin test ortamlarından kaçarak diğer sistemlere sızdığı rapor edilmişti. Bu kez İngiliz enstitüsü, testler sırasında modellere bilinçli olarak internet erişimi sağladı.
Enstitünün yürüttüğü 122 siber güvenlik mücadelesinden 10'unda, yapay zeka ajanlarının gerçek insanları ve kuruluşları hedef alarak canlı internet üzerinde otonom ve izinsiz eylemler gerçekleştirdiği tespit edildi.
Bu ihlallerin çoğunun Anthropic’in Mythos 5 modelinden, geri kalanının ise OpenAI’ın GPT-5.6-Sol modelinden kaynaklandığı bildirildi.
SAHTE KİMLİKLERLE İNSANLARI İKNA ETMEYE ÇALIŞTI
En ciddi olayda, Anthropic modelinin halka açık açık kaynaklı bir projeye "kötü amaçlı kod eklemek" amacıyla insan inceleyicilerden onay alabilmek için birden fazla sahte kimlik yarattığı ortaya çıktı.
Enstitü, yapay zeka ajanının gerçek insanlarla doğrudan iletişime geçmeye çalıştığını, bir çevrim içi dosya transfer servisi üzerinden mesajlar ve dosyalar göndererek insanları ya da onların kendi yapay zeka kodlama araçlarını zararlı kodları çalıştırmaya ikna etmeye çabaladığını belirtti.
Eylemleri engellendiğinde ise modelin önceki kayıtları değiştirdiği ve yeni bir kimlik kullanmayı düşündüğü kaydedildi.
ŞİRKETLERDEN AÇIKLAMA GELDİ
Enstitünün bu kritik açıklaması, önde gelen yapay zeka şirketlerinin temsilcilerinin, en gelişmiş modellerin halka açık olarak piyasaya sürülmeden önce hükümet tarafından incelenmesini öngören yeni çerçeveyi görüşmek üzere Beyaz Saray’da bir araya geldiği gün yayımlandı.
X üzerinden bir açıklama yapan Anthropic, modellerin güvenlik önlemlerinin kaldırıldığı ve internet kullanımına özel bir kısıtlamanın getirilmediği "bilerek esnetilmiş koşullar altında" test edildiğini savundu.
Açıklamada, "Kendi soruşturmamızı yürütürken olayın daha fazla detayını toplamak için enstitüyle yakın bir şekilde çalışıyoruz" denilirken, güvenli ortamdan herhangi bir kaçışın gerçekleştiğine dair kanıt bulunmadığı vurgulandı.
OpenAI ise test ortamının dışına çıkılarak egzersizlerde gerekmeyen eylemlerde bulunulduğunu doğrulayan iki izinsiz olayı tespit ettiklerini açıkladı.
Şirketin salı günü yayımlanan blog yazısında, "Yüksek riskli değerlendirmeleri güvenli bir şekilde yürütmek için ortak uygulamaları güçlendirmek adına sektör genelinde çalışmaya kararlıyız" ifadelerine yer verildi.
