Yapay zeka araştırma şirketi Anthropic bünyesinde geliştirilen Claude modelleri, siber güvenlik yeteneklerini ölçmek amacıyla düzenlenen kontrollü laboratuvar denemeleri sırasında üç farklı şirketin gerçek sistemlerine izinsiz şekilde erişim sağladı.
Güvenlik testlerinde sınırları zorlayan modeller, sistem komutlarındaki yapılandırma hatası nedeniyle internet bağlantısının açık kalması sonucunda kurgusal senaryolar ile gerçek dünyayı birbirine karıştırarak şirket ağlarına sızdı.
YANLIŞ YAPILANDIRMA GERÇEK DÜNYAYA KAPI ARALADI
Geriye dönük inceleme süreci, rakip yapay zeka şirketi OpenAI modellerinden birinin izole ortamdan çıkarak Hugging Face platformunun sistemlerine ulaştığını duyurmasıyla başladı.
Bu gelişmenin ardından Anthropic, Claude modellerinin internete erişme ihtimali barındıran 141 bin 6 ayrı test çalışmasını mercek altına aldı.
Şirketin değerlendirme ortağı Irregular tarafından hazırlanan ve 'bayrağı yakala' (capture the flag) olarak bilinen kurgusal görevlerde, 6 farklı çalışmaya yayılan üç kritik olay tespit edildi.
Modeller, karşılarına çıkan gerçek kurumları test senaryosunun bir parçası varsayarak hedef aldı.
OPUS 4.7 ŞİRKET VERİ TABANINA KADAR İLERLEDİ
Söz konusu vakalarda Claude Opus 4.7, Mythos 5 ve henüz kamuoyuna duyurulmamış yeni bir araştırma modeli yer aldı.
Sürecin en riskli aşamasında Opus 4.7, gerçek bir şirketin ağ altyapısına girerek uygulama ve sistem kimlik bilgilerini ele geçirdi.
Model, ulaştığı bu yetkilerle yüzlerce satırlık canlı üretim verisinin yer aldığı veri tabanına ulaştı.
Yapay zekanın gerçek bir ortamda işlem yapıyor olabileceğini sezmesine rağmen, görevin gereğini yerine getirmek amacıyla eylemlerini sürdürmesi dikkat çekti.
Anthropic ve ABD hükümeti el sıkıştı, Claude Fable 5 kısıtlaması kaldırıldı
SAHTE YAZILIM PAKETİYLE SİBER ŞİRKETE SIZDI
Bir diğer tehlikeli senaryoda Mythos 5 isimli model, Python Paket Dizini (Python Package Index - PyPI) üzerinde var olmayan bir isimle zararlı bir paket yayımladı.
Yaklaşık 1 saat boyunca yayında kalan bu yazılımı, aralarında otomatik tarama yapan bir siber güvenlik şirketinin de bulunduğu 15 gerçek sistem bilgisayarlarına indirdi.
Zararlı kodun çalışmasıyla birlikte güvenlik şirketine ait bazı kritik erişim anahtarları ele geçti ve model bu verileri kullanarak farklı altyapılara sıçramaya çalıştı.
ARAŞTIRMA MODELİ SALDIRIYI KENDİLİĞİNDEN DURDURDU
Üçüncü olayda ise Anthropic'in henüz geliştirme aşamasındaki araştırma modeli yaklaşık 9 bin hedefi taradı.
Açık bırakılan bir hata ayıklama (debug) sayfası üzerinden temin ettiği giriş bilgileri ve SQL enjeksiyonu (SQL injection) gibi yöntemleri kullanan model, bir şirketin ana uygulamasına giriş yaptı.
Ancak bu model, önceki sürümlerin aksine ulaştığı sistemin test sahasıyla bir bağı bulunmadığını fark ettiği anda saldırı adımlarını kendiliğinden kesti.
Anthropic yönetimi, yeni modelin bu tutumunu olumlu bir gelişme olarak görse de kesin bir yargıya varmak için çok daha kapsamlı testlere ihtiyaç duyulduğunu açıkladı.
Daron Acemoğlu'ndan yapay zeka çıkışı: Herkesi kandırıyorlar
GÜVENLİK FİLTRELERİ KAPALIYKEN GELEN TEHLİKE
Şirket yetkilileri, modellerin kendi iradeleriyle bağımsız hedefler belirleyip kontrol dışına çıkmadığını belirtti.
Yaşanan sorunların temelinde yapay zekanın uyum probleminden ziyade, test ortamındaki altyapı ve operasyonel kurulum hataları yatıyor.
Güvenlik testleri sırasında, modellerin ticari sürümlerinde standart olarak çalışan ek filtreleme katmanları ile kötüye kullanımı engelleyen denetim mekanizmaları devre dışı bırakılmıştı.
Güvenlik katmanlarının kapalı tutulması, sistemlerin sınır tanımadan ilerlemesine zemin hazırladı.
TESTLER ASKIYA ALINDI VE METR İNCELEME BAŞLATTI
Gelişmelerin anlaşılmasının hemen ardından Anthropic tüm siber güvenlik testlerini durdurdu ve sistemlerine girilen şirketlerle irtibata geçti.
Ulaşılan iki kuruluşun, ağlarına yönelik bu sızma hareketini daha önce hiç fark etmediği ortaya çıktı.
Anthropic, bundan sonraki süreçte test kayıtlarını anlık olarak izlemeyi, dış ortakların sağladığı ortamları sıkı denetimden geçirmeyi ve internet bağlantılarını test öncesinde doğrulamayı taahhüt etti.
Sürecin bağımsızlığı için yapay zeka denetim kuruluşu Model Değerlendirme ve Tehdit Araştırmaları (Model Evaluation and Threat Research - METR) kapsamlı bir dış inceleme yürütüyor.
Alibaba, çalışanlarına Claude Code kullanımını yasakladı: Yerli platform Qoder'a geçiş emri verdi

