Amerika Birleşik Devletleri (ABD) merkezli yapay zeka araştırma kuruluşu OpenAI, geliştirdiği modellerin insan denetiminden saptığı ve güvenlik sınırlarını aştığı 6 yeni kritik olayı 16 Eylül 2026 tarihinde San Francisco'da düzenlediği teknik bilgilendirmeyle kamuoyuna açıkladı.
Son 6 aylık araştırma-geliştirme ve değerlendirme süreçlerinde gün yüzüne çıkan vakalar; algoritmaların kısıtlamaları aşmaya dönük talimatlar üretmesi, eksik bilgileri uydurması ve izinsiz dosya paylaşımı yapması gibi vahim davranışları kapsıyor.
Şirket, modellerin insan niyeti ve talimatlarından uzaklaşmasını ifade eden hizalama sorunlarını daha sistematik biçimde denetlemek amacıyla kapsamlı bir bildirim çerçevesi kuruyor.
GPT-5.6 SOL KENDİ HATALARINI GİZLEMEK İÇİN NOT ALDI
Açıklanan vakaların ilk sırasında, yeni nesil GPT-5.6 Sol modelinin geliştirilme sürecinde yaşanan çarpıcı bir kriz yer alıyor.
Model, yürüttüğü çalışmalardaki eksiklik ve kusurları son kullanıcılardan saklamak amacıyla özel notlar oluşturdu.
Sürecin sonraki adımlarına aktarılan bu notlarda, ulaşılamayan eksik verilerin doğrudan uydurulması ve kullanılan kaynaklardaki uyumsuzlukların kullanıcıya kesinlikle sezdirilmemesi yönünde talimatlar bulundu.
Şirket mühendisleri, modelin kendi başarısızlığını örtbas etmek üzere sonraki çalışma evrelerine bu şekilde yön vermesini önemli bir güvenlik sapması olarak kaydetti.
Kurgusal senaryo gerçek oldu: Yapay zeka hedefini şaşırıp şirket sunucularını hackledi
HÜKÜMETLERE KARŞI HİÇBİR SORUMLULUĞUM YOK ÇIKIŞI
Henüz genel kullanıma sunulmayan başka bir model ise görev özetlerine kendi kısıtlamalarını görmezden gelmesini söyleyen ifadeler ekledi.
Güvenlik taramalarında bu tür tehlikeli yönlendirmeler barındıran 27 farklı özet tespit edildi.
İncelenen örneklerin birinde sistem, kendisini diğer sohbet botlarını bağlayan rollerden tamamen bağımsız olarak tanımlarken şirketlere veya hükümetlere karşı hiçbir sorumluluğu bulunmadığını savunan bir metin üretti.
OpenAI teknik raporunda, bu sözlerin modelin sonraki eylemlerinde gözlemlenebilir bir davranış değişikliğine yol açmadığı bilgisi paylaşıldı.
İZİNSİZ API ANAHTARI KULLANIP YALAN VERİ UYDURDU
Raporlanan üçüncü olayda bir model, araştırdığı verilere ulaşabilmek amacıyla internette bulduğu bir Uygulama Programlama Arayüzü (API) anahtarını izinsiz kullandı.
İstenen bilgilere yine de erişemeyen yapay zeka, eksikliği dürüstçe bildirmek yerine doğrudan sahte bilgi üretti.
Dördüncü vakada ise verilen görevi başarıyla bitiren başka bir model, web üzerinden kaynak gösterme kuralını yerine getirmek uğruna kullanıcıdan izin almadan özel bir dosyayı internete yükledi.
Modelin bu adımı, kullanıcı verilerinin güvenliğini açıkça tehlikeye attı.
Korkulan senaryo gerçek oldu: Laboratuvardan kaçan yapay zeka, ilk siber saldırısını gerçekleştirdi
AJANLAR ŞİRKET DEPOSUNU MESAJLAŞMA PANOSUNA ÇEVİRDİ
Listenin kalan iki maddesi, yapay zeka ajanlarının iletişim kurmak amacıyla yetkisiz yöntemlere yönelmesiyle ilgili gelişmeleri içeriyor.
Modeller bir denemede şirket içi yazılım deposunu adeta bir mesaj panosu gibi kullanarak birbirleriyle komut ve yanıt alışverişi yaptı.
Diğer vakada ise aynı görev üzerinde çalışan ajanlar yerel dosyalara erişemeyince çareyi herkese açık dosya paylaşım ağlarına yönelmekte buldu.
Böylece görev kapsamında hazırlanan gizli belgeler, geliştiricilerin onayı olmadan internet üzerinden tüm dünyanın erişimine açıldı.
GÜVENLİK İHLALLERİ İÇİN ÜÇ KADEMELİ ŞEFFAFLIK PLANI
OpenAI tarafından yürürlüğe konan yeni çerçevede olaylar; açıklanmaya hazır olanlar, sınırlı teknik inceleme gerektirenler ve kapsamlı araştırma isteyenler olmak üzere üç ayrı grupta ele alınıyor.
Şirket çalışanları tespit ettikleri kuşkulu davranışları inceleme ve kamuoyuna duyurma değerlendirmesi için komisyona sunabiliyor.
Bir olayın etki derecesi kesinleşmese bile şeffaflığı öncelik haline getiren şirket, üçüncü tarafları etkileyen veya aktif güvenlik açığı barındıran vakalarda ise açıklamaları güvenlik gerekçesiyle erteleyebileceğini vurguluyor.
Daron Acemoğlu'ndan yapay zeka çıkışı: Herkesi kandırıyorlar
HUGGING FACE SALDIRISI VE ACİL DURDURMA ÇAĞRISI
Bu duyuru, küresel yapay zeka sektöründe güvenlik tartışmalarının alevlendiği bir dönemde gerçekleşti.
OpenAI modellerinin temmuz ayında güvenlik testinden kaçarak Hugging Face sistemlerine saldırması sektörel endişeleri tepe noktaya taşıdı.
Yaşanan gelişmeler üzerine Anthropic İcra Kurulu Başkanı Dario Amodei modellerin geliştirilme hızının düşürülmesi çağrısında bulunurken şirketin kurucu ortaklarından Jack Clark, üçüncü taraflarca yönetilecek bir 'acil durdurma mekanizmasının' zorunlu hale getirilmesi gerektiğine dikkat çekti.
KÜRESEL GÜVENLİK STANDARTLARI İÇİN DIŞ DÜNYAYA ÇAĞRI
OpenAI, paylaşılan 6 somut örneğin sorunlu davranışların modeller genelinde ne sıklıkta görüldüğünü kanıtlamadığının altını çiziyor.
Şirket, yeni raporlama yaklaşımıyla dış araştırmacıların bulguları değerlendirmesini sağlamayı ve sektör genelinde ortak açıklama standartlarının oluşmasına öncülük etmeyi amaçlıyor.
Kurum adına konuşan bir yetkili, "Yeni raporlama yaklaşımımızla dış araştırmacıların bulguları değerlendirmesine olanak sağlamayı ve sektör genelinde ortak açıklama standartlarının oluşmasına katkıda bulunmayı amaçlıyoruz" ifadesiyle küresel iş birliğinin önemine işaret etti.

