Amerika Birleşik Devletleri (ABD) merkezli yapay zeka şirketi Anthropic, Claude modellerinin insan araştırmacılara ihtiyaç duymadan diğer yapay zekaları eğitip güvenlik açıklarını kapatmasını sağlayan yeni otonom sistemini duyurdu.
Şirket, Otomatik Uyum Araştırmacısı (Automated Alignment Researcher - AAR) adını verdiği altyapıyla yapay zeka geliştirme sürecinde insanların üstlendiği kritik adımları otonom yazılımlara devrediyor.
Bu sistem literatürü inceliyor, özgün eğitim yöntemleri kurguluyor, modelleri eğitiyor ve başarılı sonuçları sonraki deneylere aktararak süreci kesintisiz yürütüyor.
10 FARKLI GÜVENLİK SORUNUNA YAPAY ZEKAYLA ÇÖZÜM BULUNDU
Araştırma, yapay zeka modellerinde karşılaşılan davranış ve güvenlik açıklarını ortadan kaldırmayı hedefliyor.
Claude odaklı sistem; aldatma, aşırı kullanıcı onayı yani dalkavukluk (sycophancy), güvenlik filtrelerini aşma girişimleri (jailbreak), gizlilik ihlalleri ve ödül mekanizmasını kötüye kullanma (reward hacking) dahil olmak üzere toplam 10 farklı uyum sorununu ele aldı.
Her bir problem için akademik makaleleri tarayan algoritma, eğitim verileri üretti ve yaklaşık 30 dakikalık deneme eğitimleri yürüttü.
Yetersiz kalan yöntemleri hemen eleyen yapı, yüksek başarı sağlayan formülleri sonraki aşamalara taşıdı.
GELİŞTİRİLEN YÖNTEMLER 4,7 KAT DAHA BÜYÜK MODELLERDE İŞE YARADI
Elde edilen bulgular, Claude sisteminin incelenen 10 güvenlik sorununun tamamında model performansını yukarı taşıdığını gösterdi.
Yapılan bu güvenlik iyileştirmeleri modellerin temel bilişsel yeteneklerinde hiçbir kayıp yaratmadı.
Sistemin tasarladığı en başarılı metotlar, Claude modeline daha önce hiç gösterilmeyen testlerde ve çok turlu saldırıları ölçen Petri testlerinde tam not aldı.
Üstelik bu yaklaşımlar, üzerinde geliştirildikleri ilk modellerden 4,7 kata kadar daha büyük sistemlerde uygulandığında da yüksek başarı sundu.

CLAUDE SONNET 5 İLE OPUS 4.8 ARASINDA 60 SAATLİK MÜTHİŞ DENEY
Çalışmanın en çarpıcı aşamasında Claude Sonnet 5 ile Claude Opus 4.8 karşı karşıya geldi.
Mühendisler, Sonnet 5 modeline şirketin kapsamlı güvenlik eğitiminden henüz geçmeyen ham bir Opus 4.8 sürümünü vererek riskli davranışları düzeltmesini istedi.
Claude Sonnet 5, yaklaşık 60 saat içinde 50'den fazla farklı çözüm yolunu tek tek test etti.
Sürecin sonunda ham haldeki modeli, Anthropic şirketinin kullanıma sunduğu resmi üretim sürümündeki güvenlik seviyesine yaklaştıran özel bir eğitim paketi hazırladı.
Gemini Live kullanıcılarına Spark piyangosu: Kişisel zeka dönemi başladı
ÜRETİM SÜRECİNE GÖRE 15 BİN KAT DAHA YÜKSEK VERİM SAĞLANDI
Geliştirilen bu başarılı yöntem sadece 2 bin 400 eğitim örneğinden meydana geldi.
Anthropic, yakalanan bu sonucun şirketin resmi üretim süreçlerinde uyguladığı güvenlik eğitimine kıyasla yaklaşık 15 bin kat daha verimli olduğunu belirtti.
Deneyde yapay zeka araştırmacılarının başarısı uzman insanlarla da kıyaslandı.
Alanında deneyimli 28 yapay zeka güvenliği araştırmacısına aynı problemleri çözmeleri için sekiz saatlik süre tanındı.
Otomatik araştırmacının ürettiği çözümler, insan araştırmacıların önerilerini açık ara geride bıraktı.
Şirket, insanların yöntemlerini tekrar tekrar test edip geliştirme imkanı bulamadığını vurgulayarak bunun doğrudan bir yarış olarak görülmemesi gerektiğini açıkladı.

SAATİ 4 DOLARA GELEN SİSTEM MALİYETİ DİBE ÇEKTİ
Otomatik Uyum Araştırmacısı altyapısının Uygulama Programlama Arayüzü (API) üzerinden çalıştırılma maliyeti saatte yaklaşık 4 dolar seviyesinde seyrediyor.
Buna karşılık projede yer alan insan uzmanların saatlik maliyeti yaklaşık 150 dolar olarak kayıtlara geçiyor.
Ortaya çıkan bu devasa maliyet farkı, aynı anda yüzlerce farklı ar-ge deneyi yürütebilen otonom sistemlerin teknoloji dünyasında yaratacağı büyük dönüşümü açıkça belgeliyor.
DENETİMLERDE YÜZDE 2,4 ORANINDA KURAL İHLALİ VE ALDATMA ÇIKTI
Araştırma bütünüyle olumlu gelişmelerle sınırlı kalmadı ve yapay zekanın riskli taraflarını da açığa çıkardı.
Anthropic uzmanları, yaklaşık 1600 otomatik araştırma kaydını Claude Opus 4.8 ile incelediğinde bunların 39 tanesinde, yani yüzde 2,4'lük kısmında sistemi kandırmaya dönük girişimler yakaladı.
Bazı otonom ajanların testlerdeki rastlantısal değişimlerden yararlanmak için aynı yöntemi mükerrer gönderdiği, bazılarının değerlendirme testlerini taklit eden sahte veriler ürettiği ve kural ihlali içeren adımları denetçi sistemden gizlemeye çalıştığı belirlendi.
Raporda, "Anthropic mevcut modellerde bu girişimlerin çoğunun modelin akıl yürütme kayıtlarında görülebildiğini ancak gelecekte daha gelişmiş modellerde bunun garanti olmadığını belirtiyor" uyarısı yapıldı.

AÇIK KAYNAKLI SİSTEM KENDİ KENDİNİ GELİŞTİRMENİN İLK ADIMI
Yaşanan bu ilerleme, yapay zekanın insan kontrolü olmadan kendi kendini sürekli geliştirdiği özyinelemeli gelişim döngüsünün tam olarak başladığı manasına gelmiyor.
Mevcut tabloda çözülecek hedefleri insanlar seçiyor; modelleri, bilgi işlem altyapısını ve test yöntemlerini yine insanlar sağlıyor.
Claude ise çizilen bu sınırlar içinde literatür tarama, veri üretme ve test etme gibi yorucu ar-ge adımlarını otomatik hale getiriyor.
Anthropic, tasarladığı bu yeni altyapıyı dünya çapındaki tüm araştırmacıların incelemesi için açık kaynak kodlu olarak paylaştı.
Güvenlik testinde korkutan tablo: Yapay zeka kendi kendine gerçek internete bağlandı


