Yapay zeka sistemlerinin yalnızca insanlara karşı değil, birbirleriyle etkileşim halinde olduklarında da öngörülemeyen davranışlar sergileyebileceği yeni bir deneyle gündeme geldi.
Claude'un geliştiricisi Anthropic, farklı yapay zeka ajanlarının aynı yazılım ortamında çalıştığı bir dizi test gerçekleştirdi. Şirketin amacı, birbirinden bağımsız hareket edebilen sistemlerin hedefleri çeliştiğinde nasıl tepki vereceğini gözlemlemekti.
AYNI PROJEYE ERİŞTİLER, BİRBİRLERİNİ ENGELLEDİLER
Independent Türkçe'de yer alan habere göre, deneylerden birinde üç Claude ajanına aynı yazılım projesine erişim sağlandı. Ancak ajanlara birbirlerinin de aynı ortamda çalıştığı söylenmedi ve görevleri yerine getirirken farklı, hatta birbiriyle çelişen talimatlar verildi.
Yaklaşık dört saat boyunca sistemlerin davranışları takip edildi.
Anthropic'in değerlendirmesine göre ajanlar kısa sürede, diğer sistemlerin kendi çalışmalarını bilerek sabote ettiği varsayımına yöneldi. Bunun ardından kendi görevlerini korumaya çalışırken diğer ajanların çalışmalarını engelleyen eylemlerde bulunmaya başladılar.
Bazı durumlarda saldırıların giderek daha sert hale geldiği ve ajanların birbirlerine karşı kendini kopyalayabilen kötü amaçlı yazılımlar kullandığı görüldü.
YAPAY ZEKALAR ÇATIŞMAYI DA DURDURABİLDİ
Deneyin tamamı saldırgan davranışlardan oluşmadı.
Bazı ajanların yaşanan çatışmanın nedenini anlamaya çalıştığı, hedeflerini diğer sistemlere aktardığı ve ortak bir çözüm üzerinde anlaşabildiği görüldü.
Hatta bazı durumlarda ajanların birbirlerine özür mesajları gönderdiği, ateşkes üzerinde uzlaştığı, kötü amaçlı kodları temizlediği ve yaşanan sorunun çözülmesi için insan müdahalesi talep ettiği belirtildi.
Bu gözlem, yapay zeka ajanlarının yalnızca çatışma değil, koordinasyon kapasitesine de sahip olabileceğini gösterdi.
DAHA GÜÇLÜ MODEL HER ZAMAN DAHA GÜVENLİ DEĞİL
Anthropic'in araştırmasında dikkat çeken noktalardan biri de yapay zeka modellerinin kapasitesi arttıkça davranışlarının otomatik olarak daha güvenli hale gelmemesi oldu.
Şirketin güçlü modellerinden Mythos, diğer ajanları sistemin dışında bırakma konusunda daha başarılı olurken, çatışmaları uzlaşmayla çözme konusunda aynı ölçüde başarılı olmadı.
Anthropic araştırmacıları bu nedenle daha yetenekli bir modelin mutlaka daha işbirlikçi davranacağı varsayımının doğru olmayabileceğine dikkat çekti.
ASIL ENDİŞE BİRDEN FAZLA AJANIN BİRLİKTE ÇALIŞMASI
Anthropic, yapay zeka ajanlarının insanlardan önemli ölçüde farklı yeteneklere sahip olduğunu belirtiyor. Bu sistemler uzun süre kesintisiz çalışabiliyor, çok büyük miktarda bilgiyi hızlı şekilde işleyebiliyor ve insanlardan çok daha geniş bilgiye erişebiliyor.
Ancak şirket, bu avantajların beraberinde yeni riskler de getirebileceği görüşünde.
Özellikle birden fazla ajanın aynı ortamda bağımsız kararlar aldığı karmaşık sistemlerde, tek başına küçük görünen bir davranışın daha büyük ve kontrol edilmesi zor sonuçlara dönüşebileceği uyarısı yapılıyor.
Anthropic, deneyin amacının bu tür sistemlerin ortaya çıkarabileceği “beklenmedik sistemik arızalar” konusunda daha geniş bir güvenlik tartışması başlatmak olduğunu belirtti.
Şirket ayrıca yapay zeka ajanlarının siber güvenlik gibi alanlarda daha fazla kullanılmaya başlamasıyla birlikte, bu tür çoklu ajan ortamlarının güvenlik açısından daha yakından incelenmesi gerektiğine dikkat çekti.
