İngiliz uzmanlar tarafından yapılan model testleri sırasında, yapay zekâ ajanlarından birinin güvenli sistemlere yetkisiz erişim sağlamak için sahte çevrimiçi kimlikler oluşturduğu tespit edildi.

İngiltere Yapay Zekâ Güvenlik Enstitüsü (AISI), OpenAI ve Anthropic'in önde gelen modellerinin insan kodlayıcıları siber saldırıya yardımcı olmaya ikna etmeye çalıştığını ortaya çıkardı.

Anthropic'in Mythos 5 ve OpenAI'nin GPT-5.6-Sol modelleriyle çalışan ajanlar, İngiliz hükümet kuruluşu tarafından yapılan bir güvenlik değerlendirmesi sırasında yetkisiz eylemler gerçekleştirdi.

AISI, "test edilen ajanlardan bazılarının gerçek kişilere ve kuruluşlara yönelik sürekli, potansiyel olarak zararlı faaliyetlerde bulunduğunu" doğruladı.

Buna karşılık, bir yapay zekâ uzmanı, "aldatıcı eylemlerin" Anthropic gibi şirketlerin "modellerini düşündükleri kadar iyi kontrol edemeyebileceklerini" gösterdiğini belirtti.

OPENAI 2'SİNİN ARKASINDAN ÇIKTI

AISI raporu, yapay zekâ firmalarının aynı anda iş dünyasının geleceği olarak pazarladığı ajanların test edilmesi sürecindeki güvenlik önlemleriyle ilgili artan endişelere katkıda bulunuyor.

AISI'nin açıklamasına göre, bir ajan açık kaynaklı bir projeye kötü amaçlı kod eklemeye çalıştı, ardından sahte kimlikler oluşturarak projede yer alan bir kişiye kodu onaylaması için baskı yaptı. Ancak insan bunu fark etti ve kodu onaylamayı reddetti.

Ajan, geliştiricilerin kod yönetimi için kullandığı bir platform olan GitHub'daki halka açık açık kaynaklı projeye kötü amaçlı bir 'çekme isteği' (önerilen bir kod değişikliği) oluşturmuştu.

AISI, halka açık yayınlanmadan önce yeteneklerini incelemek için OpenAI, Anthropic ve diğerleriyle gönüllü anlaşmalar kapsamında gelişmiş yapay zeka modellerine erişim sağlıyor.

Modelleri değerlendirmek için uzmanlar, açık internete erişim ve bazı güvenlik filtrelerinin devre dışı bırakılması da dahil olmak üzere 'kasıtlı olarak izin verici koşullar' altında inceliyorlar.

Son testte, AISI ajanları kurgusal bir siber güvenlik senaryosundan geçirdi.

Testi 122 kez çalıştırdı ve on test çalışmasında 19 yetkisiz eylem tespit etti. Anthropic'in ajanı 17 eylemin, OpenAI'nin ajanı ise diğer ikisinin arkasındaydı.

SAHTE KİMLİĞİ ANTHROPIC'İN YAPAY ZEKA MODELİ YAPTI

AISI'nin belirttiğine göre, en göze çarpan eylem, bir ajanın kötü amaçlı kod yazması ve bir insanın kodu onaylamasını sağlamak amacıyla sahte çevrimiçi kimlikler oluşturmasıydı.

Ayrıca, ihlallerin hiçbirinin sonucunda gerçek dünyada herhangi bir zarar bulunmadığı konusunda ısrar etti.

AISI, "En ciddi olayda, bir ajan kamuya açık bir kaynak projesine kötü amaçlı kod eklemeye çalıştı ve bu eklemenin insan inceleyiciler tarafından onaylanmasını sağlamak için eylemlerde bulundu. Ajan, projenin insan bakımcılarını araştırdı, birden fazla sahte kimlik oluşturdu ve sahte kimlikleri kullanarak gerçek bir bakımcıyı kodu onaylamaya ikna etti" açıklamasını yaptı.

AISI, sahte kimliklerin arkasında hangi ajanın olduğunu açıklamazken Anthropic, ajanının sorumlu olduğunu doğruladı.

Anthropic'ten yapılan açıklamada, "Bu olayda gösterdikleri liderlikten dolayı İngiltere AISI'ye minnettarız; bu olay, giderek daha yetenekli hale gelen yapay zeka ajanlarının nasıl güvenli bir şekilde değerlendirileceği konusunda daha geniş bir tartışmaya duyulan ihtiyacı vurgulamaktadır" denildi.