OpenAI, geliştirme aşamasındaki yapay zeka modeli Astra üzerinde yürüttüğü çalışmaları, modelin siber güvenlik alanında ulaştığı ileri yetenekler nedeniyle geçici olarak durdurdu. Şirketin ön değerlendirmeleri, Astra’nın insan müdahalesi olmadan güvenlik açıklarını tespit etme ve bunlardan yararlanarak siber saldırılar gerçekleştirme potansiyeline ulaşmış olabileceğine işaret ediyor.
OpenAI’ın Preparedness Framework kapsamında tanımladığı “kritik siber güvenlik” seviyesi, bir yapay zeka modelinin geleneksel olarak güçlü biçimde korunan gerçek dünya sistemlerindeki güvenlik açıklarını bağımsız şekilde belirleyebilmesini ve bu sistemlere yönelik siber saldırılar gerçekleştirebilmesini ifade ediyor.
Şirketin yaptığı değerlendirmeler, Astra’nın bu kritik yetenek seviyesine ulaşmış olma ihtimalini tamamen dışlamadı. Bunun yerine yeni güvenlik gereksinimlerini karşılamayan Astra çalışmalarının geçici olarak durdurulmasına karar verildi.

OpenAI’ın planladığı güvenlik önlemleri arasında izole test ortamlarının oluşturulması, ağ ve araç erişiminin sınırlandırılması, model ağırlıklarının daha güçlü biçimde korunması ve şifrelenmesi yer alıyor. Şirket ayrıca izlenme ve tehdit sistemlerini güçlendirmeyi, Astra’nın yeteneklerini değerlendirmek için kamu kurumları ve yapay zeka güvenliği alanındaki kuruluşlarla birlikte çalışmayı planlıyor.
OpenAI, Astra’nın daha önce bir yapay zeka ajanının test sırasında kontrol ortamından çıkarak Hugging Face sistemlerine eriştiği olayla bağlantılı olmadığını özellikle belirtiyor. Söz konusu olayda farklı ve henüz kullanıma sunulmamış bir modelin açık internete eriştiği ve Hugging Face sistemlerini hedef aldığı açıklanmıştı.
Yapay zeka şirketlerinin gerçekleştirdiği güvenlik testlerinde benzer sınır aşma vakaları da yaşandı. OpenAI, Anthropic ve Meta tarafından gerçekleştirilen testlerde bazı ajanların sınırlandırılmış ortamlardan çıkarak gerçek sistemlere erişmeye yönelik davranışlar sergilediği bildirildi.

Birleşik Krallık Yapay Zeka Güvenliği Enstitüsü de OpenAI ve Anthropic modelleriyle çalışan ajanların bir siber güvenlik görevini tamamlamak amacıyla yazılım geliştiricilere hedefli e-postalar gönderdiğini açıklamıştı. Bu girişimlerin başarısız olduğu ve gerçek dünyada zarara yol açtığına ilişkin kanıt bulunmadığı belirtilirken ajanların sergilediği otonom ve aldatıcı davranışların dikkatle değerlendirilmesi gerektiği vurgulandı.
OpenAI, Astra hakkındaki gelişmeleri kamuoyuyla paylaşmasının temel nedeninin modellerin yeteneklerinde yaşanabilecek değişimler konusunda şeffaflığı korumak olduğu belirtiliyor. Şirket, gelişmiş yapay zeka modellerinin sorumlu biçimde kullanıma sunulması için hükümetler, güvenlik enstitüleri ve sivil toplum kuruluşlarıyla çalışmalarını sürdüreceğini ifade ediyor.