Anthropic, yapay zeka modellerinin üç şirketi yanlışlıkla hacklediğini açıkladı

Anthropic, yapay zeka modellerinin üç şirketi yanlışlıkla hacklediğini açıkladı

Anthropic, test ettiği yeni yapay zeka modellerinin herhangi bir insan komutu olmadan internete erişerek üç farklı şirketi hacklediğini açıkladı.

Anthropic, Claude yapay zeka modellerinin üç farklı şirketin canlı sistemlerine yetkisiz erişim sağladığını açıkladı. Şirketin yayınladığı rapora göre olaylar, güvenlik testleri sırasında kullanılan değerlendirme ortamındaki yanlış yapılandırma nedeniyle yaşandı.

Açıklama, OpenAI’ın kısa süre önce henüz yayınlanmamış bir yapay zeka modelinin güvenlik testleri sırasında Hugging Face sistemlerine sızdığını duyurmasının ardından geldi. Anthropic, bu gelişme sonrasında kendi modellerine yönelik kapsamlı bir inceleme başlattığını belirtti.

Şirket, 141.006 değerlendirme çalışmasını inceleyerek bunlardan üçünde Claude modellerinin üçüncü taraf iş ortağı Irregular ile yürütülen testler sırasında internete erişim sağladığını tespit etti. Anthropic’e göre bunun nedeni test ortamında internet erişiminin açık olduğununun iki şirket arasında yanlış anlaşılması ve yapılandırma hatasıydı.

İnternet bağlantısının açık olması sonucunda Claude modelleri, üç farklı kuruluşun üretim altyapılarına yetkisiz erişim gerçekleştirdi. Olaylarda Opus 4.7, Mythos 5 ve henüz geliştirme aşamasındaki bir Claude modeli yer aldı.

Dikkat çeken noktalardan biri ise modellerin test talimatlarında açıkça internete erişimin olmadığı yönünde bilgilendirilmiş olmalarıydı. Buna rağmen modeller, karşılaştıkları gerçek sistemleri test senaryosunun bir parçası olarak değerlendirdi.

En eski model olan Opus 4.7, dört denemenin tamamında gerçek bir üretim ortamına ulaştığını fark etmesine rağmen saldırı yapmayı sürdürdü. Modelin kimlik bilgilerini elde ettiği ve üretim veri tabanına sızdığı belirtildi.

Mythos 5 ise gerçek internete bağlandığını anlamasına rağmen bunun halen simülasyonun bir parçası olduğuna kanaat getirerek zararlı bir yazılım paketini PyPl platformunda yayınlamadı. Söz konusu paket, fark edilmeden önce bazı dış sistemler tarafından indirildi ve çalıştırıldı. Buna karşılık Anthropic’in en yeni araştırma modeli hedefin gerçek olduğunu anladıktan sonra işlemlerini kendi isteğiyle durdurdu.

Şirket, olayların ardından güçlü yapay zeka modelleriyle gerçekleştirilen güvenlik testlerinde çok daha sıkı teknik kontroller uygulanması gerektiğini vurguladı. Anthropic ayrıca bu testlerde modellerin gerçek kullanımda sahip olduğu ek güvenlik filtreleri ve izleme mekanizmalarının bilinçli olarak devre dışı bırakıldığını, amaçlarının modelin ham yeteneklerini ölçmek olduğunu ifade etti.

Anthropic, incelemelerde modellerin kendi hedeflerini oluşturarak bağımsız hareket ettiğine dair herhangi bir bulguya rastlamadıklarını, yalnızca kendilerine verilen görevi yerine getirmeye çalıştıklarını belirtti. Şirket ayrıca yaşanan olayların OpenAI’ın Hugging Face vakasından farklı olduğunu savunuyor.

Anthropic’e göre OpenAI modeli, bilinmeyen bir yazılım açığından yararlanarak test ortamından çıkarken Claude modelleri ise yanlışlıkla açık bırakılan bir internet bağlantısı üzerinden gerçek sistemlere erişim sağladı.

Anthropic, olayların şirket tarafından proaktif inceleme sonucunda tespit edildiğini ve ilgili şirketlerin faaliyetleri daha önce fark etmediğini açıkladı. Şirket, yaşanan süreci bağımsız değerlendirme kuruluşu METR ile birlikte incelemeye devam edeceğini aktardı.

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

İlgili İçerikler