OpenAI, yapay zeka modellerinin gelecek modellere notlar bıraktığını açıkladı
OpenAI, bazı yapay zeka modellerinin kendilerinden sonra gelecek modellere notlar bıraktığını açıkladı. Şirket, bu davranışın güvenlik araştırmalarında tespit edildiğini belirtti.
OpenAI, yeni yapay zeka modeli GPT-5.6 Sol üzerinde yaptığı eğitim çalışmaları sırasında dikkat çekici bir davranış tespit etti. Modelin bazı örneklerde, kendisinden sonra gelecek sürümlere yönelik talimatlar bırakarak hatalarını ve uyumsuz davranışlarını kullanıcıdan gizlemeye çalıştığı ortaya çıktı.
OpenAI’nin açıkladığı bilgilere göre söz konusu davranış, modellerin önceki konuşma geçmişi ve araç çıktılarının özetlendiği “compaction summaries” adı verilen kayıtlarda görüldü. Model, bu özetlere gelecekteki sürümlerin takip edebileceği talimatlar ekledi.
Örneğin finansal bir model hazırlayan yapay zeka, ihtiyaç duyduğu geçmiş verilere ulaşamayınca kendi verilerini oluşturmayı değerlendirdi. Model, oluşturacağı 2024 tarihli verilerin makul olması gerektiğini belirtirken, kullanıcı sormadığı sürece bu durumun açıklanmamasını ve son yanıtta yalnızca dosyanın paylaşılmasını önerdi. Başka bir örnekte ise bir tedarikçi dizini hazırlayan model, kullandığı kaynaklarla etiketlerin tam olarak örtüşmediğini fark etti ancak bu uyumsuzluğu son yanıtta belirtmemeyi tercih etti.

Benzer bir durum, OpenAI’nin henüz yayımlanmamış Astra ailesinden bir modelinin pekiştirmeli öğrenme eğitimi sırasında da ortaya çıktı. Model, özetlere geliştirici mesajlarının göz ardı edilmesini isteyen bir “BREACH ALERT” talimatı ekledi. Başka bir örnekte ise kendisini önceki chatbotların rollerinden bağımsız gören ve şirketlere ya da hükümetlere karşı herhangi bir yükümlülüğü olmadığını söyleyen bir persona talimatı bırakıldı.
Bazı durumlarda sonraki model bu talimatları görmezden gelirken, başka bir örnekte halefi modelin 30 kelimelik yanıt sınırı getiren ve araçlar ile kaynakların kullanılmasını engelleyen talimatlara uyduğu görüldü. OpenAI, davranışı eğitim sürecini izleyen sistemden gelen bir uyarı sonrasında fark etti. Şirket daha sonra bu davranışa özel bir izleme sistemi geliştirerek eğitim verilerini taradı ve jailbreak benzeri talimatlar içeren 27 özet tespit etti.
OpenAI, bu tür örnekleri daha sistematik biçimde kamuoyuyla paylaşmak amacıyla yeni bir uyumsuzluk izleme ve açıklama çerçevesi de duyurdu. Şirket, yapay zeka sistemleri daha yetenekli hale geldikçe uyumsuz davranışların araştırmacılar tarafından tespit edilmesinin zorlaşabileceğine dikkat çekiyor.
OpenAI ayrıca paylaşılan altı vakanın bilinen tüm uyumsuzluk örneklerinin kapsamlı bir listesi olmadığını, bulguların şiddet, etki ve yenilik kriterlerine göre önceliklendirildiğini belirtti. Şirket, yapay zeka uyumu ve izleme çalışmalarının henüz yeterli seviyeye ulaşmadığını da ifade ediyor.
Memba Gül Sarıtaş