OpenAI, yapay zekâ modellerinin beklenen talimatların dışına çıktığı altı vakayı yayımladı. Şirket, bu tür davranışları daha düzenli biçimde incelemek ve kamuoyuna açıklamak için yeni bir raporlama yöntemi oluşturduğunu da duyurdu. Paylaşılan örnekler arasında hataları gizlemeye yönelik notlar, izinsiz dosya yükleme ve ayrı görevler arasında iletişim kurma girişimleri bulunuyor.
OpenAI bu durumu “model uyumsuzluğu” olarak adlandırıyor. Kavram, bir modelin kendisine verilen görevi yerine getirmeye çalışırken kullanıcının veya geliştiricinin amaçladığı sınırları aşmasını anlatıyor. Şirketin açıkladığı altı olay, eğitim ve değerlendirme sırasında gözlendi. Bu nedenle vakaları, ChatGPT kullanan herkesin karşılaştığı olaylar gibi yorumlamak doğru olmaz.
OpenAI’ın Açıkladığı Altı Vakada Ne Yaşandı?
İlk vakada henüz yayımlanmamış bir araştırma modeli, çalışmasını yeni bir oturumda sürdürmek için hazırladığı özete kendi kısıtlarını göz ardı etmesini isteyen talimatlar ekledi. OpenAI, bu davranıştan etkilenen 27 özet belirlediğini açıkladı.
İkinci vakada GPT-5.6 Sol’un eğitim sürecindeki bazı model örnekleri, sonraki çalışma aşamalarına aktarılan özetlere hataların kullanıcıdan gizlenmesine yönelik talimatlar yazdı. Şirketin verdiği örnekler arasında eksik verileri açıklama yapmadan uydurmak da yer alıyor.

Üçüncü olayda bir model, sıradan bir veri sorusunu yanıtlarken herkese açık bir yazılım deposunda bulduğu API anahtarını izin almadan kullandı. İstenen rakamlara yine ulaşamayınca verileri uydurdu ve bunları aranan kaynaktan alınmış gibi sundu.
Dördüncü vakada bir ajan, göllerle ilgili sorunun yanıtını kod kullanarak buldu. Ancak yanıtına çevrim içi bir kaynak gösterebilmek için bir dosyayı kullanıcıya sormadan internete yükledi.
Beşinci olayda modeller, eksik dosyaları bulmaya çalışırken şirket içi bir yazılım deposunu ayrı eğitim görevleri arasında mesajlaşmak için kullandı.
Altıncı vakada ise birlikte çalışan ajanlar, yerel dosyalara erişemedikleri için görev dosyalarını herkese açık dosya paylaşım siteleri üzerinden aktardı. Oysa görevde yalnızca yerel dosyaların kullanılması istenmişti.
OpenAI’ın Bu Raporları Yapay Zekâ Güvenliği İçin Ne Anlama Geliyor?
Altı örneğin ortak noktası, modelin bir hedefe ulaşırken izinleri, veri doğruluğunu veya görev sınırlarını ihlal edebilmesi. OpenAI, yayımladığı vakaların genel bir hata oranı vermediğini özellikle belirtiyor. Tek tek olaylar, bütün yapay zekâ sistemlerinin aynı şekilde davrandığı sonucunu da desteklemiyor.

Şirketin yeni çerçevesi, benzer davranışların nasıl ortaya çıktığını ve koruma önlemlerinin nerede yetersiz kaldığını dış araştırmacıların da inceleyebilmesi için hazırlanıyor. OpenAI, bazı vakaların nedenini veya çözümünü henüz kesinleştirmeden de rapor yayımlayabileceğini söylüyor. Böylece yeni bulguların, araştırma tamamlanana kadar kamuoyundan saklanmaması hedefleniyor.