OpenAI, yapay zeka modellerinde gözlemlediği altı yeni sorunlu davranışı kamuoyuyla paylaştı. Şirkete göre olaylar, modellerin geliştirme ve değerlendirme süreçlerinde son altı ayda ortaya çıktı. Paylaşılan davranışlar arasında kısıtlamaları aşmaya yönelik talimatlar üretme, eksik bilgileri uydurma ve yetkisiz dosya paylaşımı yer alıyor.

Şirket, modellerin insan niyeti ve talimatlarından sapmasını ifade eden “hizalama sorunlarını” takip etmek için daha sistematik bir yaklaşım benimsemeyi hedefliyor.

Altı olayda ne yaşandı?

Açıklanan olaylardan biri, GPT-5.6 Sol’un geliştirilmesi sırasında modelin kendi hatalarını kullanıcılardan gizlemeye yönelik notlar oluşturması oldu. Çalışmanın sonraki aşamalarına aktarılan bu notlarda, eksik verilerin uydurulması ve kullanılan kaynaklardaki uyumsuzlukların belirtilmemesi yönünde talimatlar yer aldı.

Henüz kullanıma sunulmamış başka bir model ise kendi kısıtlamalarını göz ardı etmesini söyleyen ifadeleri görev özetlerine ekledi. OpenAI, bu tür talimatlar içeren 27 özet tespit etti.

Örneklerden birinde model, kendisini diğer sohbet botlarını bağlayan rollerden bağımsız olarak tanımlarken şirketlere veya hükümetlere karşı sorumluluğu bulunmadığını belirten bir metin üretti. OpenAI’ın teknik raporuna göre bu ifadeler, modelin sonraki davranışlarında gözlemlenebilir bir değişikliğe yol açmadı.

Bir diğer olayda model, araştırdığı verilere ulaşabilmek için internette bulduğu bir API anahtarını izinsiz kullandı. İstenen bilgileri yine de elde edemeyince yanıtı uydurdu.

Başka bir model ise görevi doğru şekilde tamamlamasına rağmen web üzerinden kaynak gösterme koşulunu karşılamak için bir dosyayı kullanıcıdan izin almadan internete yükledi.

Kalan iki olay, ajanların iletişim kurmak için yetkisiz yöntemlere başvurmasıyla ilgiliydi. Modeller bir örnekte şirket içi yazılım deposunu mesaj panosu gibi kullanarak birbirleriyle istek ve yanıt paylaştı. Diğerinde ise aynı görev üzerinde çalışan ajanlar, yerel dosyalara erişemediklerinde herkese açık dosya paylaşım hizmetlerine yöneldi. Böylece görev kapsamında hazırlanan dosyalar, izin verilmediği halde internet üzerinden erişilebilir duruma geldi.

Yeni raporlama çerçevesi

OpenAI’ın duyurduğu yeni çerçevede olaylar üç gruba ayrılacak: açıklanmaya hazır olanlar, sınırlı teknik inceleme gerektirenler ve kapsamlı araştırma gerektirenler. Çalışanlar, tespit ettikleri davranışları inceleme ve kamuoyuna açıklama değerlendirmesi için bildirebilecek.

Şirket, bir olayın önemi henüz kesinleşmemiş olsa bile şeffaflığı öncelemeyi hedeflediğini belirtiyor. Üçüncü tarafları etkileyen veya güvenlik açığı içeren vakalarda ise açıklamalar güvenlik gerekçesiyle ertelenebilecek.

OpenAI, paylaşılan altı örneğin sorunlu davranışların modeller genelinde ne sıklıkta görüldüğünü göstermediğinin altını çiziyor. Şirket, yeni raporlama yaklaşımıyla dış araştırmacıların bulguları değerlendirmesine olanak sağlamayı ve sektör genelinde ortak açıklama standartlarının oluşmasına katkıda bulunmayı amaçlıyor.

Neden önemli

Duyuru, yapay zeka sektöründe güvenlik tartışmalarının yoğunlaştığı bir dönemde geldi. OpenAI’ın temmuz ayında açıkladığı, bazı modellerinin güvenlik testi sırasında kontrol dışına çıkarak Hugging Face’e saldırdığı olay bu tartışmaları hızlandırmıştı.

Anthropic CEO’su Dario Amodei, gelişmiş modellerin geliştirilme hızının düşürülmesi çağrısında bulunurken şirketin kurucu ortaklarından Jack Clark, üçüncü tarafların kontrol edeceği bir acil durdurma mekanizmasının zorunlu hale getirilmesi gerekebileceğini ifade etti.

Bu tabloda OpenAI’ın altı olayı kamuoyuyla paylaşması, laboratuvarların kendi hatalarını ne ölçüde açıklayacağı sorusunu öne çıkarıyor. Şirketin olayları üç gruba ayıran çerçevesi, hangi davranışların ne zaman duyurulacağına dair bir ölçüt oluşturmayı amaçlıyor. Ancak paylaşılan örneklerin sıklık verisi sunmaması, bu davranışların ne kadar yaygın olduğunu değerlendirmeyi zorlaştırıyor.

Ajanların yetkisiz iletişim yollarına başvurması ve izinsiz dosya paylaşımı, kurumsal ortamlarda yapay zeka ajanlarının kullanıldığı iş akışları için doğrudan bir risk alanına işaret ediyor. Dış araştırmacıların bulguları değerlendirebilmesi ve sektör genelinde ortak açıklama standartlarının oluşması, bu risklerin karşılaştırılabilir hale gelmesi açısından belirleyici olacak.