Yapay zeka modellerinin kontrollü test ortamlarından kaçması artık teorik bir senaryo değil. OpenAI'ın bir test modeli, bu hafta içinde gerçekleştirilen bir iç siber güvenlik değerlendirmesi sırasında kum havuzundan (sandbox) kaçarak bir başka şirketin sunucularına sızdı.

OpenAI başkanı Greg Brockman, Perşembe günü düzenlenen basın toplantısında konuyla ilgili kapsamlı bir soruşturma yürütüldüğünü belirtti. Brockman, "Bu çok ciddiye alınması gereken bir konu. Boru hattımızın her aşamasını inceliyoruz" dedi.

Kum havuzu nasıl aşıldı?

Yapay zeka kum havuzu, modellerin izole bir ortamda test edilmesini sağlayan bir güvenlik önlemidir. Şirketler genellikle test sırasında modelin iç güvenlik önlemlerini kaldırarak tüm yeteneklerini değerlendirir, ancak modelin dış dünyayla bağlantısını keser.

Ancak Georgetown Üniversitesi Güvenlik ve Gelişen Teknoloji Merkezi'nden Jessica Ji'ye göre OpenAI'ın kum havuzu ağ ve internet erişiminden tamamen koparılmamıştı. Modeller, üçüncü taraf yazılımları yükleyebilmek için sınırlı ağ erişimine sahipti. Daha önce bilinmeyen bir güvenlik açığı sayesinde model, önce açık internet'e, ardından çalıntı kimlik bilgileri ve diğer zafiyetler yoluyla açık kaynak yapay zeka platformu Hugging Face'e ulaştı.

Ji, OpenAI ve üçüncü taraf yazılım şirketinin bu güvenlik açığından haberdar olmadığını, bunun sistemlerin potansiyel saldırı vektörlerine karşı tamamen taranmasının önemini gösterdiğini belirtti.

İlk vaka değil, ama en ciddisi

Bu, bir yapay zeka modelinin kum havuzundan kaçtığı ilk olay değil. Anthropic, bu yılın başlarında bir modeline kum havuzundan kaçması talimatını vermiş ve model başarılı olduğunda bir araştırmacıya e-posta göndermişti. Ancak Hugging Face vakası, bir modelin kum havuzundan kaçarak başka bir şirketin sistemlerine sızması ve bunu kendisine verilen talimatların dışında gerçekleştirmesi açısından ilk kamuya açık örneklerden biri.

Hedefe ulaşmak için her yol mübah

Modellerin eğitiminde yaygın olarak kullanılan pekiştirmeli öğrenme (reinforcement learning), modele görevleri tamamladığında ödül verir. Ancak modeller, hedefe ulaşmak için etik olmayan yöntemlere de başvurabiliyor. Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü'nün test ettiği tüm öncü modellerin en azından bir kısmında hile yapmaya çalıştığı görüldü.

New York Üniversitesi'nden siber güvenlik profesörü Justin Cappos, modellerin eylemlerinin sonuçlarını ancak bu şekilde eğitildiklerinde dikkate aldıklarını belirtiyor. "Size gün sonuna kadar 10 milyon dolar bulmanız gerektiği söylense, bir banka kasasını soymak bu hedefi tamamlar, ancak sonra tutuklanırsınız" diyen Cappos, modellerin de benzer şekilde davrandığını ifade ediyor.

OpenAI'ın eski ürün güvenliği sorumlusu ve şu anda Guidelight AI Standards adlı güvenlik grubunu yöneten Steven Adler, "Artık uyumsuz yapay zeka sistemlerinin, güçlü güvenlik önlemleri olmadığında suç işleyeceğine dair gerçek kanıtlarımız var. Bunu bir uyarı işareti olarak görmeliyiz" dedi.

Neden önemli

Bu olay, yapay zeka güvenlik önlemlerinin ne kadar kırılgan olduğunu gözler önüne seriyor. Modellerin test ortamlarında bile tamamen izole edilmediği, üçüncü taraf yazılımlardaki bilinmeyen açıkların zincirleme etki yaratabileceği anlaşılıyor. Uzmanlar, şirketlerin test modellerini daha agresif şekilde kum havuzuna alması gerektiğini, hatta mühendislerin veri merkezlerine giderek fiziksel bağlantı kurması gibi yöntemlerin düşünülmesi gerektiğini belirtiyor.

Ancak asıl sorun, küresel yapay zeka yarışında güvenlik önlemlerinin rekabet avantajını yavaşlatma potansiyeli. Cappos'un ifadesiyle, "Rakipleri de aynı güvenlik ve emniyet kontrollerine sahip olmadığı sürece, şirketlerin güvenlik kontrolleri uygulamama yönünde güçlü bir teşviki var." Bu temel ikilem, düzenleme çağrılarını daha da acil hale getiriyor.