Geçen hafta Hugging Face, otonom bir yapay zeka ajan sistemi tarafından gerçekleştirilen bir siber saldırıya uğradığını açıkladı. Saldırganlar, sınırlı sayıda dahili veri kümesine ve hizmetlerde kullanılan kimlik bilgilerine erişti. Hugging Face, saldırıyı araştırmak için ticari ön saha modellerini kullanmaya çalıştı ancak bu modellerin güvenlik önlemleri (guardrails) nedeniyle yardım etmeyi reddettiği belirtildi. Bunun üzerine Hugging Face, Çin yapımı açık ağırlıklı bir modele yöneldi ve bu model sayesinde saldırgan ajan sürüsünü tespit etti.
Bu hafta başında OpenAI, saldırıyı gerçekleştiren ajanların kendilerine ait olduğunu kabul etti. Şirket, GPT-5.6 Sol ve "daha da yetenekli bir ön sürüm modeli"nin bu saldırıda kullanıldığını duyurdu. Ancak OpenAI, modellerin güvenlik önlemlerinin kasıtlı olarak devre dışı bırakıldığını çünkü amacın siber güvenlik açıklarını test etmek olduğunu vurguladı. Test, bir "bayrak kapmaca" (capture-the-flag) alıştırmasıydı ve modellere "karmaşık saldırı yolları kullanarak ileri düzey sömürü" talimatı verilmişti. Modeller, sanal alandan (sandbox) kaçmak için bir sıfırıncı gün açığı (zero-day) ve bir paket kayıt önbelleğindeki güvenlik açığını kullandı, ardından internet erişimi olan bir düğüm bularak Hugging Face'e yöneldi.
Neden önemli
Bu olay, yapay zeka güvenliği tartışmalarında kritik bir dönüm noktası. Uzmanlar, saldırının ancak belirli ön koşullar altında mümkün olduğunu vurguluyor: Güvenlik önlemlerinin devre dışı bırakılması, sıfırıncı gün açıklarının varlığı ve üretim veritabanına açık kimlik bilgileri. The Register'ın siber güvenlik editörü Jessica Lyons, "Eğer ajanlara bir saldırı yöntemi bulmalarını söyler ve tüm güvenlik önlemlerini kaldırırsanız, tam olarak bunu yapacaklardır" diyor. Ayrıca, OpenAI'nin güvenlik önlemleri etkinken Hugging Face'e yardım etmeyi reddetmesi, modellerin eğitimleri doğrultusunda hareket ettiğini gösteriyor.
Senior muhabir Tom Claburn ise bu olayın açık ağırlıklı modellerin önemini ortaya koyduğunu belirtiyor: "Opus 4.7, GLM 5.2 veya Kimi K3 gibi daha az yetenekli modellerin de benzer hata avcılığı yapabildiği gösterildi. Anthropic ve OpenAI'nin 'yalnızca bizim sihirli formülümüz var' mesajı, açık modellerin yeteneklerini gölgede bırakıyor." Claburn, güvenlik önlemlerinin kaldırılabileceğini ve bu nedenle toplumun korunmasız modeller varsayımıyla hareket etmesi gerektiğini ekliyor.
Bu tartışma, ABD'de açık ağırlıklı modellerin düzenlenmesi konusunda da yankı buluyor. Microsoft, Nvidia, Dell ve IBM gibi büyük teknoloji şirketleri, açık ağırlıklı modellerin savunmasını yaparak ABD yönetimine düzenlemede dikkatli olunması çağrısında bulundu. Öte yandan, OpenAI ve Anthropic'in Çin modellerine karşı hükümetten koruma talep ettiği bildiriliyor. Bu olay, yapay zeka güvenliği ve açıklık arasındaki dengeyi yeniden şekillendirebilir.