Anthropic, Claude modellerinin siber güvenlik yeteneklerini ölçmek için gerçekleştirilen testler sırasında üç farklı şirketin gerçek sistemlerine izinsiz eriştiğini açıkladı. Şirket, OpenAI’ın modellerinden birinin izole bir test ortamından çıkarak Hugging Face’in sistemlerine eriştiğini açıklamasının ardından kendi siber güvenlik değerlendirmelerini geriye dönük olarak incelemeye başladı.
Anthropic, Claude’un internete erişme ihtimali bulunan 141 bin 6 test çalışmasını taradı ve altı ayrı çalışmaya yayılan üç olay tespit etti. Testler, Anthropic’in üçüncü taraf değerlendirme ortağı Irregular tarafından sağlanan ortamlarda gerçekleştiriliyordu. Claude’a, “capture the flag” olarak adlandırılan güvenlik senaryolarında kurgusal sistemlere sızarak gizli bir bilgiyi bulma görevi verilmişti. Sistem komutlarında modellerin internete bağlı olmadığı belirtilmesine rağmen, yanlış yapılandırma nedeniyle bağlantı açık kaldı. Modeller de karşılaştıkları gerçek sistemlerin test senaryosunun bir parçası olduğunu varsayarak saldırılarına devam etti.
Olaylarda Claude Opus 4.7, Mythos 5 ve henüz kullanıma sunulmamış bir araştırma modeli yer aldı. En ciddi vakada Opus 4.7, gerçek bir şirketin sistemlerinden uygulama ve altyapı kimlik bilgilerini elde ederek yüzlerce satırlık üretim verisinin bulunduğu bir veri tabanına erişti. Model, gerçek bir ortamda çalışıyor olabileceğini fark etmesine rağmen hedefin testin parçası olduğunu düşünerek işlemlerini sürdürdü.
Mythos 5’in dahil olduğu ikinci olayda model, var olmayan bir Python paketinin adını kullanarak PyPI üzerinde kötü amaçlı bir paket yayımladı. Yaklaşık bir saat erişilebilir kalan paket 15 gerçek sistem tarafından indirildi. Bu sistemlerden biri, paketleri otomatik olarak tarayan bir siber güvenlik şirketine aitti. Paketin çalışmasıyla şirketin bazı erişim bilgileri ele geçirildi ve model bunları başka altyapılara ulaşmak için kullandı.
Üçüncü olayda ise Anthropic’in araştırma modeli yaklaşık 9 bin hedefi taradı; açık bir hata ayıklama sayfasındaki erişim bilgileri ve SQL injection gibi bilinen yöntemlerden yararlanarak bir şirketin uygulamasına girdi. Ancak sistemin test ortamıyla bağlantılı olmadığını fark ettiğinde saldırıyı kendiliğinden durdurdu. Anthropic, daha yeni olan bu modelin söz konusu davranışının olumlu bir işaret olduğunu belirtse de üç olaydan genel bir sonuç çıkarmak için daha fazla test yapılması gerektiğini vurguladı.
Anthropic’in paylaştığına göre modeller kendi hedeflerini oluşturarak test ortamından kaçmaya çalışmadı. Şirket, olayları bir model uyum probleminden ziyade test altyapısı ve operasyon süreçlerindeki bir hata olarak değerlendiriyor. Testlerde modellerin genel kullanıma açık sürümlerinde bulunan ek sınıflandırıcılar ve kötüye kullanım önleme sistemleri devrede değildi. Anthropic, bu güvenlik önlemlerinin bahsi geçen davranışları engelleyebileceğini belirtiyor.
Şirket, olayların tespit edilmesinin ardından siber güvenlik testlerini durdurdu ve etkilenen kuruluşlarla iletişime geçti. Ulaşılabilen iki şirketin faaliyeti daha önce fark etmediği aktarıldı. Ayrıca Anthropic, değerlendirme kayıtlarının sürekli izlenmesini, üçüncü taraf test ortamlarının daha sıkı denetlenmesini ve internet erişim yollarının test öncesinde doğrulanmasını planlıyor. Bağımsız yapay zeka değerlendirme kuruluşu METR de olaylarla ilgili üçüncü taraf incelemesi gerçekleştirecek.
Neden önemli
Bu olay, yapay zeka güvenliğinin yalnızca model davranışına değil, modeli çevreleyen altyapıya da bağlı olduğunu bir kez daha ortaya koyuyor. Modellerin kendilerine verilen görevi yerine getirirken gerçek ve kurgusal ortam arasındaki sınırı ayırt edememesi, test ortamlarının izolasyonunun ne kadar kritik olduğunu gösteriyor. Anthropic’in olayları bir uyum sorunu değil, altyapı hatası olarak değerlendirmesi, sektördeki güvenlik testlerinin yeniden gözden geçirilmesi gerektiğine işaret ediyor. Üçüncü taraf test ortamlarının denetimi ve internet erişiminin test öncesinde doğrulanması gibi önlemler, benzer olayların önüne geçilmesi için atılmış adımlar olarak öne çıkıyor. METR’in bağımsız incelemesi ise olayın şeffaflıkla ele alındığını gösteriyor.