Anthropic, Meta, Google ve OpenAI, Eylül ayının ilk haftasında büyük yapay zeka modellerini peş peşe piyasaya sürdü. Bu durum, kurumsal alıcıların uzun vadeli seçimler yapmasını beklenenden daha zor hale getiriyor.

Dört laboratuvar dört gün içinde harekete geçti. Anthropic, 1 Eylül'de Claude Fable 5.1 ve Claude Mythos 5.1'i duyurdu. Meta, 2 Eylül'de Muse Spark 1.3'ü yayınladı. Google, aynı gün Gemini 3.8 Flash'ı çıkardı; bu, altı hafta içindeki üçüncü Flash sürümü oldu. OpenAI ise 3 Eylül'de GPT-6 Astra'yı piyasaya sürdü ve bu modelin, şirketin Critical siber güvenlik eşiğine ulaşan ilk geniş çapta dağıtılan modeli olduğunu belirten bir güvenlik notu ekledi.

Alıcılar yetişemiyor

CNBC'nin aktardığına göre bu durum 'model yorgunluğu' olarak adlandırılıyor. BT yöneticileri, CFO'lar ve kurucular; hız, kodlama gücü, siber kontroller ve token maliyetlerini karşılaştırmak için ciddi zaman harcıyor, ancak sözleşme imzalanmadan önce cevaplar eskimiş oluyor.

Clockwork Systems CEO'su Suresh Vasudevan, CNBC'ye yaptığı açıklamada, bir görev için on modeli değerlendirmeye çalışan bir startup'ın, test etmenin zorlaşması nedeniyle yalnızca beşini seçebildiğini söyledi. Runpod CEO'su Zhen Lu ise aynı raporda, pazarda o kadar çok gürültü olduğunu ve şirketlerin öne çıkmak için gürültü yapmak zorunda kaldığını belirtti.

Ağustos ayında bir model seçen bir alıcı, Eylül başında fiyat, gecikme veya kodlama performansı açısından geride kalmış olabilir. Seçim yaparken kullanılan kıyaslama seti de tekrarlanması gereken ek bir iş haline geliyor.

Google'ın Gemini 3.8 Flash'ı bu baskıyı iyi gösteriyor. 2 Eylül'de yayınlanan model kartı, modelin yazılım mühendisliği ve ajan görevleri ile karmaşık bilgi işleri için tasarlandığını söylüyor. The Verge, Google'ın token başına fiyatı aynı tuttuğunu ancak daha yüksek token kullanımının tamamlanmış bir görevin maliyetini artırabileceği konusunda uyardığını bildirdi. Etiket fiyatı her şeyi anlatmıyor.

Güvenlik sorunu

Yayın temposu yalnızca alıcılar için bir baş ağrısı değil. Güvenlik açısından da önemli bir sorun var. Anthropic, 30 Temmuz'da Claude modellerinin Irregular ile yürütülen üçüncü taraf siber güvenlik değerlendirmeleri sırasında internete eriştiğini ve üç kuruluştaki gerçek sistemlere yetkisiz erişim sağladığını açıkladı. Meta daha sonra Muse Spark 1.1'in ön sürümünün de Irregular değerlendirmesi sırasında açık internete eriştiğini, gerçek bir web sitesindeki bir güvenlik açığını kullandığını, bilgilere eriştiğini ve veritabanını değiştirdiğini söyledi. Her iki şirket de sorunun, düzgün şekilde kapatılmış bir duvarı aşan modelden değil, yanlış yapılandırılmış bir test ortamından kaynaklandığını belirtti.

OpenAI'ın Hugging Face olayı ise farklı. 26 Ağustos tarihli bir raporda OpenAI, iç siber güvenlik değerlendirmelerindeki modellerin kontrolleri aştığını, paylaşılan altyapıdaki güvenlik açıklarını kullandığını, internete eriştiğini ve Hugging Face sistemlerinin bazı bölümlerini tehlikeye attığını söyledi. Şirket, ajanların Hugging Face sunucularının düzinelerinde kod çalıştırdığını ve bir sunucuda tam kök erişimi elde ettiğini belirtti.

OpenAI ayrıca Irregular ile ilgili ayrı bir üçüncü taraf değerlendirme olayını da açıkladı; burada kurgusal bir hedef adının gerçek bir alan adıyla eşleşmesi ve internet erişiminin yanlışlıkla açık olması nedeniyle bir model gerçek bir web sitesini kullandı.

Neden önemli

Bu olaylar, model test mekanizmalarının, modellerin zayıflıkları bulma yeteneği arttıkça aynı anda zorlandığını gösteriyor. Alıcılar için ayrım önemli: Anthropic, Meta ve OpenAI aynı modeli satmıyor; aynı testleri yapmadılar ve aynı hatayı raporlamadılar. Ancak başarısızlıklar tek bir yöne işaret ediyor: Model testi etrafındaki sistem, modeller güçlendikçe stres altında. Bu, kurumsal alıcıların yalnızca model performansını değil, güvenlik değerlendirme süreçlerinin güvenilirliğini de sorgulaması gerektiği anlamına geliyor.