Anthropic'in 1 Eylül 2026'da yayınladığı Claude Fable 5.1, geliştirici ve araştırmacı Theo'nun ilk 24 saatlik testinde dikkat çekici bir sonuç ortaya koydu: açık kaynaklı T3 Code ve bulut ürünü Lakebed projelerinde 89 pull request gönderdi ve birçoğunu hiç incelemedi. Theo, t3.gg podcast'inde yaptığı detaylı analizde, modelin değerinin kod üretmekten çok, işi inceleme ve birleştirme aşamasına kadar otonom taşımasında olduğunu söylüyor. Bu, yapay zekanın kod yazmaktan kod bakımına geçişinin bir işareti olarak yorumlanıyor.
Maliyet Düşüşü Nereden Geliyor?
Anthropic'in iddiası, Fable 5.1'in tipik iş yüklerinde önceki modele göre %25, yüksek düzeyde ajanik işlerde ise %45'e varan maliyet avantajı sağladığı yönünde. Theo'nun kullanım verilerine göre bu tasarrufun ana kaynağı, önbellek okuma fiyatının milyon token başına 1 dolardan 0,25 dolara düşürülmesi (%75 indirim). Temel girdi fiyatı 10 dolar, çıktı fiyatı ise 50 dolar olarak sabit kaldı. Bu fiyatlandırma profili, tek seferlik sohbet sorgularından çok, uzun süreli ve önbellek yoğun ajanik işleri ödüllendirmek üzere tasarlanmış görünüyor.
Ajanik döngülerde her araç çağrısı (test çalıştırma, dosya okuma, dokümantasyon getirme) modelin tüm konuşma geçmişini yeniden okumasını gerektirir. Önbellekleme olmadan bu, tam fiyattan tekrar işlenirdi. Theo'nun T3 Code verileri bu durumu netleştiriyor: 42,8 milyar önbelleklenmiş girdi token'ı, 710 milyon önbelleklenmemiş girdi token'ı; önbellek okuma maliyeti 264 dolar, önbellek yazma maliyeti yaklaşık 1.200 dolar (harcamanın %60'ı), üretilen çıktılar yaklaşık 500 dolar ve önbelleklenmemiş girdiler 4 dolar. Önbellek yazma maliyeti hâlâ pahalı bir darboğaz olarak öne çıkıyor.
Kıyaslamalar Yanıltıcı Olabilir
Fable 5.1, çoğu kıyaslamada iyileşme gösterse de Theo, Opus 5 hayal kırıklığından çıkan dersin, kıyaslama puanlarının gerçek dünya kullanılabilirliğini tahmin etmede giderek yetersiz kaldığı olduğunu belirtiyor. Anthropic'in resmi kıyaslamalarında Fable 5.1, Terminal-Bench 4.0'da %55,8 (Fable 5: %42,0), CursorBench 3.2.0'da %73,4 ve Browserbase'in en zor tarayıcı testinde %82 (Fable 5: %57) skorları elde etti. Theo'nun kendi ölçümleri de CursorBench'te yaklaşık %73 ile bu sonuçları destekliyor.
Anthropic, Fable 5.1'in bazı Terminal-Bench görevlerini güvenlik açısından hassas olarak işaretlediğini ve bu durumda Opus 5'e geri düştüğünü, bunun da puanları Mythos 5.1'e kıyasla hafifçe düşürdüğünü açıkladı. Fable ve Mythos aslında aynı temel model; yalnızca güvenlik önlemleri ve erişim katmanları farklı. Yapay zeka felsefesindeki ayrışma ise dikkat çekici: OpenAI'ın Soul modeli fizik akıl yürütmede önde giderken, yanılsamayı cezalandıran AI Omniscience doğruluk kıyaslamasında Anthropic modelleri daha yüksek puan alıyor. Theo bunu, Anthropic'in asla yanlış yapmamayı, OpenAI'ın ise yeni bilgi keşfetmeyi optimize etmesi olarak yorumluyor.
Tasarımda Nesil Atlaması
Fable 5.1'in Theo'yu gerçekten şaşırttığı alan ön yüz tasarımı oldu. Claude tasarım becerisiyle üretilen pazarlama sayfaları, kartların uçuşması ve transit hatların kendini çizmesi gibi sofistike animasyonlar içeriyor. Theo bunu "en azından ana sayfa tasarımında nesil atlaması" olarak nitelendiriyor. Beceri olmadan çıktı belirgin şekilde zayıflıyor; "tat" becerisi sıkıcı sonuçlar verirken, tasarım becerisi "gerçekten geri döndü".
En çarpıcı gösterim, Theo'nun yarım kalan oyunu "Fish Slop"u yeniden inşa etmesiydi. 2D versiyonda yön değiştirmede eğilme, kabarcık izleri ve yeme animasyonları gibi zarif hareketler yer alırken, 3D versiyonda Blender ile modellenen balıklar biyolojik olarak doğru göz yerleşimine ve Theo'nun gördüğü en iyi yüzme kontrollerine sahipti. Bu animasyon kalitesinin Muse Spark ve GLM'nin Kim K3 çıktılarına benzemesi, ortak bir eğitim verisi havuzunun mekânsal 2D/3D akıl yürütmeyi mümkün kıldığını düşündürüyor.
Neden önemli
Fable 5.1'in asıl önemi, ham zeka sıçramasından çok "ajanik tamamlama"daki adım değişimidir. Theo'nun 89 pull request'i incelemeden göndermesi, geliştiricilerin devredebileceği iş biriminin değiştiğini gösteriyor. Ancak maliyet avantajı her iş yükü için geçerli değil: %45'e varan tasarruf, yalnızca önbellek yoğun ajanik işlerde ortaya çıkıyor. Fable 5.1'in bazı kıyaslamalarda Fable 5'ten yaklaşık 1,7 kat daha fazla çıktı token'ı üretmesi, tek seferlik görevlerde tasarrufu kısmen dengeliyor. Ekiplerin asıl sorusu, iş yüklerinin bu tasarrufu yakalayacak kadar ajanik olup olmadığı; aksi halde basit sohbet görevlerinde daha yüksek çıktı maliyeti ödeyebilirler.