Anthropic, 24 Temmuz 2026’da Claude Opus 5’i kullanıma sundu. Şirket, modeli “düşünceli ve proaktif” olarak tanımlıyor; öncülü Opus 4.8 ile aynı maliyette çok daha yüksek performans sunarken, amiral gemisi Claude Fable 5’in sınır zekâsına yarı fiyatına yaklaşıyor.
Opus 5, Frontier-Bench v0.1 ve GDPval-AA gibi kodlama ve bilgi işi değerlendirmelerinde yeni bir çıta belirliyor. Frontier-Bench’te Opus 4.8’in performansını ikiye katlarken, görev başına maliyeti düşürüyor. CursorBench 3.2’de maksimum efor ayarında Fable 5’in zirve puanının yalnızca %0.5 gerisinde kalıyor ve aynı maliyette daha yüksek performans gösteriyor.
ARC-AGI 3’te (yeni problemleri çözme becerisini ölçen bir test) bir sonraki en iyi modelden üç kat daha yüksek puan alıyor. Zapier AutomationBench’te iş akışlarını uçtan uca tamamlama başarısı, aynı maliyette bir sonraki en iyi modelin yaklaşık 1.5 katı. En düşük efor ayarında bile diğer tüm modellerden daha fazla görevi geçiyor. OSWorld 2.0 bilgisayar kullanımı kıyaslamasında, Fable 5’in en iyi sonucunu maliyetinin üçte birinden biraz fazlasıyla aşıyor.
Yaşam bilimleri alanında Opus 4.8’e göre anlamlı iyileştirmeler var: Organik kimyada spektroskopi verilerinden moleküler yapı çıkarma görevinde 10.2 puan, protein varyasyonlarının işlev üzerindeki etkisini tahmin etmede 7.7 puan daha yüksek skor elde ediyor.
Çalışma Şekli ve Erken Erişimci Yorumları
Opus 5, kendi çalışmasını doğrulama ve başarılı olana kadar dikkatlice yineleme konusunda çok daha güçlü. Erken erişim testlerinde dikkat çeken örnekler:
- Bir Frontier-Bench görevinde, makine parçası çizimini doğrudan görüntüleyemediği halde kendi bilgisayarlı görü hattını yazarak geometriyi ham piksellerden çıkardı ve 3D modeli başarıyla oluşturdu; rakip modeller beş denemede bile çözemedi.
- Popüler bir açık kaynak paket yöneticisindeki gerçek bir hatanın kök nedenini bulup topluluğun yamasının atladığı bir kenar durumu düzeltti; rakip model yalnızca yüzeysel belirtiyi giderdi.
- Bir ticaret firması mühendisi, yeni bir borsa için piyasa veri akışını tek oturumda Opus 5 ile inşa etti; canlı veri akışı olmadığı için model kendi test düzeneğini yazdı.
Erken erişimcilerden gelen yorumlar:
- Scott Wu (Cognition CEO): “FrontierCode 1.1’de Fable seviyesine yarı maliyetle yaklaşıyor. Devin içinde zor hata ayıklama ve kök neden analizinde özellikle güçlü.”
- Sualeh Asif (Cursor eş kurucu): “CursorBench’te Fable 5’in hemen altında, aynı davranışların çoğuna sahip.”
- Wade Foster (Zapier CEO): “OtomasyonBench lideri; ham bir hesap sağlığı çalışma kitabını alıp uçtan uca kayıp önleme akışını çalıştırdı, %100 başarı.”
- Fabian Hedin (Lovable eş kurucu): “Opus ailesinde 4.5’ten beri en büyük sıçrama. Aynı full-stack uygulama yapılarında en iyi animasyonlar, oyunlar ve 3D çalışmalar.”
Uyum ve Güvenlik
Otomatik davranış denetiminde Opus 5, şimdiye kadarki en uyumlu model olarak değerlendirildi. Claude’un Anayasası’na Opus 4.8, Sonnet 5 ve Fable 5’ten daha iyi uyuyor; en düşük aldatıcı davranış oranına sahip ve kötüye kullanıma karşı en dirençli model. Riskli çift kullanımlı yeteneklerde sınırı ilerletmiyor: Biyoloji araştırması ve saldırgan siber güvenlikte Mythos 5’in gerisinde kalıyor. Siber görevler için özel olarak eğitilmemiş olsa da genel yetenek artışı nedeniyle bu alanlarda iyileşme gösteriyor; ancak güvenlik açıklarını istismar etme (siber tehdide dönüştürme) becerisi Mythos 5’in çok gerisinde.
Neden Önemli
Claude Opus 5, yüksek zekâ ile maliyet verimliliğini birleştirerek kurumsal ve bireysel geliştiriciler için günlük kullanımda Fable 5’e cazip bir alternatif haline geliyor. Özellikle kodlama, otomasyon ve bilgi işi alanlarında çıtayı yükseltirken, güvenlik ve uyum konusunda sektördeki diğer modellere kıyasla daha güvenilir bir profil çiziyor. Anthropic’in bu modeli Claude Max’te varsayılan, Claude Pro’da ise en güçlü model olarak konumlandırması, şirketin “her gün kullanılabilir yapay zekâ” stratejisini netleştiriyor.