Anthropic, yapay zeka modeli Claude Opus 5'in tüm platformlarda kullanıma sunulduğunu duyurdu. Şirket, Opus 5'in önceki sürüm Opus 4.8'e kıyasla verimlilik ve maliyet etkinliği açısından kayda değer iyileştirmeler sunduğunu belirtiyor. Fiyatlandırma yapısı değişmezken, model Claude Max'te varsayılan seçenek haline geldi ve Claude Pro'da en gelişmiş model olarak yer alıyor.
Opus 5, özellikle yazılım mühendisliği ve bilgi işleme görevlerinde etkili. Frontier-Bench ve GDPval-AA gibi kıyaslamalarda lider sonuçlar elde ederken, bazı siber güvenlik değerlendirmelerinde Mythos 5'in gerisinde kalıyor. Fiyatlandırma, giriş token'ları için 5 dolar/milyon, çıkış token'ları için 25 dolar/milyon olarak sabit kaldı. Ayrıca, standart hızın yaklaşık 2,5 katına çıkan ve iki katı fiyatla sunulan Hızlı mod da mevcut.
Geliştiriciler, yeni modele Claude API üzerinden claude-opus-5 endpoint'i ile erişebiliyor. Anthropic, Opus 5'in yazılım mühendisliği, problem çözme ve iş otomasyonu kıyaslamalarında önceki modelleri geride bıraktığını raporluyor. Frontier-Bench v0.1 değerlendirmesinde Opus 5, Opus 4.8'in iki katından fazla performans gösterirken görev başına maliyet düşüyor. CursorBench 3.2'de maksimum çaba modunda, modelin skoru Fable 5'in zirvesinin %0,5 yakınına ulaşıyor ve maliyet yarı yarıya. ARC-AGI 3'te Opus 5, bir sonraki en iyi modelden üç kat daha yüksek puan alıyor. Zapier AutomationBench'te ise aynı maliyetteki alternatiflere göre geçiş oranı yaklaşık 1,5 kat daha fazla. OSWorld 2.0'da Fable 5'in en iyi sonucunu maliyetin üçte biriyle aşıyor.
Cursor'ın kurucu ortağı Sualeh Asif, "Claude Opus 5, Opus hızı ve maliyetinde Fable 5 zekasına yakın bir performans sunuyor. CursorBench'te Fable 5'in hemen altında ve aynı davranışların çoğunu sergiliyor" dedi.
Bilimsel araştırmalarda ilerleme
Anthropic, Opus 5'in bilimsel araştırma görevlerinde de önemli kazanımlar sağladığını belirtiyor. Yapısal biyoloji ve organik kimya gibi yaşam bilimleri değerlendirmelerinde Opus 4.8'i geride bırakan model, moleküler yapı çıkarımında %10,2 puan, proteinle ilgili görevlerde ise 7,7 puan iyileşme gösterdi. Model, sonuçları doğrulama ve başarılı olana kadar görevleri tekrarlama konusunda daha yetkin.
Erken erişim testçilerinden örnekler arasında piksel verisinden bir makine parçasının yeniden yapılandırılması ve açık kaynak yazılımdaki bir hatanın kök nedeninin belirlenmesi yer alıyor. Bir mühendis, Opus 5'i kullanarak tek bir oturumda yeni bir borsa için piyasa veri akışı oluşturmayı başardı; bu, önceki modellerin yapamadığı bir işti.
Uyum ve güvenlik
Anthropic'in iç davranış denetimine göre Opus 5, Claude'un Anayasası'na daha yüksek uyum ve önceki modellere kıyasla daha düşük aldatıcı davranış sergiliyor. Şirket, Opus 5'in biyolojik araştırma ve saldırgan siber güvenlikte Mythos 5'in gerisinde kaldığını, çift kullanımlı riskli yeteneklerde ilerlemediğini belirtiyor. OSS-Fuzz testlerinde Opus 5, Mythos 5'e benzer sonuçlarla güvenlik açıkları tespit ederken, istismar geliştirme konusunda daha az yetkin.
Opus 5'in güvenlik önlemleri, siber güvenlik ve biyoloji alanlarında belirli kısıtlamalarla kullanıma izin veriyor. Siber sınıflandırıcılar, Fable 5'tekinden daha az kısıtlayıcı; kaynak kodunda güvenlik açığı tespitine izin verirken bazı yüksek riskli faaliyetleri engelliyor.
Beta güncellemeleri
Opus 5 lansmanıyla birlikte Anthropic iki beta güncellemesi yayınlıyor: Claude Platform'da geliştiriciler için konuşma ortasında araç değişikliği ve API'de otomatik yedekleme; bu, güvenlik sınıflandırıcıları tarafından engellenen isteklerin alternatif modellere yönlendirilmesini sağlıyor. Anthropic, genel erişim için veri saklama zorunluluğu olmadığını doğruladı.
Neden önemli
Claude Opus 5, Anthropic'in mevcut fiyatlandırmayı koruyarak performansı önemli ölçüde artırmasıyla dikkat çekiyor. Özellikle yazılım mühendisliği ve otomasyon kıyaslamalarında rakiplerine yaklaşan veya onları geçen sonuçlar, kurumsal kullanıcılar için maliyet etkin bir seçenek sunuyor. Ancak siber güvenlik ve biyolojik araştırma gibi hassas alanlarda Mythos 5'in gerisinde kalması, Anthropic'in güvenlik odaklı yaklaşımını sürdürdüğünü gösteriyor. Modelin hızlı mod ve API iyileştirmeleri, geliştiriciler için esneklik sağlarken, beta özelliklerle platformun kullanılabilirliği artırılıyor. AMD ile yapılan büyük altyapı ve yatırım anlaşması da Anthropic'in uzun vadeli hedeflerini destekliyor.