Anthropic'in henüz yayınlanmamış Model 2'si, CoBench v2 benchmark'ında %62,8 puan alarak dikkat çekti. Bu sonuç, Mythos 5'in aynı testteki %50,3'lük performansına kıyasla 12,5 puanlık bir fark anlamına geliyor. Ancak bu sonucun ne ifade ettiğini anlamak için benchmark'ın kapsamına yakından bakmak gerekiyor.

CoBench v2, genel sohbet performansından ziyade teknik Ar-Ge ve mühendislik görevlerine odaklanan bir test. Bu nedenle sonuç, yapay zeka sistemlerinin yazılım mühendisliği ve teknik araştırma alanlarında ileride üstlenebileceği işlere daha yakın bir yetkinliği ölçüyor. Yine de %62,8'lik bir skor, Model 2'nin genel zekasının evrensel bir ölçüsü olarak yorumlanmamalı. Sonuç daha dar bir şeyi gösteriyor: Model 2, bu belirli iç Ar-Ge değerlendirmesinde Mythos 5'ten daha iyi performans gösterdi. Bu ayrım, sınır modellerini karşılaştırırken önem taşıyor.

Skor mu, Tavan mı?

Model 2'nin %62,8'lik skoru, Anthropic'in bu değerlendirmede teknik araştırma ve mühendislik personelinin tamamen yerine geçme performansı için bildirdiği %85 referans noktasının oldukça altında. Bu nedenle sonuç, otonom yapay zeka araştırmacılarının geldiğinin kanıtı olmaktan ziyade ilerlemenin bir göstergesi olarak değerlendirilmeli.

Bir başka karmaşıklık ise mevcut değerlendirmelerin doygunluğa ulaşmaya başlaması. Anthropic, bazı mevcut değerlendirmelerinin doygunluğa ulaştığını ve modeller güçlendikçe yetenek iyileştirmelerini ayırt etmenin zorlaştığını belirtiyor. Bu, alışılmadık bir sorun yaratıyor: Modeller ne kadar iyi olursa, ne kadar daha iyi olduklarını ölçmek de o kadar zorlaşıyor.

Model 2 Neden Yayınlanmıyor?

Anthropic, Model 2'nin dahili deneysel bir model olarak kaldığını ve kamuya açık bir sürüm için gereken normal dağıtım öncesi güvenlik değerlendirmelerini tamamlamadığını söyledi. Bu, modelin başarısız olduğu anlamına gelmiyor. Model halihazırda kodlama, aracı iş akışları ve sentetik veri üretimi için dahili olarak kullanılıyor. Deneysel bir modeli dahili tutmak, Anthropic'in yeteneklerinden yararlanmaya devam ederken davranışını ve risklerini anlamasına da olanak tanıyor.

Neden önemli

Model 2 sonucu, basit bir liderlik tablosu zaferinden çok, sınır yapay zekasının yönü hakkında bir sinyal olarak daha ilginç. CoBench v2'deki 12,5 puanlık avantaj, teknik Ar-Ge görevlerinde anlamlı bir ilerlemeye işaret ediyor. Ancak bu, Model 2'nin Mythos 5'ten genel olarak üstün olduğunu ya da insan araştırmacıların yerini almaya hazır olduğunu kanıtlamıyor.

Asıl zorluk bundan sonra başlıyor: Yapay zeka şirketleri, modeller bugünkü benchmark'ların sınırlarına yaklaşıp aştıkça bilgilendirici kalmaya devam eden değerlendirmeler geliştirebilir mi? Bu sorunun cevabı, yapay zeka ilerlemesinin ölçülebilirliğini ve dolayısıyla güvenilirliğini doğrudan etkileyecek.