Amazon, yapay zeka ajanlarının karar verme süreçlerine odaklanan açık kaynak bir model yayımladı: Strands Decider 2B. Yaklaşık 2 milyar parametreli model, Alibaba'nın Qwen tabanı üzerine ince ayar yapılarak geliştirildi ve Hugging Face üzerinden ücretsiz indirilebiliyor. Lisansı ise kurumsal kullanıma uygun, izin verici Apache 2.0.

Model, AWS'nin deneysel ajan geliştirme projesi Strands Labs kapsamında duyuruldu. Şirket, modelin yanı sıra eğitim materyallerini, kodu, veri setini ve betikleri de yayımlamayı planlıyor.

Karar modelleri neden gündemde?

Yaklaşık iki hafta önce TypeSafe AI, metin üretmek yerine önceden tanımlanmış seçenekler arasından seçim yapan Jev modelini tanıttı. O günden bu yana geliştiriciler, birçoğu indirilebilir ağırlıklarla gelen rakip karar modelleri yayımladı. Amazon da bu alana katılıyor.

Temel fikir basit: Bir program "Bu araç çalıştırılmalı mı?" ya da "Bu istek için üç rotadan hangisi uygun?" gibi bir yanıt arıyorsa, büyük bir dil modelinden açıklama yazmasını istemek zaman ve maliyet ekleyebiliyor. Karar modeli ise izin verilen yanıtları doğrudan puanlıyor. Bu sayede daha yetenekli bir ajanın etrafında sık çalışan, dar bir kontrol noktası olarak kullanılabiliyor; yazma, kodlama ve karmaşık akıl yürütme işleri üretken bir modele bırakılıyor.

AWS ne inşa etti?

Strands Decider, önceden eğitilmiş Qwen3.5-2B temel modeliyle başlıyor. AWS'ye göre geliştiriciler, bir sonraki kelimeyi tahmin eden bileşeni kaldırıp yerine sunulan yanıt seçeneklerini puanlayan küçük bir "pointer" bileşeni ekledi. Temel model, rank-16 LoRA güncellemesiyle uyarlanırken yeni puanlama bileşeni eğitildi; AWS bu bileşenin yalnızca bir milyonun biraz üzerinde parametre eklediğini belirtiyor. Duyuruya eşlik eden mimari şeması bu tasarımı "Hobson" olarak adlandırıyor. Model, bir sohbet botundan farklı olarak tek bir ileri geçiş yapıyor ve mevcut seçenekler üzerinde bir dağılım döndürüyor.

AWS, ekibinin hızlı yinelemeler yaptığını ve 20. sürümü kod, eğitim verisi ve betiklerle birlikte yayımlayacağını söylüyor. Bu açıklık teklifin önemli bir parçası: geliştiriciler tarifi inceleyebilir, modeli ince ayarlayabilir ve her kararı dış bir API'ye göndermek yerine kendi altyapılarında çalıştırabilir.

AWS'nin örneğinde karar modeli, bir ajanın hava durumu aracını çağırmasından hemen önce konumlandırılıyor. Kullanıcı konum belirtmeden hava durumunu sorduğunda demodaki ajan bir şehir tahmin ediyor. Strands Decider konuşmayı ve önerilen çağrıyı inceleyip şehrin kullanıcının isteğinden gelip gelmediğini ve aracı çağırmak için çok erken olup olmadığını sorguluyor. Uygulama kodu bu yanıtları kullanarak ajanı şehri sormaya geri gönderiyor. AWS, örnekteki soruların ve eşiklerin elle seçildiğini, karar modeline özel entegrasyon kütüphanelerinin ise hâlâ geliştirme aşamasında olduğunu belirtiyor.

Hız ve doğruluk

AWS, modelin kısa görevlerde onlarca milisaniyede, bazı yaygın donanım ve girdilerde ise 100 milisaniyenin altında yerel kararlar verebildiğini söylüyor. Yerel bir Nvidia RTX 3090 üzerinde modelin 18. sürümüyle yapılan ölçümde, 230 istek genelinde medyan gecikme 106 milisaniye, 95. yüzdelik gecikme ise 296 milisaniye olarak kaydedildi; bu süre HTTP gidiş dönüşünü de kapsıyor. Ölçüm, sunucu ısınması sırasındaki 7,7 saniyelik ilk isteği hariç tutuyor. AWS ayrıca M3 MacBook'ta küçük görevler için yaklaşık 150 milisaniye medyan bildiriyor.

TypeSafe ise barındırılan hizmeti üzerinden Jev yanıtlarının uçtan uca yaklaşık 70 ila 500 milisaniye sürdüğünü aktarıyor.

Kalite tarafında AWS, JevBench'in kamuya açık bölümünü kullanarak hem doğruluğu hem de olasılıkların güvenilirliğini ölçüyor. Grafikte 19. sürüm noktası yaklaşık %72 doğruluk ve 0,35 Brier skoru gösteriyor; benzer büyüklükteki Mapika decider-2b v11 ise yaklaşık %76 ve 0,32 ile işaretlenmiş. Yüksek doğruluk ve düşük Brier skoru tercih edildiğinden bu karşılaştırma her iki ölçütte de Mapika'nın lehine. AWS, modelinin bu testte kendi boyutundaki kamuya açık modeller arasında ikinci, eksiksiz eğitim tarifi yayımlayanlar arasında ise birinci olduğunu söylüyor. Grafikte Jev'in kendisi yer almıyor.

Neden önemli

Strands Decider'ın en net farkı, üstün kıyaslama performansı değil; açık, kendi sunucunuzda barındırılabilir ve yeniden üretilebilir olması. TypeSafe, Jev'i yalnızca API üzerinden sunuyor ve ağırlıklarını ya da tam eğitim tarifini paylaşmıyor. Amazon ise modeli, kodu, eğitim verisini ve betikleri yayımlamayı vaat ediyor; bu da geliştiricilere model düzeyinde inceleme ve ince ayar imkânı tanıyor.

Fiyat tarafında ilginç bir paradoks var: Strands'ın etiket fiyatı sıfır, Jev'in işletme maliyeti ise zaten neredeyse ihmal edilebilir düzeyde. Jev'in milyon girdi token'ı başına 0,042 dolarlık ücretiyle bir milyar girdi token'ı yalnızca 42 dolara geliyor. Dolayısıyla bir şirketin elinde boşta duran hesaplama gücü yoksa ya da yerel çalıştırmayı gizlilik ve kontrol açısından değerli bulmuyorsa, donanım, bulut maliyeti ve operasyonel yük hesaba katıldığında kendi sunucuda barındırmanın para tasarrufu sağladığı henüz kanıtlanmış değil. AWS, API ücretine kıyaslanabilir genel bir istek veya token başına işletme maliyeti tahmini de paylaşmadı.

Kategori hızla genişliyor: Laya 421 milyon parametreli ModernBERT tabanlı tasarımıyla yerel kararlar alıyor; Jared Palmer'ın Kev'i bir model ailesi ve araştırma izi yayımlıyor; Nimble 9B Apache lisanslı bir adaptör ve referans kod sunuyor; Mapika'nın decider ailesi farklı boyutlara yayılıyor; FLock'un this-that-model'i de küçük, yerelde çalıştırılabilir bir seçenek. Stanford ve Nvidia araştırmacıları ise yeniden kullanılabilir eylemlerin temsillerini önbelleğe alabilen açık CLM-8B ile ilgili bir yol izliyor. "Karar modeli" etiketini paylaşmak, bu modellerin kıyaslamalarını birbirinin yerine geçebilir kılmıyor.