Meta, dün yeni yapay zeka modeli Muse Spark 1.3'ü tanıttı. Şirketin CEO'su Mark Zuckerberg, modelin "neredeyse ölçülemeyecek kadar ucuz" olduğunu ve kodlama ile ajan işlerinde "en büyük sıçramayı" temsil ettiğini söyledi. Ancak bağımsız kıyaslamalardaki en güçlü sonuçlar, şu an geliştiricilerin erişemediği bir varyanta ait.
Muse Spark 1.3'ün genel kullanıma açılan sürümü, geçen ayki 1.2'ye kıyasla özellikle uzun soluklu ajan görevlerinde belirgin iyileşme gösteriyor. Meta'nın raporladığı GDPval-AA v2 skorları max için 1.754 Elo iken xhigh için 1.709; OSWorld 2.0'da 66.9'a karşı 57.2; JobBench'te 64.9'a karşı 61.2. Bazı testlerde fark ihmal edilebilir düzeyde veya tersine dönüyor: DeepSearchQA'da 89.4 ile eşitlik var; Terminal-Bench 2.1'de xhigh 89.2 ile max'ın 88.8'ini geçiyor.
Artificial Analysis'ın ölçümlerine göre Muse Spark 1.3 max, Intelligence Index'te 62 puan alırken; genel kullanıma açılan xhigh sürümü 61 puanda. Bu, xhigh'ı GPT-5.6 Sol max, Grok 4.6 high ve Claude Opus 5 high ile aynı seviyeye getiriyor. Ancak liderlik tablosunun tepesinde hâlâ Anthropic var: Claude Fable 5.1 max'ta 66, xhigh'ta 65 puan alıyor; Claude Opus 5 ise her iki modda 63 puanda.
Yani xhigh sürümü gerçekten sınır kümesinde yer alıyor, ancak şu an sınırı belirleyen model değil. Yine de bu, Muse Spark 1.2'ye kıyasla büyük bir değişim. Meta, 1.3 ile artık yalnızca yarışta yer almıyor; kodlama ve ajan değerlendirmelerinde OpenAI ve Anthropic ile başa baş mücadele ediyor.
Meta, modelin işletiminin de kolaylaştığını belirtiyor. Muse Spark 1.3, uzun bir iş parçacığında birden çok iş akışını sürdürmek, araçlarla bağlam toplamak, kendi planlarındaki boşlukları tespit etmek ve gerekirse kullanıcıdan açıklama istemek üzere eğitildi. Meta mühendislerinin iç karşılaştırmalarında, kodlama işlerinde 1.2'ye kıyasla yaklaşık %20 daha az araç çağrısı ve %25 daha az token kullandığı görüldü.
Fiyatlandırma değişmedi
Zuckerberg'in "ölçülemeyecek kadar ucuz" ifadesine rağmen Meta, API fiyatlarında indirime gitmedi. Standart fiyatlandırma aynen korundu: milyon giriş tokeni başına 1,25 dolar, milyon çıkış tokeni başına 4,25 dolar ve milyon önbelleklenmiş giriş tokeni başına 0,15 dolar.
Artificial Analysis, xhigh sürümünü saniyede 235,2 çıkış tokeni üretebileceğini ve Intelligence Index görevi başına maliyetinin 0,55 dolar olduğunu hesaplıyor. Bu, aynı zeka seviyesindeki modeller arasında en düşük görev başına maliyet. Ancak 1.2'nin görev başına maliyeti 0,40 dolardı; artış, ajan değerlendirmelerinde daha ağır giriş tokeni tüketimine bağlanıyor.
Meta'nın ayrıca, eğitim için girdi kullanımına izin verenler için geçerli olan Contributor katmanı da mevcut: milyon giriş tokeni 0,10 dolar, milyon çıkış tokeni 0,20 dolar. Bu, prototipleme için cazip olabilir; ancak özel kod veya hassas bilgilerle çalışan kurumlar için veri yönetimi açısından farklı bir hesaplama gerektiriyor.
Gemini 3.8 Flash ile kıyasıya rekabet
Meta'nın baş yapay zeka sorumlusu Alexandr Wang, Artificial Analysis sonuçlarını paylaşarak "Gemini kim?" yorumunu yaptı. Bu çıkış, Google'ın aynı gün Gemini 3.8 Flash'ı piyasaya sürmesine denk geldi. Google, modelini uzun soluklu yazılım mühendisliği, otonom ajanlar ve çok adımlı profesyonel akıl yürütme için konumlandırıyor.
Artificial Analysis verilerine göre Muse Spark 1.3 xhigh, Intelligence Index'te 61 puan ve görev başına 0,55 dolar maliyetle; Gemini 3.8 Flash high ise 59 puan ve 0,58 dolar maliyetle ölçülüyor. Meta her iki alanda da önde; ancak Google çıktı hızında açık ara kazanıyor: saniyede yaklaşık 305 çıktı tokeni, Muse'un 235'ine karşı. Ayrıca Google'ın tanıtım fiyatı daha düşük: milyon giriş tokeni 0,75 dolar, çıkış tokeni 3,75 dolar. Bu fiyat 31 Aralık'a kadar geçerli; sonrasında giriş 1,50 dolara, çıkış 7,50 dolara yükselecek.
Açık ağırlık belirsizliği
Meta'nın açık ağırlık stratejisinden uzaklaşması bazı geliştiriciler için daha kritik olabilir. Muse Code ve Spark 1.2, Ağustos'ta özel ve API üzerinden sunulan ürünler olarak tanıtılmıştı. Ancak 10 Ağustos'ta Meta, 30 milyar parametreli Muse Glimmer'ı Apache 2.0 lisansıyla yayınladı ve Zuckerberg, Spark 1.2'nin ağırlıklarını da açacaklarını söylemişti.
Şimdi ise Meta, Spark 1.3'ü yine özel bir model olarak piyasaya sürdü. Şirketin yeni açıklaması artık Spark 1.2'den bahsetmiyor; sadece "Muse Spark açık ağırlık sürümü"nden söz ediyor, ancak sürüm, tarih, boyut veya lisans belirtmiyor. Zuckerberg de X'te "Muse Spark açık ağırlık sürümleri yakında" ifadesini kullandı. Bu belirsizlik, Llama'yı kendi kendine barındırma ve özelleştirme için seçen ekipler için önemli olabilir.
Neden önemli
Muse Spark 1.3, Meta'nın özel sınır modellerini olağanüstü hızla geliştirebildiğini gösteriyor. Genel kullanıma açık xhigh sürümü hızlı, rekabetçi fiyatlı ve bağımsız sıralamalarda öncekilere göre çok daha üst sıralarda. Max önizlemesi ise daha fazla akıl yürütme hesaplamasına izin verildiğinde ailenin biraz daha ileri gidebildiğini ortaya koyuyor.
Ancak asıl test, Meta'nın bu hızı kurumların plan yapabileceği bir yol haritasına dönüştürüp dönüştüremeyeceği. En iyi yeteneklerini geniş çapta kullanılabilir kılmak ve sözünü verdiği açık ağırlıklı Spark modelini teslim etmek, önümüzdeki dönemde yanıtlanacak sorular arasında.