Alibaba'nın Qwen3.8-Max-0902 modeli, 2 Eylül 2026'da Code Arena'nın WebDev liderlik tablosunda 1.691 puanla birinci sıraya yerleşti. Bu sonuç, Claude Opus 5 Max'in üç puan, Kimi K3 Max'in 17 puan ve önceki Qwen3.8-Max sürümünün 22 puan önünde gerçekleşti. Arena.ai, X üzerinden yaptığı açıklamada modelin bu başarısını duyurdu.

Ancak bu üstünlük uzun sürmedi. 7 Eylül itibarıyla canlı tabloda Claude Fable 5.1 Max 1.896 puanla lider durumda; GPT-6 Astra Max 1.860, Claude Opus 5 Max 1.766 ve Qwen3.8-Max-0902 ise 1.754 puanla dördüncü sırada görünüyor. Arena.ai bu sonuçları 'ön hazırlık' olarak işaretledi.

Bu durum, Alibaba'nın başarısız olduğu anlamına gelmiyor. Canlı yapay zeka liderlik tablolarının hızla değiştiğini ve üst sıraların kalıcı olmadığını gösteriyor. Asıl önemli olan, Alibaba'nın bu performansı fiyatını artırmadan elde etmesi.

Qwen3.8-Max-0902, milyon girdi token'ı başına 2 dolar, milyon çıktı token'ı başına 6 dolar fiyatla sunuluyor. Bu, önceki Qwen3.8-Max serisiyle aynı seviyede. Arena.ai, modelin harmanlanmış milyon token başına 5 dolar maliyetle Pareto sınırındaki en yüksek puanlı giriş olduğunu belirtti. Girişimler için bu fiyat avantajı, liderlik tablosundaki geçici üstünlükten daha kritik.

Code Arena'nın WebDev benchmark'ı, çok adımlı web geliştirme görevlerini içeren ajan kodlama işlerine odaklanıyor. Arena.ai'nin 2 Eylül açıklamasına göre Qwen3.8-Max-0902, Veri ve Analitik ile Tüketici Ürünü kategorilerinde birinci, Marka ve Pazarlama, Oyun ve Simülasyon kategorilerinde ikinci, İçerik Oluşturma Araçları ve Referans Tabanlı Tasarımda üçüncü sırada yer aldı.

Alibaba, Qwen3.8-Max-0902'yi yeni bir temel model olarak sunmadı. Bu, Qwen3.8-Max'in tarihli bir sürümü. Qwen'in kamuya açık model bilgilerine göre Max ailesi 1.000.000 token bağlam penceresine, metin, görsel ve video girdisine ve metin çıktısına sahip. Alibaba Cloud dokümantasyonu, ilgili Qwen3.8-2.4T-A95B modelinin toplam 2,4 trilyon parametreye ve token başına yaklaşık 95 milyar aktif parametreye sahip olduğunu belirtiyor.

Neden önemli

Bu gelişme, ABD-Çin yapay zeka rekabetinde yeni bir cepheyi gösteriyor. Son iki yıldır tartışmalar Nvidia ihracat kontrolleri, Huawei'nin Ascend çipleri ve ileri üretim erişimi etrafında yoğunlaşmıştı. Qwen3.8-Max-0902 ise ince ayar (post-training) ve fiyatlandırma cephesinde rekabetin sürdüğünü ortaya koyuyor. Alibaba, yeni bir mimariye ihtiyaç duymadan, daha keskin bir sürüm ve sabit fiyatla geliştiricilerin dikkatini çekmeyi başardı.

Liderlik tablosundaki hızlı değişim, bu tür sıralamaların kalıcı bir başarı göstergesi olmadığını hatırlatıyor. Bir modelin kod tabanınız, gecikme ihtiyaçlarınız, veri kurallarınız ve tercih ettiğiniz araçlarla uyumlu olup olmadığını ancak kendi görevlerinizde deneyerek öğrenebilirsiniz. Benchmark'lar hangi modellerin bu hafta test edilmeye değer olduğunu söyler; hangisinin üretim iş yükünüzü kaldıracağını söylemez.

Fiyatlandırma ise pratik bir test sunuyor. Ayda binlerce kodlama ajanı oturumu çalıştıran bir ekip, gönderilen bağlam ve alınan çıktı için ödeme yapar. Kodlama liderlik tablosunda üst sıralarda yer alan ve milyon girdi token'ı başına 2 dolar, çıktı başına 6 dolar fiyatla sunulan bir model, uzun süre bir numarada kalmasa bile maliyet hesaplarını değiştirir.