Alibaba'nın yeni açık kaynak modeli Qwen3.8-27B, geliştiricilerin dikkatini çekti. 27 milyar parametreli yoğun multimodal model, Cuma günü Hugging Face'te Apache 2.0 lisansıyla yayınlandı. Model, görüntü ve video anlama, 262.144 token'lık bağlam penceresi, yapılandırılabilir akıl yürütme ve kodlama ile ajan iş akışları desteği sunuyor.
Modelin en dikkat çekici yanı, küçük donanım ayak izi. Tam 16-bit hassasiyette çalıştırmak için yaklaşık 56 GB GPU belleği gerekirken, FP8 sürümü yaklaşık 28 GB istiyor. 4-bit niceleme ile model boyutu yaklaşık 17 GB'a düşüyor ve bu da güçlü bir oyun masaüstü veya iyi donanımlı bir dizüstü bilgisayar gibi tüketici cihazlarında çalıştırılabileceği anlamına geliyor.
Alibaba'nın kendi kıyaslama sonuçları etkileyici: SWE-bench Pro'da 61.7, LiveCodeBench v6'da 90.3, CoWorkBench ofis çalışması testinde 70.7 ve OSWorld-Verified'da 84.3 puan aldı. Şirketin karşılaştırma tablosunda, 27B model, SWE-bench Pro ve LiveCodeBench'te Claude Opus 4.6 Max'in sonuçlarını geçiyor; ancak Opus, Terminal-Bench, GPQA Diamond ve Humanity's Last Exam'de önde. Alibaba'nın bazı değerlendirmeleri dahili ve kıyaslama ortamları her karşılaştırmada aynı olmadığı için bu sayılar kesin bir üstünlük ilanı için yeterli değil.
Üçüncü taraf sonuçlar da modelin gücünü doğruluyor. Yapay Zeka analiz şirketi Artificial Analysis, Qwen3.8-27B'ye Intelligence Index'te 52 puan verdi; bu, OpenAI'nin düşük seviyeli modeli GPT-5.6 Luna'nın maksimum akıl yürütme ayarındaki puanıyla aynı. Agentic Index'te ise model 51 puan alarak, Anthropic'in üç aydan kısa süre önce çıkardığı Claude Opus 4.8'i maksimum akıl yürütme çabasında geride bıraktı.
Açık kaynak kodlama ajanı Cline, X'te "Yerel bir modelin ilk kez sınır seviyesi model yeteneği puanlaması. Yerel ilerlemenin bu kadar erken olmasını beklemiyorduk" dedi. Geliştirici ve yayıncı Sero ise "3 bin dolarlık donanımda çalışan bir model, 4 ay önceki her şeyi yeniyor. Opus dahil" yorumunu yaptı.
Geliştirici Simon Willison, Q4_K_M nicelemesini M5 Max MacBook Pro ve Nvidia DGX Spark üzerinde test etti. Modelin kod yazabildiğini, görüntüleri yorumlayabildiğini ve Pi ajan çerçevesi üzerinden kodlama ajanı döngüsü çalıştırabildiğini gördü. Bir deneyde model, kimlik doğrulamanın nasıl çalıştığını açıklamak için bir kod tabanında gezindi; başka bir deneyde ise Willison'ın ihtiyaç duyduğu bir Python aracını yazıp test etti.
Willison, "17 GB'lık bir dosyanın ev makinelerimde tüm bunları yapabilmesi bir mucize" dedi. Bu duygu, güç kullanıcıları arasında yaygın.
Modelin popülaritesi kullanıma da yansıdı. Cybernews'in haberine göre, Qwen3.8-27B ilk üç günde Hugging Face'te 3 milyon indirmeyi geçti. Reddit'teki LocalLLaMA topluluğu, kıyaslamalar, nicelemeler ve yapılandırma önerilerini derlemek için özel bir başlık açtı.
Dikkat: Aşırı düşünme sorunu
Modelin kalitesinin bir bedeli var: çok fazla düşünüyor. Artificial Analysis, Intelligence Index testlerinde modelin 160 milyon çıktı token'ı ürettiğini, benzer açık ağırlıklı modellerin medyanının 43 milyon olduğunu bildirdi. Willison, varsayılan xhigh akıl yürütme ayarıyla bir SVG isteğinin 21 dakika sürdüğünü ve 22.000'den fazla akıl yürütme token'ı tükettiğini gördü. Sıradan yerel kullanım için düşük veya hiç akıl yürütme ayarını öneriyor.
Yatırımcı Tomasz Tunguz, DeepSeek V4 Flash ile yaptığı dokuz görevlik testte, akıl yürütme açıkken Qwen'in kalitede öne geçtiğini ancak yaklaşık 30 kat daha yavaş ve 4.5 kat daha pahalı olduğunu bildirdi. Dokuz görevin bir karar için yeterli olmadığını da ekledi.
Çıkarım yazılımı bu farkı kapatabilir. Model, Çoklu Token Tahmini (MTP) içeriyor; Willison, llama.cpp üzerinden MTP'yi etkinleştirdiğinde DGX Spark'ta yaklaşık %72 performans artışı elde etti. Yine de normal LM Studio çalıştırmaları saniyede yalnızca 15-30 token üretiyordu.
Neden önemli
Qwen3.8-27B, kurumsal kullanım için önemli bir soruyu gündeme getiriyor: Bir kuruluşun kendi altyapısında çalışacak kadar küçük bir model, anlamlı görev sınıfları için API çağrılarının yerini alabilir mi? Apache 2.0 lisansı, ağırlıkların incelenmesine, değiştirilmesine ve şirketin kendi kontrolleri altında barındırılmasına izin veriyor. Alibaba, vLLM, SGLang ve TokenSpeed gibi sunum çerçeveleriyle uyumluluğu belgeliyor.
Bu, gizlilik, dağıtım ve maliyet hesaplarını değiştiriyor. Küçük boyut ve erişilebilir donanım gereksinimleri, verilerin makineden çıkmaması anlamına geliyor; bu da daha fazla gizlilik, bilgi güvenliği ve yönetişim sağlıyor.
Business Insider'ın bu hafta bildirdiği Hugging Face verileri, gerçek model kullanımının büyük ölçüde küçük modellere kaydığını gösteriyor; 70 milyar parametrenin üzerindeki modeller, 2026 indirmelerinin yalnızca küçük bir payını oluşturuyor. Alibaba'nın farklı boyut sınıflarında model yayınlama stratejisi, Qwen ailesini geliştiricilerin yerel dağıtım iş akışlarının düzenli bir parçası haline getirdi.
Qwen3.8-27B bu mantığı daha da ileri taşıyor. Kıyaslama puanları daha fazla bağımsız doğrulama gerektiriyor, varsayılan akıl yürütme davranışı verimsiz olabiliyor ve hiçbir lider tablosu sınır seviyesi pariteyi kanıtlamıyor. Ancak üç gün sonra geliştiriciler artık yalnızca Alibaba'nın kıyaslama tablosuna değil, kendi donanımlarında küçük bir dosyayı çalıştırıp kısa süre önce yalnızca büyük tescilli sistemlere ait gibi görünen görevleri izleme deneyimine tepki veriyor.