Nvidia, yapay zeka ajan sistemlerinin içinde çalışacak şekilde tasarlanmış yeni bir açık model olan Nemotron 3.5 Lightning'i tanıttı. 11 Ağustos'ta yayınlanan model, 30 milyar parametreli bir mixture-of-experts (uzman karışımı) mimarisine sahip ve her token için yalnızca 3 milyar parametreyi aktif kullanıyor. Nvidia, modelin 1 milyon tokena kadar bağlam penceresini desteklediğini ve benzer boyuttaki modellere kıyasla dört kata kadar daha yüksek çıktı hızı sunabildiğini belirtiyor.

Model, açık ağırlıklar, eğitim verileri ve tariflerle birlikte OpenMDW-1.1 lisansı altında sunuluyor. Bu, geliştiricilerin modeli kendi altyapılarında çalıştırabilmesi ve özelleştirebilmesi anlamına geliyor.

Ajan sistemleri için bir işçi modeli

Nemotron 3.5 Lightning'in asıl önemi, Nvidia'nın bu tür modellere biçtiği rolde yatıyor. Şirket, bir AI ajanının her adımını büyük bir frontier modele göndermek yerine, farklı sınıflardaki görevleri farklı modellerin üstlendiği bir sistem öngörüyor. Daha büyük bir akıl yürütme modeli iş akışını planlayabilir veya zor kararları alabilirken; daha hızlı ve uzmanlaşmış bir model, ajanın planını uygularken ortaya çıkan tekrarlayan araç çağrılarını, doğrulamaları, biçimlendirme işlemlerini ve diğer rutin operasyonları gerçekleştiriyor.

Bu ayrım, AI uygulamaları tek sorgu-yanıt döngüsünden, bir görevi tamamlarken düzinelerce hatta daha fazla model çağrısı üretebilen ajanlara doğru ilerledikçe daha da önem kazanıyor.

Tek modelden model sistemine

Nvidia bu yaklaşımı "model sistemi" olarak adlandırıyor. Kurumsal duyurusuna göre modern ajanlar giderek birer model topluluğu (ensemble) gibi çalışıyor; farklı modeller farklı işlerde uzmanlaşıyor. Bu durum, AI modeli seçimindeki denklemi değiştiriyor. Ham yetenek hâlâ önemli bir faktör, ancak gecikme süresi, çıkarım maliyeti, dağıtım konumu ve görev uzmanlığı da aynı kararın parçası haline geliyor. Zor akıl yürütmede en güçlü seçenek olmayan bir model, çok sayıda dar görevi daha hızlı ve yeterli doğrulukla tamamlayabiliyorsa, yüksek hacimli işler için hâlâ mantıklı olabilir.

Nvidia bu fikri, Lightning ile birlikte yayınladığı NeMo Switchyard ile güçlendiriyor. Açık kaynaklı yönlendirme kütüphanesi, istekleri kalite, gecikme ve maliyet gibi gereksinimlere göre farklı modellere yönlendirmek için tasarlandı. Nvidia, kuruluşların uygulamaları yeniden yazmadan, kendi açık, tescilli ve Nvidia modelleri karışımı üzerinde iş yüklerini yönlendirebileceğini söylüyor.

Bu kombinasyon, model seçiminin tek seferlik bir platform tercihi olmaktan çıkıp çalışma zamanı kararı haline geldiği bir AI mimarisine işaret ediyor. Ajan ekipleri, hangi modelin hangi görevi üstlendiği de dahil olmak üzere tüm iş akışının performansını değerlendirmeye başlayabilir.

Hız mı, maksimum zeka mı?

Lightning'in tasarımı bu takası yansıtıyor. Mixture-of-experts mimarisi, modele her token için kullanılan parametre sayısından daha fazla toplam kapasite verirken; Nvidia ayrıca çoklu token tahmini, spekülatif kod çözme ve NVFP4 quantize edilmiş kontrol noktası ekleyerek çıkarım verimliliğini artırmış.

Neden önemli

Bu duyuru, AI altyapısının evriminde önemli bir dönüm noktasına işaret ediyor. Nvidia'nın açık modeli ve yönlendirme yazılımıyla birlikte sunduğu vizyon, tek bir süper modelin her şeyi yapması fikrinden uzaklaşarak, uzmanlaşmış modellerin birlikte çalıştığı bir ekosistemi öne çıkarıyor. Bu yaklaşım, özellikle maliyet ve gecikme süresinin kritik olduğu üretim ortamlarında, işletmelerin AI ajanlarını daha verimli çalıştırmasına olanak tanıyabilir. Aynı zamanda, açık kaynak lisansı sayesinde kuruluşların kendi altyapılarında çalıştırabileceği bir model sunması, bulut sağlayıcılarına bağımlılığı azaltma potansiyeli taşıyor. Ancak bu sistemin gerçek dünyada ne kadar başarılı olduğu, modellerin birbirleriyle ne kadar uyumlu çalıştığına ve yönlendirme kararlarının ne kadar isabetli olduğuna bağlı olacak.