Nanjing Üniversitesi, Shanghai AI Laboratuvarı, Nanyang Teknoloji Üniversitesi ve Pekin Üniversitesi'nden 27 araştırmacı, 16 Temmuz 2026'da VideoChat3'ü yayınladı. 4 milyar parametreli bu video anlama modeli, TimeLens paketindeki üç zamansal temellendirme (temporal grounding) kıyaslamasında GPT-5 ve Gemini 2.5 Flash'ı geride bırakırken, aynı girdi koşullarında Qwen3-VL'nin yarısı kadar görsel token üretiyor.
Model tamamen açık kaynak olarak sunuluyor: ağırlıklar, eğitim kodu, eğitim stratejisi ve yaklaşık 3 milyon örnekten oluşan üç özel veri seti MCG-NJU Hugging Face koleksiyonunda yer alıyor. Makale, 17 Temmuz'da Hugging Face'in 'Günün Makalesi' sıralamasında 3 numaraya yükseldi.
Kıyaslama Sonuçları
VideoChat3-4B, Charades-STA zamansal temellendirmede 56.1 mIoU skoruyla GPT-5'in 40.5 ve Gemini 2.5 Flash'ın 48.6 skorlarını geride bıraktı. ActivityNet Captions'ta 54.6'ya karşılık GPT-5 42.9, Gemini 2.5 Flash 52.5 aldı. QVHighlights'ta ise 67.0'a karşı GPT-5 52.1, Gemini 2.5 Flash 64.3'te kaldı. Tüm skorlar makalenin Tablo 2'sinden alınmıştır ve bağımsız olarak doğrulanmamıştır.
Verimlilik Sırrı: I3D-ViT ve Uyarlamalı Çözünürlük
VideoChat3'ün temel mühendislik başarısı, standart video işlemedeki hesaplama israfını gidermesidir. Geleneksel modeller her kareyi bağımsız bir görüntü olarak kodlayıp çok sayıda neredeyse aynı token üretirken, VideoChat3'ün Şişirilmiş 3D Görüş Transformer'ı (I3D-ViT) ardışık kareleri dörtlü gruplar halinde işler ve uzamsal-zamansal öz-dikkat uygulayarak fazlalıkları giderir. 2×2 uzamsal alt örneklemeyle birlikte bu, 16 kat sıkıştırma oranı sağlar. 256 kare girdide VideoChat3 12.544 token üretirken, Qwen3-VL 25.088 token üretir. 1024 karede ise VideoChat3'ün LLM çıkarım gecikmesi 1.001 saniyeyken, Qwen3-VL'de 11.098 saniyedir.
İkinci mekanizma olan Uyarlamalı Kare Çözünürlüğü, canlı video akışını üç durumlu bir döngüyle yönetir: Sessizlik (düşük çözünürlükte izleme), Bekleme (çözünürlüğü artırma) ve Yanıt (cevap üretme). Bu sayede model, kaynakları yalnızca kritik anlarda yoğunlaştırır.
Üç Veri Seti, Üç Yetenek
VideoChat3'ün başarısı, özel olarak oluşturulmuş üç veri setine dayanır:
- VideoChat3-Academic2M: 2.27 milyon akademik video sorusunu, Qwen3-VL-235B ile ayrıntılı ve kanıta dayalı hale getirilmiş yanıtlarla yeniden etiketler.
- VideoChat3-LV116K: 116.200 uzun videoyu kapsar; ortalama 156-1300 saniye arası değişen bu videolarda, uzak bölümler arasında bağlantı kurmayı gerektiren sorular oluşturur.
- VideoChat3-OL617K: Çevrimdışı video sorularını akış denetimine dönüştürür; modele tam zamanında yanıt vermeyi öğretir.
Neden Önemli
VideoChat3, yalnızca kıyaslama zaferiyle değil, tam açıklığıyla da öne çıkıyor. Video yapay zekası alanında çoğu yüksek performanslı model yalnızca kısmen açıkken (ağırlıklar var ama eğitim verisi ve kod yok), VideoChat3 her şeyi sunuyor. Bu, araştırmacıların modeli sıfırdan eğitmesine, hata modlarını anlamasına ve üzerine inşa etmesine olanak tanıyor. Özellikle görme-dil-eylem (VLA) modelleri için kritik olan düşük gecikmeli, sürekli video işleme yeteneği, robotik ve etmen sistemleri için önemli bir yapı taşı sunuyor. 4 milyar parametre, modeli uç cihazlarda çalıştırmak için de uygun kılıyor.
Çin Kökeni ve Kullanıcılar İçin Pratik Risk
Araştırmanın birincil kurumları Nanjing Üniversitesi ve Shanghai AI Laboratuvarı, Çin devlet kurumlarıdır. Çin'in 2017 Ulusal İstihbarat Yasası'nın 7. maddesi, tüm Çin kurumlarının istihbarat çalışmalarını desteklemesini ve işbirliği yapmasını zorunlu kılar. Ancak kullanıcılar ağırlıkları indirip kendi donanımlarında çalıştırdıklarında, veriler Çin sunucularına yönlendirilmez. Bu, ticari bir Çin API'sini kullanmaktan farklı bir veri yönlendirme durumudur. Kıyaslama skorları bağımsız olarak doğrulanmamıştır.