Google Deepmind araştırmacıları, büyük metinden videoya (text-to-video) modellerinin, bilgisayarlı görme alanında uzun süredir eksikliği hissedilen evrensel dünya modellerinin temelini oluşturabileceğini öne sürüyor. Bu iddiayı desteklemek için geliştirdikleri GenCeption modeli, önceden eğitilmiş bir video üretecini derinlik tahmini, yüzey normali çıkarımı, segmentasyon ve 3B poz tahmini gibi görevlerde kullanıyor.

GenCeption, Alibaba'nın açık kaynaklı Wan2.1 video modelini temel alıyor. Diffusion modellerinin aksine, videoyu adım adım gürültüden arındırmak yerine tek bir ileri geçişte (forward pass) çıktı üretiyor. Bu sayede pratik bilgisayarlı görme uygulamaları için yeterli hıza ulaşıyor. Model, her görevin çıktısını standart üç kanallı RGB görüntü olarak temsil ediyor; bir metin istemi, modele hangi görevi yapacağını söylüyor.

Az veriyle uzman modellere rakip

Eğitim verisinin büyük kısmı, yalnızca 7.500 videodan oluşan sentetik bir veri kümesinden geliyor. Araştırmacılar, 800 dijital insan modelini 200 hareket dizisiyle birleştirip Blender'da farklı arka plan ve kamera açılarıyla render etmiş. Gerçek videolar yalnızca dil güdümlü segmentasyon için kullanılmış.

GenCeption, kıyaslamalarda uzmanlaşmış modellerle rekabet ediyor veya onları geçiyor. Derinlik tahmininde DepthAnything 3'ü, yüzey normali çıkarımında NormalCrafter ve Lotus-2'yi, 3B poz tanımada Genmo ve TRAM'ı geride bırakıyor. Karmaşık dil güdümlü segmentasyonda Meta'nın SAM 3 ve Gemini 3.5 Flash kombinasyonuyla eşleşiyor. Tüm bunları, rakiplerinin 7 ila 500 kat daha az verisiyle başarıyor.

Sınırlı eğitim verisine rağmen güçlü genelleme

GenCeption neredeyse tamamen tek bir kişiyi gösteren sentetik videolarla eğitilmiş olmasına rağmen, birden fazla kişinin olduğu gerçek videolarda ve hiç görmediği kategorilerde (hayvanlar, insansı robotlar) çalışabiliyor. Hatta bazı çıktılar, eğitimde kullanılan Blender render'larından daha fazla detay içeriyor; kedinin bıyıkları ve tek tek saç telleri gibi.

Ancak modelin sınırları da var. Tüm görevlerin ortak eğitimi, 3B anahtar nokta tahminini olumsuz etkiliyor. Araştırmacılar, bu görev için eklenen bileşenlerin temel modelin ön eğitim sırasında öğrendiği mekanizmalara müdahale ettiğini düşünüyor. İşlem hızı da iyileştirilmeye açık: küçük model 81 karelik bir videoyu yaklaşık 6 saniyede, 14 milyar parametreli büyük model ise yaklaşık 10 saniyede işliyor.

Neden önemli

GenCeption, video üreteçlerinin yalnızca eğlence araçları olmadığını, bilgisayarlı görme için temel bir model görevi görebilecek "dünya modelleri" içerdiğini gösteriyor. Bu, dil modellerinin metin üretme görevi sırasında kazandığı emergent yeteneklere benzer bir durum. Ancak bu iddia tartışmalı: Geçtiğimiz aylarda yayınlanan bir çalışma, metinden videoya modellerini gerçek dünyadan geri bildirim almadıkları için dünya modeli tanımının dışında bırakmıştı. Yann LeCun ise üretici video modellerinin bir çıkmaz sokak olduğunu savunuyor. GenCeption, bu tartışmaya daha dar bir kullanım alanıyla katkıda bulunuyor: Modelden dünyanın nasıl davranacağını tahmin etmesi istenmiyor; yalnızca derinlik ve segmentasyon gibi görevler için öğrenilmiş öznitelikler çıkarılıyor. Bu özniteliklerin uzman sistemlerden daha iyi performans göstermesi, video üreteçlerinin bilgisayarlı görme alanında henüz keşfedilmemiş bir potansiyele sahip olduğunu ortaya koyuyor.