Google DeepMind, işaret dili yapay zekasını tüketici ürünlerine taşıyan yeni bir model duyurdu. 12 Ağustos 2026'da tanıtılan SL2T (sign-language-to-text), işaret dilini metne çeviren devasa çok dilli bir çeviri modeli olarak öne çıkıyor. Model, ilk etapta Amerikan İşaret Dili'ni (ASL) İngilizce'ye çevirerek Gboard ve Live Transcribe uygulamalarında Pixel 11 cihazlarda kullanıma sunuldu. Google, daha fazla cihaz ve dilin yakında ekleneceğini belirtiyor.

SL2T, işiten kullanıcıların sesli dikte kullanarak yazmak yerine konuşabilmesi gibi, sağır ve işitme güçlüğü çeken kullanıcıların da telefonlarına işaret diliyle yazabilmesini sağlıyor. Kullanıcılar web'de arama yapabilir, mesaj veya belge taslağı oluşturabilir ve Gemini'ye sorular sorabilir. Live Transcribe'da ise konuşmalarda yazıp göndermek yerine işaret diliyle yanıt verilebiliyor. Test kullanıcılarına göre ASL ile işaret etmek, İngilizce yazmaktan daha hızlı, daha doğal ve daha keyifli.

İşaret dilleri neden önemli

İşaret dilleri, sağır toplulukların birincil dilleri ve kültürel kimliklerinin temel taşı. Sağır insanlar arasında işaret etme, konuşma, okuma ve yazma yeterlilikleri açısından büyük çeşitlilik var. Bu nedenle tüm modalitelerde erişim desteği önemli. İşaret dili işleme, sağır insanlara işiten insanların konuşma dili işlemeden faydalandığı gibi fayda sağlayabilir ve sağır ile işiten topluluklar arasındaki iletişim boşluğunu kapatmak için yeni olanaklar sunar.

İşaret dili çevirisi, konuşma diline kıyasla iki temel zorluk içeriyor. Birincisi, işaret dilleri bağımsız, kendi dil bilgisi ve sözlüğü olan doğal dillerdir; bu nedenle sıralı işaretten kelimeye dönüşüm değil, gerçek makine çevirisi gerektirir. İkincisi, modelin fiziksel hareketi "görmesi" ve anlaması gerekir. İşaret dilleri, eller, kollar, gövde, baş ve yüzün eşzamanlı hareketleriyle anlam taşır. Bunları yüksek kare hızlarında doğru şekilde izlemek zorlu bir bilgisayar görüşü görevidir.

SL2T nasıl çalışıyor

SL2T, kullanıcı odaklı ve kültürel olarak bilinçli bir yaklaşımı büyük veri ölçeğiyle birleştiriyor. Model, 50'den fazla işaret dilinde 100.000 saatten fazla veriyle eğitildi; verinin yaklaşık dörtte biri ASL'de. Farklı diller, lehçeler ve yeterlilik seviyelerinde ortak eğitim, modelin paylaşılan temel yapıları öğrenmesini sağlıyor ve deneylerde tek dilli modellerden daha iyi performans gösteriyor.

Gizliliği korumak için SL2T, işaret dilini ham kamera görüntüsü yerine bir dizi poz landmark konumu olarak görüyor. Cihaz üzerinde çalışan MediaPipe Holistic modeli, işaretçinin vücudundaki noktaları takip ediyor ve yalnızca bu geometrik koordinatlar çeviri için sunucuya gönderiliyor; orijinal video anında siliniyor. SL2T bu koordinat dizisini doğrudan metne çeviriyor ve önceki çalışmalarda yaygın olan "gloss" ara açıklamalarını atlıyor. Glosslar, işaret dillerinin sözel olmayan belirteçler ve uzamsal yapılar gibi zengin, doğrusal olmayan yönlerini yakalayamıyor.

SL2T, FLEURS-ASL (sd-test) gibi önemli kıyaslamalarda bugüne kadarki en yetenekli işaret dili çeviri modeli olarak değerlendiriliyor. ASL'den İngilizce'ye çeviri kalitesini ölçen bu kıyaslamada 70 BLEURT puanı alarak sıfır atışta (zero-shot) daha önce bildirilen tüm puanların üzerine çıktı. Ancak akademik kıyaslamalar tek başına gerçek dünya kullanılabilirliğini garanti etmiyor; bu nedenle ekip, akıcı gecikmeyi en aza indirme, işaret etmeyen girdilerde halüsinasyonu önleme, solak işaretçilerin %10'u için adalet sağlama ve diğer elde akıllı telefon tutarken kullanılan tek elle işaret performansını iyileştirme gibi pratik sorunlar üzerinde çalıştı.

Neden önemli

SL2T, işaret dili yapay zekasını laboratuvardan çıkarıp tüketici ürünlerine taşıyan ilk model olma özelliği taşıyor. Bu, sağır ve işitme güçlüğü çeken kullanıcılar için teknolojiye erişimde önemli bir adım. Modelin çok dilli eğitimi, farklı işaret dilleri arasında paylaşılan yapıların öğrenilmesini sağlayarak tek dilli modellere göre daha iyi performans gösteriyor. Bu durum, işaret dili çevirisinin ölçeklenebilirliği açısından umut verici. Ayrıca, gizlilik odaklı tasarım (yalnızca landmark koordinatlarının sunucuya gönderilmesi) kullanıcı verilerinin korunmasına yönelik önemli bir yaklaşım sunuyor. Ancak modelin hâlâ nadir işaretlerde, hızlı parmak hecelemede, pasif yapılarda ve sınıflandırıcı betimlemelerinde hatalar yapabildiği belirtiliyor; bu da geliştirilecek alanlar olduğunu gösteriyor.