Microsoft, ilk yerli gerçek zamanlı ses modeli olarak nitelendirilen MAI Realtime'ı test ediyor. Model, şirketin MAI Playground platformunda gizli bir erken erişim girişi olarak ortaya çıktı. Listeye göre küçük bir ortak grubu şimdiden modele erişim sağlamış durumda.

MAI Realtime, çift yönlü ve tam çift yönlü (full-duplex) bir sistem olarak dikkat çekiyor. Yani model, sırayla konuşmak yerine aynı anda hem dinleyip hem konuşabiliyor. Bu özellik, onu OpenAI'ın GPT Live 1 veya Sesame gibi modellerle doğrudan karşılaştırılabilir kılıyor.

Şu ana kadar iki ses mevcut: Victoria ve Grant. Her ikisi de Copilot'un mevcut ses modundan belirgin şekilde daha doğal. Dil açıkça sabitlenebiliyor veya otomatik algılamaya bırakılabiliyor. Model, konuşma sırasında dili değiştirebiliyor ve akıcılığını kaybetmiyor.

Sıra yönetimi iki dinleyici seçeneğiyle yapılandırılabiliyor: MAI-Ears endpointer'ına dayanan ve satır içi kontrol token'larıyla çalışan Switchboard modu ile sessizlik tabanlı endpointing'i Whisper semantik endpointer ile birleştiren deterministik bir kurulum. Pratikteki fark kullanımda ince olsa da, kesintiler temiz bir şekilde ele alınıyor ve yanıt gecikmesi düşük.

Model şarkı söylemiyor veya konuşma dışı sesler üretmiyor. Bu da onu genel bir ses üreteci değil, tamamen konuşma odaklı bir sistem yapıyor. Bir hata ayıklama paneli, canlı gecikme rakamlarını, model düşüncelerini ve işlem adımlarını gösteriyor. Erişim genişlediğinde playground kullanıcıları için örnek paylaşımının da gelmesi bekleniyor.

Bu, Microsoft'un portföyünde belirgin bir boşluğu dolduracak. Şu ana kadar piyasaya sürülen tüm MAI ses modelleri tek yönlü çalışıyor: MAI-Voice-2 ve Flash varyantı sentez için, MAI-Transcribe-1.5 ise tanıma için kullanılıyor. Azure Speech'in Voice Live API'sindeki konuşmadan konuşmaya katmanı hâlâ GPT-Realtime modeline dayanıyor. İlk parti tam çift yönlü bir model, Mustafa Suleyman'ın süper zeka ekibinin bu bağımlılığını ortadan kaldıracak. Ekip, Build 2026'da yedi şirket içi model piyasaya sürmüştü ve Copilot, Teams ve Bing'den OpenAI bileşenlerini kademeli olarak çıkarıyor.

Microsoft Foundry'nin geliştirici hedefi olması muhtemel; Copilot ses ise bariz tüketici yüzeyi olarak öne çıkıyor. Ancak her ikisi için de henüz bir zaman çizelgesi belirtilmedi.

Neden önemli

MAI Realtime'ın ortaya çıkışı, Microsoft'un yapay zeka alanındaki bağımsızlık stratejisinin bir parçası olarak değerlendirilebilir. Şirket, OpenAI'a olan bağımlılığını azaltmak için kendi modellerini geliştiriyor. Özellikle Azure Speech'in Voice Live API'sinde hâlâ GPT-Realtime kullanılması, bu alandaki dışa bağımlılığın somut bir göstergesi. İlk parti tam çift yönlü bir model, bu bağımlılığı ortadan kaldırarak Microsoft'un kendi teknolojisiyle uçtan uca bir ses deneyimi sunmasını sağlayabilir.

Ayrıca, modelin çok dilli desteği ve düşük gecikme süresi, onu küresel pazarda rekabetçi kılabilir. Copilot'un ses modunun doğallığını artırması, kullanıcı deneyimini önemli ölçüde iyileştirebilir ve Microsoft'un yapay zeka asistanını rakiplerine karşı daha güçlü bir konuma getirebilir. Ancak henüz bir zaman çizelgesi olmaması, bu teknolojinin ne zaman genel kullanıma sunulacağı konusunda belirsizlik yaratıyor.