Sesli yapay zeka girişimi Patientdesk.ai, Türkçe odaklı geliştirdiği iki yeni ses modelini kullanıma sundu. Şirketin Alania adlı modeli metni sese dönüştürürken, Duyu konuşmaları yazıya aktarıyor. Her iki model de tek bir hesap ve API anahtarı üzerinden kullanılabiliyor.

Patientdesk.ai'ın şubat ayında Y Combinator liderliğindeki tohum öncesi turda 1 milyon dolar yatırım aldığı daha önce aktarılmıştı. Şirket, ABD'deki kliniklerin telefon görüşmelerini yanıtlayan sesli asistanını geliştirirken edindiği deneyimi Türkçe modellere taşıdığını belirtiyor.

Türkçe neden ayrı bir model gerektiriyor

Yeni modellerin çıkış noktasında, mevcut sesli yapay zeka çözümlerinin önemli bir bölümünün ağırlıklı olarak İngilizce verilerle eğitilmiş olması yer alıyor. Türkçenin eklemeli yapısı, özel isimler, telefon görüşmelerindeki düşük ses kalitesi ve konuşma sırasında aktarılan e-posta adresleri ile telefon numaraları mevcut modeller için çeşitli zorluklar yaratabiliyor.

Duyu, FLEURS testinde Whisper large-v3'ü geride bıraktı

Şirketin paylaştığı verilere göre Duyu, açık Türkçe okuma testi FLEURS'ta yüzde 4,71 kelime hata oranına ulaştı. Aynı testte OpenAI'ın Whisper large-v3 modelinin kelime hata oranı yüzde 5,04 olarak ölçüldü.

Patientdesk.ai'ın telefon kalitesindeki seslerden ve e-posta adresleri ile telefon numaralarının söylendiği konuşmalardan oluşan kendi test setinde ise Duyu'nun hata oranı yüzde 9,87 oldu. Şirketin aktardığına göre ElevenLabs'in Scribe v2 modeli aynı test setinde yüzde 10,4 hata oranı elde etti.

Duyu, önceden kaydedilmiş ses dosyalarının yanı sıra canlı konuşmaları da gerçek zamanlı olarak yazıya dönüştürebiliyor. Model, yüklenen bir ses dosyasını hızlı biçimde metne çeviriyor.

Alania düşük gecikmeye odaklanıyor

Alania ise Türkçe metinleri doğal ve tutarlı tek bir sesle okumaya odaklanıyor. Modelin ürettiği sesi cümlenin tamamlanmasını beklemeden akış halinde gönderebilmesi, özellikle telefon görüşmeleri ve sesli asistanlar gibi düşük gecikmenin önemli olduğu kullanım senaryolarını hedeflediğini gösteriyor.

Şu an için platformda yalnızca tek bir ses seçeneği yer alıyor. Seslendirme esnasında randevu, soru ve sakinleştirme gibi tonlama seçenekleri sunuluyor.

Her iki model de yaygın olarak kullanılan OpenAI API biçimiyle uyumlu. Bu sayede geliştiriciler modelleri mevcut uygulamalarına küçük değişikliklerle entegre edebiliyor. Patientdesk.ai, modellerin tarayıcı üzerinden denenmesine ve geliştiricilerin API anahtarı oluşturmasına da imkan tanıyor. Modeller, lansman kapsamında kayıt tarihinden itibaren bir ay boyunca ücretsiz sunuluyor.

Antalia-1 açık kaynak olarak yayınlandı

Patientdesk.ai, Alania ve Duyu'nun yanı sıra araştırma topluluğuna yönelik Antalia-1 adlı deneysel Türkçe metinden sese modelini de açık kaynak olarak yayınladı. Tek bir sesle eğitilen Antalia-1'in model ağırlıkları, kodu ve teknik raporuyla birlikte yaklaşık 5 saatlik Türkçe ses veri seti de paylaşıldı. Şirket, Antalia-1'i ticari ürünlerinden ayrı bir araştırma çalışması olarak konumlandırıyor.

Neden önemli

Türkçe, sesli yapay zeka pazarında uzun süre İngilizce modellerin yan ürünü olarak ele alındı. Patientdesk.ai'ın yaklaşımı, telefon görüşmeleri ve e-posta/numara aktarımı gibi gerçek kullanım koşullarını test setine taşıması bakımından dikkat çekici. Şirketin kendi ölçümlerinde Duyu'nun hem FLEURS hem de telefon kalitesindeki test setinde Whisper large-v3 ve Scribe v2'nin önüne geçmesi, Türkçe'ye özel eğitimin ölçülebilir bir fark yaratabildiğini gösteriyor.

OpenAI API biçimiyle uyumluluk, geliştiriciler için geçiş maliyetini düşürüyor; bu da modellerin mevcut ürünlere hızla entegre edilebilmesi anlamına geliyor. Antalia-1'in ağırlıkları, kodu ve veri setiyle birlikte açık kaynak yayınlanması ise Türkçe ses verisi kıtlığı yaşayan araştırma topluluğu için ayrı bir katkı. Tek ses seçeneği ve sınırlı tonlama gibi kısıtlar ise ürünün henüz erken aşamada olduğunu gösteriyor.