Yapay zeka ile ses üretimi pazarı hızla büyürken, Fish Audio hem yaratıcılar hem de kurumlar için kapsamlı bir çözüm sunuyor. Palo Alto merkezli startup, 15.000'den fazla doğal dil kontrolü içeren ses kütüphanesiyle dikkat çekiyor.
Fish Audio, Salı günü yaptığı açıklamada, Coreline Ventures ve Capital Today liderliğinde 52 milyon dolar tohum yatırım aldığını duyurdu. Tura 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners ve HF0 da katıldı.
Startup, geçen yıl piyasaya sürülmesinden bu yana modellerinin açık kaynak veya barındırılan sürümlerini kullanan 8 milyondan fazla kişiye ulaştı ve 21 milyon dolar yıllık tekrarlayan gelir (ARR) elde etti.
Kökenler ve Teknoloji
Fish Audio, eski NVIDIA araştırmacısı Shijia Liao'nun küçük bir projesi olarak başladı. Piyasadaki ifadesiz sentetik seslerden rahatsız olan Liao, tek bir GPU üzerinde bir ses üretim modeli eğitti ve bunu açık kaynak olarak yayınladı. Fish Speech deposu GitHub'da 31.000'den fazla yıldız aldı ve bağımsız geliştiriciler, video oyunu tasarımcıları ve yaratıcılar tarafından kullanılıyor.
Şirket, geçen yıl içinde dördü ses üretim, biri konuşmadan metne olmak üzere beş model yayınladı. Üç ses üretim modelini açık kaynak olarak sunarken, en yeni S2.1 Pro modeli yalnızca ücretli API üzerinden erişilebilir.
Fish Audio, yaratıcılar ve ekipler için aylık planlar sunuyor; bu planlar belirli sayıda dakika üretim ve ses klonlama özellikleri içeriyor. Şirket ayrıca kurumsal API ve platform sürümü de sağlıyor ve HeyGen ile Sanas gibi kuruluşların halihazırda bu hizmeti kullandığı belirtiliyor.
Topluluk ve Güven Sorunları
Fish Audio, ses kütüphanesini oluşturmak için kullanıcıların kendi seslerini göndermesini istiyor ve sesleri kullanılırsa onlara tazminat ödüyor. Ancak bu yöntem, birkaç ay önce bazı yaratıcıların seslerinin izinsiz olarak yüklendiği iddialarıyla sorun yarattı. Startup'ın DMCA kaldırma süreci vardı ancak bu süreç uzun sürüyordu.
Fish Audio CEO'su ve kurucu ortağı Rissa Cao, şirketin artık kaldırma sürecini otomatikleştirdiğini söyledi. Yaratıcılar, kısa bir ses örneği veya sözleşme göndererek seslerinin üç dakikadan kısa sürede platformdan kaldırılmasını sağlayabiliyor. Ancak bu, bir sanatçının sesinin bilgisi dışında yüklenmesini engellemiyor.
Coreline Ventures ortağı Osuke Honda, topluluk odaklı bir modelin ancak yaratıcılar platforma güvendiğinde işe yarayacağını belirtti: "Topluluk merkezli bir yaklaşım, ancak yaratıcılar platforma güvenirse sürdürülebilir bir avantaj haline gelir. Bu, rıza, şeffaflık ve atıfın sonradan düşünülmek yerine ürüne yerleştirilmesi anlamına geliyor."
Gelecek Planları
Fish Audio, bu yıl bir ses anlama modeli ve bir konuşmadan konuşmaya modeli yayınlamayı planlıyor. Şirket, yalnızca açık kaynak ve yaratıcı planları sunarken verimli çalıştığını ancak daha gelişmiş modeller geliştirmek ve kurumsal talebi karşılamak için dış sermaye arayışına girdiğini belirtti.
Neden önemli
Ses üretim pazarı ElevenLabs, WellSaid, Cartesia, Speechify, Async (eski adıyla Podcastle) ve Krisp gibi şirketlerle oldukça rekabetçi. Fish Audio'nun 15.000'den fazla doğal dil kontrolü, geliştiricilere ince ayar yapma imkanı sunarken, maliyet etkin model eğitimi büyük yapay zeka laboratuvarlarıyla rekabette avantaj sağlayabilir. 359 Capital ortağı Rico Mallozzi'ye göre, şirketin küçük bir ekiple son teknoloji modeller geliştirmesi, yapay ve insan sesi arasındaki farkı kapatmadaki teknik yeteneğini gösteriyor. Ancak topluluk güveni ve telif hakkı ihlalleri konusundaki endişeler, platformun sürdürülebilir büyümesi için çözülmesi gereken kritik sorunlar olarak öne çıkıyor.