OpenAI, 13 Ağustos'ta GPT-5.6 Sol için Ultrafast adlı yeni bir önizleme hizmet katmanını duyurdu. Bu katman, modeli standart işlemeye göre 14 kata kadar daha hızlı çalıştırıyor ve saniyede 750'ye kadar çıktı token'ı üretebiliyor. Hizmet, öncelikle sınırlı bir müşteri grubuna API üzerinden sunuluyor; OpenAI, kapasite arttıkça erişimin genişleyeceğini belirtiyor.
Ultrafast, Cerebras donanımıyla çalışıyor ve GPT-5.6 Sol'un yeteneklerini korurken yanıt üretim süresini kısaltmayı hedefliyor. OpenAI, gerçek zamanlı performansın genellikle daha küçük veya daha özel bir model seçmeyi gerektirdiğini, Ultrafast'ın ise "saniye başına daha faydalı iş" hedeflediğini söylüyor. Şirket, olay müdahalesi, finansal araştırma, müşteri desteği, ticaret ve canlı araştırma gibi iş akışlarının bu hızdan en çok faydalanacağını öngörüyor.
Erken müşteriler, hızın modelin etkileşimli çalışmaya entegrasyonunu değiştirdiğini belirtiyor. Jane Street'ten John Crepezzi, artışı "etkileyici" olarak nitelendirirken, modelle birlikte odaklanmış çalışmanın daha pratik hale geldiğini söylüyor. Podium'ın ses yapay zekası ürün lideri Courtland Lykins ise Ultrafast'ın ses yığınları için değerli olduğunu, çünkü "hızın karmaşık işlerde çağrı deneyimini tamamen değiştirdiğini" ifade ediyor.
Finansal araştırmacılar için Ultrafast, değişen piyasa sinyallerini ve işlemleri yavaş toplu işleme süreçlerini beklemeden analiz etme imkânı sunuyor. Bu kullanım senaryosu, hızla değişen girdilere dayanıyor.
Önizleme, geniş bir halka açık sunumdan ziyade altyapı kısıtlarıyla sınırlı. OpenAI, hızın en çok değer ürettiği alanları belirlemek için ilk şirketlerden gelen geri bildirimleri kullanacağını ve erişimi buna göre genişleteceğini söylüyor.
Cerebras bağlantısı Ultrafast'tan öncesine dayanıyor. OpenAI, Ocak ayında çip üreticisiyle platformuna 750 megavat düşük gecikmeli yapay zeka işlem gücü eklemek için ortaklık duyurmuştu. Şubat ayında GPT-5.3-Codex-Spark, bu ortaklığa bağlı ilk model olarak Cerebras donanımıyla gerçek zamanlı kodlamada saniyede 1.000 token'ı aşmıştı.
Neden önemli
Ultrafast, büyük dil modellerinin (LLM) gerçek zamanlı kullanımındaki temel sınırlardan birini hedefliyor: yanıt gecikmesi. Şimdiye kadar gerçek zamanlı etkileşimler için genellikle daha küçük modeller tercih ediliyordu; Ultrafast, öncü modelin yeteneklerini koruyarak bu dengeyi değiştirmeyi amaçlıyor. Bu, müşteri desteği ve sesli asistanlar gibi gecikmeye duyarlı uygulamalarda daha yetenekli modellerin kullanılabilmesi anlamına geliyor.
Ayrıca, hız artışı token üretim maliyetini doğrudan etkiliyor. Saniyede 750 token, uzun ve karmaşık görevlerde toplam yanıt süresini önemli ölçüde kısaltabilir; bu da özellikle finansal araştırma ve olay müdahalesi gibi zamanın kritik olduğu alanlarda iş akışlarını dönüştürebilir. OpenAI'ın bu hızı önce sınırlı bir grupla test etmesi, teknolojinin henüz olgunlaşma aşamasında olduğunu ve şirketin kapasiteyi kademeli olarak artırmayı planladığını gösteriyor.