OpenAI, yeni amiral gemisi modeli GPT-6 Astra'nın lansman sonrası "aptallaştığı" yönündeki bir haftalık şikayet dalgasının ardından üç teknik hatayı tespit edip düzelttiğini duyurdu. Codex ürün lideri Tibo Sottiaux, cumartesi günü yayımlanan güncellemede ekibin kullanıcılarla birlikte sorunları izlediğini, düzeltmeleri yayına aldığını ve yerel saatle gece yarısından önce Codex aboneleri için kullanım limitlerini tamamen sıfırladığını belirtti.
Üç ayrı arıza
Sottiaux'nun sıraladığı nedenlerden ilki, eski modeller için yazılmış yeteneklerin (skills) çok sık tetiklenmesiydi. Bu durum Astra'nın zaman zaman kendi işini kontrol etmesini engelliyordu. İkinci sorun ise isteğe bağlı bir bağlam yönetimi (context management) deneyiydi: Bu deney, modelin erken yanıt vermesine ya da eski mesajlara cevap üretmesine yol açabiliyordu. OpenAI, yaklaşık 4.000 ila 5.000 kullanıcıyı etkileyen bu testi devre dışı bıraktı.
Üçüncü arıza ise altyapı tarafındaydı. Bazı motorlar yanlış yapılandırılmıştı ve bu motorlar üzerinden yönlendirilen "kuyruk" trafiğinde ölçülebilir bir kalite düşüşü yaşanıyordu. Şirket bu motorları kaldırdı ve birkaç küçük onarım daha yaptı. Sottiaux, modelin artık kullanıcının en son mesajını daha doğru takip ettiğini yazdı.
Geliştiriciler ne bildirdi?
Şikayetler hafta boyunca X üzerinde birikti. Geliştiriciler, lansman günündeki Astra ile mevcut sürümü aynı istemlerle, tüm ayarları sabit tutarak yan yana test etti ve sonuçları karşılaştırdı. Modeli günler önce öven geliştirici Pranjal Paliwal, kendisi için yazılan kodu yeniden inceledi ve sonucu ilerleme değil "gerileme" olarak nitelendirdi.
Kodlama aracı Opencode'u geliştiren Dax Raad ise ekibini eski model GPT-5.6 Sol'e geri taşıdı. Raad, Astra'daki harcamanın iki katına çıktığını ve elde edilen sonuçların bu maliyete değmediğini belirtti. Bir forum kullanıcısı da Astra'nın artık aynı görevlerde Sol ile aynı seviyede olduğunu ve aynı sayıda yeniden deneme gerektirdiğini yazdı.
Herkes bu okumayı kabul etmedi. Antikythera takma adıyla yazan bir kullanıcı, modelin baştan beri tembel olduğunu ve madde işaretli listeler kullanmayı sevdiğini, dolayısıyla kullanıcıların yalnızca ilk etkinin büyüsünden çıktığını savundu.
Kapasite gölgesi
Hesaplama kapasitesi sorunu, model eylül başında geniş kullanıma açıldığından beri süreci gölgeliyor. Kullanıcı raporlarına göre OpenAI, yoğun ChatGPT kullanıcıları için Astra kullanım limitlerini kıstı ve yeni 200 dolarlık Pro aboneliklerini duraklattı; Sottiaux bu adımı 10 Eylül'de doğruladı. Model hâlâ milyon giriş token'ı başına 10 dolar, milyon çıkış token'ı başına 50 dolar fiyatlanıyor; bu, Sol'un lansman fiyatının 2,5 katı.
Bu, iki ay içinde ödeme yapan kullanıcılardan aynı suçlamayı alan ikinci OpenAI amiral gemisi oldu. Kullanıcılar temmuz ayında Sol'un en güçlü akıl yürütme modunun bir gecede yüzeyselleştiğini söylemiş, Sottiaux modeli kasten zayıflatmadıklarını reddederken şirketin akıl yürütme eforu üzerinde deneyler yaptığını doğrulamıştı.
Neden önemli
Bu olay, sınır modellerinde yaşanan kalite dalgalanmalarının artık istisna değil, tekrarlayan bir örüntü haline geldiğini gösteriyor. Aynı suçlamanın iki ay içinde iki farklı amiral gemisi için dile getirilmesi, sorunun tek bir hatadan çok dağıtım ve altyapı yönetimi pratiklerine işaret ettiğini düşündürüyor.
Öne çıkan üç neden de bunu destekliyor: eski modeller için yazılmış yeteneklerin yeni modelde istenmeyen davranışlar tetiklemesi, bağlam yönetimi gibi deneylerin üretim trafiğine sızması ve yanlış yapılandırılmış motorların kaliteyi ölçülebilir biçimde düşürmesi. Üçü de modelin kendi yeteneğinden çok, onu çevreleyen sistemlerle ilgili.
Geliştiriciler açısından bu, model seçiminin yalnızca benchmark skorlarına bakılarak yapılamayacağı anlamına geliyor. Aynı model, aynı istemlerle haftalar içinde farklı sonuçlar verebiliyor; bu da üretim sistemlerinde sürüm sabitlemeyi ve düzenli regresyon testlerini zorunlu kılıyor. Token maliyetinin Sol'un 2,5 katı olması ise kalite dalgalanmasını doğrudan bir maliyet sorununa dönüştürüyor: Raad örneğinde olduğu gibi ekipler, beklenen faydayı göremediklerinde daha ucuz ve öngörülebilir bir modele geri dönebiliyor.
OpenAI'nin kullanım limitlerini sıfırlaması ve Pro aboneliklerini geçici olarak durdurması, kapasite kısıtının kalite sorunundan bağımsız bir baskı unsuru olduğunu gösteriyor. Ödeme yapan kullanıcılar için güven, artık yalnızca modelin yeteneğiyle değil, bu yeteneğin tutarlı biçimde sunulup sunulmadığıyla ölçülüyor.