Ornith, 20 Ağustos 2026'da X üzerinden yaptığı duyuruyla Ornith-1.5 model ailesini tanıttı. Aile, 9B yoğun, 35B uzman karışımı (MoE) ve 397B MoE amiral gemisi olmak üzere üç modelden oluşuyor. Laboratuvar, tüm modellerin kendini geliştiren stratejilerle eğitildiğini ve MIT lisansı altında yayınlandığını belirtiyor. Ayrıca FP8, GGUF, MLX ve NVFP4 formatlarında quantize sürümler de sunuluyor.
Ornith, 397B sürümünün Terminal-Bench 2.1'de 86.1, SWE-Bench Verified'da 86, SWE-Bench Pro'da 65.1 ve SWE-Bench Multilingual'de 79.6 puan aldığını açıkladı. Ayrıca DeepSWE'de 56, Humanity's Last Exam'de 44.6, ClawEval'de 81.4 ve Tool Decathlon'da 71.2 skorları raporlandı. Bu rakamlar, laboratuvarın seçtiği kıyaslamalarda en güçlü kapalı kodlama ajanlarıyla aynı seviyede bir performans işaret ediyor.
Ancak bu iddialar, model yaratıcısının kendi duyurusuna dayanıyor ve bağımsız ölçümlerle doğrulanmış değil. Terminal-Bench'in genel liderlik tablosunda Claude Code ile Opus 4.8, Terminal-Bench 2.1'de %78.9 puan alırken, Ornith-1.0-397B aynı tabloda %77.5 ile yer alıyor. Ornith-1.5'in 86.1 skoru, eğer bağımsız olarak doğrulanırsa ciddi bir sıçrama anlamına gelir; ancak şu ana kadar bu yalnızca satıcı raporu.
Ornith-1.0'ın geçmişi, bu alanın ne kadar hızlı liderlik tablosu tiyatrosuna dönüşebileceğini gösteriyor. Önceki 397B model, Hugging Face model kartında SWE-Bench Verified'da 82.4 ve Terminal-Bench 2.1'de 77.5 puan almıştı; ancak yine de Ornith'in kendi yayınladığı ana metriklerde Claude Opus 4.8'in gerisinde kalmıştı. Yeni sürüm, bu açığın kapandığı iddiasını taşıyor.
Ornith'in en dikkat çekici iddiası tek bir kıyaslama satırı değil, eğitim yöntemi. Ornith-1.0'da laboratuvar, modelin yalnızca cevabı değil, kodlama görevi etrafındaki iskeleti (scaffold) de oluşturmayı öğrendiği 'kendi kendine iskeletleme' (self-scaffolding) yaklaşımını tanımlamıştı. Ornith-1.5 bu döngüyü daha da ileri taşıyor: model artık yeni görevler öneriyor, göreve özel iskeletler üretiyor ve çözüm roll-out'larını pekiştirmeli öğrenmeye geri besliyor.
Bu yaklaşım, modelin sabit bir insan yapımı kodlama problemi havuzunu tüketmek yerine kendi pratik materyalinin bir kısmını ürettiği anlamına geliyor. Küratörlü kodlama verisi toplamak yavaş, temizlemek zor ve aşırı öğrenmeye açık bir süreç; modelin kendine faydalı görevler yaratabilmesi, ajan eğitimindeki en zorlu darboğazlardan birini hafifletebilir.
Açık model alanı boş durmuyor. Alibaba'nın Qwen ailesi, Google'ın Gemma serisi, DeepSeek, MiniMax ve GLM modelleri kodlama ve araç kullanımını merkezi bir rekabet alanı haline getirdi. Ornith-1.0, model kartlarına ve GitHub materyallerine göre Gemma 4 ve Qwen 3.5 temelleri üzerine inşa edilmişti; bu nedenle bu, sıfırdan ortaya çıkan bir rakip değil, güçlü mevcut temel modeller üzerine yapılan bir sonradan eğitim (post-training) bahsi.
Geliştiriciler için 9B sürümü en kullanışlı parça olabilir. 397B MoE modeli bir gösterişten ibaretken, quantize edilmiş 9B model, yerel bir makinede veya küçük bir sunucuda test edilebilir. Eğer depo düzeyinde çalışmayı yeterince iyi yönetirse, küçük ekiplere sadece kodlama rozeti taşıyan bir sohbet modelinden daha ilginç bir seçenek sunar.
Neden önemli
Ornith-1.5'in asıl önemi, kıyaslama skorlarının ötesinde. Açık kaynak bir modelin, kapalı API'lerin en güçlü sistemleriyle aynı ligde olduğunu iddia etmesi, geliştiricilerin bağımsız altyapılar üzerinde ajanik kodlama sistemleri test edebilmesi anlamına geliyor. Eğer 9B sürümü vaat edilen boyutlarda kullanılabilirse, küçük ekipler bulut API'sine bağımlı kalmadan kendi yığınlarında denemeler yapabilir.
Ayrıca, kendi görevlerini üreten bir eğitim döngüsü, veri darboğazını aşmak için somut bir yol öneriyor. Bu, tek bir liderlik tablosu satırının Claude'u bir puan geçmesinden daha kalıcı bir etki yaratabilir. Ancak tüm bu iddialar, bağımsız doğrulama yapılana kadar dikkatle ele alınmalı; satıcı raporları ile kanıt arasındaki fark, bu alanda hızla kapanmayan bir uçurum olabilir.