Tether AI Research, küçük yapay zeka modellerini bilim, teknoloji, mühendislik ve matematik (STEM) alanlarında daha yetkin hale getirmek için tasarlanan QVAC Genesis III sentetik veri setini yayımladı. 191,43 milyar token ve 159,6 milyon belgeden oluşan veri seti, modellerin yalnızca doğru cevabı vermesini değil, cevabın neden doğru olduğunu ve yanlış seçeneklerin neden yanlış olduğunu açıklamasını hedefliyor.

Çalışma, yapay zekayı gündelik cihazlara taşımanın önündeki temel bir soruna odaklanıyor: Küçük modeller daha az hesaplama gücü gerektirdiği için dizüstü bilgisayarlarda, telefonlarda ve yerel sunucularda çalışabiliyor; ancak çok daha büyük sistemlere kıyasla yetenek kaybı yaşıyor. Genesis III, modelleri büyütmek yerine öğrendikleri veriyi iyileştirerek bu açığı kapatmayı amaçlıyor. Hedef, her sorunun büyük bir bulut modeline gönderilmesini gerektirmeyen, doğrudan kullanıcının cihazında çalışan yapay zeka öğretmenleri ve uzmanlaşmış teknik asistanlar.

Genesis III neyi farklı yapıyor?

Veri seti, 24 Ekim 2025'te yayımlanan QVAC Genesis I ve 22 Aralık 2025'te yayımlanan Genesis II'nin üzerine inşa edildi. Genesis III, lise, üniversite ve profesyonel düzeyde müfredatla uyumlu 19 STEM alanını kapsıyor; biyoloji, kimya, fizik, matematik, bilgisayar bilimi, tıp, astronomi, elektrik mühendisliği, istatistik ve makine öğrenmesi bunlar arasında.

Veri seti, modellere her problemden daha fazlasını öğretmek için iki yöntem kullanıyor:

  • Failure Analysis (Hata Analizi): Daha küçük bir "öğrenci" modelin hatalarını yeni eğitim materyaline dönüştürüyor. Daha yetenekli bir "öğretmen" model, akıl yürütmenin nerede bozulduğunu tespit ediyor, yanlış anlamayı açıklıyor ve doğru çözümü adım adım işliyor.
  • Option-Level Reasoning (Seçenek Düzeyinde Akıl Yürütme): Modelin doğru yanıtladığı sorularda hem cevabın neden doğru olduğunu hem de her bir alternatifin neden yanlış olduğunu açıklıyor.

İki yöntem birlikte, modellere yalnızca bir cevaba nasıl ulaşılacağını değil, hatalı akıl yürütmeyi nasıl tanıyıp düzelteceğini de öğretmeyi amaçlıyor.

Test sonuçları

Araştırmacılar, Genesis III'ün Option-Level veri setinin Qwen, Llama, SmolLM ve Gemma dahil birden fazla model mimarisinde eşdeğer Cosmopedia-v2 eğitimini geride bıraktığını buldu. Option-Level verisiyle eğitilen 1,7 milyar parametreli bir model, kıyaslama yanıtlarının %99,45'inde geçerli cevap üretti.

Tam Genesis III külliyatıyla eğitilen modeller de belirgin kazanımlar kaydetti. Token açısından eşleştirilmiş bir Cosmopedia-v2 modeliyle karşılaştırıldığında Genesis III; ARC-Easy'de 28,57 puan, ARC-Challenge'da 21,35 puan ve MMLU STEM kıyaslamasında 15,03 puan iyileşme sağladı. Genesis III ile ön eğitilmiş model, ek matematik ve kod verisiyle eğitilen daha büyük bir model olan Cosmo-1B'yi de değerlendirilen kıyaslamalarda geride bıraktı.

QVAC Genesis III makalesi, Conference on Language Modeling (COLM) 2026'da sunum için kabul edildi. Tether AI Research, çalışmayı daha geniş dil modeli topluluğunun araştırmalarıyla birlikte sunacak.

Tether CEO'su Paolo Ardoino, konuya ilişkin değerlendirmesinde yapay zeka endüstrisinin büyük ölçüde modelleri büyütmeye ve onlara daha fazla hesaplama gücü vermeye odaklandığını belirterek, Genesis III'ün küçük modellerin öğrendiği veriyi iyileştirmenin ne sağlayabileceğini gösterdiğini söyledi. Ardoino, STEM için bunun modelin yalnızca nihai cevabı değil, bir şeyin neden doğru olduğunu, akıl yürütmenin nerede bozulduğunu ve nasıl düzeltileceğini öğrenmesi anlamına geldiğini ifade etti. Hedefin, faydalı yapay zekayı büyük bulut altyapısından insanların hâlihazırda sahip olduğu cihazlara taşımak olduğunu ekledi.

Neden önemli

Yapay zeka yarışının büyük bölümü parametre sayısını ve hesaplama gücünü artırmaya odaklanmış durumda. Genesis III ise tam tersi bir kaldıraç noktasını işaret ediyor: Küçük modellerin öğrendiği verinin kalitesi. Bu yaklaşım, aynı donanımda daha yetenekli modeller anlamına geldiği için hem maliyet hem de erişilebilirlik açısından farklı bir denklem kuruyor.

Sonuçların en somut yansıması yerel çalışma. Model cihazda kaldığında, sürekli bulut erişiminin maliyeti ve bağlantı gereksinimi ortadan kalkıyor; hassas verilerin dışarı gönderilmesi de gerekmiyor. Bu, bağlantının kısıtlı olduğu okullar ve topluluklar için olduğu kadar, gizliliğin kritik olduğu profesyonel kullanım senaryoları için de belirleyici.

Eğitim tarafında ise fark, cevabı vermekle açıklamak arasındaki ayrımda yatıyor. Bir öğrencinin fizik problemini adım adım çözen, matematikte yanlış cevabın neden yanlış olduğunu gösteren ve akıl yürütmenin nerede koptuğunu tespit eden bir yapay zeka öğretmeni, yalnızca sonucu söyleyen bir araçtan nitelik olarak ayrılıyor. Hata Analizi ve Seçenek Düzeyinde Akıl Yürütme yöntemlerinin tam da bu boşluğu hedeflemesi, veri setini bir performans artışının ötesine taşıyor.

Kıyaslama sonuçları da yaklaşımın mimariden bağımsız işlediğini gösteriyor: Qwen, Llama, SmolLM ve Gemma gibi farklı modellerde benzer kazanımlar elde edilmesi, yöntemin tek bir modele özgü bir hile olmadığına işaret ediyor. 1,7 milyar parametreli bir modelin kıyaslama yanıtlarının %99,45'inde geçerli cevap üretmesi, küçük ölçekte güvenilirliğin mümkün olduğunu gösteriyor. COLM 2026'da sunulacak makale, bu sonuçların akademik topluluk önünde tartışılmasını sağlayacak.