Samaya AI, yatırım profesyonellerine yönelik yapay zeka platformu olarak, bugün FrontierFinance adlı yeni bir açık benchmark yayınladı. Bu benchmark, yapay zeka ajanlarının (AI Agents) yatırım sürecinin tamamını kapsayan zorlu iş akışlarındaki performansını ölçmek için tasarlandı. Samaya AI, kendi özel yapay zeka sisteminin değerlendirme sonuçlarını açıkladı ve sistemin, Anthropic Claude Fable 5, OpenAI GPT-5.6 Sol ve Google Gemini 3.1 Pro gibi öncü modelleri geride bıraktığını duyurdu.
FrontierFinance, finans uzmanları tarafından oluşturulmuş 220 farklı sorgu ve 11.543 uzman hazırlığı rubrikten oluşuyor. Rubrikler, Samaya AI'nin Criteria Eval çerçevesi kullanılarak geliştirildi. Benchmark, yatırım sürecinin fikir taraması, araştırma, finansal modelleme, portföy takibi ve katalizör izleme gibi tüm aşamalarını kapsıyor. Mevcut finans benchmark'larının çoğu yalnızca finansal veri çıkarmaya odaklanırken, FrontierFinance çok daha geniş bir kullanım yelpazesini ele alıyor.
Değerlendirmede, Anthropic Claude Fable 5 ve Claude Opus 4.8, OpenAI GPT-5.6 Sol, Google Gemini 3.1 Pro gibi öncü modellerin yanı sıra GLM 5.2 ve DeepSeek V4 Pro gibi açık kaynak modeller de yer aldı. Samaya AI'nin özel sistemi, düşük efor modunda %50,8 doğrulukla ve Fable 5'e kıyasla 4 kat daha düşük çıkarım maliyetiyle en iyi performansı gösterdi. Yüksek efor modunda ise %56 doğruluk ve Fable 5'e kıyasla 2 kat daha düşük maliyet elde edildi. Öncü modeller arasında en iyi performansı %49,2 ile Claude Fable 5 gösterirken, onu %46,8 ile GPT-5.6 Sol ve %45 ile Claude Opus 4.8 takip etti.
Samaya AI CEO'su ve Kurucusu Maithra Raghu, "Yatırım kullanım durumları yapay zeka için benzersiz şekilde zordur çünkü neredeyse doğru olmak hala kayıptır. Uzman düzeyinde bir yanıt üretmek, uzun ve karmaşık bir iş akışında her veri noktasında ve her akıl yürütme adımında doğruluk gerektirir, sadece makul görünen bir çıktı değil," dedi. Raghu, FrontierFinance'ın yatırım sürecinde bu doğrulukta ölçüm yapan ilk benchmark olduğunu ve Samaya'nın sisteminin öncü modelleri çok daha düşük maliyetle geride bırakmasının önemli olduğunu vurguladı.
Neden önemli
FrontierFinance, yapay zeka ajanlarının yatırım iş akışlarındaki performansını ölçmek için en kapsamlı ve zorlu açık benchmark olarak öne çıkıyor. Samaya AI'nin kendi sisteminin, çok daha düşük maliyetle öncü modelleri geçmesi, özel amaçlı modellerin genel amaçlı modellere kıyasla belirli alanlarda daha verimli olabileceğini gösteriyor. Bu durum, finans sektöründe yapay zeka kullanımının yaygınlaşmasıyla birlikte, uzmanlaşmış modellerin maliyet avantajı sağlayabileceğine işaret ediyor. Ayrıca, benchmark'ın açık kaynak olması, araştırmacıların ve geliştiricilerin kendi modellerini karşılaştırmasına olanak tanıyarak alandaki ilerlemeyi hızlandırabilir.