Yapay zeka teknolojisinin sınırlarını zorlayan Artificial Analysis'ın en son değerlendirme sistemi, beklenmedik bir hızla güncellendi. Platformun yetkilileri, bu ani dönüşümlerin, yapay zeka alanındaki olağanüstü ilerlemelerin, kapsamlı v5 güncellemesine geçilmeden önce hızlandırılmış bir şekilde sunulmasının zorunlu olduğunu açıkladı. Bu durum, sektördeki teknolojik atılımların ne kadar hızlı ve etkili olduğunu bir kez daha gözler önüne serdi.
İlk aşamada, GPT-6 Astra modeli, lansmanıyla birlikte v4.1.1 sürümünde 61 puan alarak liderliği ele geçirdi. Ancak, hemen ardından gelen v4.2 sürümü, değerlendirme kriterlerine yeni bir boyut getirdi. Platform, kullanıcı memnuniyetini ölçen GPQA Diamond testini ekleyerek, test sonuçlarında belirgin farklılıklar yarattı. Bu değişiklikler sonucunda, Fable 5.1 modelinin puanı 66'dan 57'ye, Astra modelinin ise 61'den 55'e geriledi. Bu durum, yapay zeka modellerinin performansının, kullanılan değerlendirme yöntemlerine ne kadar duyarlı olduğunu gösterdi.
Üç gün sonra, v4.3 sürümüyle birlikte Terminal-Bench ve AutomationBench-AA testleri sistemin içine entegre edildi. Bu entegrasyon, GPT-6 Astra ve Claude Fable 5.1 modellerinin puanlarını 53 puana eşitledi. Bu eşitsizlik, performans ve maliyet açısından önemli farklılıklar olduğunu ortaya koydu. Astra modelinin, 53 puanlık bir performans seviyesinde görev başına ortalama 3,26 dolar maliyet karşılığında hizmet sunması, Claude Fable 5.1 modelinin ise 7,63 dolar maliyetli olmasına neden oldu. Bu, Astra'nın aynı performansı sunarken, maliyet açısından yüzde 57 oranında daha avantajlı olduğunu gösteriyordu. Bu farkın temelinde, Astra'nın değerlendirme sürecinde daha az ‘çıktı çipi’ kullanması yatmaktaydı.
Test sonuçları, modellerin farklı yeteneklere sahip olduğunu da ortaya koydu. Fable 5.1, bilgi odaklı görevlerde ve bilimsel hesaplamalarda üstün performans gösterirken, Astra, terminal tabanlı yazılım işlerinde ve iş akışı otomasyonlarında daha başarılıydı. Ayrıca, Artificial Analysis, modellerin ‘ezber yapmasını’ önlemek amacıyla, gizli test setlerinin ağırlığını artırdı. Bu oran, v4.1 sürümünde yüzde 20 iken, v4.2'de yüzde 40'a, v4.3'te ise yüzde 45'e yükseltildi. Platform, v5 sürümünde bu oranı daha da artırmayı hedefliyor. Liderlik tablosunda, Astra ve Fable 5.1'in ardından Claude Opus 5 modeli 51 puanla üçüncü sırada yer aldı. Açık kaynaklı modeller arasında GLM-5.3 Flash 42 puanla öne çıktı. Bu gelişmeler, yapay zeka alanındaki rekabetin giderek arttığını ve teknolojinin sürekli olarak geliştiğini gösteriyor.