Yapay zekada liderlik yarışı: Tablo bir haftada 3 kez değişti

featured
Google'da Abone Ol service
0
Paylaş

Bu Yazıyı Paylaş

veya linki kopyala

Yapay zeka sektörünün en çok takip edilen bağımsız değerlendirme platformu Artificial Analysis, Intelligence Index puanlama sistemini bir haftadan kısa bir süre içinde üç kez güncelledi. 7 Eylül’de yayımlanan v4.3 sürümünde OpenAI’ın GPT-6 Astra modeli ile Anthropic’in Claude Fable 5.1 modeli 53 puanda eşitlendi.

Artificial Analysis yetkilileri, v4.1.1, v4.2 ve v4.3 sürümlerinin daha geniş kapsamlı v5 güncellemesi öncesinde hızlandırılmış bir süreç olarak sunulduğunu bildirdi. Sektördeki hızlı ilerleme nedeniyle güncellemenin bekletilemediği ifade edildi.

Bir haftadaki üç güncelleme neleri değiştirdi

Güncelleme sürecinin başında, GPT-6 Astra’nın kullanıma sunulduğu dönemde v4.1.1 sürümünde Astra 61 puan alırken Fable 5.1 modeli 66 puandaydı.

Dört gün sonra yayımlanan v4.2 sürümünde platform, içeriğe yeni değerlendirme kriterleri eklerken doyuma ulaşan GPQA Diamond testini çıkardı. Bu aşamada fark kapanarak Fable 5.1’in puanı 57’ye, Astra’nın puanı ise 55’e geldi.

Üç gün sonra yayımlanan v4.3 sürümünde Terminal-Bench ve AutomationBench-AA testlerinin sisteme entegre edilmesiyle iki model 53 puanda eşitlendi.

İki modelin aynı toplam puana ulaşması, performans ve maliyet tarafında ciddi farklılıklar barındırıyor.

Astra v4.3 maliyet karşılaştırmasına göre, 53 puanlık performans seviyesinde GPT-6 Astra görev başına ortalama 3,26 dolar maliyet çıkarırken, Claude Fable 5.1 için bu rakam 7,63 dolar seviyesinde gerçekleşti. Bu durum Astra’nın aynı performans seviyesinde görev başına yüzde 57 daha düşük maliyet sunduğunu gösterdi. Aradaki farkın temel nedeni olarak Astra’nın değerlendirme sürecinde daha az çıktı çipi kullanması gösterildi.

Test detaylarında ise Fable 5.1 modeli bilgi odaklı işlerde ve bilimsel hesaplamalarda öne çıkarken, Astra modeli terminal tabanlı yazılım işlerinde ve iş akışı otomasyonlarında daha yüksek başarı gösterdi.

Platform, modellerin ezber yapmasını önlemek amacıyla gizli test setlerinin ağırlığını artırdı. v4.1 sürümünde yüzde 20 olan gizli test oranı v4.2’de yüzde 40’a, v4.3’te ise yüzde 45’e yükseltildi.

Artificial Analysis, v5 sürümünde bu oranı daha da artırmayı hedefliyor.

v4.3 liderlik tablosunda Astra ve Fable 5.1’in ardından Claude Opus 5 modeli 51 puanla üçüncü sırada yer aldı.

Claude Fable 5 modeli 50, Muse Spark 1.3 modeli 48, GPT-5.6 Sol modeli ise 47 puan aldı. Açık kaynaklı modeller arasında GLM-5.3 Flash 42 puanla öne çıktı.

Yapay zekada liderlik yarışı: Tablo bir haftada 3 kez değişti
0

Tamamen Ücretsiz Olarak Bültenimize Abone Olabilirsin

Yeni haberlerden haberdar olmak için fırsatı kaçırma ve ücretsiz e-posta aboneliğini hemen başlat.

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

0/30 karakter