Henüz doygunlaşmamış 800'den fazla YZ benchmark'ını LLM'ler, GPU'lar, bulut GPU'ları, YZ ajanları, tabular YZ ve siber güvenlik için derledik.
YZ benchmark büyümesi
Mayıs-Haziran zirvesinin çoğunun araştırmamızı yürüttüğümüz döneme karşılık geldiğini unutmayın. Sürekli güncellenen benchmark'lar, onları son doğruladığımız tarihle tarihlendirilir; bu nedenle yeni benchmark'larda gerçek bir artışa işaret etmekten ziyade, veri topladığımız aylar civarında kümelenme eğilimindedirler.
Kategorilere göre YZ benchmark'ları
YZ benchmark'larını ana kategorilerine göre listeledik. En fazla sayı bakımından LLM benchmark'ları başı çekiyor.
Alt kategorilere göre YZ benchmark'ları
YZ benchmark'ları listesi
Basitlik adına, en güncel 250 benchmark'ı, 809 benchmark'lık tam listemizden dahil ettik. Bu listeyi nasıl derlediğimizi öğrenmek için metodolojimizi okuyun.
Listeyi okumaya dair notlar:
Boolean bayraklı dört sütun (T = doğru, F = yanlış) her benchmark'ın hangi değerlendirme boyutunu kapsadığını gösterir. Her bayrak, benchmark'ın kapsamı hakkında evet/hayır sorusuna yanıt verir:
- Performans (T/F): Benchmark, çıktı doğruluğu, görev tamamlama veya zeka gibi yetenek veya kaliteyi değerlendiriyor mu? Çoğu benchmark için T işaretlenmiştir, çünkü çoğu bir modelin veya sistemin ne kadar iyi performans gösterdiğini değerlendirir. Yalnızca maliyet veya hıza odaklanan ve çıktı kalitesini değerlendirmeyen benchmark'lar için F işaretlenmiştir.
- Fiyat (T/F): Benchmark, token başına dolar, çıktı başına fiyat veya görev başına maliyet gibi maliyetle ilgili faktörleri içeriyor mu?
- Gecikme (T/F): Benchmark, saniye başına token, ilk token süresi, çıktı hacmi veya yanıt süresi gibi hızı ölçüyor mu? Yanıtın ne kadar sürdüğüne bakılmaksızın doğruluğu değerlendiren benchmark'lar için F'dir.
- Güvenilirlik (T/F): Benchmark, çalıştırmalar arası varyans, başarı oranlarının istikrarı veya sağlamlık gibi tutarlılık veya güvenilirliği değerlendiriyor mu? Bu en az yaygın bayraktır. HAL Reliability, tau-bench/tau2-bench, METR Time Horizons ve geçiş oranı tutarlılığının merkezi olduğu çeşitli ajan benchmark'ları dahil olmak üzere bu amaç için tasarlanmış benchmark'lar için T'dir. Tek bir genel puan bildiren çoğu liderlik tablosu için F'dir.
- Kontaminasyona dayanıklı (T/F): Benchmark'ın, test sorularının bir modelin eğitim verilerinde yer aldığı ve modelin gerçek yetenek yerine ezber yoluyla yüksek puan aldığı veri kontaminasyonu riskini azaltmak üzere tasarlanıp tasarlanmadığını gösterir. T, benchmark'ın gizli bir holdout, yeni oluşturulan veya dönen sorular, aylık yenilemeler, kendi kendine üreten öğeler veya bir modelin eğitim kesme tarihinden sonra yayımlanan yarışma problemleri gibi anlamlı bir savunmaya sahip olduğu anlamına gelir. F, benchmark'ın yıllardır çevrimiçi olan ve eğitim külliyatına emilmiş olabilecek sabit bir halka açık dataset olduğu anlamına gelir. Bu durumlarda yüksek puanlar daha dikkatli yorumlanmalıdır.
Uygulamada, T/F/F/F olarak işaretlenmiş bir satır saf kalite benchmark'ını temsil eder. Buna karşılık, T/T/T/T/F olarak işaretlenmiş bir benchmark kalite, maliyet ve hızı birlikte değerlendirir. Bu bayraklar, her benchmark'ın dört değerlendirme ekseninden hangilerini kapsadığını gösteren kompakt bir taksonomi sağlar.
Bazı hücreler neden boş?
Kontaminasyona dayanıklı & Kontaminasyon kaynağı: Bu iki alan, özellikle GPU, bulut GPU, hız ve fiyatlandırma benchmark'ları olmak üzere aynı satır türlerinde genellikle boştur. Kontaminasyon direnci, bir modelin eğitim verilerinden test sorularını ezberlemiş olabileceği bilgi ve akıl yürütme benchmark'larıyla ilgilidir. Donanım çıktı hacmi, gecikme veya fiyatlandırma benchmark'ları için kontamine edilecek test sorusu bulunmadığından alan T veya F olarak işaretlenmek yerine boş bırakılır.
YZ benchmark metodolojisi
Benchmark verilerini çevrimiçi araştırma ve doğrulama süreciyle topladık. Amaç, LLM'leri, GPU'ları, bulut GPU'ları, YZ ajanlarını, tabular YZ'yı ve siber güvenliği kapsayan, mevcut YZ sistemlerini ve altyapısını karşılaştırmak için yararlı kalan yapılandırılmış bir teknoloji benchmark'ları listesi oluşturmaktı.
Dataset'in kapsamını tanımlayarak başladık. Model yeteneği, altyapı performansı, maliyet, gecikme, güvenilirlik veya kontaminasyona direnci ölçen benchmark'lara odaklandık. İlk kaynak listesi, Artificial Analysis, SemiAnalysis, Vals YZ, LMArena, AIMultiple ve Epoch YZ gibi başlıca benchmark ve analiz sağlayıcılarının yanı sıra resmi benchmark web sitelerini, GitHub depolarını, akademik makaleleri, liderlik tablosu sayfalarını ve ilgili üçüncü taraf benchmark toplayıcılarını içeriyordu.
Her benchmark için hem tanımlayıcı hem değerlendirici alanları kaydettik. Tanımlayıcı alanlar, benchmark'ın ne olduğunu, neyi ölçtüğünü, hangi ürün veya modellerin değerlendirildiğini ve ne sıklıkta güncellendiğini yakalar. Değerlendirici alanlar, benchmark'ın performansı, fiyatı, gecikmeyi veya güvenilirliği ölçüp ölçmediğini sınıflandırır. Ayrıca benchmark yapısı ve veri bütünlüğü hakkında bilgi topladık.
Mümkün olduğunca birincil kaynaklara öncelik verdik. Bunlar resmi benchmark metodolojisi sayfalarını, liderlik tablosu sayfalarını, GitHub depolarını, benchmark makalelerini ve sağlayıcı dokümantasyonunu içeriyordu. Birincil kaynak belirli bir alanı sağlamadığında, özellikle en iyi skorlar, güncel model kapsamı ve son ölçüm tarihleri için boşlukları doldurmak amacıyla saygın ikincil kaynakları veya toplayıcıları kullandık. Kaynak sütunları, her değerin kanıtının kaynağına kadar izlenebilmesi için dataset genelinde dahil edildi.
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{ermut2026,
author = {Ermut, Sıla},
title = {{800+ Önde Gelen YZ benchmark'ları}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-benchmarks}},
note = {AIMultiple. Erişim tarihi: 13 Ağustos 2026}
}
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.