Henüz doygunluğa ulaşmamış LLM'ler, GPU'lar, bulut GPU'lar, AI ajanları, tablo AI ve siber güvenlik için 800'den fazla AI benchmark'ını derledik.
AI Benchmark Büyümesi
Mayıs–Haziran zirvesinin çoğunun, araştırmamızı yürüttüğümüz döneme karşılık geldiğini unutmayın. Sürekli güncellenen benchmark'lar, onları son doğruladığımız zamana tarihlendiğinden, yeni benchmark'larda gerçek bir artışa işaret etmek yerine veri topladığımız aylar civarında kümelenme eğilimindedir.
Kategorilere Göre AI Benchmark'ları
AI benchmark'larını ana kategorilerine göre listeledik. En fazla sayı açısından LLM benchmark'ları öndedir.
Alt Kategorilere Göre AI Benchmark'ları
AI Benchmark'ları Listesi
Basitlik açısından 809 benchmark'lık tam listemizden en güncel 250 benchmark'ı ekledik. Bu listeyi nasıl derlediğimizi öğrenmek için metodolojimizi okuyun.
Listeyi nasıl okuyacağınıza dair notlar:
Boolean bayrakları içeren dört sütun (T = true, F = false), her benchmark'ın hangi değerlendirme boyutunu kapsadığını gösterir. Her bayrak, benchmark'ın kapsamı hakkında evet/hayır sorusunu yanıtlar:
- Performans (T/F): Benchmark; çıktı doğruluğu, görev tamamlama veya zekâ gibi yetenek ya da kaliteyi değerlendiriyor mu? Hemen tüm benchmark'larda bu T olarak işaretlenmiştir, çünkü çoğu bir modelin veya sistemin ne kadar iyi performans gösterdiğini değerlendirir. Yalnızca maliyet veya hıza odaklanan ve çıktı kalitesini değerlendirmeyen benchmark'larda F olarak işaretlenmiştir.
- Fiyat (T/F): Benchmark; token başına dolar, çıktı başına fiyat veya görev başına maliyet gibi maliyetle ilgili faktörleri içeriyor mu?
- Gecikme (T/F): Benchmark; saniye başına token, ilk token'a kadar geçen süre, verim veya yanıt süresi gibi hızı ölçüyor mu? Yanıtın ne kadar sürdüğüne bakmaksızın doğruluğu değerlendiren benchmark'larda F'dir.
- Güvenilirlik (T/F): Benchmark; çalıştırmalar arası varyans, başarı oranlarının istikrarı veya sağlamlık gibi tutarlılık ya da güvenilirliği değerlendiriyor mu? Bu, en az yaygın olan bayraktır. HAL Reliability, tau-bench/tau2-bench, METR Time Horizons ve geçiş oranı tutarlılığının merkezi olduğu çeşitli ajan benchmark'ları dahil olmak üzere bu amaç için tasarlanmış benchmark'larda T'dir. Tek bir genel puan bildiren çoğu lider tablosunda F'dir.
- Kontaminasyona dayanıklı (T/F): Benchmark'ın, test sorularının bir modelin eğitim verilerinde göründüğü ve modelin gerçek yetenek yerine hatırlama yoluyla yüksek puanlar aldığı veri kontaminasyonu riskini azaltmak üzere tasarlanıp tasarlanmadığını gösterir. T, benchmark'ın gizli bir doğrulama seti, yeni üretilen veya dönen sorular, aylık yenilemeler, kendi kendini üreten öğeler veya bir modelin eğitim kesim tarihinden sonra yayımlanan yarışma problemleri gibi anlamlı bir savunmaya sahip olduğu anlamına gelir. F, benchmark'ın yıllardır çevrimiçi olan ve eğitim korpuslarına karışmış olabilecek sabit bir genel dataset olduğu anlamına gelir. Bu durumlarda yüksek puanlar daha dikkatli yorumlanmalıdır.
Pratikte T/F/F/F olarak işaretlenen bir satır, saf kalite benchmark'ını temsil eder. Buna karşılık T/T/T/T/F olarak işaretlenen bir benchmark; kaliteyi, maliyeti ve hızı birlikte değerlendirir. Bu bayraklar, her benchmark'ın dört değerlendirme ekseninden hangilerini kapsadığını gösteren kompakt bir sınıflandırma sağlar.
Neden bazı hücreler boş?
Kontaminasyona dayanıklı ve Kontaminasyon kaynağı: Bu iki alan, özellikle GPU, bulut GPU'ler, hız ve fiyatlandırma benchmark'ları için aynı satır türlerinde genellikle boştur. Kontaminasyon direnci, bir modelin test sorularını eğitim verilerinden ezberlemiş olabileceği bilgi ve akıl yürütme benchmark'larıyla ilgilidir. Donanım verimi, gecikme veya fiyatlandırma benchmark'larında kirletilecek test sorusu bulunmadığından alan, T veya F olarak işaretlenmek yerine boş bırakılır.
AI Benchmark Metodolojisi
Benchmark verilerini çevrimiçi bir araştırma ve doğrulama süreciyle topladık. Amaç; LLM'ler, GPU'lar, bulut GPU'ları, AI ajanları, tablo AI ve siber güvenlik dahil olmak üzere mevcut AI sistemlerini ve altyapılarını karşılaştırmak için yararlı olmaya devam eden yapılandırılmış bir teknoloji benchmark'ları listesi oluşturmaktı.
İşe dataset'in kapsamını tanımlayarak başladık. Model yeteneğini, altyapı performansını, maliyeti, gecikmeyi, güvenilirliği veya kontaminasyona direnci ölçen benchmark'lara odaklandık. Başlangıç kaynak listesi; Artificial Analysis, SemiAnalysis, Vals AI, LMArena, AIMultiple ve Epoch AI gibi belli başlı benchmark ve analiz sağlayıcılarının yanı sıra resmî benchmark web sitelerini, GitHub depolarını, akademik makaleleri, lider tablosu sayfalarını ve ilgili üçüncü taraf benchmark toplayıcılarını içeriyordu.
Her benchmark için hem tanımlayıcı hem değerlendirici alanları kaydettik. Tanımlayıcı alanlar benchmark'ın ne olduğunu, neyi ölçtüğünü, hangi ürünlerin veya modellerin değerlendirildiğini ve ne sıklıkla güncellendiğini yakalar. Değerlendirici alanlar ise benchmark'ın performans, fiyat, gecikme veya güvenilirlik ölçüp ölçmediğini sınıflandırır. Ayrıca benchmark yapısı ve veri bütünlüğü hakkında da bilgi topladık.
Mümkün olan her yerde birincil kaynaklara öncelik verdik. Bunlar arasında resmî benchmark metodolojisi sayfaları, lider tablosu sayfaları, GitHub depoları, benchmark makaleleri ve sağlayıcı belgeleri yer aldı. Birincil kaynak belirli bir alanı sağlamadığında, özellikle en yüksek puanlar, güncel model kapsamı ve son ölçüm tarihleri için boşlukları doldurmak amacıyla saygın ikincil kaynakları veya toplayıcıları kullandık. Her değere ilişkin kanıtın kaynağına kadar izlenebilmesi için dataset genelinde kaynak sütunlarına yer verildi.
Bu araştırmayı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{ermut2026,
author = {Ermut, Sıla},
title = {{800+ Önde Gelen AI Benchmark'ları}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-benchmarks}},
note = {AIMultiple. Erişim tarihi: 17 Ağustos 2026}
}250 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, bir CSV dosyası içeren ZIP dosyası olarak indirin.
Daha önce proje yönetimi ve danışmanlık firmalarında işe alım uzmanı olarak çalıştı. Sıla, Sosyal Psikoloji alanında yüksek lisans derecesine ve Uluslararası İlişkiler alanında lisans derecesine sahiptir.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.