Hizmetler
Bize Ulaşın

800+ Önde Gelen AI Benchmark'ları

Sıla Ermut
Sıla Ermut
Güncellenme tarihi: 17 Ağu 2026

Henüz doygunluğa ulaşmamış LLM'ler, GPU'lar, bulut GPU'lar, AI ajanları, tablo AI ve siber güvenlik için 800'den fazla AI benchmark'ını derledik.

AI Benchmark Büyümesi

Loading Chart

Mayıs–Haziran zirvesinin çoğunun, araştırmamızı yürüttüğümüz döneme karşılık geldiğini unutmayın. Sürekli güncellenen benchmark'lar, onları son doğruladığımız zamana tarihlendiğinden, yeni benchmark'larda gerçek bir artışa işaret etmek yerine veri topladığımız aylar civarında kümelenme eğilimindedir.

Kategorilere Göre AI Benchmark'ları

AI benchmark'larını ana kategorilerine göre listeledik. En fazla sayı açısından LLM benchmark'ları öndedir.

Alt Kategorilere Göre AI Benchmark'ları

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

AI Benchmark'ları Listesi

Basitlik açısından 809 benchmark'lık tam listemizden en güncel 250 benchmark'ı ekledik. Bu listeyi nasıl derlediğimizi öğrenmek için metodolojimizi okuyun.

Listeyi nasıl okuyacağınıza dair notlar:

Boolean bayrakları içeren dört sütun (T = true, F = false), her benchmark'ın hangi değerlendirme boyutunu kapsadığını gösterir. Her bayrak, benchmark'ın kapsamı hakkında evet/hayır sorusunu yanıtlar:

  • Performans (T/F): Benchmark; çıktı doğruluğu, görev tamamlama veya zekâ gibi yetenek ya da kaliteyi değerlendiriyor mu? Hemen tüm benchmark'larda bu T olarak işaretlenmiştir, çünkü çoğu bir modelin veya sistemin ne kadar iyi performans gösterdiğini değerlendirir. Yalnızca maliyet veya hıza odaklanan ve çıktı kalitesini değerlendirmeyen benchmark'larda F olarak işaretlenmiştir.
  • Fiyat (T/F): Benchmark; token başına dolar, çıktı başına fiyat veya görev başına maliyet gibi maliyetle ilgili faktörleri içeriyor mu?
  • Gecikme (T/F): Benchmark; saniye başına token, ilk token'a kadar geçen süre, verim veya yanıt süresi gibi hızı ölçüyor mu? Yanıtın ne kadar sürdüğüne bakmaksızın doğruluğu değerlendiren benchmark'larda F'dir.
  • Güvenilirlik (T/F): Benchmark; çalıştırmalar arası varyans, başarı oranlarının istikrarı veya sağlamlık gibi tutarlılık ya da güvenilirliği değerlendiriyor mu? Bu, en az yaygın olan bayraktır. HAL Reliability, tau-bench/tau2-bench, METR Time Horizons ve geçiş oranı tutarlılığının merkezi olduğu çeşitli ajan benchmark'ları dahil olmak üzere bu amaç için tasarlanmış benchmark'larda T'dir. Tek bir genel puan bildiren çoğu lider tablosunda F'dir.
  • Kontaminasyona dayanıklı (T/F): Benchmark'ın, test sorularının bir modelin eğitim verilerinde göründüğü ve modelin gerçek yetenek yerine hatırlama yoluyla yüksek puanlar aldığı veri kontaminasyonu riskini azaltmak üzere tasarlanıp tasarlanmadığını gösterir. T, benchmark'ın gizli bir doğrulama seti, yeni üretilen veya dönen sorular, aylık yenilemeler, kendi kendini üreten öğeler veya bir modelin eğitim kesim tarihinden sonra yayımlanan yarışma problemleri gibi anlamlı bir savunmaya sahip olduğu anlamına gelir. F, benchmark'ın yıllardır çevrimiçi olan ve eğitim korpuslarına karışmış olabilecek sabit bir genel dataset olduğu anlamına gelir. Bu durumlarda yüksek puanlar daha dikkatli yorumlanmalıdır.

Pratikte T/F/F/F olarak işaretlenen bir satır, saf kalite benchmark'ını temsil eder. Buna karşılık T/T/T/T/F olarak işaretlenen bir benchmark; kaliteyi, maliyeti ve hızı birlikte değerlendirir. Bu bayraklar, her benchmark'ın dört değerlendirme ekseninden hangilerini kapsadığını gösteren kompakt bir sınıflandırma sağlar.

Neden bazı hücreler boş?

Kontaminasyona dayanıklı ve Kontaminasyon kaynağı: Bu iki alan, özellikle GPU, bulut GPU'ler, hız ve fiyatlandırma benchmark'ları için aynı satır türlerinde genellikle boştur. Kontaminasyon direnci, bir modelin test sorularını eğitim verilerinden ezberlemiş olabileceği bilgi ve akıl yürütme benchmark'larıyla ilgilidir. Donanım verimi, gecikme veya fiyatlandırma benchmark'larında kirletilecek test sorusu bulunmadığından alan, T veya F olarak işaretlenmek yerine boş bırakılır.

AI Benchmark Metodolojisi

Benchmark verilerini çevrimiçi bir araştırma ve doğrulama süreciyle topladık. Amaç; LLM'ler, GPU'lar, bulut GPU'ları, AI ajanları, tablo AI ve siber güvenlik dahil olmak üzere mevcut AI sistemlerini ve altyapılarını karşılaştırmak için yararlı olmaya devam eden yapılandırılmış bir teknoloji benchmark'ları listesi oluşturmaktı.

İşe dataset'in kapsamını tanımlayarak başladık. Model yeteneğini, altyapı performansını, maliyeti, gecikmeyi, güvenilirliği veya kontaminasyona direnci ölçen benchmark'lara odaklandık. Başlangıç kaynak listesi; Artificial Analysis, SemiAnalysis, Vals AI, LMArena, AIMultiple ve Epoch AI gibi belli başlı benchmark ve analiz sağlayıcılarının yanı sıra resmî benchmark web sitelerini, GitHub depolarını, akademik makaleleri, lider tablosu sayfalarını ve ilgili üçüncü taraf benchmark toplayıcılarını içeriyordu.

Her benchmark için hem tanımlayıcı hem değerlendirici alanları kaydettik. Tanımlayıcı alanlar benchmark'ın ne olduğunu, neyi ölçtüğünü, hangi ürünlerin veya modellerin değerlendirildiğini ve ne sıklıkla güncellendiğini yakalar. Değerlendirici alanlar ise benchmark'ın performans, fiyat, gecikme veya güvenilirlik ölçüp ölçmediğini sınıflandırır. Ayrıca benchmark yapısı ve veri bütünlüğü hakkında da bilgi topladık.

Mümkün olan her yerde birincil kaynaklara öncelik verdik. Bunlar arasında resmî benchmark metodolojisi sayfaları, lider tablosu sayfaları, GitHub depoları, benchmark makaleleri ve sağlayıcı belgeleri yer aldı. Birincil kaynak belirli bir alanı sağlamadığında, özellikle en yüksek puanlar, güncel model kapsamı ve son ölçüm tarihleri için boşlukları doldurmak amacıyla saygın ikincil kaynakları veya toplayıcıları kullandık. Her değere ilişkin kanıtın kaynağına kadar izlenebilmesi için dataset genelinde kaynak sütunlarına yer verildi.

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Bu araştırmayı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Sıla Ermut (2026) - "800+ Önde Gelen AI Benchmark'ları". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 17 Ağustos 2026, kaynak: https://aimultiple.com/ai-benchmarks [Çevrimiçi Kaynak]

Ermut, S. (2026, 17 Ağustos). 800+ Önde Gelen AI Benchmark'ları. AIMultiple. https://aimultiple.com/ai-benchmarks

@misc{ermut2026,
  author = {Ermut, Sıla},
  title  = {{800+ Önde Gelen AI Benchmark'ları}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-benchmarks}},
  note   = {AIMultiple. Erişim tarihi: 17 Ağustos 2026}
}
Tüm verileri indir

250 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, bir CSV dosyası içeren ZIP dosyası olarak indirin.

Son güncelleme: 17 Ağustos 2026
İndir
Sıla Ermut
Sıla Ermut
Sektör Analisti
Sıla Ermut, AIMultiple'da yapay zeka model'lerini, yapay zeka altyapısını, yapay zeka yönetişimini ve kurumsal yapay zeka uygulamalarını ele alan bir sektör analistidir. Araştırmaları çoğunlukla yapay zekanın pazarlama, sağlık hizmetleri, tedarik zincirleri ve sürdürülebilirlik alanlarındaki kullanımına odaklanmaktadır.
Daha önce proje yönetimi ve danışmanlık firmalarında işe alım uzmanı olarak çalıştı. Sıla, Sosyal Psikoloji alanında yüksek lisans derecesine ve Uluslararası İlişkiler alanında lisans derecesine sahiptir.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450