Hizmetler
Bize Ulaşın

LLM Karşılaştırmaları

Kamuya açık karşılaştırmaları AIMultiple'ın kendi agentic, RAG ve kurumsal muhakeme değerlendirmeleriyle birleştiren tek ve şeffaf bir Zeka Endeksi. Metodolojiyi inceleyin.

EN İYİ MODEL
Claude Opus 5
Endeks 86
En iyi değer
DeepSeek V4 Flash 0731
$0.11 / 1M
En hızlı
Trinity Large Thinking
0.12s TTFT
Kapsam
151 model
12 karşılaştırma · 697 değerlendirme
AIMultiple Zeka Endeksi

Liderlik Tablosu

Tüm benchmark'larda en yüksek puan alan modeller.

Filter & Sort
#
Model
Endeks
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
67
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Sayfa 1 / 16

Maliyet$10.00
Gecikme3.83s
Bağlam1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Maliyet$8.00
Gecikme4.43s
Bağlam1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Maliyet$20.00
Gecikme5.28s
Bağlam1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Maliyet$4.50
Gecikme1.92s
Bağlam1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Maliyet$10.00
Gecikme4.53s
Bağlam1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Maliyet$20.00
Gecikme5.44s
Bağlam1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Maliyet$1.50
Gecikme6.05s
Bağlam1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Maliyet$33.75
Gecikme3.65s
Bağlam1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Maliyet$5.44
Gecikme0.93s
Bağlam1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Maliyet$2.00
Gecikme10.25s
Bağlam1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Sayfa 1 / 16
Model Çıkış Zamanları
Model yayın tarihine göre Zeka Endeksi
Maliyet ve Performans
Harmanlanmış maliyete karşı Zeka Endeksi
Model × Karşılaştırma
Seçili karşılaştırmalarda önde gelen modeller
Metodoloji

Endeks Nasıl Oluşturulur

Her karşılaştırma 0-100 ölçeğinde bir konuma çevrilir ve endeks bu konumların ağırlıklı ortalamasıdır. Modelin girmediği karşılaştırma alan ortalaması sayılır, böylece puanlar karşılaştırılabilir kalır. Endeks = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAG5 veri tabanı üzerinde çoklu veri tabanı yönlendirmesi ve SQL sorgusu üretimi (BIRD-SQL, 500 soru).
Kamuya Açık
ARC-AGI-1Izgara donusumleri uzerinde az ornekli soyut akil yurutme; ilk ARC Prize kiyaslamasi.
Kamuya Açık
ARC-AGI-2Ezberi değil genellemeyi ölçen özgün görsel muhakeme bulmacaları.
Kamuya Açık
ArxivMathYeni arXiv matematik problemleri; kontaminasyonu sinirlamak icin yayindan hemen sonra kosulur.
Kamuya Açık
BioMysteryBenchAnthropic'in, ajanlarin ham veriden gercek biyoinformatik bilmecelerini cozup cozemedigini olcen kiyaslamasi.
Kamuya Açık
CritPtCok adimli turetme gerektiren arastirma duzeyinde fizik problemleri.
AIMultiple
FinanceReasoning238 zor FinanceReasoning sorusunda çok adımlı, karmaşık finansal muhakeme.
Kamuya Açık
Frontier-BenchGuncel depolar uzerinde ajan tabanli yazilim gorevleri; cozum orani ile puanlanir.
Kamuya Açık
FrontierMathUzmanlarca hazırlanmış, yayımlanmamış araştırma düzeyi matematik problemleri (1–4. seviyeler).
Kamuya Açık
LegalBenchHukuk profesyonellerinin oluşturduğu 162 görevde kitle kaynaklı hukuki muhakeme.
Kamuya Açık
MMMU-ProDisiplinler arasi universite duzeyinde cok kipli anlama; yalnizca metinle cozmeye karsi sertlestirilmis.
Kamuya Açık
Terminal-Bench 2.1Yazilim muhendisligi, veri ve sistem yonetimi alanlarinda ajan tabanli terminal gorevleri.
Kamuya Açık
Terminal-Bench HardTerminal-Bench'in zor alt kumesi: gercek bir terminalde cok adimli yazilim gorevleri.
Kamuya Açık
Terminal-Bench-ScienceGercek bilimsel hesaplama is akislarindan alinan terminal gorevleri.
AIMultiple
Text-to-SQL35'ten fazla LLM'de doğal dilden SQL sorgusu üretme doğruluğu.
Son Güncellemeler

Son Güncellemeler

Zeka Endeksi, model kapsamı ve AIMultiple karşılaştırma metodolojisindeki en son değişiklikler.

Google

Gemini 3.8 Flash

AIMultiple Zeka Endeksine yeni eklenen model.

Anthropic

Claude Fable 5.1

AIMultiple Zeka Endeksine yeni eklenen model.

Tencent

Hy4 preview

AIMultiple Zeka Endeksine yeni eklenen model.

Z AI

GLM 5.3 Flash

AIMultiple Zeka Endeksine yeni eklenen model.

Yapay Zeka Modeli Yayın Zaman ÇizelgesiSon 20 günde 12 model

Önde gelen sağlayıcıların son 20 gündeki öne çıkan yapay zeka modeli yayınları.

Sağlayıcı
OpenAI
OpenAI
04 Eyl 2026
GPT-6 Astra +1 dahaGPT-6 AstraGPT-6 Astra Pro
Alibaba Cloud
Alibaba Cloud
26 Ağu 2026
Qwen3.8 Flash
03 Eyl 2026
Qwen3.8 Max (0902)
Google
Google
02 Eyl 2026
Gemini 3.8 Flash
Meta
Meta
21 Ağu 2026
Muse Spark 1.2 Contributor
02 Eyl 2026
Muse Spark 1.3 +1 dahaMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Eyl 2026
Claude Fable 5.1
Tencent
Tencent
28 Ağu 2026
Hy4 preview
Z AI
Z AI
18 Ağu 2026
GLM 5.3
26 Ağu 2026
GLM 5.3 Flash

LLM Kullanım Durumları, Analizler ve Ölçümler Keşfedin

Finans Alanında 40+ LLM Karşılaştırması: Claude Fable 5 ve GPT-5.6 Sol

LLM
Kıyaslama
14 Ağu

Finans alanında 40+ LLM'i, hangi modellerin tablo analizi, tahminleme ve oran hesaplamaları gibi karmaşık finansal muhakeme görevlerinde üstün performans gösterdiğini belirlemek için FinanceReasoning karşılaştırma testindeki 238 zor soru üzerinde değerlendirdik. LLM'leri FinanceReasoning karşılaştırma testindeki (Tang ve diğerleri) 238 zor soru üzerinde değerlendirdik.1 Bu alt küme, finansal kavramları ve formülleri içeren karmaşık, çok adımlı nicel muhakemeyi…

Devamını Oku
LLM
Kıyaslama
12 Ağu

LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması

En iyi 11 büyük dil modelini toplam 1.320 istek ile test ettik, akıl yürüten ve akıl yürütmeyen modelleri birbirinden ayırdık ve ilk token gecikmesini, token başına gecikmeyi ve toplam yanıt süresini ölçtük. Gecikmeyi nasıl ölçtüğümüze dair ayrıntıları burada bulabilirsiniz. Akıl yürüten ve akıl yürütmeyen modelleri ayrı olarak raporluyoruz. Akıl yürüten modeller, ilk görünür yanıttan önce…

LLM
Kıyaslama
11 Ağu

Agentic IT: Can LLMs Design a Benchmark

We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…

LLM
Kıyaslama
4 Ağu

Çok Modlu Yapay Zeka Modellerini Görsel Muhakeme Konusunda Karşılaştırın

Önde gelen 15 çok modlu yapay zeka modelini 200 görsel tabanlı soru kullanarak görsel muhakeme konusunda kıyasladık. Değerlendirme iki parkurdan oluşuyordu: veri görselleştirme yorumlamasını test eden 100 grafik anlama sorusu ve örüntü tanıma ile uzamsal muhakemeyi değerlendiren 100 görsel mantık sorusu. Tutarlı ve güvenilir sonuçlar sağlamak için her soru 5 kez çalıştırıldı. Test prosedürlerimizi öğrenmek…

LLM
Kıyaslama
2 Ağu

OpenAI için Yapay Zeka Ağ Geçitleri: OpenRouter Alternatifleri

OpenRouter, SambaNova, TogetherAI, Groq ve AI/ML API'yi üç gösterge (ilk token gecikmesi, toplam gecikme ve çıktı token sayısı) genelinde, toplam gecikme için kısa prompt'lar (yaklaşık 18 token) ve uzun prompt'lar (yaklaşık 203 token) kullanarak 300 testle benchmark ettik. Bu yapay zeka ağ geçitlerinden birini kullanmayı planlıyorsanız şunları yapabilirsiniz: Bu benchmark'ta, OpenRouter, SambaNova, TogetherAI, Groq ve…

LLM
Kıyaslama
5 Haz

Siber Güvenlikte Büyük Dil Modelleri

SecBench kullanarak 9 siber güvenlik alanında 7 büyük dil modeli değerlendirdik; SecBench, güvenlik görevleri için büyük ölçekli ve çok formatlı bir benchmark'tır. Her modeli veri güvenliği, kimlik ve erişim yönetimi, ağ güvenliği, zafiyet yönetimi ve bulut güvenliği gibi alanları kapsayan 44.823 çoktan seçmeli soruda (MCQ) ve 3.087 kısa cevaplı soruda (SAQ) test ettik. Bu büyük…

LLM
Kıyaslama
15 Nis

LLM Kuantizasyonu: BF16 vs FP8 vs INT4

Qwen3-32B'yi tek bir NVIDIA H100 80GB GPU üzerinde 4 hassasiyet seviyesinde (BF16, FP8, GPTQ-Int8, GPTQ-Int4) benchmark'ladık. Her yapılandırma, bilgi ve kod üretimi kapsayan 2 benchmark'ta (~12.2K soru) ve verimliliği ölçmek için 2.000'den fazla inference çalıştırmasında değerlendirildi. Int4, MMLU-Pro'da 2 puandan daha az kayıp yaşarken BF16'dan 2.7 kat daha hızlıdır, ancak kod üretimi (HumanEval) 8 puan…