Hizmetler
Bize Ulaşın

LLM Karşılaştırmaları

Kamuya açık karşılaştırmaları AIMultiple'ın kendi agentic, RAG ve kurumsal muhakeme değerlendirmeleriyle birleştiren tek ve şeffaf bir Zeka Endeksi.

Son Güncelleme Haz 2026
EN İYİ MODEL
Claude Fable 5
Endeks 92
En iyi değer
MiniMax M3
$0.42 / 1M
En hızlı
GPT OSS 120B
0.19s TTFT
Kapsam
64 model
8 karşılaştırma · 336 değerlendirme
AIMultiple Zeka Endeksi

Liderlik Tablosu

Tüm benchmark'larda en yüksek puan alan modeller.

Filter & Sort
#
Model
Endeks
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Sayfa 1 / 7

Maliyet$20.00
Gecikme3.98s
Bağlam1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Maliyet$6.00
Gecikme252.11s
Bağlam1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Maliyet$11.25
Gecikme2.47s
Bağlam1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Maliyet$3.00
Gecikme10.26s
Bağlam500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Maliyet$11.25
Gecikme1.03s
Bağlam272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Maliyet$5.63
Gecikme1.92s
Bağlam1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Maliyet$11.25
Gecikme11.46s
Bağlam1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Maliyet$10.00
Gecikme1.75s
Bağlam1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Maliyet$4.50
Gecikme-
Bağlam1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Maliyet$4.50
Gecikme33.83s
Bağlam1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Sayfa 1 / 7

Grafikler

"En İyi Performans" modelleri takip ediliyor

Model Çıkış Zamanları
Model yayın tarihine göre Zeka Endeksi
Maliyet ve Performans
Harmanlanmış maliyete karşı Zeka Endeksi
Model × Karşılaştırma
Seçili karşılaştırmalarda önde gelen modeller
Metodoloji

Endeks Nasıl Oluşturulur

Zeka Endeksi her karşılaştırmayı 0-100 ölçeğine normalize eder ve modelin değerlendirildiği karşılaştırmalardaki göreli konumunun ortalamasını alır. Aşağıdaki her karşılaştırma bu puanı besler.

Son Güncellemeler

Son Güncellemeler

Zeka Endeksi, model kapsamı ve AIMultiple karşılaştırma metodolojisindeki en son değişiklikler.

Moonshot AI

Kimi K3

AIMultiple Zeka Endeksine yeni eklenen model.

OpenAI

GPT-5.6 Sol

AIMultiple Zeka Endeksine yeni eklenen model.

OpenAI

GPT-5.6 Terra

AIMultiple Zeka Endeksine yeni eklenen model.

OpenAI

GPT-5.6 Sol Pro

AIMultiple Zeka Endeksine yeni eklenen model.

LLM Kullanım Durumları, Analizler ve Ölçümler Keşfedin

Hedef Kitle Simülasyonu: LLM'ler İnsan Davranışını Tahmin Edebilir mi?

LLM
Kıyaslama
22 Haz

Pazarlamada, LLM'lerin insan davranışını ne kadar doğru tahmin ettiğini değerlendirmek, hedef kitle ihtiyaçlarını öngörmedeki etkinliklerini değerlendirmek ve uyumsuzluk, etkisiz iletişim veya istenmeyen etki risklerini tanımak açısından kritik öneme sahiptir. LLM'ler ile hedef kitle simülasyonu, sanal kitlelerin modellenmesini sağlar ve kuruluşların maliyetli anketlere veya odak gruplarına başvurmadan içeriklere veya ürünlere verilecek tepkileri öngörmesine yardımcı olur. Yapay…

Devamını Oku
LLM
Kıyaslama
15 Haz

Yapay Zeka Ağ Geçitleri için OpenAI: OpenRouter Alternatifleri

OpenRouter, SambaNova, TogetherAI, Groq ve AI/ML API'yi üç gösterge (ilk token gecikmesi, toplam gecikme ve çıktı token sayısı) üzerinden, toplam gecikme için kısa prompt'lar (yaklaşık 18 token) ve uzun prompt'lar (yaklaşık 203 token) ile 300 test yaparak karşılaştırdık. Bu yapay zeka ağ geçitlerinden birini kullanmayı planlıyorsanız şunları yapabilirsiniz: Bu karşılaştırmada OpenRouter, SambaNova, TogetherAI, Groq ve…

LLM
Kıyaslama
5 Haz

Siber Güvenlikte Büyük Dil Modelleri

SecBench kullanarak 9 siber güvenlik alanında 7 büyük dil modeli değerlendirdik; SecBench, güvenlik görevleri için büyük ölçekli ve çok formatlı bir benchmark'tır. Her modeli veri güvenliği, kimlik ve erişim yönetimi, ağ güvenliği, zafiyet yönetimi ve bulut güvenliği gibi alanları kapsayan 44.823 çoktan seçmeli soruda (MCQ) ve 3.087 kısa cevaplı soruda (SAQ) test ettik. Bu büyük…

LLM
İçgörü
26 May

Müşteri Hizmetleri için ChatGPT: En İyi 10 Kullanım Senaryosu

ChatGPT, müşteri hizmetlerinde bir yenilikten altyapıya evrildi. Şirketler, yanıt sürelerini kısaltmak, ekiplerinin karşılayamayacağı hacmi yönetmek ve rutin etkileşimlerin maliyetini düşürmek için onu kullanıyor. Ancak sonuçlar, nasıl uygulandığına bağlı olarak keskin bir şekilde değişir. OpenAI daha yetenekli bir model olan GPT-5.2 yayınladı ve bu model talimatları takip etme, uzun bağlamlarda akıl yürütme ve doğru, marka ile…

LLM
Kıyaslama
15 Nis

LLM Kuantizasyonu: BF16 vs FP8 vs INT4

Qwen3-32B'yi tek bir NVIDIA H100 80GB GPU üzerinde 4 hassasiyet seviyesinde (BF16, FP8, GPTQ-Int8, GPTQ-Int4) benchmark'ladık. Her yapılandırma, bilgi ve kod üretimi kapsayan 2 benchmark'ta (~12.2K soru) ve verimliliği ölçmek için 2.000'den fazla inference çalıştırmasında değerlendirildi. Int4, MMLU-Pro'da 2 puandan daha az kayıp yaşarken BF16'dan 2.7 kat daha hızlıdır, ancak kod üretimi (HumanEval) 8 puan…