Hizmetler
Bize Ulaşın

LLM Karşılaştırmaları

Kamuya açık karşılaştırmaları AIMultiple'ın kendi agentic, RAG ve kurumsal muhakeme değerlendirmeleriyle birleştiren tek ve şeffaf bir Zeka Endeksi. Metodolojiyi inceleyin.

EN İYİ MODEL
Claude Opus 5
Endeks 86
En iyi değer
DeepSeek V4 Flash 0731
$0.11 / 1M
En hızlı
Trinity Large Thinking
0.12s TTFT
Kapsam
151 model
12 karşılaştırma · 697 değerlendirme
AIMultiple Zeka Endeksi

Liderlik Tablosu

Tüm benchmark'larda en yüksek puan alan modeller.

Filter & Sort
#
Model
Endeks
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
67
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Sayfa 1 / 16

Maliyet$10.00
Gecikme3.83s
Bağlam1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Maliyet$8.00
Gecikme4.43s
Bağlam1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Maliyet$20.00
Gecikme5.28s
Bağlam1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Maliyet$4.50
Gecikme1.92s
Bağlam1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Maliyet$10.00
Gecikme4.53s
Bağlam1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Maliyet$20.00
Gecikme5.44s
Bağlam1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Maliyet$1.50
Gecikme6.05s
Bağlam1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Maliyet$33.75
Gecikme3.65s
Bağlam1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Maliyet$5.44
Gecikme0.93s
Bağlam1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Maliyet$2.00
Gecikme10.25s
Bağlam1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Sayfa 1 / 16
Model Çıkış Zamanları
Model yayın tarihine göre Zeka Endeksi
Maliyet ve Performans
Harmanlanmış maliyete karşı Zeka Endeksi
Model × Karşılaştırma
Seçili karşılaştırmalarda önde gelen modeller
Metodoloji

Endeks Nasıl Oluşturulur

Her karşılaştırma 0-100 ölçeğinde bir konuma çevrilir ve endeks bu konumların ağırlıklı ortalamasıdır. Modelin girmediği karşılaştırma alan ortalaması sayılır, böylece puanlar karşılaştırılabilir kalır. Endeks = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAG5 veri tabanı üzerinde çoklu veri tabanı yönlendirmesi ve SQL sorgusu üretimi (BIRD-SQL, 500 soru).
Kamuya Açık
ARC-AGI-1Izgara donusumleri uzerinde az ornekli soyut akil yurutme; ilk ARC Prize kiyaslamasi.
Kamuya Açık
ARC-AGI-2Ezberi değil genellemeyi ölçen özgün görsel muhakeme bulmacaları.
Kamuya Açık
ArxivMathYeni arXiv matematik problemleri; kontaminasyonu sinirlamak icin yayindan hemen sonra kosulur.
Kamuya Açık
BioMysteryBenchAnthropic'in, ajanlarin ham veriden gercek biyoinformatik bilmecelerini cozup cozemedigini olcen kiyaslamasi.
Kamuya Açık
CritPtCok adimli turetme gerektiren arastirma duzeyinde fizik problemleri.
AIMultiple
FinanceReasoning238 zor FinanceReasoning sorusunda çok adımlı, karmaşık finansal muhakeme.
Kamuya Açık
Frontier-BenchGuncel depolar uzerinde ajan tabanli yazilim gorevleri; cozum orani ile puanlanir.
Kamuya Açık
FrontierMathUzmanlarca hazırlanmış, yayımlanmamış araştırma düzeyi matematik problemleri (1–4. seviyeler).
Kamuya Açık
LegalBenchHukuk profesyonellerinin oluşturduğu 162 görevde kitle kaynaklı hukuki muhakeme.
Kamuya Açık
MMMU-ProDisiplinler arasi universite duzeyinde cok kipli anlama; yalnizca metinle cozmeye karsi sertlestirilmis.
Kamuya Açık
Terminal-Bench 2.1Yazilim muhendisligi, veri ve sistem yonetimi alanlarinda ajan tabanli terminal gorevleri.
Kamuya Açık
Terminal-Bench HardTerminal-Bench'in zor alt kumesi: gercek bir terminalde cok adimli yazilim gorevleri.
Kamuya Açık
Terminal-Bench-ScienceGercek bilimsel hesaplama is akislarindan alinan terminal gorevleri.
AIMultiple
Text-to-SQL35'ten fazla LLM'de doğal dilden SQL sorgusu üretme doğruluğu.
Son Güncellemeler

Son Güncellemeler

Zeka Endeksi, model kapsamı ve AIMultiple karşılaştırma metodolojisindeki en son değişiklikler.

Google

Gemini 3.8 Flash

AIMultiple Zeka Endeksine yeni eklenen model.

Anthropic

Claude Fable 5.1

AIMultiple Zeka Endeksine yeni eklenen model.

Tencent

Hy4 preview

AIMultiple Zeka Endeksine yeni eklenen model.

Z AI

GLM 5.3 Flash

AIMultiple Zeka Endeksine yeni eklenen model.

Yapay Zeka Modeli Yayın Zaman ÇizelgesiSon 20 günde 12 model

Önde gelen sağlayıcıların son 20 gündeki öne çıkan yapay zeka modeli yayınları.

Sağlayıcı
OpenAI
OpenAI
04 Eyl 2026
GPT-6 Astra +1 dahaGPT-6 AstraGPT-6 Astra Pro
Alibaba Cloud
Alibaba Cloud
26 Ağu 2026
Qwen3.8 Flash
03 Eyl 2026
Qwen3.8 Max (0902)
Google
Google
02 Eyl 2026
Gemini 3.8 Flash
Meta
Meta
21 Ağu 2026
Muse Spark 1.2 Contributor
02 Eyl 2026
Muse Spark 1.3 +1 dahaMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Eyl 2026
Claude Fable 5.1
Tencent
Tencent
28 Ağu 2026
Hy4 preview
Z AI
Z AI
18 Ağu 2026
GLM 5.3
26 Ağu 2026
GLM 5.3 Flash

LLM Kullanım Durumları, Analizler ve Ölçümler Keşfedin

Sağlık Hizmetlerinde 9 Büyük Dil Modelini Karşılaştırın

LLM
Özellik Karşılaştırması
4 Eyl

MedQA dataset'ini kullanarak 9 LLM'i benchmark ettik; bu, USMLE sorularından türetilen lisansüstü düzeyde bir klinik sınav benchmark'ıdır. Her model, standart bir prompt kullanarak aynı çoktan seçmeli klinik senaryoları yanıtladı; bu da doğrulukların doğrudan karşılaştırılmasını sağladı. Ayrıca, toplam çalışma süresini tamamlanan MedQA öğesi sayısına bölerek soru başına gecikme süresini kaydettik. Benchmark metodolojisi: Bu benchmark, sağlık hizmetlerindeki…

Devamını Oku
LLM
İçgörü
3 Eyl

Büyük Multimodal Model'ler (LMM'ler) vs LLM'ler

Finansal akıl yürütme görevlerinde Büyük Multimodal Model'lerin (LMM'lerin) performansını özenle seçilmiş bir dataset kullanarak değerlendirdik. Yüksek kaliteli finansal örneklerin bir alt kümesini analiz ederek, model'lerin finans alanındaki multimodal verileri işleme ve bu verilerle akıl yürütme yeteneklerini değerlendiriyoruz. metodoloji bölümü kullanılan dataset ve değerlendirme framework'ü hakkında ayrıntılı bilgiler sunar. Büyük multimodal model'leri keşfedin ve bunları büyük…

LLM
İçgörü
2 Eyl

LLM Ölçekleme Yasaları: Yapay Zeka Araştırmacılarından Analiz

Büyük dil modelleri, metin verilerinden öğrenilen kalıplara dayanarak bir sonraki token'ı tahmin eder. LLM ölçekleme yasaları terimi, model performansını eğitim sırasında kullanılan hesaplama miktarı, eğitim verisi ve model parametreleriyle ilişkilendiren deneysel düzenlilikleri ifade eder. Bu ilişkilerin pratikte modern model tasarımını nasıl etkilediğini anlamak için 8 akademik makaleden bulguları ve 3 büyük yapay zeka laboratuvarı ile…

LLM
İçgörü
2 Eyl

LLM Gözlemlenebilirlik Araçları: Weights & Biases, Langsmith

LLM uygulamaları, tek turlu sohbetlerden araçları kullanan, veritabanlarını sorgulayan ve diğer modellerle koordine olan çok adımlı ajanlara doğru genişledi; bu da davranışlarını yorumlamayı zorlaştırıyor. LLM gözlemlenebilirliği, bu karmaşık iş akışlarına sürekli görünürlük sağlayarak kuruluşların kaliteyi izlemesine, hataları tespit etmesine, sorunları gidermesine ve performans ile maliyetleri yönetmesine yardımcı olur. W&B Weave, Weights & Biases'in LLM gözlemlenebilirlik…

LLM
Özellik Karşılaştırması
2 Eyl

Cloud LLM vs Local LLM'ler: Örnekler & Faydalar

Cloud LLM'ler, GPT-5.5 ve Claude Opus 4.7 gibi gelişmiş modellerle desteklenen, ölçeklenebilirlik ve erişilebilirlik sunar. Buna karşılık, Llama 4, DeepSeek V4 ve Qwen3.6-Plus gibi açık kaynaklı modellerle çalışan Yerel LLM'ler, daha güçlü gizlilik ve özelleştirme sağlar. Bulut LLM'lerin ne olduğunu, güçlü ve zayıf yönlerini, gerçek hayattan örneklerle en yaygın vaka çalışmalarını ve yerel LLM'lerden nasıl…

LLM
Kıyaslama
1 Eyl

Kitle Simülasyonu: LLM'ler İnsan Davranışını Tahmin Edebilir mi?

Pazarlamada, LLM'lerin insan davranışını ne kadar doğru tahmin ettiğini değerlendirmek; kitle ihtiyaçlarını öngörme ve yanlış hizalama, etkisiz iletişim veya istenmeyen etki gibi riskleri tanıma konusundaki etkinliklerini değerlendirmek için kritik önem taşır. Kitle simülasyonu, LLM'lerle birlikte sanal kitlelerin modellenmesini sağlayarak kuruluşların maliyetli anketlere veya odak gruplarına başvurmadan içeriklere veya ürünlere verilecek tepkileri öngörmelerine yardımcı olur. Yapay…

LLM
İçgörü
1 Eyl

LLM İnce Ayar Rehberi: İşletmeler İçin

LLM çıktı zorluklarınız için özel çözümlere giden bağlantıları takip edin. Eğer LLM'niz: Büyük dil modellerinin (LLM'ler) yaygın olarak benimsenmesi, insan dilini işleme yeteneğimizi geliştirdi. Ancak, genel eğitimleri genellikle belirli görevler için optimumun altında performansla sonuçlanır. Bu sınırlamanın üstesinden gelmek için, LLM'leri farklı uygulama alanlarının benzersiz gereksinimlerine göre uyarlamak amacıyla ince ayar yöntemleri kullanılır. Büyük bir…

LLM
İçgörü
1 Eyl

LLM Pazar Payı: Kullanım ve Benimsemeyi Karşılaştırın

Biz LLM pazar payını, kullanım tabanlı verileri ve web ziyareti tahminlerini birleştirerek, büyük dil modellerine olan talebin yapay zeka laboratuvarları ve yapay zeka uygulamaları arasında nasıl dağıldığını göstermek için analiz ettik: Bu sonuçları nasıl ölçtüğümüzü ve hesapladığımızı görmek için yöntemi okuyun. Birleşik Devletler, tüm dört ay boyunca web ziyaretlerinde hakimdi ve sürekli olarak 85.5–%90,5 oranına…

LLM
İçgörü
1 Eyl

10+ Large Language Model Örnekleri

Önde gelen özel ve açık kaynaklı large language model'leri karşılaştırmak için açık kaynak benchmark'ları bir araya getirdik. Doğru model'i bulmak için kullanım durumunuzu seçin. Large language model'leri, benchmark performanslarını ve gerçek dünya gecikme sürelerini (tablodaki her model'in adına tıklayarak görebilirsiniz) inceleyerek ve genel verimlilik ile maliyet etkinliğini değerlendirmek için fiyatlandırmalarını gözden geçirerek değerlendirebilirsiniz. Maliyet tahminine…

LLM
İçgörü
31 Ağu

LLM Kendi Kendine Barındırma için VRAM Hesaplayıcı

Bir LLM'yi kendi kendine barındırmak, çıkarımı operatörün kontrol ettiği donanımda, üçüncü taraf bir API aracılığıyla değil, çalıştırmak anlamına gelir; bu da maliyeti, veri kontrolünü ve gizlilik profilini değiştirir. Bir modelin hiç çalışıp çalışmayacağı belleğe bağlıdır. Hesaplayıcı, modele, hassasiyetine, bağlam uzunluğuna ve hedef donanıma bağlı olarak bir modelin yerel olarak çalıştırılması için gereken VRAM veya birleşik…

LLM
Özellik Karşılaştırması
27 Ağu

LLM Fiyatlandırması: En İyi 15+ Sağlayıcı Karşılaştırması

Bir LLM için ödeme yapmanın iki yolu vardır: büyük sağlayıcıların abonelik planları veya token kullanımına göre faturalandırılan kullandıkça öde API modeli. Her modelin verimliliğini ve maliyet etkinliğini değerlendirmek için model adlarına tıklayarak benchmark sonuçlarını, gerçek dünya gecikme sürelerini ve fiyatlandırmayı görüntüleyin. Sıralama: Modeller, tüm benchmark'lardaki ortalama konumlarına göre sıralanmıştır. En iyi LLM'lerin halüsinasyon oranlarını ve…