Hizmetler
Bize Ulaşın

LLM Karşılaştırmaları

Kamuya açık karşılaştırmaları AIMultiple'ın kendi agentic, RAG ve kurumsal muhakeme değerlendirmeleriyle birleştiren tek ve şeffaf bir Zeka Endeksi.

Son Güncelleme Haz 2026
EN İYİ MODEL
Claude Fable 5
Endeks 92
En iyi değer
MiniMax M3
$0.42 / 1M
En hızlı
GPT OSS 120B
0.19s TTFT
Kapsam
64 model
8 karşılaştırma · 336 değerlendirme
AIMultiple Zeka Endeksi

Liderlik Tablosu

Tüm benchmark'larda en yüksek puan alan modeller.

Filter & Sort
#
Model
Endeks
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Sayfa 1 / 7

Maliyet$20.00
Gecikme3.98s
Bağlam1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Maliyet$6.00
Gecikme252.11s
Bağlam1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Maliyet$11.25
Gecikme2.47s
Bağlam1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Maliyet$3.00
Gecikme10.26s
Bağlam500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Maliyet$11.25
Gecikme1.03s
Bağlam272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Maliyet$5.63
Gecikme1.92s
Bağlam1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Maliyet$11.25
Gecikme11.46s
Bağlam1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Maliyet$10.00
Gecikme1.75s
Bağlam1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Maliyet$4.50
Gecikme-
Bağlam1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Maliyet$4.50
Gecikme33.83s
Bağlam1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Sayfa 1 / 7

Grafikler

"En İyi Performans" modelleri takip ediliyor

Model Çıkış Zamanları
Model yayın tarihine göre Zeka Endeksi
Maliyet ve Performans
Harmanlanmış maliyete karşı Zeka Endeksi
Model × Karşılaştırma
Seçili karşılaştırmalarda önde gelen modeller
Metodoloji

Endeks Nasıl Oluşturulur

Zeka Endeksi her karşılaştırmayı 0-100 ölçeğine normalize eder ve modelin değerlendirildiği karşılaştırmalardaki göreli konumunun ortalamasını alır. Aşağıdaki her karşılaştırma bu puanı besler.

Son Güncellemeler

Son Güncellemeler

Zeka Endeksi, model kapsamı ve AIMultiple karşılaştırma metodolojisindeki en son değişiklikler.

Moonshot AI

Kimi K3

AIMultiple Zeka Endeksine yeni eklenen model.

OpenAI

GPT-5.6 Sol

AIMultiple Zeka Endeksine yeni eklenen model.

OpenAI

GPT-5.6 Terra

AIMultiple Zeka Endeksine yeni eklenen model.

OpenAI

GPT-5.6 Sol Pro

AIMultiple Zeka Endeksine yeni eklenen model.

LLM Kullanım Durumları, Analizler ve Ölçümler Keşfedin

LLM Ölçekleme Yasaları: Yapay Zeka Araştırmacılarından Analizler

LLM
İçgörü
24 Tem

Büyük dil modelleri metin verilerinden öğrenilen kalıplara dayanarak bir sonraki token'ı tahmin eder. LLM ölçekleme yasaları terimi, model performansını eğitim sırasında kullanılan hesaplama, eğitim verisi ve model parametreleri miktarına bağlayan ampirik düzenlilikleri ifade eder. Bu ilişkilerin pratikte modern model tasarımını nasıl etkilediğini anlamak için, 8 akademik makaleden bulguları ve 3 büyük yapay zeka laboratuvarı ve…

Devamını Oku
LLM23 Tem

LLM Fiyatlandırması: En İyi 15+ Sağlayıcı Karşılaştırması

Bir LLM için ödeme yapmanın iki yolu vardır: büyük sağlayıcıların abonelik planları veya token kullanımına göre faturalandırılan kullandıkça öde API modeli. Her modelin verimliliğini ve maliyet etkinliğini değerlendirmek için model adlarına tıklayarak benchmark sonuçlarını, gerçek dünya gecikme sürelerini ve fiyatlandırmayı görüntüleyin. Sıralama: Modeller, tüm benchmark'lardaki ortalama konumlarına göre sıralanmıştır. En iyi LLM'lerin halüsinasyon oranlarını ve…

LLM
Kıyaslama
17 Tem

Text-to-SQL: LLM Doğruluk Karşılaştırması

Veri analizi için SQL'e 18 yıldır güveniyorum, danışmanlık günlerimden beri. Doğal dildeki soruları SQL'e çevirmek, verileri daha erişilebilir kılar ve teknik becerisi olmayanlar da dahil herkesin doğrudan veritabanlarıyla çalışmasına olanak tanır. Text-to-SQL kıyaslama metodolojimizi 35'ten fazla büyük dil modeli (LLM'ler) üzerinde, SQL komutu oluşturma performanslarını değerlendirmek için kullandık: LLM'ler sıklıkla dört tür hata yapar: hatalı…

LLM
İçgörü
16 Tem

LLM İnce Ayar Rehberi: İşletmeler İçin

LLM çıktı zorluklarınız için özel çözümlere giden bağlantıları takip edin. Eğer LLM'niz: Büyük dil modellerinin (LLM'ler) yaygın olarak benimsenmesi, insan dilini işleme yeteneğimizi geliştirdi. Ancak, genel eğitimleri genellikle belirli görevler için optimumun altında performansla sonuçlanır. Bu sınırlamanın üstesinden gelmek için, LLM'leri farklı uygulama alanlarının benzersiz gereksinimlerine göre uyarlamak amacıyla ince ayar yöntemleri kullanılır. Büyük bir…

LLM
İçgörü
16 Tem

LLM Gözlemlenebilirlik Araçları: Weights & Biases, Langsmith

LLM uygulamaları, tek turlu sohbetlerden araçları kullanan, veritabanlarını sorgulayan ve diğer modellerle koordinasyon kuran çok adımlı ajanlara doğru genişledi ve bu da davranışlarını yorumlamayı zorlaştırdı. LLM gözlemlenebilirliği, bu karmaşık iş akışlarına sürekli görünürlük sağlayarak kuruluşların kaliteyi izlemesine, hataları tespit etmesine, sorunları gidermesine ve performans ile maliyetleri yönetmesine yardımcı olur. W&B Weave, Weights & Biases'ın LLM…

LLM
İçgörü
12 Tem

LLM Self-Hosting için VRAM Hesaplayıcı

Kendi barındırılan bir LLM, çıkarımın operatörün kontrol ettiği donanım üzerinde, üçüncü taraf bir API üzerinden değil, çalıştırılması anlamına gelir; bu durum maliyet, veri kontrolü ve gizlilik profilini değiştirir. Bir modelin çalışıp çalışmadığı tamamen belleğe bağlıdır. Hesaplayıcı, modelin, hassasiyetinin, bağlam uzunluğunun ve hedef donanımın temelinde bir modelin yerel olarak çalışması için gereken VRAM veya birleşik belleği…

LLM
Kıyaslama
10 Tem

Finans Alanında 40+ LLM Karşılaştırması: Claude Fable 5 ve GPT-5.6 Sol

Finans alanında 40+ LLM'i, hangi modellerin tablo analizi, tahminleme ve oran hesaplamaları gibi karmaşık finansal muhakeme görevlerinde üstün performans gösterdiğini belirlemek için FinanceReasoning karşılaştırma testindeki 238 zor soru üzerinde değerlendirdik. LLM'leri FinanceReasoning karşılaştırma testindeki (Tang ve diğerleri) 238 zor soru üzerinde değerlendirdik.1 Bu alt küme, finansal kavramları ve formülleri içeren karmaşık, çok adımlı nicel muhakemeyi…

LLM
İçgörü
10 Tem

LLM Otomasyonu: En İyi 7 Araç ve 8 Vaka Çalışması

LLM otomasyonu, AI ajanları, ince ayar yapılmış LLM'ler ve RAG modelleri dahil olmak üzere LLM'leri kullanarak görevleri otomatikleştiren ve koordine eden akıllı otomasyon araçlarına geçişi ifade eder. LLM otomasyonunun ne olduğunu, en önemli gerçek hayat uygulamalarını ve başlıca araçlarını keşfedin: Büyük dil modellerinin otomasyonda kullanımı, Doğal Dil İşleme (NLP) ile mevcut süreç otomasyon yöntemlerini birleştiren…

LLM
Kıyaslama
8 Tem

LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması

Toplam 1.320 istekle 11 üst düzey büyük dil modelini karşılaştırdık; akıl yürüten ve akıl yürütmeyen modelleri ayırdık ve ilk token gecikmesini, token başına gecikmeyi ve toplam yanıt süresini ölçtük. Gecikmeyi nasıl ölçtüğümüze dair ayrıntıları burada bulabilirsiniz. Akıl yürüten ve akıl yürütmeyen modelleri ayrı ayrı raporluyoruz. Akıl yürüten modeller ilk görünür yanıttan önce birkaç saniye düşünmeye…

LLM
Kıyaslama
7 Tem

HALC-Bench: LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon

HALC-Bench (LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon) büyük bir dil modelinin, hedef dokümanda bulunmayan bir metrik için kanıt uydurmaya karşı direncini, modelin bağlam penceresinin başına, ortasına ve sonuna yerleştirilmiş 3 samanlık kullanarak, 204 soru ile ölçer. claude-fable-5 her samanlık konumunda 204 tuzağın hepsini doğru yanıtladı. Kalan modeller arasında en az halüsinasyon gösteren gpt-5.5 oldu.…

LLM
Kıyaslama
7 Tem

71 LLM'nin Zeka Yoğunluğu: Daha Akıllı ve Daha Yoğun Modeller

Şubat 2023 ile Mayıs 2026 arasında yayınlanan 71 LLM'yi izledik ve zeka yoğunluğunu ölçmek için 10 genel kıyaslama topladık. Yetkinlik puanını modelin tükettiği kaynağa (aktif parametreler, eğitim hesaplaması ve çıkarım fiyatı) böldük. Zeka yoğunluğunu hesaplamak için şu adımları izledik: Puanlama yaklaşımı ve kaynak başına dökümler için metodoloji bölümüne bakın. 2026 ortasına gelindiğinde, yapay zeka ekosistemi…