AIMultiple Zeka Endeksindeki en yeni model Kimi K3.
LLM Karşılaştırmaları
Kamuya açık karşılaştırmaları AIMultiple'ın kendi agentic, RAG ve kurumsal muhakeme değerlendirmeleriyle birleştiren tek ve şeffaf bir Zeka Endeksi. Metodolojiyi inceleyin.
Liderlik Tablosu
Tüm benchmark'larda en yüksek puan alan modeller.
# | Model | Endeks | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Sayfa 1 / 7 | ||||||||||
Endeks Nasıl Oluşturulur
Zeka Endeksi her karşılaştırmayı 0-100 ölçeğine normalize eder ve modelin değerlendirildiği karşılaştırmalardaki göreli konumunun ortalamasını alır. Aşağıdaki her karşılaştırma bu puanı besler.
Son Güncellemeler
Zeka Endeksi, model kapsamı ve AIMultiple karşılaştırma metodolojisindeki en son değişiklikler.
Kimi K3
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Sol
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Terra
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Sol Pro
AIMultiple Zeka Endeksine yeni eklenen model.
LLM Kullanım Durumları, Analizler ve Ölçümler Keşfedin
LLM Parametreleri: GPT-5 High, Orta, Düşük ve Minimal
OpenAI'in GPT-5 ailesi gibi bazı LLM'ler, farklı sürümlerde (ör. GPT-5, GPT-5-mini ve GPT-5-nano) ve yüksek, orta, düşük ve minimal dahil olmak üzere çeşitli parametre ayarlarıyla gelir. Aşağıda, bu model sürümleri arasındaki farkları, benchmark performanslarını ve benchmark'ları çalıştırmanın maliyetlerini inceleyerek keşfediyoruz. Analizimizde GPT-5 ailesini kullandık. Muhakeme, kodlama, talimat takibi ve matematik dahil olmak üzere çeşitli alanlarda…
Büyük Dil Modellerinin Geleceği
Büyük dil modellerinin geleceğini büyük dil modellerine bakarak, kendi kendine eğitim, olgu kontrolü ve seyrek uzmanlık gibi umut verici yaklaşımları inceleyerek LLM'lerin sınırlamalarını gidermeyi hedefleyin. LLM'lerin başarı oranı karşılaştırması Claude Sonnet 4.6, 0.748 genel puanla karşılaştırmada birinci oldu; temel ve düşünme varyantları üç ondalık basamağa kadar birbirine eşit. Claude Opus 4.8 (0.702), Opus 4.6 temel…
10+ Large Language Model Örnekleri
Önde gelen özel ve açık kaynaklı large language model'leri karşılaştırmak için açık kaynak benchmark'ları bir araya getirdik. Doğru model'i bulmak için kullanım durumunuzu seçin. Large language model'leri, benchmark performanslarını ve gerçek dünya gecikme sürelerini (tablodaki her model'in adına tıklayarak görebilirsiniz) inceleyerek ve genel verimlilik ile maliyet etkinliğini değerlendirmek için fiyatlandırmalarını gözden geçirerek değerlendirebilirsiniz. Maliyet tahminine…
Cloud LLM vs Local LLM'ler: Örnekler & Faydalar
Cloud LLM'ler, GPT-5.5 ve Claude Opus 4.7 gibi gelişmiş modellerle desteklenen, ölçeklenebilirlik ve erişilebilirlik sunar. Buna karşılık, Llama 4, DeepSeek V4 ve Qwen3.6-Plus gibi açık kaynaklı modellerle çalışan Yerel LLM'ler, daha güçlü gizlilik ve özelleştirme sağlar. Bulut LLM'lerin ne olduğunu, güçlü ve zayıf yönlerini, gerçek hayattan örneklerle en yaygın vaka çalışmalarını ve yerel LLM'lerden nasıl…
Siber Güvenlikte Büyük Dil Modelleri
SecBench kullanarak 9 siber güvenlik alanında 7 büyük dil modeli değerlendirdik; SecBench, güvenlik görevleri için büyük ölçekli ve çok formatlı bir benchmark'tır. Her modeli veri güvenliği, kimlik ve erişim yönetimi, ağ güvenliği, zafiyet yönetimi ve bulut güvenliği gibi alanları kapsayan 44.823 çoktan seçmeli soruda (MCQ) ve 3.087 kısa cevaplı soruda (SAQ) test ettik. Bu büyük…
LLM Kuantizasyonu: BF16 vs FP8 vs INT4
Qwen3-32B'yi tek bir NVIDIA H100 80GB GPU üzerinde 4 hassasiyet seviyesinde (BF16, FP8, GPTQ-Int8, GPTQ-Int4) benchmark'ladık. Her yapılandırma, bilgi ve kod üretimi kapsayan 2 benchmark'ta (~12.2K soru) ve verimliliği ölçmek için 2.000'den fazla inference çalıştırmasında değerlendirildi. Int4, MMLU-Pro'da 2 puandan daha az kayıp yaşarken BF16'dan 2.7 kat daha hızlıdır, ancak kod üretimi (HumanEval) 8 puan…