LLM Karşılaştırmaları
Kamuya açık karşılaştırmaları AIMultiple'ın kendi agentic, RAG ve kurumsal muhakeme değerlendirmeleriyle birleştiren tek ve şeffaf bir Zeka Endeksi.
Liderlik Tablosu
Tüm benchmark'larda en yüksek puan alan modeller.
# | Model | Endeks | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Sayfa 1 / 7 | ||||||||||
Grafikler
"En İyi Performans" modelleri takip ediliyor
Endeks Nasıl Oluşturulur
Zeka Endeksi her karşılaştırmayı 0-100 ölçeğine normalize eder ve modelin değerlendirildiği karşılaştırmalardaki göreli konumunun ortalamasını alır. Aşağıdaki her karşılaştırma bu puanı besler.
Son Güncellemeler
Zeka Endeksi, model kapsamı ve AIMultiple karşılaştırma metodolojisindeki en son değişiklikler.
Kimi K3
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Sol
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Terra
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Sol Pro
AIMultiple Zeka Endeksine yeni eklenen model.
LLM Kullanım Durumları, Analizler ve Ölçümler Keşfedin
Yapay Zeka Ağ Geçitleri için OpenAI: OpenRouter Alternatifleri
OpenRouter, SambaNova, TogetherAI, Groq ve AI/ML API'yi üç gösterge (ilk token gecikmesi, toplam gecikme ve çıktı token sayısı) üzerinden, toplam gecikme için kısa prompt'lar (yaklaşık 18 token) ve uzun prompt'lar (yaklaşık 203 token) ile 300 test yaparak karşılaştırdık. Bu yapay zeka ağ geçitlerinden birini kullanmayı planlıyorsanız şunları yapabilirsiniz: Bu karşılaştırmada OpenRouter, SambaNova, TogetherAI, Groq ve…
Siber Güvenlikte Büyük Dil Modelleri
SecBench kullanarak 9 siber güvenlik alanında 7 büyük dil modeli değerlendirdik; SecBench, güvenlik görevleri için büyük ölçekli ve çok formatlı bir benchmark'tır. Her modeli veri güvenliği, kimlik ve erişim yönetimi, ağ güvenliği, zafiyet yönetimi ve bulut güvenliği gibi alanları kapsayan 44.823 çoktan seçmeli soruda (MCQ) ve 3.087 kısa cevaplı soruda (SAQ) test ettik. Bu büyük…
Müşteri Hizmetleri için ChatGPT: En İyi 10 Kullanım Senaryosu
ChatGPT, müşteri hizmetlerinde bir yenilikten altyapıya evrildi. Şirketler, yanıt sürelerini kısaltmak, ekiplerinin karşılayamayacağı hacmi yönetmek ve rutin etkileşimlerin maliyetini düşürmek için onu kullanıyor. Ancak sonuçlar, nasıl uygulandığına bağlı olarak keskin bir şekilde değişir. OpenAI daha yetenekli bir model olan GPT-5.2 yayınladı ve bu model talimatları takip etme, uzun bağlamlarda akıl yürütme ve doğru, marka ile…
LLM Kuantizasyonu: BF16 vs FP8 vs INT4
Qwen3-32B'yi tek bir NVIDIA H100 80GB GPU üzerinde 4 hassasiyet seviyesinde (BF16, FP8, GPTQ-Int8, GPTQ-Int4) benchmark'ladık. Her yapılandırma, bilgi ve kod üretimi kapsayan 2 benchmark'ta (~12.2K soru) ve verimliliği ölçmek için 2.000'den fazla inference çalıştırmasında değerlendirildi. Int4, MMLU-Pro'da 2 puandan daha az kayıp yaşarken BF16'dan 2.7 kat daha hızlıdır, ancak kod üretimi (HumanEval) 8 puan…