AIMultiple Zeka Endeksindeki en yeni model Claude Opus 5.5.
LLM Karşılaştırmaları
Kamuya açık karşılaştırmaları AIMultiple'ın kendi agentic, RAG ve kurumsal muhakeme değerlendirmeleriyle birleştiren tek ve şeffaf bir Zeka Endeksi. Endeks Nasıl Oluşturulur
Liderlik Tablosu
Tüm benchmark'larda en yüksek puan alan modeller.
# | Model | Endeks | AA-LCR | AIM-A-CODE-LLM Bench | AIM-Agentic-RAG | AIM-FinanceReasoning | AIM-HALC-Bench | AIM-RELC-Bench | AIM-Text-to-SQL | APEX-Agents-AA | ARC-AGI-1 | ARC-AGI-2 | ARC-AGI-3 | ArxivMath | AutomationBench-AA | BioMysteryBench | BrowseComp | Convex Coding Evals | CritPt | Crosby RedlineBench | DeepSWE 1.1 | EnterpriseOps-Gym-AA | Frontier-Bench | FrontierCode | FrontierMath | GDPval | GPQA Diamond | Harvey LAB-AA | HealthBench Professional | HieroglyphBench | Humanity's Last Exam | IFBench | ITBench-AA | LegalBench | LiveCodeBench | MMMU-Pro | ObviousBench | Opus Magnum Bench | ReactBench | RuneBench | SciCode | SimpleBench | Swe-Bench | Tau2-Bench Telecom | Tau3-Banking | Terminal-Bench 2.1 | Terminal-Bench 4.0 | Terminal-Bench Hard | Terminal-Bench-Science |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 100 | - | - | 90 | 92 | - | - | 88 | - | - | - | - | - | - | - | - | - | 32 | - | - | - | - | - | - | 1846 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 67 | - | - | - | - | - | - | - | - |
| 2 | GPT-6 Astra OpenAI | 92 | - | - | 84 | 87 | - | - | 66 | - | - | 95 | 63 | - | 41 | - | 92 | 85 | 32 | - | 74 | - | - | 53 | 98 | 1542 | 96 | - | 70 | - | - | - | - | - | - | - | - | - | - | 7 | 56 | - | - | - | - | 90 | 58 | - | - |
| 3 | Claude Fable 5.1 Anthropic | 91 | 80 | - | 84 | 90 | - | - | 67 | - | 98 | 90 | - | - | 31 | - | - | 81 | 31 | - | 67 | - | - | 51 | 88 | 1735 | 94 | - | 62 | - | 59 | - | - | 89 | - | - | - | - | - | 6 | 63 | - | - | - | 47 | 91 | 56 | - | - |
| 4 | Qwen3.8 Flash Alibaba Cloud | 87 | 77 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 1743 | 92 | - | - | - | 38 | 81 | - | - | - | - | - | - | - | - | 47 | - | - | - | 45 | 86 | - | - | - |
| 5 | Command A+ Cohere | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 30 | - | - | - | - | - | - | - | - | - | - | - | - | 74 | - | 61 | - | - | - | - | - | - | - | - | - | 81 | - | - | - | 25 | - |
| 6 | MiMo-V2.6-Pro Xiaomi | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 27 | - | - | - | - | - | - | 1673 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 61 | - | - | - | - | - | - | - | - |
| 7 | Muse Spark 1.1 Meta | 86 | 81 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 53 | - | - | - | - | 1381 | 90 | - | 59 | - | 46 | - | - | 85 | - | - | 99 | - | 23 | 6 | 58 | - | - | - | 32 | 78 | - | - | - |
| 8 | Claude Fable 5 Anthropic | 85 | 77 | 69 | 82 | 90 | - | - | 66 | 59 | 99 | 89 | - | 79 | 17 | - | 87 | 84 | 29 | - | 70 | - | 34 | 54 | 90 | 1741 | 93 | 14 | 63 | 23 | 56 | 64 | - | 89 | - | 81 | 99 | 22 | 47 | 6 | 61 | 82 | - | 99 | 38 | 85 | 42 | 63 | 21 |
| 9 | Claude Opus 5 Anthropic | 83 | 79 | - | 85 | 90 | - | - | 64 | - | 98 | 90 | 30 | 91 | 50 | 79 | 91 | 82 | 29 | - | 74 | - | 44 | 53 | 73 | 1708 | 94 | - | 60 | - | 55 | - | - | 87 | - | 85 | 100 | - | - | 6 | 56 | - | - | - | 45 | 89 | 52 | - | 30 |
| 10 | GPT-6 Sol OpenAI | 79 | - | - | 82 | - | - | - | 54 | - | - | - | - | - | - | - | - | - | 31 | - | - | - | - | - | - | 1487 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 58 | - | - | - | - | - | - | - | - |
Endeks Nasıl Oluşturulur
Her benchmark ham skor olarak değil, konum olarak okunur. Bir benchmark'ın içinde en iyi sonuç 100'e, en kötüsü 0'a oturur; diğer bütün modeller ikisinin arasında bir yere düşer. İndeks, modelin gerçekten koştuğu benchmark'lardaki bu konumların ağırlıklı ortalamasıdır: hiç koşmadığı bir benchmark sıfır sayılmaz, yalnızca yoktur. Benchmark'lar eşit ağırlıkta değildir ve her birinin taşıdığı ağırlık yanında belirtilir. Bir modelin sıralanabilmesi için en az iki indeks benchmark'ında sonucu olması gerekir; tek bir sonuç modeli o benchmark'ın çizgisine yerleştirir ama kendi başına bir sıralama vermez. Ham doğruluk yerine konum kullanılır, çünkü benchmark'lar zorluk ve ölçek bakımından keskin biçimde ayrışır ve farklı benchmark'ların skorları aynı ortalamayı paylaşamaz. Ağırlıklar: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).
Kullandığımız kıyaslamalar
Son Güncellemeler
Zeka Endeksi, model kapsamı ve AIMultiple karşılaştırma metodolojisindeki en son değişiklikler.
Claude Opus 5.5
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-6 Sol
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-6 Luna
AIMultiple Zeka Endeksine yeni eklenen model.
MiMo-V2.6-Pro
AIMultiple Zeka Endeksine yeni eklenen model.
LLM Kullanım Durumları, Analizler ve Ölçümler Keşfedin
En İyi LLMOps Araçları ve MLOPs ile Karşılaştırması
LLMOps platformları, büyük dil modellerinin operasyonel tarafını yönetir: dağıtım, izleme, değerlendirme ve maliyet yönetimi. Çeşitli kullanım durumları için en uygun olanı belirlemeye yardımcı olmak amacıyla en iyi LLMOps araçlarını, temel özelliklerini, fiyatlandırma modellerini ve birbirlerinden nasıl ayrıldıklarını inceledik. Her bir metriğin detaylı açıklaması aşağıda verilmiştir: LLMOps platformları, şunları sağlayarak LLM'lerin yaşam döngüsünü destekler: LLMOps platformları…
50+ ChatGPT Kullanım Alanları ve Gerçek Hayat Örnekleri
ChatGPT, 2026'nın başlarında dünya nüfusunun kabaca %10'ine denk gelen yaklaşık 1 milyar haftalık aktif kullanıcıya ulaştı.1 OpenAI, CFO Sarah Friar tarafından doğrulanan 2025 yılı yıllık gelirinde $20 milyar eşiğini aştı.2 Anthropic Ekonomik Endeksi ikikullanım modunu ayırt eder: insanın yapay zeka ile etkileşime girdiği artırım ve yapay zekanın görevleri bağımsız olarak tamamladığı otomasyon. Tüketici kullanımı %52…
Müşteri Hizmetleri için ChatGPT: En İyi 10 Kullanım Alanı
ChatGPT, müşteri hizmetlerinde yenilik olmaktan çıkıp altyapıya dönüştü. Şirketler; yanıt sürelerini kısaltmak, ekiplerinin karşılayamayacağı hacmi yönetmek ve rutin etkileşimlerin maliyetini azaltmak için kullanıyor. Ancak sonuçlar, nasıl uygulandığına bağlı olarak büyük farklılık gösteriyor. OpenAI piyasaya sürdü GPT-5.6, önemli ölçüde daha yetenekli bir model; bu model, yönerge izleme, uzun bağlamlarda akıl yürütme ve doğru, marka ile uyumlu…
Daha Akıllı ve Daha Yoğun Modeller için 71 LLM'nin Zeka Yoğunluğu
Şubat 2023 ile Mayıs 2026 arasında yayımlanan 71 LLM'yi izledik ve zeka yoğunluğunu ölçmek için 10 halka açık benchmark topladık. Yetkinlik puanını, modelin tükettiği kaynağa (aktif parametreler, eğitim hesaplama gücü ve inference fiyatı) böldük. Zeka yoğunluğunu hesaplamak için şu adımları uyguladık: Puanlama yaklaşımı ve kaynak bazında dağılımlar için metodoloji bölümüne bakın. 2026 ortasına gelindiğinde yapay…
LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması
En iyi 11 büyük dil modelini toplam 1.320 istek ile test ettik, akıl yürüten ve akıl yürütmeyen modelleri birbirinden ayırdık ve ilk token gecikmesini, token başına gecikmeyi ve toplam yanıt süresini ölçtük. Gecikmeyi nasıl ölçtüğümüze dair ayrıntıları burada bulabilirsiniz. Akıl yürüten ve akıl yürütmeyen modelleri ayrı olarak raporluyoruz. Akıl yürüten modeller, ilk görünür yanıttan önce…
LLM Kuantizasyonu: BF16 vs FP8 vs INT4
Qwen3-32B'yi tek bir NVIDIA H100 80GB GPU üzerinde 4 hassasiyet seviyesinde (BF16, FP8, GPTQ-Int8, GPTQ-Int4) benchmark'ladık. Her yapılandırma, bilgi ve kod üretimi kapsayan 2 benchmark'ta (~12.2K soru) ve verimliliği ölçmek için 2.000'den fazla inference çalıştırmasında değerlendirildi. Int4, MMLU-Pro'da 2 puandan daha az kayıp yaşarken BF16'dan 2.7 kat daha hızlıdır, ancak kod üretimi (HumanEval) 8 puan…