AIMultiple Zeka Endeksindeki en yeni model Kimi K3.
LLM Karşılaştırmaları
Kamuya açık karşılaştırmaları AIMultiple'ın kendi agentic, RAG ve kurumsal muhakeme değerlendirmeleriyle birleştiren tek ve şeffaf bir Zeka Endeksi. Metodolojiyi inceleyin.
Liderlik Tablosu
Tüm benchmark'larda en yüksek puan alan modeller.
# | Model | Endeks | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Sayfa 1 / 7 | ||||||||||
Endeks Nasıl Oluşturulur
Zeka Endeksi her karşılaştırmayı 0-100 ölçeğine normalize eder ve modelin değerlendirildiği karşılaştırmalardaki göreli konumunun ortalamasını alır. Aşağıdaki her karşılaştırma bu puanı besler.
Son Güncellemeler
Zeka Endeksi, model kapsamı ve AIMultiple karşılaştırma metodolojisindeki en son değişiklikler.
Kimi K3
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Sol
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Terra
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Sol Pro
AIMultiple Zeka Endeksine yeni eklenen model.
LLM Kullanım Durumları, Analizler ve Ölçümler Keşfedin
Büyük Multimodal Modeller (LMM'ler) ve LLM'ler
Büyük Multimodal Modellerin (LMM'lerin) finansal akıl yürütme görevlerindeki performansını özenle seçilmiş bir dataset kullanarak değerlendirdik. Yüksek kaliteli finansal örneklerin bir alt kümesini analiz ederek modellerin finans alanındaki multimodal verileri işleme ve bunlar üzerinde akıl yürütme yeteneklerini değerlendiriyoruz. Metodoloji bölümü, kullanılan dataset ve değerlendirme çerçevesi hakkında ayrıntılı bilgiler sunar. Büyük multimodal modelleri keşfedin ve bunları büyük…
Sağlık Hizmetlerinde 9 Büyük Dil Modelini Karşılaştırın
9 LLM'ler MedQA veri kümesini kullanarak kıyasladık; bu, USMLE sorularından türetilen lisansüstü düzey klinik sınav kıyaslama ölçütüdür. Her model, standartlaştırılmış bir prompt kullanarak aynı çoktan seçmeli klinik senaryoları yanıtladı ve doğrulukların doğrudan karşılaştırılmasını sağladı. Ayrıca, toplam çalışma süresini tamamlanan MedQA öğe sayısına bölerek soru başına gecikmeyi de kaydettik. Kıyaslama metodolojisi: Bu kıyaslama, sağlık hizmetlerindeki LLM'lerin…
Daha Akıllı ve Daha Yoğun Modeller için 71 LLM'nin Zeka Yoğunluğu
Şubat 2023 ile Mayıs 2026 arasında yayımlanan 71 LLM'yi izledik ve zeka yoğunluğunu ölçmek için 10 halka açık benchmark topladık. Yetkinlik puanını, modelin tükettiği kaynağa (aktif parametreler, eğitim hesaplama gücü ve inference fiyatı) böldük. Zeka yoğunluğunu hesaplamak için şu adımları uyguladık: Puanlama yaklaşımı ve kaynak bazında dağılımlar için metodoloji bölümüne bakın. 2026 ortasına gelindiğinde yapay…
50+ ChatGPT Kullanım Alanları ve Gerçek Hayat Örnekleri
ChatGPT, 2026'nın başlarında dünya nüfusunun kabaca %10'ine denk gelen yaklaşık 1 milyar haftalık aktif kullanıcıya ulaştı.1 OpenAI, CFO Sarah Friar tarafından doğrulanan 2025 yılı yıllık gelirinde $20 milyar eşiğini aştı.2 Anthropic Ekonomik Endeksi ikikullanım modunu ayırt eder: insanın yapay zeka ile etkileşime girdiği artırım ve yapay zekanın görevleri bağımsız olarak tamamladığı otomasyon. Tüketici kullanımı %52…
Finans Alanında 40+ LLM Karşılaştırması: Claude Fable 5 ve GPT-5.6 Sol
Finans alanında 40+ LLM'i, hangi modellerin tablo analizi, tahminleme ve oran hesaplamaları gibi karmaşık finansal muhakeme görevlerinde üstün performans gösterdiğini belirlemek için FinanceReasoning karşılaştırma testindeki 238 zor soru üzerinde değerlendirdik. LLM'leri FinanceReasoning karşılaştırma testindeki (Tang ve diğerleri) 238 zor soru üzerinde değerlendirdik.1 Bu alt küme, finansal kavramları ve formülleri içeren karmaşık, çok adımlı nicel muhakemeyi…
AIM Enterprise: Ajanik Kurumsal Benchmark
Kurumlar düzenli görevleri için her gün LLM'ler kullanıyor. En maliyet etkin LLM'leri bulmak için, farklı kategorilerde 69 kurumsal görevi kullandığımız ajansal bir kurumsal benchmark olan AIM Enterprise'ı tasarladık. Her model her görev için bir dosya teslim etti. Puanlar görelidir: jüriler her yanıtı aynı görevdeki diğer yanıtlara göre sıralar, bu nedenle ortalama puan tasarım gereği 50'dir.…
LLM Ölçekleme Yasaları: Yapay Zeka Araştırmacılarından Analiz
Büyük dil modelleri, metin verilerinden öğrenilen kalıplara dayanarak bir sonraki token'ı tahmin eder. LLM ölçekleme yasaları terimi, model performansını eğitim sırasında kullanılan hesaplama miktarı, eğitim verisi ve model parametreleriyle ilişkilendiren deneysel düzenlilikleri ifade eder. Bu ilişkilerin pratikte modern model tasarımını nasıl etkilediğini anlamak için 8 akademik makaleden bulguları ve 3 büyük yapay zeka laboratuvarı ile…
LLM Gözlemlenebilirlik Araçları: Weights & Biases, Langsmith
LLM uygulamaları, tek turlu sohbetlerden araçları kullanan, veritabanlarını sorgulayan ve diğer modellerle koordine olan çok adımlı ajanlara doğru genişledi; bu da davranışlarını yorumlamayı zorlaştırıyor. LLM gözlemlenebilirliği, bu karmaşık iş akışlarına sürekli görünürlük sağlayarak kuruluşların kaliteyi izlemesine, hataları tespit etmesine, sorunları gidermesine ve performans ile maliyetleri yönetmesine yardımcı olur. W&B Weave, Weights & Biases'in LLM gözlemlenebilirlik…
Müşteri Hizmetleri için ChatGPT: En İyi 10 Kullanım Alanı
ChatGPT, müşteri hizmetlerinde yenilik olmaktan çıkıp altyapıya dönüştü. Şirketler yanıt sürelerini kısaltmak, ekiplerinin karşılayamayacağı hacimleri yönetmek ve rutin etkileşimlerin maliyetini düşürmek için kullanıyor. Ancak sonuçlar, nasıl uygulandığına bağlı olarak keskin biçimde değişiyor. OpenAI piyasaya sürdü GPT-5.6'yı, önemli ölçüde daha yetenekli bir model ki bu model talimat takibinde, uzun bağlamlarda akıl yürütmede ve doğru, markaya uygun…
LLM Kullanım Durumlarına Göre Gecikme Karşılaştırması
En iyi 11 büyük dil modelini toplam 1.320 istek ile test ettik, akıl yürüten ve akıl yürütmeyen modelleri birbirinden ayırdık ve ilk token gecikmesini, token başına gecikmeyi ve toplam yanıt süresini ölçtük. Gecikmeyi nasıl ölçtüğümüze dair ayrıntıları burada bulabilirsiniz. Akıl yürüten ve akıl yürütmeyen modelleri ayrı olarak raporluyoruz. Akıl yürüten modeller, ilk görünür yanıttan önce…