AIMultiple Zeka Endeksindeki en yeni model GPT-6 Astra.
LLM Karşılaştırmaları
Kamuya açık karşılaştırmaları AIMultiple'ın kendi agentic, RAG ve kurumsal muhakeme değerlendirmeleriyle birleştiren tek ve şeffaf bir Zeka Endeksi. Endeks Nasıl Oluşturulur
Liderlik Tablosu
Tüm benchmark'larda en yüksek puan alan modeller.
# | Model | Endeks | AA-LCR | A-CODE-LLM Bench | Agentic RAG | APEX-Agents-AA | ARC-AGI-1 | ARC-AGI-2 | ARC-AGI-3 | ArxivMath | AutomationBench-AA | BioMysteryBench | BrowseComp | Convex Coding Evals | CritPt | Crosby RedlineBench | DeepSWE 1.1 | EnterpriseOps-Gym-AA | FinanceReasoning | Frontier-Bench | FrontierCode | FrontierMath | GDPval | GPQA Diamond | HALC-Bench | Harvey LAB-AA | HealthBench Professional | HieroglyphBench | Humanity's Last Exam | IFBench | ITBench-AA | LegalBench | LiveCodeBench | MMMU-Pro | ObviousBench | Opus Magnum Bench | ReactBench | RELC-Bench | RuneBench | SciCode | SimpleBench | Swe-Bench | Tau2-Bench Telecom | Tau3-Banking | Terminal-Bench 2.1 | Terminal-Bench 4.0 | Terminal-Bench Hard | Terminal-Bench-Science | Text-to-SQL |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra OpenAI | 98 | - | - | - | - | - | 95 | 63 | - | 41 | - | 92 | 85 | - | - | 74 | - | 87 | - | 53 | - | - | 96 | - | - | 70 | - | - | - | - | - | - | - | - | - | - | - | 7 | - | - | - | - | - | - | 58 | - | - | - |
| 2 | Claude Opus 5 Anthropic | 96 | 79 | - | - | - | 98 | 90 | 30 | 91 | 50 | 79 | 91 | 82 | 29 | - | 74 | - | 90 | 44 | 53 | 73 | 1824 | 94 | - | - | 60 | - | 55 | - | - | 87 | - | 85 | 100 | - | - | - | 6 | 56 | - | - | - | 45 | 89 | 52 | - | 30 | - |
| 3 | Claude Fable 5.1 Anthropic | 95 | 80 | - | - | - | 98 | 90 | - | - | 31 | - | - | 81 | 31 | - | 67 | - | 90 | - | 51 | 88 | 1853 | 94 | - | - | 62 | - | 59 | - | - | 89 | - | - | - | - | - | - | 6 | 62 | - | - | - | 47 | 91 | 56 | - | - | - |
| 4 | Claude Fable 5 Anthropic | 93 | 77 | 69 | 98 | 59 | 99 | 89 | - | 79 | 17 | - | 87 | 84 | 29 | - | 70 | - | 90 | 34 | 54 | 88 | 1741 | 93 | - | 14 | 63 | 23 | 56 | 64 | - | 89 | - | 81 | 99 | 22 | 47 | - | 6 | 60 | 82 | - | 99 | 38 | 85 | 42 | 63 | 21 | 90 |
| 5 | GPT-5.6 Sol OpenAI | 92 | 78 | 62 | 87 | 57 | 98 | 93 | 8 | - | 47 | 71 | 90 | 82 | 32 | - | 73 | - | 90 | 34 | 48 | 83 | 1710 | 95 | - | 3 | 64 | 28 | 50 | 73 | - | 87 | - | 83 | 94 | - | 53 | - | 6 | 57 | - | - | - | 44 | 89 | 37 | - | 22 | 74 |
| 6 | Muse Spark 1.3 Meta | 92 | - | - | - | - | - | - | - | - | 49 | - | - | - | - | - | 75 | - | - | - | - | - | 1754 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 5 | - | - | - | - | - | - | - | - | - | - |
| 7 | GLM 5.3 Z AI | 90 | 76 | - | - | - | - | - | - | - | - | - | - | 37 | 19 | - | 69 | - | - | - | - | 29 | 1758 | 92 | - | - | - | - | 42 | - | - | 85 | - | - | - | - | - | - | 5 | 57 | - | - | - | 50 | 84 | - | - | 8 | - |
| 8 | Grok 4.6 X | 89 | 79 | - | - | 58 | 88 | 67 | 2 | - | - | 72 | - | 77 | 17 | - | 67 | - | - | - | - | 32 | 1755 | 95 | - | 16 | - | - | 44 | - | - | 86 | - | - | 100 | - | - | - | 6 | 55 | - | - | - | 51 | 88 | - | - | 7 | - |
| 9 | Kimi K3 Moonshot AI | 85 | 83 | 73 | 93 | 41 | 95 | 60 | - | - | 23 | 71 | 91 | 66 | 23 | 49 | 69 | - | 88 | - | - | 39 | 1668 | 94 | - | 27 | - | - | 47 | - | - | 86 | - | 82 | 100 | - | 33 | - | 4 | 59 | - | - | - | 46 | 85 | - | - | 7 | 77 |
| 10 | GPT-5.6 Terra OpenAI | 85 | 80 | 61 | 91 | 39 | 97 | 84 | 1 | - | 24 | - | 88 | 70 | 30 | - | 70 | - | 87 | 21 | 41 | 71 | 1566 | 93 | - | 3 | 62 | 21 | 43 | 71 | - | 85 | - | 81 | 97 | - | 53 | - | 6 | 54 | - | - | - | 40 | 87 | 24 | - | 9 | 71 |
Endeks Nasıl Oluşturulur
Her benchmark ham skor olarak değil, konum olarak okunur. Bir benchmark'ın içinde en iyi sonuç 100'e, en kötüsü 0'a oturur; diğer bütün modeller ikisinin arasında bir yere düşer. İndeks, modelin gerçekten koştuğu benchmark'lardaki bu konumların ağırlıklı ortalamasıdır: hiç koşmadığı bir benchmark sıfır sayılmaz, yalnızca yoktur. Benchmark'lar eşit ağırlıkta değildir ve her birinin taşıdığı ağırlık yanında belirtilir. Bir modelin sıralanabilmesi için en az iki indeks benchmark'ında sonucu olması gerekir; tek bir sonuç modeli o benchmark'ın çizgisine yerleştirir ama kendi başına bir sıralama vermez. Ham doğruluk yerine konum kullanılır, çünkü benchmark'lar zorluk ve ölçek bakımından keskin biçimde ayrışır ve farklı benchmark'ların skorları aynı ortalamayı paylaşamaz. Ağırlıklar: GDPval (29%) + EnterpriseOps-Gym-AA (15%) + DeepSWE 1.1 (15%) + FinanceReasoning (10%) + FrontierCode (8%) + RuneBench (6%) + ARC-AGI-2 (5%) + LiveCodeBench (4%) + ITBench-AA (3%) + Terminal-Bench 4.0 (2%) + Opus Magnum Bench (1%) + HealthBench Professional (1%) + Tau2-Bench Telecom (1%).
Kullandığımız kıyaslamalar
Son Güncellemeler
Zeka Endeksi, model kapsamı ve AIMultiple karşılaştırma metodolojisindeki en son değişiklikler.
GPT-6 Astra
AIMultiple Zeka Endeksine yeni eklenen model.
Muse Spark 1.3
AIMultiple Zeka Endeksine yeni eklenen model.
Gemini 3.8 Flash
AIMultiple Zeka Endeksine yeni eklenen model.
Claude Fable 5.1
AIMultiple Zeka Endeksine yeni eklenen model.
LLM Kullanım Durumları, Analizler ve Ölçümler Keşfedin
Finans Alanında 40+ LLM Kıyaslaması: Claude Fable 5 ve GPT-5.6 Sol
LLM'leri FinanceReasoning kıyaslamasındaki 238 zor soru üzerinde değerlendirdik (Tang ve ark.).1 Bu alt küme, en zorlu finansal muhakeme görevlerini hedefler; finansal kavramları ve formülleri içeren karmaşık, çok adımlı nicel akıl yürütmeyi değerlendirir. Değerlendirmemizde özel bir prompt tasarımı ve doğruluk ile token tüketimi puanlama kriterleri kullanılmıştır. Bu metriklerin nasıl hesaplandığına ve bu değerlendirme için kullanılan framework'e…
AIM Enterprise: Ajan Tabanlı Kurumsal Benchmark
İşletmeler normal görevleri için her gün LLM'leri kullanıyor. En maliyet verimli LLM'leri bulmak için, strateji, pazarlama, İK, satış ve operasyonlar genelinde 69 gerçek kurumsal görevi kullandığımız ajan tabanlı bir kurumsal benchmark olan AIM Enterprise'ı tasarladık. İki değerlendirici model, kontrolleri geçen her dosyayı puanladı. Bireysel puanların %32.7'sinde iki model ölçeğin çeyreğinden fazla farklılaştı ve bu satırları…
Sağlık Hizmetlerinde 9 Büyük Dil Modelini Karşılaştırın
MedQA dataset'ini kullanarak 9 LLM'i benchmark ettik; bu, USMLE sorularından türetilen lisansüstü düzeyde bir klinik sınav benchmark'ıdır. Her model, standart bir prompt kullanarak aynı çoktan seçmeli klinik senaryoları yanıtladı; bu da doğrulukların doğrudan karşılaştırılmasını sağladı. Ayrıca, toplam çalışma süresini tamamlanan MedQA öğesi sayısına bölerek soru başına gecikme süresini kaydettik. Benchmark metodolojisi: Bu benchmark, sağlık hizmetlerindeki…
Büyük Multimodal Model'ler (LMM'ler) vs LLM'ler
Finansal akıl yürütme görevlerinde Büyük Multimodal Model'lerin (LMM'lerin) performansını özenle seçilmiş bir dataset kullanarak değerlendirdik. Yüksek kaliteli finansal örneklerin bir alt kümesini analiz ederek, model'lerin finans alanındaki multimodal verileri işleme ve bu verilerle akıl yürütme yeteneklerini değerlendiriyoruz. metodoloji bölümü kullanılan dataset ve değerlendirme framework'ü hakkında ayrıntılı bilgiler sunar. Büyük multimodal model'leri keşfedin ve bunları büyük…
LLM Ölçekleme Yasaları: Yapay Zeka Araştırmacılarından Analiz
Büyük dil modelleri, metin verilerinden öğrenilen kalıplara dayanarak bir sonraki token'ı tahmin eder. LLM ölçekleme yasaları terimi, model performansını eğitim sırasında kullanılan hesaplama miktarı, eğitim verisi ve model parametreleriyle ilişkilendiren deneysel düzenlilikleri ifade eder. Bu ilişkilerin pratikte modern model tasarımını nasıl etkilediğini anlamak için 8 akademik makaleden bulguları ve 3 büyük yapay zeka laboratuvarı ile…
LLM Gözlemlenebilirlik Araçları: Weights & Biases, Langsmith
LLM uygulamaları, tek turlu sohbetlerden araçları kullanan, veritabanlarını sorgulayan ve diğer modellerle koordine olan çok adımlı ajanlara doğru genişledi; bu da davranışlarını yorumlamayı zorlaştırıyor. LLM gözlemlenebilirliği, bu karmaşık iş akışlarına sürekli görünürlük sağlayarak kuruluşların kaliteyi izlemesine, hataları tespit etmesine, sorunları gidermesine ve performans ile maliyetleri yönetmesine yardımcı olur. W&B Weave, Weights & Biases'in LLM gözlemlenebilirlik…
Cloud LLM vs Local LLM'ler: Örnekler & Faydalar
Cloud LLM'ler, GPT-5.5 ve Claude Opus 4.7 gibi gelişmiş modellerle desteklenen, ölçeklenebilirlik ve erişilebilirlik sunar. Buna karşılık, Llama 4, DeepSeek V4 ve Qwen3.6-Plus gibi açık kaynaklı modellerle çalışan Yerel LLM'ler, daha güçlü gizlilik ve özelleştirme sağlar. Bulut LLM'lerin ne olduğunu, güçlü ve zayıf yönlerini, gerçek hayattan örneklerle en yaygın vaka çalışmalarını ve yerel LLM'lerden nasıl…
Kitle Simülasyonu: LLM'ler İnsan Davranışını Tahmin Edebilir mi?
Pazarlamada, LLM'lerin insan davranışını ne kadar doğru tahmin ettiğini değerlendirmek; kitle ihtiyaçlarını öngörme ve yanlış hizalama, etkisiz iletişim veya istenmeyen etki gibi riskleri tanıma konusundaki etkinliklerini değerlendirmek için kritik önem taşır. Kitle simülasyonu, LLM'lerle birlikte sanal kitlelerin modellenmesini sağlayarak kuruluşların maliyetli anketlere veya odak gruplarına başvurmadan içeriklere veya ürünlere verilecek tepkileri öngörmelerine yardımcı olur. Yapay…
LLM İnce Ayar Rehberi: İşletmeler İçin
LLM çıktı zorluklarınız için özel çözümlere giden bağlantıları takip edin. Eğer LLM'niz: Büyük dil modellerinin (LLM'ler) yaygın olarak benimsenmesi, insan dilini işleme yeteneğimizi geliştirdi. Ancak, genel eğitimleri genellikle belirli görevler için optimumun altında performansla sonuçlanır. Bu sınırlamanın üstesinden gelmek için, LLM'leri farklı uygulama alanlarının benzersiz gereksinimlerine göre uyarlamak amacıyla ince ayar yöntemleri kullanılır. Büyük bir…
LLM Pazar Payı: Kullanım ve Benimsemeyi Karşılaştırın
Biz LLM pazar payını, kullanım tabanlı verileri ve web ziyareti tahminlerini birleştirerek, büyük dil modellerine olan talebin yapay zeka laboratuvarları ve yapay zeka uygulamaları arasında nasıl dağıldığını göstermek için analiz ettik: Bu sonuçları nasıl ölçtüğümüzü ve hesapladığımızı görmek için yöntemi okuyun. Birleşik Devletler, tüm dört ay boyunca web ziyaretlerinde hakimdi ve sürekli olarak 85.5–%90,5 oranına…