AIMultiple Zeka Endeksindeki en yeni model Kimi K3.
LLM Karşılaştırmaları
Kamuya açık karşılaştırmaları AIMultiple'ın kendi agentic, RAG ve kurumsal muhakeme değerlendirmeleriyle birleştiren tek ve şeffaf bir Zeka Endeksi. Metodolojiyi inceleyin.
Liderlik Tablosu
Tüm benchmark'larda en yüksek puan alan modeller.
# | Model | Endeks | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Sayfa 1 / 7 | ||||||||||
Endeks Nasıl Oluşturulur
Zeka Endeksi her karşılaştırmayı 0-100 ölçeğine normalize eder ve modelin değerlendirildiği karşılaştırmalardaki göreli konumunun ortalamasını alır. Aşağıdaki her karşılaştırma bu puanı besler.
Son Güncellemeler
Zeka Endeksi, model kapsamı ve AIMultiple karşılaştırma metodolojisindeki en son değişiklikler.
Kimi K3
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Sol
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Terra
AIMultiple Zeka Endeksine yeni eklenen model.
GPT-5.6 Sol Pro
AIMultiple Zeka Endeksine yeni eklenen model.
LLM Kullanım Durumları, Analizler ve Ölçümler Keşfedin
LLM Fiyatlandırması: En İyi 15+ Sağlayıcı Karşılaştırması
Bir LLM için ödeme yapmanın iki yolu vardır: büyük sağlayıcıların abonelik planları veya token kullanımına göre faturalandırılan kullandıkça öde API modeli. Her modelin verimliliğini ve maliyet etkinliğini değerlendirmek için model adlarına tıklayarak benchmark sonuçlarını, gerçek dünya gecikme sürelerini ve fiyatlandırmayı görüntüleyin. Sıralama: Modeller, tüm benchmark'lardaki ortalama konumlarına göre sıralanmıştır. En iyi LLM'lerin halüsinasyon oranlarını ve…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
Metin-SQL: LLM Doğruluğu Karşılaştırması
36 büyük dil modelini BIRD-SQL veri kümesindeki 759 soru üzerinde çalıştırdık; her model, 11 aday arasından kendi belirlemesi gereken bir veritabanına karşı SQL yazdı. Çözümlenebilen her sorgu gerçek veritabanında yürütüldü ve sonuç kümesi BIRD'in altın sorgusunun sonuç kümesiyle karşılaştırıldı. Eksik, hatalı ve yürütme hatası veren sorgular isabetsiz olarak değerlendirildi. Tüm çalıştırmalar sıcaklık 0'da, sıfır atışla…
LLM Orkestrasyonu: 22 Framework'lar ve Gateway'ler
LLM orkestrasyonunu optimize etmek, kaynak kullanımını kontrol altında tutarken performansı artırmanın anahtarıdır. Farklı orkestrasyon yaklaşımlarının pratikte nasıl performans gösterdiğini değerlendirmek için şunları test ettik: Seçili LLM orkestrasyon araçlarını keşfedin, geliştirici framework'leri ve kurumsal gateway'ler dahil: LLM Orkestrasyonu, karmaşık görevleri verimli bir şekilde gerçekleştirmek için birden fazla Büyük Dil Modelini (LLM's) yönetmeyi ve entegre etmeyi içerir.…
HALC-Bench: LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon
HALC-Bench (LLM Uzun Bağlam Geri Getirme Benchmark'ında Halüsinasyon) büyük bir dil modelinin, hedef dokümanda bulunmayan bir metrik için kanıt uydurmaya karşı direncini, modelin bağlam penceresinin başına, ortasına ve sonuna yerleştirilmiş 3 samanlık kullanarak, 204 soru ile ölçer. claude-fable-5 her samanlık konumunda 204 tuzağın hepsini doğru yanıtladı. Kalan modeller arasında en az halüsinasyon gösteren gpt-5.5 oldu.…
Çok Modlu Yapay Zeka Modellerini Görsel Muhakeme Konusunda Karşılaştırın
Önde gelen 15 çok modlu yapay zeka modelini 200 görsel tabanlı soru kullanarak görsel muhakeme konusunda kıyasladık. Değerlendirme iki parkurdan oluşuyordu: veri görselleştirme yorumlamasını test eden 100 grafik anlama sorusu ve örüntü tanıma ile uzamsal muhakemeyi değerlendiren 100 görsel mantık sorusu. Tutarlı ve güvenilir sonuçlar sağlamak için her soru 5 kez çalıştırıldı. Test prosedürlerimizi öğrenmek…
Kitle Simülasyonu: LLM'ler İnsan Davranışını Tahmin Edebilir mi?
Pazarlamada, LLM'lerin insan davranışını ne kadar doğru tahmin ettiğini değerlendirmek; kitle ihtiyaçlarını öngörme ve yanlış hizalama, etkisiz iletişim veya istenmeyen etki gibi riskleri tanıma konusundaki etkinliklerini değerlendirmek için kritik önem taşır. Kitle simülasyonu, LLM'lerle birlikte sanal kitlelerin modellenmesini sağlayarak kuruluşların maliyetli anketlere veya odak gruplarına başvurmadan içeriklere veya ürünlere verilecek tepkileri öngörmelerine yardımcı olur. Yapay…
OpenAI için Yapay Zeka Ağ Geçitleri: OpenRouter Alternatifleri
OpenRouter, SambaNova, TogetherAI, Groq ve YZ/ML API'yi üç gösterge (ilk token gecikmesi, toplam gecikme ve çıktı token sayısı) genelinde, toplam gecikme için kısa prompt'lar (yaklaşık 18 token) ve uzun prompt'lar (yaklaşık 203 token) kullanarak 300 testle benchmark ettik. Bu yapay zeka ağ geçitlerinden birini kullanmayı planlıyorsanız şunları yapabilirsiniz: Bu benchmark'ta, OpenRouter, SambaNova, TogetherAI, Groq ve…
LLM İnce Ayar Rehberi: İşletmeler İçin
LLM çıktı zorluklarınız için özel çözümlere giden bağlantıları takip edin. Eğer LLM'niz: Büyük dil modellerinin (LLM'ler) yaygın olarak benimsenmesi, insan dilini işleme yeteneğimizi geliştirdi. Ancak, genel eğitimleri genellikle belirli görevler için optimumun altında performansla sonuçlanır. Bu sınırlamanın üstesinden gelmek için, LLM'leri farklı uygulama alanlarının benzersiz gereksinimlerine göre uyarlamak amacıyla ince ayar yöntemleri kullanılır. Büyük bir…
LLM Self-Hosting için VRAM Hesaplayıcı
Kendi barındırılan bir LLM, çıkarımın operatörün kontrol ettiği donanım üzerinde, üçüncü taraf bir API üzerinden değil, çalıştırılması anlamına gelir; bu durum maliyet, veri kontrolü ve gizlilik profilini değiştirir. Bir modelin çalışıp çalışmadığı tamamen belleğe bağlıdır. Hesaplayıcı, modelin, hassasiyetinin, bağlam uzunluğunun ve hedef donanımın temelinde bir modelin yerel olarak çalışması için gereken VRAM veya birleşik belleği…