Das neueste Modell im AIMultiple Intelligenz-Index ist Kimi K3.
LLM Benchmarks
Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert. Zur Methodik.
Bestenliste
Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.
# | Modell | Index | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Seite 1 von 7 | ||||||||||
Wie der Index aufgebaut ist
Der Intelligenz-Index normalisiert jeden Benchmark auf eine Skala von 0-100 und mittelt die relative Position eines Modells über die Benchmarks, für die es bewertet wurde. Jeder unten aufgeführte Benchmark fließt in diese Punktzahl ein.
Aktuelle Updates
Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.
Kimi K3
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-5.6 Sol
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-5.6 Terra
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-5.6 Sol Pro
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
LLM Anwendungsfälle, Analysen & Benchmarks erkunden
LLM Latenz-Benchmark nach Anwendungsfällen
Wir haben 11 führende große Sprachmodelle mit insgesamt 1.320 Anfragen gebenchmarkt, dabei zwischen Reasoning- und Nicht-Reasoning-Modellen unterschieden und die First-Token-Latenz, die Per-Token-Latenz und die Gesamtantwortzeit gemessen. Details dazu, wie wir die Latenz gemessen haben, finden Sie hier. Wir berichten Reasoning- und Nicht-Reasoning-Modelle getrennt. Reasoning-Modelle verbringen mehrere Sekunden mit Nachdenken vor der ersten sichtbaren Antwort; daher…
Top LLMOps Tools & Vergleich mit MLOPs
LLMOps-Plattformen übernehmen den operativen Teil des Betriebs von Large Language Models: Bereitstellung, Überwachung, Evaluierung und Kostenmanagement. Wir haben führende LLMOps-Tools, deren Kernfunktionen, Preismodelle und ihre Unterschiede untersucht, um die beste Lösung für verschiedene Anwendungsfälle zu identifizieren. Eine Aufschlüsselung jeder Metrik finden Sie unten: LLMOps-Plattformen unterstützen den Lebenszyklus von LLMs durch die Ermöglichung von: LLMOps-Plattformen unterscheiden…
LLM-Preise: Top 15+ Anbieter im Vergleich
LLM-Preise erstrecken sich über drei Größenordnungen: Die günstigsten Commodity-Modelle kosten unter $0,20 pro Million Token, während die Reasoning-Tier-Preise für Spitzenmodelle bei bis zu $262,50 lagen. Das folgende Diagramm zeigt die Entwicklung der Einführungspreise: Jedes Modell ist am Tag seiner Einführung mit dem damaligen Listenpreis pro Million Token positioniert, gemittelt bei einem Eingabe-zu-Ausgabe-Verhältnis von 3:1, in…
LLM-Automatisierung: Top 7 Tools & 8 Fallstudien
LLM-Automatisierung bezeichnet den Wandel hin zu intelligenten Automatisierungstools, die LLMs nutzen, einschließlich KI-Agenten, feinabgestimmten LLMs und RAG-Modellen, um Aufgaben zu automatisieren und zu koordinieren. Erkunden Sie, was LLM-Automatisierung ist, ihre wichtigsten praktischen Anwendungen und die wesentlichen Tools: LLM in der Automatisierung sind ein systematischer Ansatz, der Natural Language Processing (NLP) mit bestehenden Prozessautomatisierungsmethoden kombiniert. Es…
Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol
Wir haben 40+ LLMs im Finanzwesen anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark evaluiert, um herauszufinden, welche Modelle bei komplexen Finanzlogik-Aufgaben wie Bilanzanalyse, Prognosen und Kennzahlenberechnungen hervorragend sind. Wir haben LLMs auf 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Untergruppe zielt auf die anspruchsvollsten Finanzlogik-Aufgaben ab und bewertet komplexe, mehrstufige…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
LLM Observability-Tools: Weights & Biases, Langsmith
LLM-Anwendungen haben sich von Single-Turn-Chats zu mehrstufigen Agenten erweitert, die Tools verwenden, Datenbanken abfragen und mit anderen Modellen koordinieren, was ihr Verhalten schwerer interpretierbar macht. LLM-Observability bietet kontinuierliche Transparenz in diese komplexen Workflows und hilft Unternehmen, die Qualität zu überwachen, Fehler zu erkennen, Probleme zu beheben sowie Leistung und Kosten zu verwalten. W&B Weave ist…
Text-zu-SQL: Vergleich der LLM-Genauigkeit
Wir führten 36 große Sprachmodelle über 759 Fragen aus BIRD-SQL durch, wobei jedes Modell SQL gegen eine Datenbank schrieb, die es selbst aus 11 Kandidaten identifizieren musste. Jede ausführbare Abfrage wurde gegen die echte Datenbank ausgeführt und ihre Ergebnismenge mit der Ergebnismenge der Gold-Abfrage von BIRD verglichen. Fehlende, fehlerhaft formatierte und ausführungsfehlschlagende Abfragen wurden als…
LLM-Orchestrierung: 22 Frameworks und Gateways
Die Optimierung der LLM-Orchestrierung ist entscheidend, um die Leistung zu verbessern und gleichzeitig den Ressourcenverbrauch unter Kontrolle zu halten. Um zu bewerten, wie verschiedene Orchestrierungsansätze in der Praxis abschneiden, haben wir Folgendes einem Benchmark unterzogen: Entdecken Sie ausgewählte LLM-Orchestrierungstools, einschließlich Entwickler-Frameworks und Unternehmens-Gateways: LLM-Orchestrierung umfasst die Verwaltung und Integration mehrerer Large Language Models (LLMs), um…
HALC-Bench: LLM Halluzination im Long-Context Retrieval Benchmark
HALC-Bench (LLM Halluzination im Long-Context Retrieval Benchmark) misst die Widerstandsfähigkeit eines großen Sprachmodells gegenüber dem Erfinden von Beweisen für eine Kennzahl, die im Zieldokument nicht existiert, indem es 3 Heuhaufen verwendet, die am Anfang, in der Mitte und am Ende des Kontextfensters des Modells platziert sind, mit 204 Fragen. claude-fable-5 beantwortete alle 204 Fallen an…