Dienstleistungen
Kontaktieren

LLM Benchmarks

Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert. Zur Methodik.

TOP-MODELL
Claude Opus 5
Index 86
Bestes Preis-Leistungs-Verhältnis
DeepSeek V4 Flash 0731
$0.11 / 1M
Am schnellsten
Trinity Large Thinking
0.12s TTFT
Abdeckung
151 Modelle
12 Benchmarks · 697 Bewertungsläufe
AIMultiple Intelligenz-Index

Bestenliste

Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.

Filter & Sort
#
Modell
Index
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
67
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Seite 1 von 16

Kosten$10.00
Latenz3.83s
Kontext1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Kosten$8.00
Latenz4.43s
Kontext1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Kosten$20.00
Latenz5.28s
Kontext1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Kosten$4.50
Latenz1.92s
Kontext1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Kosten$10.00
Latenz4.53s
Kontext1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Kosten$20.00
Latenz5.44s
Kontext1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Kosten$1.50
Latenz6.05s
Kontext1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Kosten$33.75
Latenz3.65s
Kontext1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Kosten$5.44
Latenz0.93s
Kontext1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Kosten$2.00
Latenz10.25s
Kontext1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Seite 1 von 16
Entwicklung im Zeitverlauf
Intelligenz-Index nach Modell-Veröffentlichungsdatum
Kosten vs. Leistung
Gemischte Kosten im Verhältnis zum Intelligenz-Index
Modell × Benchmark
Top-Modelle bei ausgewählten Benchmarks
Methodik

Wie der Index aufgebaut ist

Jeder Benchmark wird zu einer Position auf einer Skala von 0-100, und der Index ist der gewichtete Durchschnitt dieser Positionen. Ein Benchmark, für den ein Modell nicht getestet wurde, zählt als Feldmittelwert, damit die Punktzahlen vergleichbar bleiben. Index = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAGMulti-Datenbank-Routing und SQL-Abfragegenerierung über 5 Datenbanken hinweg (BIRD-SQL, 500 Fragen).
Öffentlich
ARC-AGI-1Abstraktes Schlussfolgern mit wenigen Beispielen uber Gittertransformationen; der erste ARC-Prize-Benchmark.
Öffentlich
ARC-AGI-2Neuartige visuelle Denkaufgaben, die Generalisierung statt Auswendiglernen prüfen.
Öffentlich
ArxivMathAktuelle arXiv-Mathematikprobleme, kurz nach Veroffentlichung ausgefuhrt, um Kontamination zu begrenzen.
Öffentlich
BioMysteryBenchAnthropics Benchmark dazu, ob KI-Agenten echte bioinformatische Ratsel aus Rohdaten losen konnen.
Öffentlich
CritPtPhysikprobleme auf Forschungsniveau, die mehrstufige Herleitungen erfordern.
AIMultiple
FinanceReasoningKomplexes mehrstufiges Finanzdenken anhand von 238 schwierigen FinanceReasoning-Fragen.
Öffentlich
Frontier-BenchAgentische Softwareaufgaben auf aktuellen Repositories, bewertet nach Losungsquote.
Öffentlich
FrontierMathUnveröffentlichte, von Experten verfasste mathematische Forschungsprobleme (Stufen 1–4).
Öffentlich
LegalBenchCrowdsourcing-basiertes juristisches Denken in 162 von Rechtspraktikern erstellten Aufgaben.
Öffentlich
MMMU-ProMultimodales Verstandnis auf Hochschulniveau uber Facher hinweg, gehartet gegen reine Textabkurzungen.
Öffentlich
Terminal-Bench 2.1Agentische Terminalaufgaben aus Softwareentwicklung, Daten und Systemadministration.
Öffentlich
Terminal-Bench HardDie schwere Teilmenge von Terminal-Bench: mehrstufige Softwareaufgaben in einem echten Terminal.
Öffentlich
Terminal-Bench-ScienceTerminalaufgaben aus realen wissenschaftlichen Rechen-Workflows.
AIMultiple
Text-to-SQLGenauigkeit der SQL-Abfragegenerierung aus natürlicher Sprache über mehr als 35 LLMs hinweg.
Aktuelle Updates

Aktuelle Updates

Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.

Google

Gemini 3.8 Flash

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

Anthropic

Claude Fable 5.1

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

Tencent

Hy4 preview

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

Z AI

GLM 5.3 Flash

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

Zeitleiste der KI-ModellveröffentlichungenLetzte 12 Modelle in 20 Tagen

Wichtige KI-Modellveröffentlichungen führender Anbieter der letzten 20 Tage.

Anbieter
OpenAI
OpenAI
04 Sep 2026
GPT-6 Astra +1 weitereGPT-6 AstraGPT-6 Astra Pro
Alibaba Cloud
Alibaba Cloud
26 Aug 2026
Qwen3.8 Flash
03 Sep 2026
Qwen3.8 Max (0902)
Google
Google
02 Sep 2026
Gemini 3.8 Flash
Meta
Meta
21 Aug 2026
Muse Spark 1.2 Contributor
02 Sep 2026
Muse Spark 1.3 +1 weitereMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Sep 2026
Claude Fable 5.1
Tencent
Tencent
28 Aug 2026
Hy4 preview
Z AI
Z AI
18 Aug 2026
GLM 5.3
26 Aug 2026
GLM 5.3 Flash

LLM Anwendungsfälle, Analysen & Benchmarks erkunden

LLM-Automatisierung: Top 7 Tools & 8 Fallstudien 

LLM
Einblick
27. Aug

LLM-Automatisierung bezeichnet den Wandel hin zu intelligenten Automatisierungstools, die LLMs nutzen, einschließlich KI-Agenten, feinabgestimmte LLMs und RAG-Modelle, um Aufgaben zu automatisieren und zu koordinieren. Erfahren Sie, was LLM-Automatisierung ist, welche wichtigsten Anwendungen es in der Praxis gibt und welche Haupttools eingesetzt werden: LLM in der Automatisierung sind ein systematischer Ansatz, der Natural Language Processing (NLP)…

Mehr lesen
LLM
Open-World-Bewertung
26. Aug

LLM Orchestrierung: 22 Frameworks und Gateways

Die Optimierung der LLM-Orchestrierung ist entscheidend, um die Leistung zu verbessern und gleichzeitig den Ressourcenverbrauch unter Kontrolle zu halten. Um zu bewerten, wie verschiedene Orchestrierungsansätze in der Praxis funktionieren, haben wir Folgendes einem Benchmark unterzogen: Entdecken Sie ausgewählte LLM-Orchestrierungstools, einschließlich Entwickler-Frameworks und Unternehmens-Gateways: LLM-Orchestrierung umfasst die Verwaltung und Integration mehrerer großer Sprachmodelle (LLMs), um komplexe…

LLM
Benchmark
24. Aug

AIM Enterprise: Agentischer Unternehmens-Benchmark

Unternehmen nutzen LLMs täglich für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Unternehmens-Benchmark, bei dem wir 69 reale Unternehmensaufgaben aus Strategie, Marketing, HR, Vertrieb und Betrieb verwendet haben. Zwei Bewerter-Modelle bewerteten jede Datei und waren oft unterschiedlicher Meinung. Bei etwa einem Drittel der Einzelbewertungen lagen die…

LLM
Benchmark
24. Aug

Text-zu-SQL: Vergleich der LLM-Genauigkeit

Wir haben 36 große Sprachmodelle über 759 Fragen aus BIRD-SQL ausgeführt, wobei jedes Modell SQL gegen eine Datenbank schrieb, die es selbst aus 11 Kandidaten identifizieren musste. Jede parsebare Abfrage wurde gegen die echte Datenbank ausgeführt und ihre Ergebnismenge mit der Ergebnismenge der Gold-Abfrage von BIRD verglichen. Fehlende, fehlerhafte und bei der Ausführung fehlgeschlagene Abfragen…

LLM
Einblick
21. Aug

LLM Parameter: GPT-5 High, Mittel, Niedrig und Minimal

Einige LLMs, wie die GPT-5-Familie von OpenAI, sind in verschiedenen Versionen verfügbar (z. B. GPT-5, GPT-5-mini und GPT-5-nano) und mit verschiedenen Parametereinstellungen, einschließlich hoch, mittel, niedrig und minimal. Im Folgenden untersuchen wir die Unterschiede zwischen diesen Modellversionen, indem wir ihre Benchmark-Leistung und die Kosten für die Durchführung der Benchmarks erfassen. Wir haben die GPT-5-Familie in…

LLM
Benchmark
21. Aug

HALC-Bench: LLM Halluzination im Long-Context Retrieval Benchmark

HALC-Bench (LLM Halluzination im Long-Context Retrieval Benchmark) misst die Widerstandsfähigkeit eines großen Sprachmodells gegenüber dem Erfinden von Beweisen für eine Kennzahl, die im Zieldokument nicht existiert, indem es 3 Heuhaufen verwendet, die am Anfang, in der Mitte und am Ende des Kontextfensters des Modells platziert sind, mit 204 Fragen. claude-fable-5 beantwortete alle 204 Fallen an…

LLM
Funktionsvergleich
21. Aug

Top LLMOps-Tools & Vergleich mit MLOps

LLMOps-Plattformen übernehmen die operative Seite des Betriebs großer Sprachmodelle: Bereitstellung, Überwachung, Evaluierung und Kostenmanagement. Wir haben führende LLMOps-Tools, ihre Kernfunktionen, Preismodelle und ihre Unterschiede untersucht, um die beste Lösung für verschiedene Anwendungsfälle zu identifizieren. Eine Aufschlüsselung der einzelnen Metriken finden Sie unten: LLMOps-Plattformen unterstützen den Lebenszyklus von LLMs durch: LLMOps-Plattformen unterscheiden sich in ihrem Ansatz:…

LLM
Einblick
19. Aug

50+ ChatGPT-Anwendungsfälle mit Beispielen aus der Praxis

ChatGPT erreichte Anfang 2026 rund 1 Milliarde wöchentlich aktive Nutzer, ungefähr 10 % der Weltbevölkerung.1 OpenAI übertraf im Jahr 2025 einen Jahresumsatz von $20 Milliarden, bestätigt von CFO Sarah Friar.2 Der Anthropic Economic Index unterscheidet zwei Nutzungsmodi: Augmentation, bei der ein Mensch mit KI interagiert, und Automatisierung, bei der KI Aufgaben selbstständig erledigt. Die Verbrauchernutzung teilt…

LLM
Einblick
19. Aug

ChatGPT für Kundenservice: Top 10 Anwendungsfälle

ChatGPT hat sich im Kundenservice von einer Neuheit zu einer Infrastruktur entwickelt. Unternehmen nutzen ihn, um Antwortzeiten zu verkürzen, ein Volumen zu bewältigen, das ihre Teams nicht auffangen können, und die Kosten für Routineinteraktionen zu senken. Aber die Ergebnisse variieren stark, je nachdem, wie er implementiert ist. OpenAI hat GPT-5.6 auf den Markt gebracht, ein…

LLM
Einblick
18. Aug

Die Zukunft großer Sprachmodelle

Sehen Sie die Zukunft großer Sprachmodelle, indem Sie vielversprechende Ansätze wie Selbsttraining, Faktenprüfung und spärliche Expertise untersuchen, die LLM-Einschränkungen beheben könnten. Erfolgsratenvergleich der LLMs Claude Sonnet 4.6 führte den Benchmark mit einer Gesamtpunktzahl von 0.748 an, wobei Basis- und Thinking-Varianten bis auf drei Dezimalstellen gleichauf lagen. Es folgten Claude Opus 4.8 (0.702), Opus 4.6 Basis…

LLM
Benchmark
16. Aug

Intelligenzdichte von 71 LLMs für intelligentere & dichtere Modelle

Wir haben 71 LLMs verfolgt, die zwischen Februar 2023 und Mai 2026 veröffentlicht wurden, und 10 öffentliche Benchmarks gesammelt, um die Intelligenzdichte zu messen. Wir haben den Fähigkeitswert durch die vom Modell verbrauchte Ressource geteilt (aktive Parameter, Trainingsrechenleistung und Inferenzpreis). Um die Intelligenzdichte zu berechnen, haben wir die folgenden Schritte ausgeführt: Siehe Methodik für den…