Dienstleistungen
Kontaktieren

LLM Benchmarks

Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert.

Zuletzt aktualisiert Jun 2026
TOP-MODELL
Claude Fable 5
Index 92
Bestes Preis-Leistungs-Verhältnis
MiniMax M3
$0.42 / 1M
Am schnellsten
GPT OSS 120B
0.19s TTFT
Abdeckung
64 Modelle
8 Benchmarks · 336 Bewertungsläufe
AIMultiple Intelligenz-Index

Bestenliste

Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.

Filter & Sort
#
Modell
Index
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Seite 1 von 7

Kosten$20.00
Latenz3.98s
Kontext1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Kosten$6.00
Latenz252.11s
Kontext1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Kosten$11.25
Latenz2.47s
Kontext1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Kosten$3.00
Latenz10.26s
Kontext500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Kosten$11.25
Latenz1.03s
Kontext272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Kosten$5.63
Latenz1.92s
Kontext1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Kosten$11.25
Latenz11.46s
Kontext1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Kosten$10.00
Latenz1.75s
Kontext1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Kosten$4.50
Latenz-
Kontext1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Kosten$4.50
Latenz33.83s
Kontext1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Seite 1 von 7

Diagramme

Folgt den Modellen mit der besten Performance

Entwicklung im Zeitverlauf
Intelligenz-Index nach Modell-Veröffentlichungsdatum
Kosten vs. Leistung
Gemischte Kosten im Verhältnis zum Intelligenz-Index
Modell × Benchmark
Top-Modelle bei ausgewählten Benchmarks
Methodik

Wie der Index aufgebaut ist

Der Intelligenz-Index normalisiert jeden Benchmark auf eine Skala von 0-100 und mittelt die relative Position eines Modells über die Benchmarks, für die es bewertet wurde. Jeder unten aufgeführte Benchmark fließt in diese Punktzahl ein.

Aktuelle Updates

Aktuelle Updates

Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.

Moonshot AI

Kimi K3

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Sol

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Terra

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Sol Pro

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

LLM Anwendungsfälle, Analysen & Benchmarks erkunden

Zielgruppensimulation: Können LLMs menschliches Verhalten vorhersagen?

LLM
Benchmark
22. Jun

Im Marketing ist die Frage, wie genau LLMs menschliches Verhalten vorhersagen, entscheidend, um ihre Wirksamkeit bei der Antizipation von Zielgruppenbedürfnissen zu beurteilen und die Risiken von Fehlausrichtungen, ineffektiver Kommunikation oder unbeabsichtigter Beeinflussung zu erkennen. Die Zielgruppensimulation mit LLMs ermöglicht die Modellierung virtueller Zielgruppen und hilft Organisationen dabei, Reaktionen auf Inhalte oder Produkte vorherzusehen, ohne auf…

Mehr lesen
LLM
Benchmark
15. Jun

KI-Gateways für OpenAI: OpenRouter Alternativen

Wir haben OpenRouter, SambaNova, TogetherAI, Groq und die KI/ML API anhand von drei Indikatoren verglichen (Latenz bis zum ersten Token, Gesamtlatenz und Anzahl der Ausgabe-Tokens), mit 300 Tests unter Verwendung von kurzen Prompts (ca. 18 Tokens) und langen Prompts (ca. 203 Tokens) für die Gesamtlatenz. Wenn Sie planen, eines dieser KI-Gateways zu nutzen, können Sie:…

LLM
Benchmark
5. Jun

LLM in der Cybersicherheit

Wir haben 7 große Sprachmodelle in 9 Cyberbereichen mit SecBench evaluiert, einem groß angelegten und mehrformatigen Benchmark für Sicherheitstasks. Wir haben jedes Modell an 44.823 Multiple-Choice-Fragen (MCQs) und 3.087 Kurzantwort-Fragen (SAQs) getestet, die Bereiche wie Datensicherheit, Identitäts- und Zugriffsverwaltung, Netzwerksicherheit, Schwachstellenmanagement und Cloud-Sicherheit abdecken. Diese großen Sprachmodelle wurden nicht ausschließlich auf Cybersicherheitsdaten trainiert, können aber…

LLM
Einblick
26. Mai

ChatGPT für den Kundenservice: Top 10 Anwendungsfälle

ChatGPT hat sich im Kundenservice von einer Neuheit zu einer Infrastruktur entwickelt. Unternehmen nutzen es, um Reaktionszeiten zu verkürzen, Volumen zu bewältigen, das ihre Teams nicht absorbieren können, und die Kosten für Routineinteraktionen zu senken. Die Ergebnisse variieren jedoch stark, je nachdem, wie es implementiert wird. OpenAI hat GPT-5.2 veröffentlicht, ein deutlich leistungsfähigeres Modell, das…

LLM
Benchmark
15. Apr

LLM Quantisierung: BF16 vs FP8 vs INT4

Wir haben Qwen3-32B auf 4 Genauigkeitsstufen (BF16, FP8, GPTQ-Int8, GPTQ-Int4) auf einer einzelnen NVIDIA H100 80GB GPU getestet. Jede Konfiguration wurde auf 2 Benchmarks (~12,2K Fragen) bewertet, die Wissen und Code-Generierung abdecken, sowie auf 2.000+ Inferenzläufen zur Messung des Durchsatzes. Int4 ist 2,7-mal schneller als BF16, verliert jedoch weniger als 2 Punkte auf MMLU-Pro, während…