Dienstleistungen
Kontaktieren

LLM Benchmarks

Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert.

Zuletzt aktualisiert Jun 2026
TOP-MODELL
Claude Fable 5
Index 92
Bestes Preis-Leistungs-Verhältnis
MiniMax M3
$0.42 / 1M
Am schnellsten
GPT OSS 120B
0.19s TTFT
Abdeckung
64 Modelle
8 Benchmarks · 336 Bewertungsläufe
AIMultiple Intelligenz-Index

Bestenliste

Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.

Filter & Sort
#
Modell
Index
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Seite 1 von 7

Kosten$20.00
Latenz3.98s
Kontext1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Kosten$6.00
Latenz252.11s
Kontext1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Kosten$11.25
Latenz2.47s
Kontext1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Kosten$3.00
Latenz10.26s
Kontext500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Kosten$11.25
Latenz1.03s
Kontext272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Kosten$5.63
Latenz1.92s
Kontext1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Kosten$11.25
Latenz11.46s
Kontext1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Kosten$10.00
Latenz1.75s
Kontext1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Kosten$4.50
Latenz-
Kontext1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Kosten$4.50
Latenz33.83s
Kontext1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Seite 1 von 7

Diagramme

Folgt den Modellen mit der besten Performance

Entwicklung im Zeitverlauf
Intelligenz-Index nach Modell-Veröffentlichungsdatum
Kosten vs. Leistung
Gemischte Kosten im Verhältnis zum Intelligenz-Index
Modell × Benchmark
Top-Modelle bei ausgewählten Benchmarks
Methodik

Wie der Index aufgebaut ist

Der Intelligenz-Index normalisiert jeden Benchmark auf eine Skala von 0-100 und mittelt die relative Position eines Modells über die Benchmarks, für die es bewertet wurde. Jeder unten aufgeführte Benchmark fließt in diese Punktzahl ein.

Aktuelle Updates

Aktuelle Updates

Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.

Moonshot AI

Kimi K3

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Sol

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Terra

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Sol Pro

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

LLM Anwendungsfälle, Analysen & Benchmarks erkunden

LLM Skalierungsgesetze: Analyse von KI-Forschern

LLM
Einblick
24. Jul

LLM sagen das nächste Token basierend auf Mustern vorher, die aus Textdaten gelernt wurden. Der Begriff LLM Skalierungsgesetze bezeichnet empirische Regelmäßigkeiten, die Modellleistung mit der verwendeten Rechenleistung, den Trainingsdaten und den Modellparametern während des Trainings verknüpfen. Um zu verstehen, wie diese Beziehungen das moderne Modelldesign in der Praxis beeinflussen, haben wir Ergebnisse aus 8…

Mehr lesen
LLM23. Jul

LLM Preisgestaltung: Top 15+ Anbieter im Vergleich

API-Preise ändern sich mit jeder Modellgeneration. Das folgende Diagramm zeigt jedes Modell zum Zeitpunkt seiner Markteinführung, zeigt seinen Listenpreis pro Million Token, verwendet ein gemischtes Verhältnis von 3:1 Input zu Output und gruppiert die Modelle in acht Größenklassen. Die Preise sind Standard-API-Tarife ohne Cache- oder Batch-Rabatte, und die y-Achse ist logarithmisch. Es gibt zwei Möglichkeiten,…

LLM
Benchmark
17. Jul

Text-to-SQL: Vergleich der Genauigkeit von LLMs

Ich verlasse mich seit 18 Jahren auf SQL für die Datenanalyse, begonnen in meiner Zeit als Berater. Die Übersetzung von natürlichsprachlichen Fragen in SQL macht Daten zugänglicher und ermöglicht es jedem, auch Personen ohne technische Kenntnisse, direkt mit Datenbanken zu arbeiten. Wir haben unsere Benchmark-Methodik für Text-to-SQL auf über 35 große Sprachmodelle (LLMs) angewendet, um…

LLM
Einblick
16. Jul

LLM-Feintuning-Leitfaden für Unternehmen

Folgen Sie den Links für die spezifischen Lösungen zu Ihren LLM-Ausgabeherausforderungen. Wenn Ihr LLM: Die weite Verbreitung von Large Language Models (LLMs) hat unsere Fähigkeit verbessert, menschliche Sprache zu verarbeiten. Ihr generisches Training führt jedoch oft zu suboptimaler Leistung bei spezifischen Aufgaben. Um diese Einschränkung zu überwinden, werden Feintuning-Methoden eingesetzt, um LLMs an die einzigartigen…

LLM
Einblick
16. Jul

LLM Observability-Tools: Weights & Biases, Langsmith

LLM-Anwendungen haben sich von Single-Turn-Chats zu mehrstufigen Agenten entwickelt, die Tools verwenden, Datenbanken abfragen und sich mit anderen Modellen koordinieren, was ihr Verhalten schwerer interpretierbar macht. LLM-Observability bietet kontinuierliche Einblicke in diese komplexen Workflows und hilft Unternehmen, die Qualität zu überwachen, Ausfälle zu erkennen, Probleme zu beheben sowie Leistung und Kosten zu managen. W&B Weave…

LLM
Einblick
12. Jul

LLM VRAM-Rechner für Selbsthosting

Einen LLM selbst zu hosten bedeutet, die Inferenz auf Hardware auszuführen, die der Betreiber kontrolliert, anstatt über eine API eines Drittanbieters, was die Kosten, die Datenkontrolle und das Datenschutzprofil verändert. Ob ein Modell überhaupt läuft, hängt vom Speicher ab. Der Rechner schätzt den benötigten VRAM oder vereinheitlichten Speicher, um ein Modell lokal auszuführen, basierend auf…

LLM
Benchmark
10. Jul

Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol

Wir haben 40+ LLMs im Finanzwesen anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark evaluiert, um herauszufinden, welche Modelle bei komplexen Finanzlogik-Aufgaben wie Bilanzanalyse, Prognosen und Kennzahlenberechnungen hervorragend sind. Wir haben LLMs auf 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Untergruppe zielt auf die anspruchsvollsten Finanzlogik-Aufgaben ab und bewertet komplexe, mehrstufige…

LLM
Einblick
10. Jul

LLM-Automatisierung: Top 7 Tools & 8 Fallstudien 

LLM-Automatisierung bezeichnet den Wandel hin zu intelligenten Automatisierungstools, die LLMs nutzen, einschließlich KI-Agenten, feinabgestimmten LLMs und RAG-Modellen, um Aufgaben zu automatisieren und zu koordinieren. Erkunden Sie, was LLM-Automatisierung ist, ihre wichtigsten praktischen Anwendungen und die wesentlichen Tools: LLM in der Automatisierung sind ein systematischer Ansatz, der Natural Language Processing (NLP) mit bestehenden Prozessautomatisierungsmethoden kombiniert. Es…

LLM
Benchmark
8. Jul

LLM-Latenz-Benchmark nach Anwendungsfällen

Wir haben 11 führende große Sprachmodelle mit insgesamt 1.320 Anfragen einem Benchmark unterzogen, wobei wir zwischen Reasoning- und Nicht-Reasoning-Modellen unterschieden und die Time to First Token, die Latenz pro Token sowie die gesamte Antwortzeit gemessen haben. Details zur Messung der Latenz finden Sie hier. Wir berichten über Reasoning- und Nicht-Reasoning-Modelle getrennt. Reasoning-Modelle verbringen mehrere Sekunden…

LLM
Benchmark
7. Jul

HALC-Bench: LLM Halluzination bei Langkontext-Retrieval-Benchmark

HALC-Bench (LLM Halluzination bei Langkontext-Retrieval-Benchmark) misst die Beständigkeit eines großen Sprachmodells gegenüber der Erfindung von Belegen für eine Metrik, die im Zieldokument nicht existiert, indem 3 Heuhaufen am Anfang, in der Mitte und am Ende des Kontextfensters des Modells platziert werden, mit 204 Fragen. claude-fable-5 beantwortete alle 204 Fallen an jeder Heuhaufenposition korrekt. Unter den…

LLM
Benchmark
7. Jul

Intelligenzdichte von 71 LLMs: Intelligentere und dichtere Modelle

Wir haben 71 LLMs verfolgt, die zwischen Februar 2023 und Mai 2026 veröffentlicht wurden, und 10 öffentliche Benchmarks gesammelt, um die Intelligenzdichte zu messen. Wir haben den Fähigkeitswert durch die vom Modell verbrauchten Ressourcen (aktive Parameter, Trainingsrechenleistung und Inferenzpreis) dividiert. Um die Intelligenzdichte zu berechnen, haben wir die folgenden Schritte ausgeführt: Siehe Methodik für den…