Dienstleistungen
Kontaktieren

LLM Benchmarks

Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert. Zur Methodik.

TOP-MODELL
Claude Opus 5
Index 86
Bestes Preis-Leistungs-Verhältnis
DeepSeek V4 Flash 0731
$0.11 / 1M
Am schnellsten
Trinity Large Thinking
0.12s TTFT
Abdeckung
151 Modelle
12 Benchmarks · 697 Bewertungsläufe
AIMultiple Intelligenz-Index

Bestenliste

Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.

Filter & Sort
#
Modell
Index
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
67
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Seite 1 von 16

Kosten$10.00
Latenz3.83s
Kontext1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Kosten$8.00
Latenz4.43s
Kontext1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Kosten$20.00
Latenz5.28s
Kontext1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Kosten$4.50
Latenz1.92s
Kontext1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Kosten$10.00
Latenz4.53s
Kontext1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Kosten$20.00
Latenz5.44s
Kontext1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Kosten$1.50
Latenz6.05s
Kontext1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Kosten$33.75
Latenz3.65s
Kontext1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Kosten$5.44
Latenz0.93s
Kontext1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Kosten$2.00
Latenz10.25s
Kontext1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Seite 1 von 16
Entwicklung im Zeitverlauf
Intelligenz-Index nach Modell-Veröffentlichungsdatum
Kosten vs. Leistung
Gemischte Kosten im Verhältnis zum Intelligenz-Index
Modell × Benchmark
Top-Modelle bei ausgewählten Benchmarks
Methodik

Wie der Index aufgebaut ist

Jeder Benchmark wird zu einer Position auf einer Skala von 0-100, und der Index ist der gewichtete Durchschnitt dieser Positionen. Ein Benchmark, für den ein Modell nicht getestet wurde, zählt als Feldmittelwert, damit die Punktzahlen vergleichbar bleiben. Index = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAGMulti-Datenbank-Routing und SQL-Abfragegenerierung über 5 Datenbanken hinweg (BIRD-SQL, 500 Fragen).
Öffentlich
ARC-AGI-1Abstraktes Schlussfolgern mit wenigen Beispielen uber Gittertransformationen; der erste ARC-Prize-Benchmark.
Öffentlich
ARC-AGI-2Neuartige visuelle Denkaufgaben, die Generalisierung statt Auswendiglernen prüfen.
Öffentlich
ArxivMathAktuelle arXiv-Mathematikprobleme, kurz nach Veroffentlichung ausgefuhrt, um Kontamination zu begrenzen.
Öffentlich
BioMysteryBenchAnthropics Benchmark dazu, ob KI-Agenten echte bioinformatische Ratsel aus Rohdaten losen konnen.
Öffentlich
CritPtPhysikprobleme auf Forschungsniveau, die mehrstufige Herleitungen erfordern.
AIMultiple
FinanceReasoningKomplexes mehrstufiges Finanzdenken anhand von 238 schwierigen FinanceReasoning-Fragen.
Öffentlich
Frontier-BenchAgentische Softwareaufgaben auf aktuellen Repositories, bewertet nach Losungsquote.
Öffentlich
FrontierMathUnveröffentlichte, von Experten verfasste mathematische Forschungsprobleme (Stufen 1–4).
Öffentlich
LegalBenchCrowdsourcing-basiertes juristisches Denken in 162 von Rechtspraktikern erstellten Aufgaben.
Öffentlich
MMMU-ProMultimodales Verstandnis auf Hochschulniveau uber Facher hinweg, gehartet gegen reine Textabkurzungen.
Öffentlich
Terminal-Bench 2.1Agentische Terminalaufgaben aus Softwareentwicklung, Daten und Systemadministration.
Öffentlich
Terminal-Bench HardDie schwere Teilmenge von Terminal-Bench: mehrstufige Softwareaufgaben in einem echten Terminal.
Öffentlich
Terminal-Bench-ScienceTerminalaufgaben aus realen wissenschaftlichen Rechen-Workflows.
AIMultiple
Text-to-SQLGenauigkeit der SQL-Abfragegenerierung aus natürlicher Sprache über mehr als 35 LLMs hinweg.
Aktuelle Updates

Aktuelle Updates

Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.

Google

Gemini 3.8 Flash

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

Anthropic

Claude Fable 5.1

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

Tencent

Hy4 preview

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

Z AI

GLM 5.3 Flash

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

Zeitleiste der KI-ModellveröffentlichungenLetzte 12 Modelle in 19 Tagen

Wichtige KI-Modellveröffentlichungen führender Anbieter der letzten 19 Tage.

Anbieter
OpenAI
OpenAI
04 Sep 2026
GPT-6 Astra +1 weitereGPT-6 AstraGPT-6 Astra Pro
Alibaba Cloud
Alibaba Cloud
26 Aug 2026
Qwen3.8 Flash
03 Sep 2026
Qwen3.8 Max (0902)
Google
Google
02 Sep 2026
Gemini 3.8 Flash
Meta
Meta
21 Aug 2026
Muse Spark 1.2 Contributor
02 Sep 2026
Muse Spark 1.3 +1 weitereMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Sep 2026
Claude Fable 5.1
Tencent
Tencent
28 Aug 2026
Hy4 preview
Z AI
Z AI
18 Aug 2026
GLM 5.3
26 Aug 2026
GLM 5.3 Flash

LLM Anwendungsfälle, Analysen & Benchmarks erkunden

Vergleichen Sie 9 große Sprachmodelle im Gesundheitswesen

LLM
Funktionsvergleich
4. Sep

Wir haben 9 LLMs mithilfe des MedQA-Datasets verglichen, einem Benchmark für klinische Prüfungen auf Graduierten-Niveau, der aus USMLE-Fragen abgeleitet ist. Jedes Model beantwortete dieselben klinischen Multiple-Choice-Szenarien mit einem standardisierten Prompt und ermöglichte so einen direkten Vergleich der Genauigkeit. Wir haben außerdem die Latenz pro Frage erfasst, indem wir die Gesamtlaufzeit durch die Anzahl der abgeschlossenen…

Mehr lesen
LLM
Einblick
3. Sep

Große multimodale Modelle (LMMs) vs LLMs

Wir haben die Leistung großer multimodaler Modelle (LMMs) bei Aufgaben des finanziellen Denkens anhand eines sorgfältig ausgewählten Datensatzes bewertet. Durch die Analyse einer Teilmenge hochwertiger Finanzbeispiele bewerten wir die Fähigkeiten der Modelle, multimodale Daten im Finanzbereich zu verarbeiten und mit ihnen zu denken. Der Abschnitt zur Methodik bietet detaillierte Einblicke in den verwendeten Datensatz und…

LLM
Einblick
2. Sep

LLM-Skalierungsgesetze: Analyse von KI-Forschern

LLM sagen auf der Grundlage von aus Textdaten gelernten Mustern das nächste Token voraus. Der Begriff LLM-Skalierungsgesetze bezieht sich auf empirische Regelmäßigkeiten, die Modellleistung mit der Menge an Rechenleistung, Trainingsdaten und Modellparametern verknüpfen, die während des Trainings verwendet werden. Um zu verstehen, wie diese Beziehungen das moderne Modelldesign in der Praxis beeinflussen, haben wir…

LLM
Einblick
2. Sep

LLM Observability-Tools: Weights & Biases, Langsmith

LLM-Anwendungen haben sich von Single-Turn-Chats zu mehrstufigen Agenten entwickelt, die Tools verwenden, Datenbanken abfragen und mit anderen Modellen koordinieren, wodurch ihr Verhalten schwieriger zu interpretieren ist. LLM-Observability bietet kontinuierliche Transparenz über diese komplexen Workflows und hilft Unternehmen, die Qualität zu überwachen, Fehler zu erkennen, Probleme zu beheben sowie Leistung und Kosten zu verwalten. W&B Weave…

LLM
Funktionsvergleich
2. Sep

Cloud LLM vs. lokale LLMs: Beispiele & Vorteile

Cloud-LLMs, die auf fortschrittlichen Modellen wie GPT-5.5 und Claude Opus 4.7 basieren, bieten Skalierbarkeit und Zugänglichkeit. Umgekehrt gewährleisten lokale LLMs, die auf Open-Source-Modellen wie Llama 4, DeepSeek V4 und Qwen3.6-Plus basieren, stärkeren Datenschutz und Anpassbarkeit. Erkunden Sie, was Cloud-LLMs sind, Stärken und Schwächen, die häufigsten Fallstudien mit Beispielen aus der Praxis und wie sie sich…

LLM
Benchmark
1. Sep

Zielgruppensimulation: Können LLMs menschliches Verhalten vorhersagen?

Im Marketing ist die Bewertung, wie genau LLMs menschliches Verhalten vorhersagen, entscheidend für die Beurteilung ihrer Wirksamkeit bei der Antizipation von Zielgruppenbedürfnissen und der Erkennung der Risiken von Fehlausrichtung, ineffektiver Kommunikation oder unbeabsichtigter Beeinflussung. Die Zielgruppensimulation mit LLMs ermöglicht die Modellierung virtueller Zielgruppen und hilft Organisationen, Reaktionen auf Inhalte oder Produkte vorherzusehen, ohne auf teure…

LLM
Einblick
1. Sep

LLM-Feintuning-Leitfaden für Unternehmen

Folgen Sie den Links für die spezifischen Lösungen zu Ihren LLM-Ausgabeherausforderungen. Wenn Ihr LLM: Die weite Verbreitung von Large Language Models (LLMs) hat unsere Fähigkeit verbessert, menschliche Sprache zu verarbeiten. Ihr generisches Training führt jedoch oft zu suboptimaler Leistung bei spezifischen Aufgaben. Um diese Einschränkung zu überwinden, werden Feintuning-Methoden eingesetzt, um LLMs an die einzigartigen…

LLM
Einblick
1. Sep

LLM Marktanteil: Vergleich von Nutzung & Akzeptanz

Wir analysierten den LLM-Marktanteil, indem wir nutzungsbasierte Daten und Schätzungen zu Web-Besuchen kombinierten, um zu zeigen, wie die Nachfrage nach large language models über KI-Labore und KI-Anwendungen verteilt ist: Lesen Sie die Methodik, um zu erfahren, wie wir diese Ergebnisse gemessen und berechnet haben. Die Vereinigten Staaten dominierten die Web-Besuche über alle vier Monate hinweg…

LLM
Einblick
1. Sep

10+ Large Language Model Beispiele

Wir haben Open-Source-Benchmarks zusammengestellt, um führende proprietäre und Open-Source Large Language Models zu vergleichen. Wählen Sie Ihren Anwendungsfall, um das richtige Modell zu finden. Sie können Large Language Models bewerten, indem Sie ihre Benchmark-Leistung und die tatsächliche Latenz (verfügbar durch Klicken auf den Namen jedes Modells in der Tabelle) prüfen und ihre Preise überprüfen, um…

LLM
Einblick
31. Aug

LLM VRAM-Rechner für Self-Hosting

Self-Hosting eines LLMs bedeutet, Inferenz auf Hardware auszuführen, die der Betreiber kontrolliert, statt über eine API eines Drittanbieters, was Kosten, Datenkontrolle und Datenschutzprofil verändert. Ob ein Modell überhaupt läuft, hängt vom Speicher ab. Der Rechner schätzt den VRAM oder Unified Memory, den ein Modell lokal benötigt, basierend auf dem Modell, seiner Präzision, der Kontextlänge und…

LLM
Funktionsvergleich
27. Aug

LLM-Preise: Top 15+ Anbieter im Vergleich

LLM-Preise erstrecken sich über vier Größenordnungen: Die günstigsten Modelle starteten bei unter $0,03 pro Million Tokens, während Frontier-Reasoning-Stufen bei bis zu $262,50 starteten. Das folgende Diagramm zeigt die Einführungspreise: Jeder Punkt ist der Durchschnittspreis der Modelle einer Größenklasse, die in einem Kalenderquartal eingeführt wurden, gemischt im Verhältnis 3 Teile Eingabe zu 1 Teil Ausgabe, über…