Premium
Dienstleistungen
Premium

LLM Benchmarks

Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert. Wie der Index aufgebaut ist

TOP-MODELL
Claude Opus 5.5
Index 100
Bestes Preis-Leistungs-Verhältnis
Qwen3.8 Flash
$0.23 / 1M
Am schnellsten
MiniMax M2.7
0.15s TTFT
AIMultiple Intelligenz-Index

Bestenliste

Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.

Filter & Sort
#
Modell
Index
AA-LCR
AIM-A-CODE-LLM Bench
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-HALC-Bench
AIM-RELC-Bench
AIM-Text-to-SQL
APEX-Agents-AA
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
ArxivMath
AutomationBench-AA
BioMysteryBench
BrowseComp
Convex Coding Evals
CritPt
Crosby RedlineBench
DeepSWE 1.1
EnterpriseOps-Gym-AA
Frontier-Bench
FrontierCode
FrontierMath
GDPval
GPQA Diamond
Harvey LAB-AA
HealthBench Professional
HieroglyphBench
Humanity's Last Exam
IFBench
ITBench-AA
LegalBench
LiveCodeBench
MMMU-Pro
ObviousBench
Opus Magnum Bench
ReactBench
RuneBench
SciCode
SimpleBench
Swe-Bench
Tau2-Bench Telecom
Tau3-Banking
Terminal-Bench 2.1
Terminal-Bench 4.0
Terminal-Bench Hard
Terminal-Bench-Science
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
100
--9092--88---------32------1846--------------67--------
2
GPT-6 Astra
GPT-6 Astra
OpenAI
92
--8487--66--9563-41-928532-74--5398154296-70----------756----9058--
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
91
80-8490--67-9890--31--8131-67--5188173594-62-59--89-----663---479156--
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
87
77----------------------174392---3881--------47---4586---
5
Command A+
Command A+
Cohere
87
----------------30------------74-61---------81---25-
6
MiMo-V2.6-Pro
MiMo-V2.6-Pro
Xiaomi
87
----------------27------1673--------------61--------
7
Muse Spark 1.1
Muse Spark 1.1
Meta
86
81-----------------53----138190-59-46--85--99-23658---3278---
8
Claude Fable 5
Claude Fable 5
Anthropic
85
77698290--66599989-7917-878429-70-3454901741931463235664-89-8199224766182-993885426321
9
Claude Opus 5
Claude Opus 5
Anthropic
83
79-8590--64-989030915079918229-74-445373170894-60-55--87-85100--656---458952-30
10
GPT-6 Sol
GPT-6 Sol
OpenAI
79
--82---54---------31------1487--------------58--------
Seite 1 von 13

Kosten$8.00
Latenz2.81s
Kontext1M
TTFT2.81s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
GDPval
1846
SciCode
67

Kosten$20.00
Latenz6.31s
Kontext1M
TTFT6.31s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-2
95
ARC-AGI-3
63
AutomationBench-AA
41
BrowseComp
92
Convex Coding Evals
85
CritPt
32
DeepSWE 1.1
74
FrontierCode
53
FrontierMath
98
GDPval
1542
GPQA Diamond
96
HealthBench Professional
70
RuneBench
7
SciCode
56
Terminal-Bench 2.1
90
Terminal-Bench 4.0
58

Kosten$20.00
Latenz3.84s
Kontext1M
TTFT3.84s
AA-LCR
80
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
ARC-AGI-1
98
ARC-AGI-2
90
AutomationBench-AA
31
Convex Coding Evals
81
CritPt
31
DeepSWE 1.1
67
FrontierCode
51
FrontierMath
88
GDPval
1735
GPQA Diamond
94
HealthBench Professional
62
Humanity's Last Exam
59
LegalBench
89
RuneBench
6
SciCode
63
Tau3-Banking
47
Terminal-Bench 2.1
91
Terminal-Bench 4.0
56

Kosten$0.23
Latenz0.85s
Kontext1M
TTFT0.85s
AA-LCR
77
GDPval
1743
GPQA Diamond
92
Humanity's Last Exam
38
IFBench
81
SciCode
47
Tau3-Banking
45
Terminal-Bench 2.1
86

Kosten$0.60
Latenz-
Kontext200k
TTFT
CritPt
30
IFBench
74
LegalBench
61
Tau2-Bench Telecom
81
Terminal-Bench Hard
25

Kosten$0.54
Latenz43.98s
Kontext1M
TTFT43.98s
CritPt
27
GDPval
1673
SciCode
61

Kosten$2.00
Latenz5.26s
Kontext1M
TTFT5.26s
AA-LCR
81
DeepSWE 1.1
53
GDPval
1381
GPQA Diamond
90
HealthBench Professional
59
Humanity's Last Exam
46
LegalBench
85
ObviousBench
99
ReactBench
23
RuneBench
6
SciCode
58
Tau3-Banking
32
Terminal-Bench 2.1
78

Kosten$20.00
Latenz4.35s
Kontext1M
TTFT4.35s
AA-LCR
77
AIM-A-CODE-LLM Bench
69
AIM-Agentic-RAG
82
AIM-FinanceReasoning
90
AIM-Text-to-SQL
66
APEX-Agents-AA
59
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
AutomationBench-AA
17
BrowseComp
87
Convex Coding Evals
84
CritPt
29
DeepSWE 1.1
70
Frontier-Bench
34
FrontierCode
54
FrontierMath
90
GDPval
1741
GPQA Diamond
93
Harvey LAB-AA
14
HealthBench Professional
63
HieroglyphBench
23
Humanity's Last Exam
56
IFBench
64
LegalBench
89
MMMU-Pro
81
ObviousBench
99
Opus Magnum Bench
22
ReactBench
47
RuneBench
6
SciCode
61
SimpleBench
82
Tau2-Bench Telecom
99
Tau3-Banking
38
Terminal-Bench 2.1
85
Terminal-Bench 4.0
42
Terminal-Bench Hard
63
Terminal-Bench-Science
21

Kosten$10.00
Latenz4.03s
Kontext1M
TTFT4.03s
AA-LCR
79
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-1
98
ARC-AGI-2
90
ARC-AGI-3
30
ArxivMath
91
AutomationBench-AA
50
BioMysteryBench
79
BrowseComp
91
Convex Coding Evals
82
CritPt
29
DeepSWE 1.1
74
Frontier-Bench
44
FrontierCode
53
FrontierMath
73
GDPval
1708
GPQA Diamond
94
HealthBench Professional
60
Humanity's Last Exam
55
LegalBench
87
MMMU-Pro
85
ObviousBench
100
RuneBench
6
SciCode
56
Tau3-Banking
45
Terminal-Bench 2.1
89
Terminal-Bench 4.0
52
Terminal-Bench-Science
30

Kosten$4.00
Latenz1.36s
Kontext1M
TTFT1.36s
AIM-Agentic-RAG
82
AIM-Text-to-SQL
54
CritPt
31
GDPval
1487
SciCode
58
Seite 1 von 13
Entwicklung im Zeitverlauf
Intelligenz-Index nach Modell-Veröffentlichungsdatum
Kosten vs. Leistung
Gemischte Kosten im Verhältnis zum Intelligenz-Index
Modell × Benchmark
Top-Modelle bei ausgewählten Benchmarks

Wie der Index aufgebaut ist

Jeder Benchmark wird als Platzierung gelesen, nicht als Rohwert. Innerhalb eines Benchmarks liegt das beste Ergebnis bei 100, das schlechteste bei 0, und jedes andere Modell fällt irgendwo dazwischen. Der Index ist der gewichtete Durchschnitt dieser Platzierungen über die Benchmarks, die ein Modell tatsächlich absolviert hat: ein Benchmark, den es nie absolviert hat, zählt nicht als Null, er fehlt einfach. Benchmarks zählen nicht gleich viel, und das Gewicht jedes einzelnen ist bei ihm angegeben. Ein Modell braucht Ergebnisse in mindestens zwei Index-Benchmarks, bevor es eingestuft wird; ein einzelnes Ergebnis setzt ein Modell auf die Linie eines Benchmarks, ohne ihm eine eigene Einstufung zu geben. Platzierungen werden statt roher Genauigkeit verwendet, weil sich Benchmarks in Schwierigkeit und Skala stark unterscheiden und Werte aus verschiedenen Benchmarks keinen gemeinsamen Durchschnitt bilden können. Gewichte: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).

Verwendete Benchmarks

Öffentlich
AA-LCRSchlussfolgern uber lange Kontexte mit Eingaben aus mehreren Dokumenten.
AIMultiple
AIM-A-CODE-LLM BenchAgentenbasiertes Programmieren bei 10 Softwareentwicklungsaufgaben über ein CLI-Tool (~3.500 Validierungsschritte).
AIMultiple
AIM-Agentic-RAGMulti-Datenbank-Routing und SQL-Abfragegenerierung über 5 Datenbanken hinweg (BIRD-SQL, 500 Fragen).
AIMultiple
AIM-FinanceReasoningKomplexes mehrstufiges Finanzdenken anhand von 238 schwierigen FinanceReasoning-Fragen.
AIMultiple
AIM-HALC-BenchWiderstandsfähigkeit gegen das Erfinden nicht erwähnter Kennzahlen in Dokumenten mit langem Kontext (204 Fallen, 14 Transkripte).
AIMultiple
AIM-RELC-BenchAbruf numerischer Fakten in langen Kontexten an verschiedenen Dokumentpositionen (100 Elemente, 14 Transkripte).
AIMultiple
AIM-Text-to-SQLGenauigkeit der SQL-Abfragegenerierung aus natürlicher Sprache über mehr als 35 LLMs hinweg.
Öffentlich
APEX-Agents-AALangfristige, anwendungsubergreifende Aufgaben, verfasst von Investmentbankern, Beratern und Wirtschaftsanwalten.
Öffentlich
ARC-AGI-1Abstraktes Schlussfolgern mit wenigen Beispielen uber Gittertransformationen; der erste ARC-Prize-Benchmark.
Öffentlich
ARC-AGI-2Neuartige visuelle Denkaufgaben, die Generalisierung statt Auswendiglernen prüfen.
Öffentlich
ARC-AGI-3Interaktives Schlussfolgern: Agenten erkunden neue Spielumgebungen, setzen sich unterwegs Ziele und lernen uber mehrere Schritte. 100% entspricht menschlicher Lerneffizienz.
Öffentlich
ArxivMathAktuelle arXiv-Mathematikprobleme, kurz nach Veroffentlichung ausgefuhrt, um Kontamination zu begrenzen.
Öffentlich
AutomationBench-AADurchgangige Buroautomatisierungsaufgaben, bewertet nach Teilerfullung.
Öffentlich
BioMysteryBenchAnthropics Benchmark dazu, ob KI-Agenten echte bioinformatische Ratsel aus Rohdaten losen konnen.
Öffentlich
BrowseCompSchwer auffindbare Fakten im Web: kurze Fragen, die hartnackiges Browsen erfordern.
Öffentlich
Convex Coding EvalsSchreiben von Convex-Backends und Client-Integrationen ohne framework-spezifische Vorgaben im Prompt.
Öffentlich
CritPtPhysikprobleme auf Forschungsniveau, die mehrstufige Herleitungen erfordern.
Öffentlich
Crosby RedlineBenchVertragsuberarbeitungsaufgaben, Zug um Zug gegen Anwaltsanderungen bewertet.
Öffentlich
DeepSWE 1.1Langfristige Entwicklungsaufgaben aus aktiven Open-Source-Repositories, bewertet am committeten Code in einer sauberen Umgebung.
Öffentlich
EnterpriseOps-Gym-AAZustandsbehaftete agentische Planung und Werkzeugnutzung uber acht Unternehmenssysteme.
Öffentlich
Frontier-BenchAgentische Softwareaufgaben auf aktuellen Repositories, bewertet nach Losungsquote.
Öffentlich
FrontierCodeOb eine Anderung mergefahig ist, nicht nur testbestehend: Regressionssicherheit, Umfang und Wartbarkeit nach Rubrik bewertet.
Öffentlich
FrontierMathUnveröffentlichte, von Experten verfasste mathematische Forschungsprobleme (Stufen 1–4).
Öffentlich
GDPvalEchte Arbeitsergebnisse aus 44 Berufen in den neun grossten Sektoren des US-BIP, blind von erfahrenen Fachleuten gegen eine menschliche Referenz bewertet.
Öffentlich
GPQA DiamondNaturwissenschaftliche Fragen auf Graduiertenniveau, die nicht ergoogelbar sind und tiefes Schlussfolgern erfordern.
Öffentlich
Harvey LAB-AAHarveys Benchmark fur Rechtsagenten, bewertet nach vollstandig bestandenen Aufgaben.
Öffentlich
HealthBench ProfessionalVon Arzten verfasste Gesprache, bewertet nach von Arzten verfassten Rubriken, im professionellen Teil.
Öffentlich
HieroglyphBenchLesen agyptischer Hieroglyphen aus Bildern, bewertet nach Zeichengenauigkeit.
Öffentlich
Humanity's Last ExamArgumentation auf Expertenniveau ohne Hilfsmittel in über 100 akademischen Fächern (2,5k Fragen).
Öffentlich
IFBenchPrazises Befolgen von Anweisungen bei 58 unbekannten, uberprufbaren Ausgabebeschrankungen.
Öffentlich
ITBench-AAReale IT-Automatisierungsszenarien aus Site Reliability, FinOps und Security Operations.
Öffentlich
LegalBenchCrowdsourcing-basiertes juristisches Denken in 162 von Rechtspraktikern erstellten Aufgaben.
Öffentlich
LiveCodeBenchKontaminationsfreie, kontinuierlich aktualisierte Wettbewerbsprogrammieraufgaben.
Öffentlich
MMMU-ProMultimodales Verstandnis auf Hochschulniveau uber Facher hinweg, gehartet gegen reine Textabkurzungen.
Öffentlich
ObviousBenchFragen mit offensichtlichen Antworten, die Modelle dennoch falsch beantworten; Pass-hoch-drei-Wertung.
Öffentlich
Opus Magnum BenchEntwurf funktionierender Maschinen im Puzzlespiel Opus Magnum.
Öffentlich
ReactBenchErstellen und Reparieren von React-Komponenten, bewertet mit pass@1.
Öffentlich
RuneBenchLesen und Schlussfolgern uber eine konstruierte Runenschrift, die das Modell nie gesehen hat, auf logarithmischer Skala bewertet.
Öffentlich
SciCodeWissenschaftliches Programmieren auf Forschungsniveau in Physik, Mathematik, Biologie und Chemie (338 Teilprobleme)
Öffentlich
SimpleBenchAlltagliche Denkaufgaben, bei denen Menschen Spitzenmodelle zuverlassig schlagen.
Öffentlich
Swe-BenchReale GitHub-Issues durchgängig gelöst (vollständiger Satz mit 2.294 Instanzen).
Öffentlich
Tau2-Bench TelecomWerkzeugnutzende Kundendienst-Agenten im Telekombereich, bewertet nach Aufgabenerfolg.
Öffentlich
Tau3-BankingWerkzeugnutzende Agenten in realistischen Banken-Kundendienstablaufen.
Öffentlich
Terminal-Bench 2.1Agentische Terminalaufgaben aus Softwareentwicklung, Daten und Systemadministration.
Öffentlich
Terminal-Bench 4.0Die aktuelle Terminal-Bench-Generation: agentische Terminalaufgaben, bewertet nach Losungsquote.
Öffentlich
Terminal-Bench HardDie schwere Teilmenge von Terminal-Bench: mehrstufige Softwareaufgaben in einem echten Terminal.
Öffentlich
Terminal-Bench-ScienceTerminalaufgaben aus realen wissenschaftlichen Rechen-Workflows.

Aktuelle Updates

Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.

Anthropic

Claude Opus 5.5

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-6 Sol

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-6 Luna

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

Xiaomi

MiMo-V2.6-Pro

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

LLM-VeröffentlichungszeitleisteDas Tempo der KI-Innovation
KI-Labore
Alibaba Cloud
Alibaba Cloud
03 Aug 2026
Qwen3.7 Flash +1 weitereQwen3.7 FlashQwen3.8 Max
14 Aug 2026
Qwen3.8 2.4T A95B +1 weitereQwen3.8 2.4T A95BQwen3.8 27B
03 Sep 2026
Qwen3.8 Flash +1 weitereQwen3.8 FlashQwen3.8 Max (0902)
23 Sep 2026
Qwen3.8 Max Prime +1 weitereQwen3.8 Max PrimeQwen3.8 Omni Flash
Z AI
Z AI
26 Aug 2026
GLM 5.3 +1 weitereGLM 5.3GLM 5.3 Flash
23 Sep 2026
GLM 5.3 FlashX +1 weitereGLM 5.3 FlashXGLM 5.3 Prime
Anthropic
Anthropic
24 Jul 2026
Claude Opus 5
01 Sep 2026
Claude Fable 5.1
22 Sep 2026
Claude Opus 5.5
OpenAI
OpenAI
22 Sep 2026
GPT-6 Astra +2 weitereGPT-6 AstraGPT-6 LunaGPT-6 Sol
Xiaomi
Xiaomi
21 Sep 2026
MiMo-V2.6-Pro
X
X
12 Aug 2026
Grok 4.6
21 Sep 2026
Grok 4.7
Meta
Meta
09 Aug 2026
Muse Glimmer 30B +1 weitereMuse Glimmer 30BMuse Spark 1.2
02 Sep 2026
Muse Spark 1.2 Contributor +2 weitereMuse Spark 1.2 ContributorMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
13 Aug 2026
Gemini 3.7 Flash
02 Sep 2026
Gemini 3.8 Flash
Tencent
Tencent
28 Aug 2026
Hy4

LLM Anwendungsfälle, Analysen & Benchmarks erkunden

LLM Parameter: GPT-5 High, Mittel, Niedrig und Minimal

LLM
Einblick
21. Aug

Einige LLMs, wie die GPT-5-Familie von OpenAI, sind in verschiedenen Versionen verfügbar (z. B. GPT-5, GPT-5-mini und GPT-5-nano) und mit verschiedenen Parametereinstellungen, einschließlich hoch, mittel, niedrig und minimal. Im Folgenden untersuchen wir die Unterschiede zwischen diesen Modellversionen, indem wir ihre Benchmark-Leistung und die Kosten für die Durchführung der Benchmarks erfassen. Wir haben die GPT-5-Familie in…

Mehr lesen
LLM
Funktionsvergleich
21. Aug

Top LLMOps-Tools & Vergleich mit MLOps

LLMOps-Plattformen übernehmen die operative Seite des Betriebs großer Sprachmodelle: Bereitstellung, Überwachung, Evaluierung und Kostenmanagement. Wir haben führende LLMOps-Tools, ihre Kernfunktionen, Preismodelle und ihre Unterschiede untersucht, um die beste Lösung für verschiedene Anwendungsfälle zu identifizieren. Eine Aufschlüsselung der einzelnen Metriken finden Sie unten: LLMOps-Plattformen unterstützen den Lebenszyklus von LLMs durch: LLMOps-Plattformen unterscheiden sich in ihrem Ansatz:…

LLM
Einblick
19. Aug

50+ ChatGPT-Anwendungsfälle mit Beispielen aus der Praxis

ChatGPT erreichte Anfang 2026 rund 1 Milliarde wöchentlich aktive Nutzer, ungefähr 10 % der Weltbevölkerung.1 OpenAI übertraf im Jahr 2025 einen Jahresumsatz von $20 Milliarden, bestätigt von CFO Sarah Friar.2 Der Anthropic Economic Index unterscheidet zwei Nutzungsmodi: Augmentation, bei der ein Mensch mit KI interagiert, und Automatisierung, bei der KI Aufgaben selbstständig erledigt. Die Verbrauchernutzung teilt…

LLM
Einblick
19. Aug

ChatGPT für Kundenservice: Top 10 Anwendungsfälle

ChatGPT hat sich im Kundenservice von einer Neuheit zu einer Infrastruktur entwickelt. Unternehmen nutzen ihn, um Antwortzeiten zu verkürzen, ein Volumen zu bewältigen, das ihre Teams nicht auffangen können, und die Kosten für Routineinteraktionen zu senken. Aber die Ergebnisse variieren stark, je nachdem, wie er implementiert ist. OpenAI hat GPT-5.6 auf den Markt gebracht, ein…

LLM
Benchmark
16. Aug

Intelligenzdichte von 71 LLMs für intelligentere & dichtere Modelle

Wir haben 71 LLMs verfolgt, die zwischen Februar 2023 und Mai 2026 veröffentlicht wurden, und 10 öffentliche Benchmarks gesammelt, um die Intelligenzdichte zu messen. Wir haben den Fähigkeitswert durch die vom Modell verbrauchte Ressource geteilt (aktive Parameter, Trainingsrechenleistung und Inferenzpreis). Um die Intelligenzdichte zu berechnen, haben wir die folgenden Schritte ausgeführt: Siehe Methodik für den…

LLM
Benchmark
12. Aug

LLM Latenz-Benchmark nach Anwendungsfällen

Wir haben 11 führende große Sprachmodelle mit insgesamt 1.320 Anfragen gebenchmarkt, dabei zwischen Reasoning- und Nicht-Reasoning-Modellen unterschieden und die First-Token-Latenz, die Per-Token-Latenz und die Gesamtantwortzeit gemessen. Details dazu, wie wir die Latenz gemessen haben, finden Sie hier. Wir berichten Reasoning- und Nicht-Reasoning-Modelle getrennt. Reasoning-Modelle verbringen mehrere Sekunden mit Nachdenken vor der ersten sichtbaren Antwort; daher…

LLM
Benchmark
15. Apr

LLM Quantisierung: BF16 vs FP8 vs INT4

Wir haben Qwen3-32B auf 4 Genauigkeitsstufen (BF16, FP8, GPTQ-Int8, GPTQ-Int4) auf einer einzelnen NVIDIA H100 80GB GPU getestet. Jede Konfiguration wurde auf 2 Benchmarks (~12,2K Fragen) bewertet, die Wissen und Code-Generierung abdecken, sowie auf 2.000+ Inferenzläufen zur Messung des Durchsatzes. Int4 ist 2,7-mal schneller als BF16, verliert jedoch weniger als 2 Punkte auf MMLU-Pro, während…