Dienstleistungen
Kontaktieren

LLM Benchmarks

Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert. Zur Methodik.

TOP-MODELL
Claude Fable 5
Index 92
Bestes Preis-Leistungs-Verhältnis
MiniMax M3
$0.42 / 1M
Am schnellsten
GPT OSS 120B
0.23s TTFT
Abdeckung
64 Modelle
8 Benchmarks · 336 Bewertungsläufe
AIMultiple Intelligenz-Index

Bestenliste

Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.

Filter & Sort
#
Modell
Index
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Seite 1 von 7

Kosten$20.00
Latenz4.02s
Kontext1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Kosten$6.00
Latenz2.93s
Kontext1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Kosten$11.25
Latenz4.31s
Kontext1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Kosten$3.00
Latenz7.25s
Kontext500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Kosten$11.25
Latenz0.70s
Kontext272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Kosten$4.50
Latenz1.62s
Kontext1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Kosten$11.25
Latenz11.11s
Kontext1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Kosten$10.00
Latenz1.71s
Kontext1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Kosten$4.50
Latenz-
Kontext1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Kosten$4.50
Latenz22.02s
Kontext1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Seite 1 von 7
Entwicklung im Zeitverlauf
Intelligenz-Index nach Modell-Veröffentlichungsdatum
Kosten vs. Leistung
Gemischte Kosten im Verhältnis zum Intelligenz-Index
Modell × Benchmark
Top-Modelle bei ausgewählten Benchmarks
Methodik

Wie der Index aufgebaut ist

Der Intelligenz-Index normalisiert jeden Benchmark auf eine Skala von 0-100 und mittelt die relative Position eines Modells über die Benchmarks, für die es bewertet wurde. Jeder unten aufgeführte Benchmark fließt in diese Punktzahl ein.

AIMultiple
FinanceReasoningKomplexes mehrstufiges Finanzdenken anhand von 238 schwierigen FinanceReasoning-Fragen.
AIMultiple
Text-to-SQLGenauigkeit der SQL-Abfragegenerierung aus natürlicher Sprache über mehr als 35 LLMs hinweg.
AIMultiple
Agentic RAGMulti-Datenbank-Routing und SQL-Abfragegenerierung über 5 Datenbanken hinweg (BIRD-SQL, 500 Fragen).
AIMultiple
AI MemoryAbruf numerischer Fakten in langen Kontexten an verschiedenen Dokumentpositionen (100 Elemente, 14 Transkripte).
AIMultiple
AI HallucinationWiderstandsfähigkeit gegen das Erfinden nicht erwähnter Kennzahlen in Dokumenten mit langem Kontext (204 Fallen, 14 Transkripte).
Öffentlich
Humanity's Last ExamArgumentation auf Expertenniveau ohne Hilfsmittel in über 100 akademischen Fächern (2,5k Fragen).
Öffentlich
SciCodeWissenschaftliches Programmieren auf Forschungsniveau in Physik, Mathematik, Biologie und Chemie (338 Teilprobleme)
Öffentlich
LegalBenchCrowdsourcing-basiertes juristisches Denken in 162 von Rechtspraktikern erstellten Aufgaben.
Öffentlich
FrontierMathUnveröffentlichte, von Experten verfasste mathematische Forschungsprobleme (Stufen 1–4).
Öffentlich
ARC-AGI-2Neuartige visuelle Denkaufgaben, die Generalisierung statt Auswendiglernen prüfen.
Öffentlich
Swe-BenchReale GitHub-Issues durchgängig gelöst (vollständiger Satz mit 2.294 Instanzen).
Öffentlich
LiveCodeBenchKontaminationsfreie, kontinuierlich aktualisierte Wettbewerbsprogrammieraufgaben.
AIMultiple
Agentic LLM BenchmarkAgentenbasiertes Programmieren bei 10 Softwareentwicklungsaufgaben über ein CLI-Tool (~3.500 Validierungsschritte).
Aktuelle Updates

Aktuelle Updates

Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.

Moonshot AI

Kimi K3

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Sol

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Terra

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Sol Pro

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

LLM Anwendungsfälle, Analysen & Benchmarks erkunden

Intelligenzdichte von 71 LLMs für intelligentere & dichtere Modelle

LLM
Benchmark
16. Aug

Wir haben 71 LLMs verfolgt, die zwischen Februar 2023 und Mai 2026 veröffentlicht wurden, und 10 öffentliche Benchmarks gesammelt, um die Intelligenzdichte zu messen. Wir haben den Fähigkeitswert durch die vom Modell verbrauchte Ressource geteilt (aktive Parameter, Trainingsrechenleistung und Inferenzpreis). Um die Intelligenzdichte zu berechnen, haben wir die folgenden Schritte ausgeführt: Siehe Methodik für den…

Mehr lesen
LLM
Einblick
14. Aug

50+ ChatGPT-Anwendungsfälle mit Beispielen aus der Praxis

ChatGPT erreichte Anfang 2026 rund 1 Milliarde wöchentlich aktive Nutzer, ungefähr 10 % der Weltbevölkerung.1 OpenAI übertraf im Jahr 2025 einen Jahresumsatz von $20 Milliarden, bestätigt von CFO Sarah Friar.2 Der Anthropic Economic Index unterscheidet zwei Nutzungsmodi: Augmentation, bei der ein Mensch mit KI interagiert, und Automatisierung, bei der KI Aufgaben selbstständig erledigt. Die Verbrauchernutzung teilt…

LLM
Benchmark
14. Aug

Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol

Wir haben 40+ LLMs im Finanzwesen anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark evaluiert, um herauszufinden, welche Modelle bei komplexen Finanzlogik-Aufgaben wie Bilanzanalyse, Prognosen und Kennzahlenberechnungen hervorragend sind. Wir haben LLMs auf 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Untergruppe zielt auf die anspruchsvollsten Finanzlogik-Aufgaben ab und bewertet komplexe, mehrstufige…

LLM
Benchmark
14. Aug

AIM Enterprise: Agentischer Enterprise-Benchmark

Unternehmen nutzen LLMs täglich für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Enterprise-Benchmark, bei dem wir 69 Unternehmensaufgaben aus verschiedenen Kategorien verwendet haben. Jedes Modell lieferte eine Datei pro Aufgabe. Die Punktzahlen sind relativ: Die Juroren stufen jede Antwort im Vergleich zu den anderen Antworten auf…

LLM
Einblick
13. Aug

LLM-Skalierungsgesetze: Analyse von KI-Forschern

LLM sagen auf der Grundlage von aus Textdaten gelernten Mustern das nächste Token voraus. Der Begriff LLM-Skalierungsgesetze bezieht sich auf empirische Regelmäßigkeiten, die Modellleistung mit der Menge an Rechenleistung, Trainingsdaten und Modellparametern verknüpfen, die während des Trainings verwendet werden. Um zu verstehen, wie diese Beziehungen das moderne Modelldesign in der Praxis beeinflussen, haben wir…

LLM
Einblick
13. Aug

LLM Observability-Tools: Weights & Biases, Langsmith

LLM-Anwendungen haben sich von Single-Turn-Chats zu mehrstufigen Agenten entwickelt, die Tools verwenden, Datenbanken abfragen und mit anderen Modellen koordinieren, wodurch ihr Verhalten schwieriger zu interpretieren ist. LLM-Observability bietet kontinuierliche Transparenz über diese komplexen Workflows und hilft Unternehmen, die Qualität zu überwachen, Fehler zu erkennen, Probleme zu beheben sowie Leistung und Kosten zu verwalten. W&B Weave…

LLM
Einblick
13. Aug

Große multimodale Modelle (LMMs) vs LLMs

Wir haben die Leistung großer multimodaler Modelle (LMMs) bei Aufgaben des finanziellen Denkens anhand eines sorgfältig ausgewählten Datensatzes bewertet. Durch die Analyse einer Teilmenge hochwertiger Finanzbeispiele bewerten wir die Fähigkeiten der Modelle bei der Verarbeitung von und dem Schlussfolgern mit multimodalen Daten im Finanzbereich. Der Abschnitt zur Methodik bietet detaillierte Einblicke in den verwendeten Datensatz…

LLM
Einblick
12. Aug

ChatGPT für Kundenservice: Top 10 Anwendungsfälle

ChatGPT hat sich im Kundenservice von einer Neuheit zu einer Infrastruktur entwickelt. Unternehmen nutzen es, um Antwortzeiten zu verkürzen, ein Volumen zu bewältigen, das ihre Teams nicht absorbieren können, und die Kosten für Routineinteraktionen zu senken. Doch die Ergebnisse variieren stark je nach Implementierung. OpenAI hat GPT-5.6 veröffentlicht, ein wesentlich leistungsfähigeres Modell, das besser darin…

LLM
Benchmark
12. Aug

LLM Latenz-Benchmark nach Anwendungsfällen

Wir haben 11 führende große Sprachmodelle mit insgesamt 1.320 Anfragen gebenchmarkt, dabei zwischen Reasoning- und Nicht-Reasoning-Modellen unterschieden und die First-Token-Latenz, die Per-Token-Latenz und die Gesamtantwortzeit gemessen. Details dazu, wie wir die Latenz gemessen haben, finden Sie hier. Wir berichten Reasoning- und Nicht-Reasoning-Modelle getrennt. Reasoning-Modelle verbringen mehrere Sekunden mit Nachdenken vor der ersten sichtbaren Antwort; daher…

LLM
Funktionsvergleich
12. Aug

Top LLMOps Tools & Vergleich mit MLOPs

LLMOps-Plattformen übernehmen den operativen Teil des Betriebs von Large Language Models: Bereitstellung, Überwachung, Evaluierung und Kostenmanagement. Wir haben führende LLMOps-Tools, deren Kernfunktionen, Preismodelle und ihre Unterschiede untersucht, um die beste Lösung für verschiedene Anwendungsfälle zu identifizieren. Eine Aufschlüsselung jeder Metrik finden Sie unten: LLMOps-Plattformen unterstützen den Lebenszyklus von LLMs durch die Ermöglichung von: LLMOps-Plattformen unterscheiden…

LLM11. Aug

LLM-Preise: Top 15+ Anbieter im Vergleich

LLM-Preise erstrecken sich über drei Größenordnungen: Die günstigsten Commodity-Modelle kosten unter $0,20 pro Million Token, während die Reasoning-Tier-Preise für Spitzenmodelle bei bis zu $262,50 lagen. Das folgende Diagramm zeigt die Entwicklung der Einführungspreise: Jedes Modell ist am Tag seiner Einführung mit dem damaligen Listenpreis pro Million Token positioniert, gemittelt bei einem Eingabe-zu-Ausgabe-Verhältnis von 3:1, in…