Dienstleistungen
Kontaktieren

LLM Benchmarks

Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert. Zur Methodik.

TOP-MODELL
Claude Fable 5
Index 92
Bestes Preis-Leistungs-Verhältnis
MiniMax M3
$0.42 / 1M
Am schnellsten
GPT OSS 120B
0.23s TTFT
Abdeckung
64 Modelle
8 Benchmarks · 336 Bewertungsläufe
AIMultiple Intelligenz-Index

Bestenliste

Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.

Filter & Sort
#
Modell
Index
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Seite 1 von 7

Kosten$20.00
Latenz4.02s
Kontext1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Kosten$6.00
Latenz2.93s
Kontext1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Kosten$11.25
Latenz4.31s
Kontext1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Kosten$3.00
Latenz7.25s
Kontext500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Kosten$11.25
Latenz0.70s
Kontext272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Kosten$4.50
Latenz1.62s
Kontext1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Kosten$11.25
Latenz11.11s
Kontext1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Kosten$10.00
Latenz1.71s
Kontext1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Kosten$4.50
Latenz-
Kontext1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Kosten$4.50
Latenz22.02s
Kontext1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Seite 1 von 7
Entwicklung im Zeitverlauf
Intelligenz-Index nach Modell-Veröffentlichungsdatum
Kosten vs. Leistung
Gemischte Kosten im Verhältnis zum Intelligenz-Index
Modell × Benchmark
Top-Modelle bei ausgewählten Benchmarks
Methodik

Wie der Index aufgebaut ist

Der Intelligenz-Index normalisiert jeden Benchmark auf eine Skala von 0-100 und mittelt die relative Position eines Modells über die Benchmarks, für die es bewertet wurde. Jeder unten aufgeführte Benchmark fließt in diese Punktzahl ein.

AIMultiple
FinanceReasoningKomplexes mehrstufiges Finanzdenken anhand von 238 schwierigen FinanceReasoning-Fragen.
AIMultiple
Text-to-SQLGenauigkeit der SQL-Abfragegenerierung aus natürlicher Sprache über mehr als 35 LLMs hinweg.
AIMultiple
Agentic RAGMulti-Datenbank-Routing und SQL-Abfragegenerierung über 5 Datenbanken hinweg (BIRD-SQL, 500 Fragen).
AIMultiple
AI MemoryAbruf numerischer Fakten in langen Kontexten an verschiedenen Dokumentpositionen (100 Elemente, 14 Transkripte).
AIMultiple
AI HallucinationWiderstandsfähigkeit gegen das Erfinden nicht erwähnter Kennzahlen in Dokumenten mit langem Kontext (204 Fallen, 14 Transkripte).
Öffentlich
Humanity's Last ExamArgumentation auf Expertenniveau ohne Hilfsmittel in über 100 akademischen Fächern (2,5k Fragen).
Öffentlich
SciCodeWissenschaftliches Programmieren auf Forschungsniveau in Physik, Mathematik, Biologie und Chemie (338 Teilprobleme)
Öffentlich
LegalBenchCrowdsourcing-basiertes juristisches Denken in 162 von Rechtspraktikern erstellten Aufgaben.
Öffentlich
FrontierMathUnveröffentlichte, von Experten verfasste mathematische Forschungsprobleme (Stufen 1–4).
Öffentlich
ARC-AGI-2Neuartige visuelle Denkaufgaben, die Generalisierung statt Auswendiglernen prüfen.
Öffentlich
Swe-BenchReale GitHub-Issues durchgängig gelöst (vollständiger Satz mit 2.294 Instanzen).
Öffentlich
LiveCodeBenchKontaminationsfreie, kontinuierlich aktualisierte Wettbewerbsprogrammieraufgaben.
AIMultiple
Agentic LLM BenchmarkAgentenbasiertes Programmieren bei 10 Softwareentwicklungsaufgaben über ein CLI-Tool (~3.500 Validierungsschritte).
Aktuelle Updates

Aktuelle Updates

Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.

Moonshot AI

Kimi K3

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Sol

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Terra

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

OpenAI

GPT-5.6 Sol Pro

Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.

LLM Anwendungsfälle, Analysen & Benchmarks erkunden

LLM Marktanteil: Vergleich von Nutzung & Akzeptanz

LLM
Einblick
2. Jul

Wir analysierten den LLM-Marktanteil, indem wir nutzungsbasierte Daten und Schätzungen zu Web-Besuchen kombinierten, um zu zeigen, wie die Nachfrage nach large language models über KI-Labore und KI-Anwendungen verteilt ist: Lesen Sie die Methodik, um zu erfahren, wie wir diese Ergebnisse gemessen und berechnet haben. Die Vereinigten Staaten dominierten die Web-Besuche über alle vier Monate hinweg…

Mehr lesen
LLM
Einblick
26. Jun

LLM Parameter: GPT-5 High, Mittel, Niedrig und Minimal

Einige LLMs, wie die GPT-5-Familie von OpenAI, sind in verschiedenen Versionen verfügbar (z. B. GPT-5, GPT-5-mini und GPT-5-nano) und mit verschiedenen Parametereinstellungen, einschließlich hoch, mittel, niedrig und minimal. Im Folgenden untersuchen wir die Unterschiede zwischen diesen Modellversionen, indem wir ihre Benchmark-Leistung und die Kosten für die Durchführung der Benchmarks erfassen. Wir haben die GPT-5-Familie in…

LLM
Einblick
25. Jun

Die Zukunft großer Sprachmodelle

Entdecken Sie die Zukunft großer Sprachmodelle, indem Sie vielversprechende Ansätze wie Selbsttraining, Faktenprüfung und spärliche Expertise untersuchen, die Einschränkungen von LLM beheben könnten. Vergleich der Erfolgsquoten von LLM’s Claude Sonnet 4.6 führte den Benchmark mit einer Gesamtpunktzahl von 0.748 an, wobei die Basis- und Denkvarianten bis auf drei Dezimalstellen gleichauf lagen. Claude Opus 4.8…

LLM
Einblick
22. Jun

10+ Large Language Model Beispiele

Wir haben Open-Source-Benchmarks zusammengestellt, um führende proprietäre und Open-Source Large Language Models zu vergleichen. Wählen Sie Ihren Anwendungsfall, um das richtige Modell zu finden. Sie können Large Language Models bewerten, indem Sie ihre Benchmark-Leistung und die tatsächliche Latenz (verfügbar durch Klicken auf den Namen jedes Modells in der Tabelle) prüfen und ihre Preise überprüfen, um…

LLM
Funktionsvergleich
22. Jun

Cloud LLM vs. lokale LLMs: Beispiele & Vorteile

Cloud-LLMs, die auf fortschrittlichen Modellen wie GPT-5.5 und Claude Opus 4.7 basieren, bieten Skalierbarkeit und Zugänglichkeit. Umgekehrt gewährleisten lokale LLMs, die auf Open-Source-Modellen wie Llama 4, DeepSeek V4 und Qwen3.6-Plus basieren, stärkeren Datenschutz und Anpassbarkeit. Erkunden Sie, was Cloud-LLMs sind, Stärken und Schwächen, die häufigsten Fallstudien mit Beispielen aus der Praxis und wie sie sich…

LLM
Benchmark
5. Jun

LLM in der Cybersicherheit

Wir haben 7 große Sprachmodelle in 9 Cyberbereichen mit SecBench evaluiert, einem groß angelegten und mehrformatigen Benchmark für Sicherheitstasks. Wir haben jedes Modell an 44.823 Multiple-Choice-Fragen (MCQs) und 3.087 Kurzantwort-Fragen (SAQs) getestet, die Bereiche wie Datensicherheit, Identitäts- und Zugriffsverwaltung, Netzwerksicherheit, Schwachstellenmanagement und Cloud-Sicherheit abdecken. Diese großen Sprachmodelle wurden nicht ausschließlich auf Cybersicherheitsdaten trainiert, können aber…

LLM
Benchmark
15. Apr

LLM Quantisierung: BF16 vs FP8 vs INT4

Wir haben Qwen3-32B auf 4 Genauigkeitsstufen (BF16, FP8, GPTQ-Int8, GPTQ-Int4) auf einer einzelnen NVIDIA H100 80GB GPU getestet. Jede Konfiguration wurde auf 2 Benchmarks (~12,2K Fragen) bewertet, die Wissen und Code-Generierung abdecken, sowie auf 2.000+ Inferenzläufen zur Messung des Durchsatzes. Int4 ist 2,7-mal schneller als BF16, verliert jedoch weniger als 2 Punkte auf MMLU-Pro, während…