Das neueste Modell im AIMultiple Intelligenz-Index ist Gemini 3.8 Flash.
LLM Benchmarks
Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert. Zur Methodik.
Bestenliste
Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.
# | Modell | Index | Agentic RAG | ARC-AGI-1 | ARC-AGI-2 | ArxivMath | CritPt | FinanceReasoning | FrontierMath | LegalBench | MMMU-Pro | Terminal-Bench 2.1 | Terminal-Bench Hard | Text-to-SQL |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 Anthropic | 86 | - | 98 | 90 | 91 | 29 | 90 | 73 | 87 | 85 | 89 | - | - |
| 2 | GPT-5.6 Sol OpenAI | 81 | 87 | 98 | 93 | - | 32 | 90 | 83 | 87 | 83 | 89 | - | 74 |
| 3 | Claude Fable 5 Anthropic | 79 | 98 | 99 | 89 | 79 | 29 | 90 | 88 | 89 | 81 | 85 | 63 | 90 |
| 4 | GPT-5.6 Terra OpenAI | 67 | 91 | 97 | 84 | - | 30 | 87 | 71 | 85 | 81 | 87 | - | 71 |
| 5 | Claude Opus 4.8 Anthropic | 66 | 100 | 93 | 72 | 71 | - | 89 | 56 | 84 | 79 | 85 | 58 | 77 |
| 6 | Claude Fable 5.1 Anthropic | 66 | - | 98 | 90 | - | 31 | - | 88 | 89 | - | 91 | - | - |
| 7 | Gemini 3.7 Flash Google | 62 | - | 96 | 85 | - | 14 | - | 37 | 87 | 86 | 86 | - | - |
| 8 | GPT-5.5 Pro OpenAI | 62 | - | 97 | 85 | - | 31 | - | 78 | - | - | - | - | - |
| 9 | Kimi K3 Moonshot AI | 61 | 93 | 95 | 60 | - | 23 | 88 | 39 | 86 | 82 | 85 | - | 77 |
| 10 | GPT-5.6 Sol Pro OpenAI | 60 | 96 | - | - | - | - | 91 | 81 | - | - | - | - | 79 |
Wie der Index aufgebaut ist
Jeder Benchmark wird zu einer Position auf einer Skala von 0-100, und der Index ist der gewichtete Durchschnitt dieser Positionen. Ein Benchmark, für den ein Modell nicht getestet wurde, zählt als Feldmittelwert, damit die Punktzahlen vergleichbar bleiben. Index = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).
Aktuelle Updates
Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.
Gemini 3.8 Flash
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
Claude Fable 5.1
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
Hy4 preview
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GLM 5.3 Flash
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
Wichtige KI-Modellveröffentlichungen führender Anbieter der letzten 20 Tage.
LLM Anwendungsfälle, Analysen & Benchmarks erkunden
LLM Latenz-Benchmark nach Anwendungsfällen
Wir haben 11 führende große Sprachmodelle mit insgesamt 1.320 Anfragen gebenchmarkt, dabei zwischen Reasoning- und Nicht-Reasoning-Modellen unterschieden und die First-Token-Latenz, die Per-Token-Latenz und die Gesamtantwortzeit gemessen. Details dazu, wie wir die Latenz gemessen haben, finden Sie hier. Wir berichten Reasoning- und Nicht-Reasoning-Modelle getrennt. Reasoning-Modelle verbringen mehrere Sekunden mit Nachdenken vor der ersten sichtbaren Antwort; daher…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
Vergleichen Sie multimodale KI-Modelle im visuellen Schlussfolgern
Wir haben 15 führende multimodale KI-Modelle im visuellen Schlussfolgern mit 200 visuellen Fragen getestet. Die Evaluierung bestand aus zwei Bereichen: 100 Fragen zum Diagrammverständnis, die Interpretation von Datenvisualisierungen testen, und 100 Fragen zur visuellen Logik, die Mustererkennung und räumliches Denken bewerten. Jede Frage wurde 5‑mal ausgeführt, um konsistente und zuverlässige Ergebnisse zu gewährleisten. Sehen…
KI-Gateways für OpenAI: OpenRouter Alternativen
Wir haben OpenRouter, SambaNova, TogetherAI, Groq und KI/ML API anhand von drei Indikatoren (First-Token-Latenz, Gesamtlatenz und Anzahl der Ausgabe-Tokens) mit 300 Tests verglichen, wobei kurze Prompts (ca. 18 Tokens) und lange Prompts (ca. 203 Tokens) für die Gesamtlatenz verwendet wurden. Wenn Sie planen, eines dieser KI-Gateways zu verwenden, können Sie: In diesem Benchmark haben wir…
LLM in der Cybersicherheit
Wir haben 7 große Sprachmodelle in 9 Cyberbereichen mit SecBench evaluiert, einem groß angelegten und mehrformatigen Benchmark für Sicherheitstasks. Wir haben jedes Modell an 44.823 Multiple-Choice-Fragen (MCQs) und 3.087 Kurzantwort-Fragen (SAQs) getestet, die Bereiche wie Datensicherheit, Identitäts- und Zugriffsverwaltung, Netzwerksicherheit, Schwachstellenmanagement und Cloud-Sicherheit abdecken. Diese großen Sprachmodelle wurden nicht ausschließlich auf Cybersicherheitsdaten trainiert, können aber…
LLM Quantisierung: BF16 vs FP8 vs INT4
Wir haben Qwen3-32B auf 4 Genauigkeitsstufen (BF16, FP8, GPTQ-Int8, GPTQ-Int4) auf einer einzelnen NVIDIA H100 80GB GPU getestet. Jede Konfiguration wurde auf 2 Benchmarks (~12,2K Fragen) bewertet, die Wissen und Code-Generierung abdecken, sowie auf 2.000+ Inferenzläufen zur Messung des Durchsatzes. Int4 ist 2,7-mal schneller als BF16, verliert jedoch weniger als 2 Punkte auf MMLU-Pro, während…