Das neueste Modell im AIMultiple Intelligenz-Index ist Claude Opus 5.5.
LLM Benchmarks
Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert. Wie der Index aufgebaut ist
Bestenliste
Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.
# | Modell | Index | AA-LCR | AIM-A-CODE-LLM Bench | AIM-Agentic-RAG | AIM-FinanceReasoning | AIM-HALC-Bench | AIM-RELC-Bench | AIM-Text-to-SQL | APEX-Agents-AA | ARC-AGI-1 | ARC-AGI-2 | ARC-AGI-3 | ArxivMath | AutomationBench-AA | BioMysteryBench | BrowseComp | Convex Coding Evals | CritPt | Crosby RedlineBench | DeepSWE 1.1 | EnterpriseOps-Gym-AA | Frontier-Bench | FrontierCode | FrontierMath | GDPval | GPQA Diamond | Harvey LAB-AA | HealthBench Professional | HieroglyphBench | Humanity's Last Exam | IFBench | ITBench-AA | LegalBench | LiveCodeBench | MMMU-Pro | ObviousBench | Opus Magnum Bench | ReactBench | RuneBench | SciCode | SimpleBench | Swe-Bench | Tau2-Bench Telecom | Tau3-Banking | Terminal-Bench 2.1 | Terminal-Bench 4.0 | Terminal-Bench Hard | Terminal-Bench-Science |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 100 | - | - | 90 | 92 | - | - | 88 | - | - | - | - | - | - | - | - | - | 32 | - | - | - | - | - | - | 1846 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 67 | - | - | - | - | - | - | - | - |
| 2 | GPT-6 Astra OpenAI | 92 | - | - | 84 | 87 | - | - | 66 | - | - | 95 | 63 | - | 41 | - | 92 | 85 | 32 | - | 74 | - | - | 53 | 98 | 1542 | 96 | - | 70 | - | - | - | - | - | - | - | - | - | - | 7 | 56 | - | - | - | - | 90 | 58 | - | - |
| 3 | Claude Fable 5.1 Anthropic | 91 | 80 | - | 84 | 90 | - | - | 67 | - | 98 | 90 | - | - | 31 | - | - | 81 | 31 | - | 67 | - | - | 51 | 88 | 1735 | 94 | - | 62 | - | 59 | - | - | 89 | - | - | - | - | - | 6 | 63 | - | - | - | 47 | 91 | 56 | - | - |
| 4 | Qwen3.8 Flash Alibaba Cloud | 87 | 77 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 1743 | 92 | - | - | - | 38 | 81 | - | - | - | - | - | - | - | - | 47 | - | - | - | 45 | 86 | - | - | - |
| 5 | Command A+ Cohere | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 30 | - | - | - | - | - | - | - | - | - | - | - | - | 74 | - | 61 | - | - | - | - | - | - | - | - | - | 81 | - | - | - | 25 | - |
| 6 | MiMo-V2.6-Pro Xiaomi | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 27 | - | - | - | - | - | - | 1673 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 61 | - | - | - | - | - | - | - | - |
| 7 | Muse Spark 1.1 Meta | 86 | 81 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 53 | - | - | - | - | 1381 | 90 | - | 59 | - | 46 | - | - | 85 | - | - | 99 | - | 23 | 6 | 58 | - | - | - | 32 | 78 | - | - | - |
| 8 | Claude Fable 5 Anthropic | 85 | 77 | 69 | 82 | 90 | - | - | 66 | 59 | 99 | 89 | - | 79 | 17 | - | 87 | 84 | 29 | - | 70 | - | 34 | 54 | 90 | 1741 | 93 | 14 | 63 | 23 | 56 | 64 | - | 89 | - | 81 | 99 | 22 | 47 | 6 | 61 | 82 | - | 99 | 38 | 85 | 42 | 63 | 21 |
| 9 | Claude Opus 5 Anthropic | 83 | 79 | - | 85 | 90 | - | - | 64 | - | 98 | 90 | 30 | 91 | 50 | 79 | 91 | 82 | 29 | - | 74 | - | 44 | 53 | 73 | 1708 | 94 | - | 60 | - | 55 | - | - | 87 | - | 85 | 100 | - | - | 6 | 56 | - | - | - | 45 | 89 | 52 | - | 30 |
| 10 | GPT-6 Sol OpenAI | 79 | - | - | 82 | - | - | - | 54 | - | - | - | - | - | - | - | - | - | 31 | - | - | - | - | - | - | 1487 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 58 | - | - | - | - | - | - | - | - |
Wie der Index aufgebaut ist
Jeder Benchmark wird als Platzierung gelesen, nicht als Rohwert. Innerhalb eines Benchmarks liegt das beste Ergebnis bei 100, das schlechteste bei 0, und jedes andere Modell fällt irgendwo dazwischen. Der Index ist der gewichtete Durchschnitt dieser Platzierungen über die Benchmarks, die ein Modell tatsächlich absolviert hat: ein Benchmark, den es nie absolviert hat, zählt nicht als Null, er fehlt einfach. Benchmarks zählen nicht gleich viel, und das Gewicht jedes einzelnen ist bei ihm angegeben. Ein Modell braucht Ergebnisse in mindestens zwei Index-Benchmarks, bevor es eingestuft wird; ein einzelnes Ergebnis setzt ein Modell auf die Linie eines Benchmarks, ohne ihm eine eigene Einstufung zu geben. Platzierungen werden statt roher Genauigkeit verwendet, weil sich Benchmarks in Schwierigkeit und Skala stark unterscheiden und Werte aus verschiedenen Benchmarks keinen gemeinsamen Durchschnitt bilden können. Gewichte: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).
Verwendete Benchmarks
Aktuelle Updates
Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.
Claude Opus 5.5
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-6 Sol
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-6 Luna
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
MiMo-V2.6-Pro
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
LLM Anwendungsfälle, Analysen & Benchmarks erkunden
Top LLMOps-Tools & Vergleich mit MLOps
LLMOps-Plattformen übernehmen die operative Seite des Betriebs großer Sprachmodelle: Bereitstellung, Überwachung, Evaluierung und Kostenmanagement. Wir haben führende LLMOps-Tools, ihre Kernfunktionen, Preismodelle und ihre Unterschiede untersucht, um die beste Lösung für verschiedene Anwendungsfälle zu identifizieren. Eine Aufschlüsselung der einzelnen Metriken finden Sie unten: LLMOps-Plattformen unterstützen den Lebenszyklus von LLMs durch: LLMOps-Plattformen unterscheiden sich in ihrem Ansatz:…
50+ ChatGPT-Anwendungsfälle mit Beispielen aus der Praxis
ChatGPT erreichte Anfang 2026 rund 1 Milliarde wöchentlich aktive Nutzer, ungefähr 10 % der Weltbevölkerung.1 OpenAI übertraf im Jahr 2025 einen Jahresumsatz von $20 Milliarden, bestätigt von CFO Sarah Friar.2 Der Anthropic Economic Index unterscheidet zwei Nutzungsmodi: Augmentation, bei der ein Mensch mit KI interagiert, und Automatisierung, bei der KI Aufgaben selbstständig erledigt. Die Verbrauchernutzung teilt…
ChatGPT für Kundenservice: Top 10 Anwendungsfälle
ChatGPT hat sich im Kundenservice von einer Neuheit zu einer Infrastruktur entwickelt. Unternehmen nutzen ihn, um Antwortzeiten zu verkürzen, ein Volumen zu bewältigen, das ihre Teams nicht auffangen können, und die Kosten für Routineinteraktionen zu senken. Aber die Ergebnisse variieren stark, je nachdem, wie er implementiert ist. OpenAI hat GPT-5.6 auf den Markt gebracht, ein…
Intelligenzdichte von 71 LLMs für intelligentere & dichtere Modelle
Wir haben 71 LLMs verfolgt, die zwischen Februar 2023 und Mai 2026 veröffentlicht wurden, und 10 öffentliche Benchmarks gesammelt, um die Intelligenzdichte zu messen. Wir haben den Fähigkeitswert durch die vom Modell verbrauchte Ressource geteilt (aktive Parameter, Trainingsrechenleistung und Inferenzpreis). Um die Intelligenzdichte zu berechnen, haben wir die folgenden Schritte ausgeführt: Siehe Methodik für den…
LLM Latenz-Benchmark nach Anwendungsfällen
Wir haben 11 führende große Sprachmodelle mit insgesamt 1.320 Anfragen gebenchmarkt, dabei zwischen Reasoning- und Nicht-Reasoning-Modellen unterschieden und die First-Token-Latenz, die Per-Token-Latenz und die Gesamtantwortzeit gemessen. Details dazu, wie wir die Latenz gemessen haben, finden Sie hier. Wir berichten Reasoning- und Nicht-Reasoning-Modelle getrennt. Reasoning-Modelle verbringen mehrere Sekunden mit Nachdenken vor der ersten sichtbaren Antwort; daher…
LLM Quantisierung: BF16 vs FP8 vs INT4
Wir haben Qwen3-32B auf 4 Genauigkeitsstufen (BF16, FP8, GPTQ-Int8, GPTQ-Int4) auf einer einzelnen NVIDIA H100 80GB GPU getestet. Jede Konfiguration wurde auf 2 Benchmarks (~12,2K Fragen) bewertet, die Wissen und Code-Generierung abdecken, sowie auf 2.000+ Inferenzläufen zur Messung des Durchsatzes. Int4 ist 2,7-mal schneller als BF16, verliert jedoch weniger als 2 Punkte auf MMLU-Pro, während…