Das neueste Modell im AIMultiple Intelligenz-Index ist Claude Opus 5.5.
LLM Benchmarks
Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert. Wie der Index aufgebaut ist
Bestenliste
Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.
# | Modell | Index | AA-LCR | AIM-A-CODE-LLM Bench | AIM-Agentic-RAG | AIM-FinanceReasoning | AIM-HALC-Bench | AIM-RELC-Bench | AIM-Text-to-SQL | APEX-Agents-AA | ARC-AGI-1 | ARC-AGI-2 | ARC-AGI-3 | ArxivMath | AutomationBench-AA | BioMysteryBench | BrowseComp | Convex Coding Evals | CritPt | Crosby RedlineBench | DeepSWE 1.1 | EnterpriseOps-Gym-AA | Frontier-Bench | FrontierCode | FrontierMath | GDPval | GPQA Diamond | Harvey LAB-AA | HealthBench Professional | HieroglyphBench | Humanity's Last Exam | IFBench | ITBench-AA | LegalBench | LiveCodeBench | MMMU-Pro | ObviousBench | Opus Magnum Bench | ReactBench | RuneBench | SciCode | SimpleBench | Swe-Bench | Tau2-Bench Telecom | Tau3-Banking | Terminal-Bench 2.1 | Terminal-Bench 4.0 | Terminal-Bench Hard | Terminal-Bench-Science |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 100 | - | - | 90 | 92 | - | - | 88 | - | - | - | - | - | - | - | - | - | 32 | - | - | - | - | - | - | 1846 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 67 | - | - | - | - | - | - | - | - |
| 2 | GPT-6 Astra OpenAI | 92 | - | - | 84 | 87 | - | - | 66 | - | - | 95 | 63 | - | 41 | - | 92 | 85 | 32 | - | 74 | - | - | 53 | 98 | 1542 | 96 | - | 70 | - | - | - | - | - | - | - | - | - | - | 7 | 56 | - | - | - | - | 90 | 58 | - | - |
| 3 | Claude Fable 5.1 Anthropic | 91 | 80 | - | 84 | 90 | - | - | 67 | - | 98 | 90 | - | - | 31 | - | - | 81 | 31 | - | 67 | - | - | 51 | 88 | 1735 | 94 | - | 62 | - | 59 | - | - | 89 | - | - | - | - | - | 6 | 63 | - | - | - | 47 | 91 | 56 | - | - |
| 4 | Qwen3.8 Flash Alibaba Cloud | 87 | 77 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 1743 | 92 | - | - | - | 38 | 81 | - | - | - | - | - | - | - | - | 47 | - | - | - | 45 | 86 | - | - | - |
| 5 | Command A+ Cohere | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 30 | - | - | - | - | - | - | - | - | - | - | - | - | 74 | - | 61 | - | - | - | - | - | - | - | - | - | 81 | - | - | - | 25 | - |
| 6 | MiMo-V2.6-Pro Xiaomi | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 27 | - | - | - | - | - | - | 1673 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 61 | - | - | - | - | - | - | - | - |
| 7 | Muse Spark 1.1 Meta | 86 | 81 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 53 | - | - | - | - | 1381 | 90 | - | 59 | - | 46 | - | - | 85 | - | - | 99 | - | 23 | 6 | 58 | - | - | - | 32 | 78 | - | - | - |
| 8 | Claude Fable 5 Anthropic | 85 | 77 | 69 | 82 | 90 | - | - | 66 | 59 | 99 | 89 | - | 79 | 17 | - | 87 | 84 | 29 | - | 70 | - | 34 | 54 | 90 | 1741 | 93 | 14 | 63 | 23 | 56 | 64 | - | 89 | - | 81 | 99 | 22 | 47 | 6 | 61 | 82 | - | 99 | 38 | 85 | 42 | 63 | 21 |
| 9 | Claude Opus 5 Anthropic | 83 | 79 | - | 85 | 90 | - | - | 64 | - | 98 | 90 | 30 | 91 | 50 | 79 | 91 | 82 | 29 | - | 74 | - | 44 | 53 | 73 | 1708 | 94 | - | 60 | - | 55 | - | - | 87 | - | 85 | 100 | - | - | 6 | 56 | - | - | - | 45 | 89 | 52 | - | 30 |
| 10 | GPT-6 Sol OpenAI | 79 | - | - | 82 | - | - | - | 54 | - | - | - | - | - | - | - | - | - | 31 | - | - | - | - | - | - | 1487 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 58 | - | - | - | - | - | - | - | - |
Wie der Index aufgebaut ist
Jeder Benchmark wird als Platzierung gelesen, nicht als Rohwert. Innerhalb eines Benchmarks liegt das beste Ergebnis bei 100, das schlechteste bei 0, und jedes andere Modell fällt irgendwo dazwischen. Der Index ist der gewichtete Durchschnitt dieser Platzierungen über die Benchmarks, die ein Modell tatsächlich absolviert hat: ein Benchmark, den es nie absolviert hat, zählt nicht als Null, er fehlt einfach. Benchmarks zählen nicht gleich viel, und das Gewicht jedes einzelnen ist bei ihm angegeben. Ein Modell braucht Ergebnisse in mindestens zwei Index-Benchmarks, bevor es eingestuft wird; ein einzelnes Ergebnis setzt ein Modell auf die Linie eines Benchmarks, ohne ihm eine eigene Einstufung zu geben. Platzierungen werden statt roher Genauigkeit verwendet, weil sich Benchmarks in Schwierigkeit und Skala stark unterscheiden und Werte aus verschiedenen Benchmarks keinen gemeinsamen Durchschnitt bilden können. Gewichte: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).
Verwendete Benchmarks
Aktuelle Updates
Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.
Claude Opus 5.5
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-6 Sol
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-6 Luna
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
MiMo-V2.6-Pro
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
LLM Anwendungsfälle, Analysen & Benchmarks erkunden
LLM-Marktanteil: Nutzung und Akzeptanz im Vergleich
Wir haben den LLM-Marktanteil analysiert, indem wir nutzungsbasierte Daten und Schätzungen zu Web-Besuchen kombiniert haben, um zu zeigen, wie sich die Nachfrage nach großen Sprachmodellen auf KI-Labore und KI-Anwendungen verteilt. Lesen Sie die Methodik, um zu erfahren, wie wir diese Ergebnisse gemessen und berechnet haben. Die Vereinigten Staaten dominierten die Web-Besuche in allen vier Monaten…
Benchmark von 40+ LLMs im Finanzwesen: Claude Fable 5 & GPT-5.6 Sol
Wir haben LLMs anhand von 238 schwierigen Fragen aus dem FinanceReasoning-Benchmark (Tang et al.) evaluiert.1 Diese Teilmenge zielt auf die anspruchsvollsten Aufgaben zum finanziellen Denken ab und bewertet komplexe, mehrstufige quantitative Schlussfolgerungen mit Finanzkonzepten und -formeln. Unsere Evaluierung verwendete ein eigenes Prompt-Design und Bewertungskriterien für Genauigkeit und Token-Verbrauch. Eine detaillierte Erklärung, wie diese Metriken berechnet…
Vergleichen Sie multimodale KI-Modelle im visuellen Schlussfolgern
Wir haben 15 führende multimodale KI-Modelle im visuellen Schlussfolgern mit 200 visuellen Fragen getestet. Die Evaluierung bestand aus zwei Bereichen: 100 Fragen zum Diagrammverständnis, die Interpretation von Datenvisualisierungen testen, und 100 Fragen zur visuellen Logik, die Mustererkennung und räumliches Denken bewerten. Jede Frage wurde 5‑mal ausgeführt, um konsistente und zuverlässige Ergebnisse zu gewährleisten. Sehen…
Große multimodale Modelle (LMMs) vs LLMs
Wir haben die Leistung großer multimodaler Modelle (LMMs) bei Aufgaben des finanziellen Denkens anhand eines sorgfältig ausgewählten Datensatzes bewertet. Durch die Analyse einer Teilmenge hochwertiger Finanzbeispiele bewerten wir die Fähigkeiten der Modelle, multimodale Daten im Finanzbereich zu verarbeiten und mit ihnen zu denken. Der Abschnitt zur Methodik bietet detaillierte Einblicke in den verwendeten Datensatz und…
LLM VRAM-Rechner für Self-Hosting
Self-Hosting eines LLMs bedeutet, Inferenz auf Hardware auszuführen, die der Betreiber kontrolliert, statt über eine API eines Drittanbieters, was Kosten, Datenkontrolle und Datenschutzprofil verändert. Ob ein Modell überhaupt läuft, hängt vom Speicher ab. Der Rechner schätzt den VRAM oder Unified Memory, den ein Modell lokal benötigt, basierend auf dem Modell, seiner Präzision, der Kontextlänge und…
Agentic IT: Können KI-Agenten einen Benchmark entwerfen
Wir haben 16 Models anhand eines Benchmark-Entwurfs in Text-zu-SQL und Tool-Calling getestet. Jedes Model erstellte einen Benchmark pro Thema, insgesamt 32 Einreichungen. Keine Einreichung erfüllte jedes Rubrik-Kriterium. Die Agenten konnten Tests erstellen und ausführen, aber keiner führte sowohl einen Leerantwort-Test als auch einen Richtigantwort-Test des eigenen Scorers vor. Text-zu-SQL wandelt eine Frage in natürlicher Sprache…
AIM Enterprise: Agentischer Unternehmens-Benchmark
Unternehmen nutzen LLMs jeden Tag für ihre regulären Aufgaben. Um die kosteneffizientesten LLMs zu finden, haben wir AIM Enterprise entwickelt, einen agentischen Unternehmens-Benchmark, bei dem wir 69 reale Unternehmensaufgaben aus Strategie, Marketing, HR, Vertrieb und Betrieb verwendet haben. Zwei Bewerter-Models bewerteten jede Datei, die Prüfungen bestand. Bei 32,7 % der Einzelbewertungen wichen die beiden um…
Die Zukunft großer Sprachmodelle
Sehen Sie die Zukunft großer Sprachmodelle, indem Sie vielversprechende Ansätze wie Selbsttraining, Faktenprüfung und spärliche Expertise untersuchen, die Einschränkungen von LLM begegnen könnten. Erfolgsratenvergleich von LLMs Claude Sonnet 4.6 führte den Benchmark mit einer Gesamtpunktzahl von 0.748 an, wobei Basis- und Denkvarianten bis auf drei Dezimalstellen gleichauf lagen. Claude Opus 4.8 (0.702), Opus 4.6 Basis…
Large Language Models in der Cybersicherheit
Wir haben 7 Large Language Models über 9 Cybersicherheitsdomänen mit SecBench bewertet, einem groß angelegten und formatübergreifenden Benchmark für Sicherheitsaufgaben. Wir haben jedes Modell mit 44.823 Multiple-Choice-Fragen (MCQs) und 3.087 Kurzantwortfragen (SAQs) getestet, die Datensicherheit, Identitäts- und Zugriffsverwaltung, Netzwerksicherheit, Schwachstellenmanagement und Cloud-Sicherheit abdecken. MCQs (Multiple-Choice-Fragen) Benchmarking: SAQs (Kurzantwortfragen): Dieser Benchmark bewertet 7 allgemeine LLMs, einschließlich…
LLM-Skalierungsgesetze: Analyse von KI-Forschern
LLM sagen auf der Grundlage von aus Textdaten gelernten Mustern das nächste Token voraus. Der Begriff LLM-Skalierungsgesetze bezieht sich auf empirische Regelmäßigkeiten, die Modellleistung mit der Menge an Rechenleistung, Trainingsdaten und Modellparametern verknüpfen, die während des Trainings verwendet werden. Um zu verstehen, wie diese Beziehungen das moderne Modelldesign in der Praxis beeinflussen, haben wir…