Das neueste Modell im AIMultiple Intelligenz-Index ist Claude Opus 5.5.
LLM Benchmarks
Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert. Wie der Index aufgebaut ist
Bestenliste
Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.
# | Modell | Index | AA-LCR | AIM-A-CODE-LLM Bench | AIM-Agentic-RAG | AIM-FinanceReasoning | AIM-HALC-Bench | AIM-RELC-Bench | AIM-Text-to-SQL | APEX-Agents-AA | ARC-AGI-1 | ARC-AGI-2 | ARC-AGI-3 | ArxivMath | AutomationBench-AA | BioMysteryBench | BrowseComp | Convex Coding Evals | CritPt | Crosby RedlineBench | DeepSWE 1.1 | EnterpriseOps-Gym-AA | Frontier-Bench | FrontierCode | FrontierMath | GDPval | GPQA Diamond | Harvey LAB-AA | HealthBench Professional | HieroglyphBench | Humanity's Last Exam | IFBench | ITBench-AA | LegalBench | LiveCodeBench | MMMU-Pro | ObviousBench | Opus Magnum Bench | ReactBench | RuneBench | SciCode | SimpleBench | Swe-Bench | Tau2-Bench Telecom | Tau3-Banking | Terminal-Bench 2.1 | Terminal-Bench 4.0 | Terminal-Bench Hard | Terminal-Bench-Science |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 100 | - | - | 90 | 92 | - | - | 88 | - | - | - | - | - | - | - | - | - | 32 | - | - | - | - | - | - | 1846 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 67 | - | - | - | - | - | - | - | - |
| 2 | GPT-6 Astra OpenAI | 92 | - | - | 84 | 87 | - | - | 66 | - | - | 95 | 63 | - | 41 | - | 92 | 85 | 32 | - | 74 | - | - | 53 | 98 | 1542 | 96 | - | 70 | - | - | - | - | - | - | - | - | - | - | 7 | 56 | - | - | - | - | 90 | 58 | - | - |
| 3 | Claude Fable 5.1 Anthropic | 91 | 80 | - | 84 | 90 | - | - | 67 | - | 98 | 90 | - | - | 31 | - | - | 81 | 31 | - | 67 | - | - | 51 | 88 | 1735 | 94 | - | 62 | - | 59 | - | - | 89 | - | - | - | - | - | 6 | 63 | - | - | - | 47 | 91 | 56 | - | - |
| 4 | Qwen3.8 Flash Alibaba Cloud | 87 | 77 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 1743 | 92 | - | - | - | 38 | 81 | - | - | - | - | - | - | - | - | 47 | - | - | - | 45 | 86 | - | - | - |
| 5 | Command A+ Cohere | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 30 | - | - | - | - | - | - | - | - | - | - | - | - | 74 | - | 61 | - | - | - | - | - | - | - | - | - | 81 | - | - | - | 25 | - |
| 6 | MiMo-V2.6-Pro Xiaomi | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 27 | - | - | - | - | - | - | 1673 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 61 | - | - | - | - | - | - | - | - |
| 7 | Muse Spark 1.1 Meta | 86 | 81 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 53 | - | - | - | - | 1381 | 90 | - | 59 | - | 46 | - | - | 85 | - | - | 99 | - | 23 | 6 | 58 | - | - | - | 32 | 78 | - | - | - |
| 8 | Claude Fable 5 Anthropic | 85 | 77 | 69 | 82 | 90 | - | - | 66 | 59 | 99 | 89 | - | 79 | 17 | - | 87 | 84 | 29 | - | 70 | - | 34 | 54 | 90 | 1741 | 93 | 14 | 63 | 23 | 56 | 64 | - | 89 | - | 81 | 99 | 22 | 47 | 6 | 61 | 82 | - | 99 | 38 | 85 | 42 | 63 | 21 |
| 9 | Claude Opus 5 Anthropic | 83 | 79 | - | 85 | 90 | - | - | 64 | - | 98 | 90 | 30 | 91 | 50 | 79 | 91 | 82 | 29 | - | 74 | - | 44 | 53 | 73 | 1708 | 94 | - | 60 | - | 55 | - | - | 87 | - | 85 | 100 | - | - | 6 | 56 | - | - | - | 45 | 89 | 52 | - | 30 |
| 10 | GPT-6 Sol OpenAI | 79 | - | - | 82 | - | - | - | 54 | - | - | - | - | - | - | - | - | - | 31 | - | - | - | - | - | - | 1487 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 58 | - | - | - | - | - | - | - | - |
Wie der Index aufgebaut ist
Jeder Benchmark wird als Platzierung gelesen, nicht als Rohwert. Innerhalb eines Benchmarks liegt das beste Ergebnis bei 100, das schlechteste bei 0, und jedes andere Modell fällt irgendwo dazwischen. Der Index ist der gewichtete Durchschnitt dieser Platzierungen über die Benchmarks, die ein Modell tatsächlich absolviert hat: ein Benchmark, den es nie absolviert hat, zählt nicht als Null, er fehlt einfach. Benchmarks zählen nicht gleich viel, und das Gewicht jedes einzelnen ist bei ihm angegeben. Ein Modell braucht Ergebnisse in mindestens zwei Index-Benchmarks, bevor es eingestuft wird; ein einzelnes Ergebnis setzt ein Modell auf die Linie eines Benchmarks, ohne ihm eine eigene Einstufung zu geben. Platzierungen werden statt roher Genauigkeit verwendet, weil sich Benchmarks in Schwierigkeit und Skala stark unterscheiden und Werte aus verschiedenen Benchmarks keinen gemeinsamen Durchschnitt bilden können. Gewichte: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).
Verwendete Benchmarks
Aktuelle Updates
Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.
Claude Opus 5.5
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-6 Sol
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-6 Luna
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
MiMo-V2.6-Pro
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
LLM Anwendungsfälle, Analysen & Benchmarks erkunden
Zielgruppensimulation: Können LLMs menschliches Verhalten vorhersagen?
Im Marketing ist die Bewertung, wie genau LLMs menschliches Verhalten vorhersagen, entscheidend für die Beurteilung ihrer Wirksamkeit bei der Antizipation von Zielgruppenbedürfnissen und der Erkennung der Risiken von Fehlausrichtung, ineffektiver Kommunikation oder unbeabsichtigter Beeinflussung. Die Zielgruppensimulation mit LLMs ermöglicht die Modellierung virtueller Zielgruppen und hilft Organisationen, Reaktionen auf Inhalte oder Produkte vorherzusehen, ohne auf teure…
HALC-Bench: LLM Halluzination im Long-Context Retrieval Benchmark
HALC-Bench (LLM Halluzination im Long-Context Retrieval Benchmark) misst die Widerstandsfähigkeit eines großen Sprachmodells gegenüber dem Erfinden von Beweisen für eine Kennzahl, die im Zieldokument nicht existiert, indem es 3 Heuhaufen verwendet, die am Anfang, in der Mitte und am Ende des Kontextfensters des Modells platziert sind, mit 204 Fragen. claude-fable-5 beantwortete alle 204 Fallen an…
KI-Gateways für OpenAI: Alternativen zu OpenRouter
Wir haben OpenRouter, SambaNova, TogetherAI, Groq und KI/ML API anhand von drei Indikatoren (First-Token-Latenz, Gesamtlatenz und Output-Token-Anzahl) verglichen, mit 300 Tests unter Verwendung kurzer Prompts (ca. 18 Tokens) und langer Prompts (ca. 203 Tokens) für die Gesamtlatenz. Wenn Sie planen, eines dieser KI-Gateways zu nutzen, können Sie: In diesem Benchmark haben wir OpenRouter, SambaNova, TogetherAI,…
LLM Observability-Tools: Weights & Biases, Langsmith
LLM-Anwendungen haben sich von Single-Turn-Chats zu mehrstufigen Agenten entwickelt, die Tools verwenden, Datenbanken abfragen und mit anderen Modellen koordinieren, wodurch ihr Verhalten schwieriger zu interpretieren ist. LLM-Observability bietet kontinuierliche Transparenz über diese komplexen Workflows und hilft Unternehmen, die Qualität zu überwachen, Fehler zu erkennen, Probleme zu beheben sowie Leistung und Kosten zu verwalten. W&B Weave…
Cloud LLM vs. lokale LLMs: Beispiele & Vorteile
Cloud-LLMs, die auf fortschrittlichen Modellen wie GPT-5.5 und Claude Opus 4.7 basieren, bieten Skalierbarkeit und Zugänglichkeit. Umgekehrt gewährleisten lokale LLMs, die auf Open-Source-Modellen wie Llama 4, DeepSeek V4 und Qwen3.6-Plus basieren, stärkeren Datenschutz und Anpassbarkeit. Erkunden Sie, was Cloud-LLMs sind, Stärken und Schwächen, die häufigsten Fallstudien mit Beispielen aus der Praxis und wie sie sich…
LLM-Feintuning-Leitfaden für Unternehmen
Folgen Sie den Links für die spezifischen Lösungen zu Ihren LLM-Ausgabeherausforderungen. Wenn Ihr LLM: Die weite Verbreitung von Large Language Models (LLMs) hat unsere Fähigkeit verbessert, menschliche Sprache zu verarbeiten. Ihr generisches Training führt jedoch oft zu suboptimaler Leistung bei spezifischen Aufgaben. Um diese Einschränkung zu überwinden, werden Feintuning-Methoden eingesetzt, um LLMs an die einzigartigen…
10+ Large Language Model Beispiele
Wir haben Open-Source-Benchmarks zusammengestellt, um führende proprietäre und Open-Source Large Language Models zu vergleichen. Wählen Sie Ihren Anwendungsfall, um das richtige Modell zu finden. Sie können Large Language Models bewerten, indem Sie ihre Benchmark-Leistung und die tatsächliche Latenz (verfügbar durch Klicken auf den Namen jedes Modells in der Tabelle) prüfen und ihre Preise überprüfen, um…
LLM-Preise: Top 15+ Anbieter im Vergleich
LLM-Preise erstrecken sich über vier Größenordnungen: Die günstigsten Modelle starteten bei unter $0,03 pro Million Tokens, während Frontier-Reasoning-Stufen bei bis zu $262,50 starteten. Das folgende Diagramm zeigt die Einführungspreise: Jeder Punkt ist der Durchschnittspreis der Modelle einer Größenklasse, die in einem Kalenderquartal eingeführt wurden, gemischt im Verhältnis 3 Teile Eingabe zu 1 Teil Ausgabe, über…
LLM-Automatisierung: Top 7 Tools & 8 Fallstudien
LLM-Automatisierung bezeichnet den Wandel hin zu intelligenten Automatisierungstools, die LLMs nutzen, einschließlich KI-Agenten, feinabgestimmte LLMs und RAG-Modelle, um Aufgaben zu automatisieren und zu koordinieren. Erfahren Sie, was LLM-Automatisierung ist, welche wichtigsten Anwendungen es in der Praxis gibt und welche Haupttools eingesetzt werden: LLM in der Automatisierung sind ein systematischer Ansatz, der Natural Language Processing (NLP)…
LLM Orchestrierung: 22 Frameworks und Gateways
Die Optimierung der LLM-Orchestrierung ist entscheidend, um die Leistung zu verbessern und gleichzeitig den Ressourcenverbrauch unter Kontrolle zu halten. Um zu bewerten, wie verschiedene Orchestrierungsansätze in der Praxis funktionieren, haben wir Folgendes einem Benchmark unterzogen: Entdecken Sie ausgewählte LLM-Orchestrierungstools, einschließlich Entwickler-Frameworks und Unternehmens-Gateways: LLM-Orchestrierung umfasst die Verwaltung und Integration mehrerer großer Sprachmodelle (LLMs), um komplexe…