LLM Benchmarks
Ein transparenter Intelligenz-Index, der öffentliche Benchmarks mit AIMultiples eigenen agentischen, RAG- und Enterprise-Reasoning-Bewertungen kombiniert.
Bestenliste
Die am höchsten bewerteten Modelle über alle Benchmarks hinweg.
# | Modell | Index | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Seite 1 von 7 | ||||||||||
Diagramme
Folgt den Modellen mit der besten Performance
Wie der Index aufgebaut ist
Der Intelligenz-Index normalisiert jeden Benchmark auf eine Skala von 0-100 und mittelt die relative Position eines Modells über die Benchmarks, für die es bewertet wurde. Jeder unten aufgeführte Benchmark fließt in diese Punktzahl ein.
Aktuelle Updates
Neueste Änderungen am Intelligenz-Index, an der Modellabdeckung und an der AIMultiple-Benchmark-Methodik.
Kimi K3
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-5.6 Sol
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-5.6 Terra
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
GPT-5.6 Sol Pro
Neues Modell zum AIMultiple Intelligenz-Index hinzugefügt.
LLM Anwendungsfälle, Analysen & Benchmarks erkunden
Vergleichen Sie multimodale KI-Modelle im visuellen Schlussfolgern
Wir haben 15 führende multimodale KI-Modelle im visuellen Schlussfolgern mit 200 visuellen Fragen getestet. Die Evaluierung bestand aus zwei Bereichen: 100 Fragen zum Diagrammverständnis, die Interpretation von Datenvisualisierungen testen, und 100 Fragen zur visuellen Logik, die Mustererkennung und räumliches Denken bewerten. Jede Frage wurde 5‑mal ausgeführt, um konsistente und zuverlässige Ergebnisse zu gewährleisten. Sehen…
LLM Marktanteil: Vergleich von Nutzung & Akzeptanz
Wir analysierten den LLM-Marktanteil, indem wir nutzungsbasierte Daten und Schätzungen zu Web-Besuchen kombinierten, um zu zeigen, wie die Nachfrage nach large language models über KI-Labore und KI-Anwendungen verteilt ist: Lesen Sie die Methodik, um zu erfahren, wie wir diese Ergebnisse gemessen und berechnet haben. Die Vereinigten Staaten dominierten die Web-Besuche über alle vier Monate hinweg…
Top LLMOps Tools & Vergleich mit MLOPs
LLMOps-Plattformen übernehmen den operativen Teil des Betriebs von Large Language Models: Bereitstellung, Überwachung, Evaluierung und Kostenmanagement. Wir haben führende LLMOps-Tools, deren Kernfunktionen, Preismodelle und ihre Unterschiede untersucht, um die beste Lösung für verschiedene Anwendungsfälle zu identifizieren. Eine Aufschlüsselung jeder Metrik finden Sie unten: LLMOps-Plattformen unterstützen den Lebenszyklus von LLMs durch die Ermöglichung von: LLMOps-Plattformen unterscheiden…
Vergleich von 9 Großen Sprachmodellen im Gesundheitswesen
Wir haben 9 LLMs anhand des MedQA-Datensatzes verglichen, einer klinischen Prüfungsbenchmark auf Graduiertenniveau, die auf USMLE-Fragen basiert. Jedes Modell beantwortete dieselben klinischen Multiple-Choice-Szenarien mit einem standardisierten Prompt, was einen direkten Genauigkeitsvergleich ermöglicht. Wir haben auch die Latenz pro Frage gemessen, indem wir die Gesamtlaufzeit durch die Anzahl der bearbeiteten MedQA-Items dividiert haben. Benchmark-Methodik: Dieser Benchmark…
LLM Parameter: GPT-5 High, Mittel, Niedrig und Minimal
Einige LLMs, wie die GPT-5-Familie von OpenAI, sind in verschiedenen Versionen verfügbar (z. B. GPT-5, GPT-5-mini und GPT-5-nano) und mit verschiedenen Parametereinstellungen, einschließlich hoch, mittel, niedrig und minimal. Im Folgenden untersuchen wir die Unterschiede zwischen diesen Modellversionen, indem wir ihre Benchmark-Leistung und die Kosten für die Durchführung der Benchmarks erfassen. Wir haben die GPT-5-Familie in…
LLM-Orchestrierung: 22 Frameworks und Gateways
Die Optimierung der LLM-Orchestrierung ist entscheidend, um die Leistung zu verbessern und gleichzeitig den Ressourcenverbrauch zu kontrollieren. Um zu bewerten, wie unterschiedliche Orchestrierungsansätze in der Praxis abschneiden, haben wir folgende Benchmarks durchgeführt: Entdecken Sie ausgewählte LLM-Orchestrierungs-Tools, einschließlich Entwickler-Frameworks und Enterprise-Gateways: Die LLM-Orchestrierung umfasst die Verwaltung und Integration mehrerer Large Language Models (LLMs), um komplexe Aufgaben…
Die Zukunft großer Sprachmodelle
Entdecken Sie die Zukunft großer Sprachmodelle, indem Sie vielversprechende Ansätze wie Selbsttraining, Faktenprüfung und spärliche Expertise untersuchen, die Einschränkungen von LLM beheben könnten. Vergleich der Erfolgsquoten von LLM’s Claude Sonnet 4.6 führte den Benchmark mit einer Gesamtpunktzahl von 0.748 an, wobei die Basis- und Denkvarianten bis auf drei Dezimalstellen gleichauf lagen. Claude Opus 4.8…
Große multimodale Modelle (LMMs) vs. LLMs
Wir haben die Leistung großer multimodaler Modelle (LMMs) bei finanziellen Denkaufgaben anhand eines sorgfältig ausgewählten Datensatzes bewertet. Durch die Analyse einer Teilmenge hochwertiger Finanzproben bewerten wir die Fähigkeiten der Modelle bei der Verarbeitung und dem logischen Denken mit multimodalen Daten im Finanzbereich. Der Abschnitt zur Methodik bietet detaillierte Einblicke in den verwendeten Datensatz und den…
10+ Large Language Model Beispiele
Wir haben Open-Source-Benchmarks zusammengestellt, um führende proprietäre und Open-Source Large Language Models zu vergleichen. Wählen Sie Ihren Anwendungsfall, um das richtige Modell zu finden. Sie können Large Language Models bewerten, indem Sie ihre Benchmark-Leistung und die tatsächliche Latenz (verfügbar durch Klicken auf den Namen jedes Modells in der Tabelle) prüfen und ihre Preise überprüfen, um…
Cloud LLM vs. lokale LLMs: Beispiele & Vorteile
Cloud-LLMs, die auf fortschrittlichen Modellen wie GPT-5.5 und Claude Opus 4.7 basieren, bieten Skalierbarkeit und Zugänglichkeit. Umgekehrt gewährleisten lokale LLMs, die auf Open-Source-Modellen wie Llama 4, DeepSeek V4 und Qwen3.6-Plus basieren, stärkeren Datenschutz und Anpassbarkeit. Erkunden Sie, was Cloud-LLMs sind, Stärken und Schwächen, die häufigsten Fallstudien mit Beispielen aus der Praxis und wie sie sich…