Wir haben eine Liste mit über 800 KI-Benchmarks für LLMs, GPUs, Cloud-GPUs, KI-Agenten, tabellarische KI und Cybersicherheit zusammengestellt, die noch nicht gesättigt sind.
Wachstum der KI-Benchmarks
Beachten Sie, dass der größte Teil des Höhepunkts von Mai bis Juni dem Zeitraum entspricht, in dem wir unsere Recherche durchgeführt haben. Benchmarks, die kontinuierlich aktualisiert werden, sind auf den letzten Zeitpunkt datiert, zu dem wir sie überprüft haben, und häufen sich daher tendenziell um die Monate, in denen wir Daten gesammelt haben, statt auf einen echten Anstieg neuer Benchmarks hinzuweisen.
KI-Benchmarks nach Kategorien
Wir haben die KI-Benchmarks anhand ihrer Hauptkategorien aufgelistet. LLM-Benchmarks führen mit der größten Anzahl.
KI-Benchmarks nach Unterkategorien
Liste der KI-Benchmarks
Der Einfachheit halber haben wir die jüngsten 250 Benchmarks aus unserer vollständigen Liste von 809 Benchmarks aufgenommen. Lesen Sie unsere Methodik, um zu erfahren, wie wir diese Liste zusammengestellt haben.
Hinweise zum Lesen der Liste:
Die vier Spalten mit booleschen Flags (T = wahr, F = falsch) geben an, welche Bewertungsdimension jeder Benchmark abdeckt. Jedes Flag beantwortet eine Ja/Nein-Frage zum Umfang des Benchmarks:
- Leistung (T/F): Bewertet der Benchmark Fähigkeit oder Qualität, etwa Ausgabegenauigkeit, Aufgabenerfüllung oder Intelligenz? Dies ist für fast alle Benchmarks mit T markiert, da die meisten bewerten, wie gut ein Modell oder System abschneidet. Es ist mit F markiert für Benchmarks, die sich rein auf Kosten oder Geschwindigkeit konzentrieren und die Ausgabequalität nicht bewerten.
- Preis (T/F): Enthält der Benchmark kostenbezogene Faktoren wie Dollar pro Token, Preis pro Durchsatz oder Kosten pro Aufgabe?
- Latenz (T/F): Misst der Benchmark Geschwindigkeit, etwa Tokens pro Sekunde, Zeit bis zum ersten Token, Durchsatz oder Antwortzeit? Er ist F für Benchmarks, die Korrektheit bewerten, unabhängig davon, wie lange die Antwort dauert.
- Zuverlässigkeit (T/F): Bewertet der Benchmark Konsistenz oder Verlässlichkeit, etwa Varianz über Läufe, Stabilität der Erfolgsquoten oder Robustheit? Dies ist das seltenste Flag. Es ist T für Benchmarks, die für diesen Zweck konzipiert sind, einschließlich HAL Reliability, tau-bench/tau2-bench, METR Time Horizons und mehreren Agenten-Benchmarks, bei denen die Konsistenz der Bestehensquote zentral ist. Es ist F für die meisten Bestenlisten, die eine einzige Gesamtpunktzahl melden.
- Kontaminationsresistent (T/F): Gibt an, ob der Benchmark darauf ausgelegt ist, das Risiko von Datenkontamination zu verringern, bei der Testfragen in den Trainingsdaten eines Modells erscheinen und das Modell hohe Punktzahlen eher durch Erinnern als durch echte Fähigkeit erreicht. T bedeutet, dass der Benchmark eine sinnvolle Abwehr aufweist, etwa einen verborgenen Holdout, neu generierte oder rotierende Fragen, monatliche Aktualisierungen, selbstgenerierende Elemente oder Wettbewerbsaufgaben, die nach dem Trainingsstichtag eines Modells veröffentlicht wurden. F bedeutet, dass der Benchmark ein fester öffentlicher Datensatz ist, der seit Jahren online ist und möglicherweise in Trainingskorpora aufgenommen wurde. In diesen Fällen sollten hohe Punktzahlen mit größerer Vorsicht interpretiert werden.
In der Praxis stellt eine Zeile mit T/F/F/F einen reinen Qualitäts-Benchmark dar. Im Gegensatz dazu bewertet ein Benchmark mit T/T/T/T/F Qualität, Kosten und Geschwindigkeit gemeinsam. Diese Flags bieten eine kompakte Taxonomie, die zeigt, welche der vier Bewertungsachsen jeder Benchmark abdeckt.
Warum sind einige Zellen leer?
Kontaminationsresistent & Kontaminationsquelle: Diese beiden Felder sind normalerweise bei denselben Zeilentypen leer, insbesondere bei GPU, Cloud-GPU, Geschwindigkeits- und Preis-Benchmarks. Die Kontaminationsresistenz ist für Wissens- und Argumentations-Benchmarks relevant, bei denen ein Modell Testfragen aus den Trainingsdaten auswendig gelernt haben könnte. Bei Hardware-Durchsatz-, Latenz- oder Preis-Benchmarks gibt es keine Testfragen, die kontaminiert werden könnten, daher bleibt das Feld leer, statt mit T oder F markiert zu werden.
Methodik der KI-Benchmarks
Wir haben die Benchmark-Daten durch einen Online-Recherche- und Validierungsprozess gesammelt. Ziel war es, eine strukturierte Liste von Technologie-Benchmarks zu erstellen, die für den Vergleich aktueller KI-Systeme und Infrastrukturen nützlich bleiben und LLMs, GPUs, Cloud-GPUs, KI-Agenten, tabellarische KI und Cybersicherheit abdecken.
Wir begannen mit der Festlegung des Umfangs des Datensatzes. Wir konzentrierten uns auf Benchmarks, die Modellfähigkeit, Infrastrukturleistung, Kosten, Latenz, Zuverlässigkeit oder Widerstandsfähigkeit gegen Kontamination messen. Die anfängliche Quellenliste umfasste große Benchmark- und Analyseanbieter wie Artificial Analysis, SemiAnalysis, Vals KI, LMArena, AIMultiple und Epoch KI sowie offizielle Benchmark-Websites, GitHub-Repositories, wissenschaftliche Arbeiten, Bestenlistenseiten und relevante Drittanbieter-Benchmark-Aggregatoren.
Für jeden Benchmark erfassten wir sowohl beschreibende als auch bewertende Felder. Beschreibende Felder halten fest, was der Benchmark ist, was er misst, welche Produkte oder Modelle bewertet werden und wie häufig er aktualisiert wird. Bewertende Felder klassifizieren, ob der Benchmark Leistung, Preis, Latenz oder Zuverlässigkeit misst. Wir sammelten außerdem Informationen zur Benchmark-Struktur und Datenintegrität.
Wir priorisierten nach Möglichkeit Primärquellen. Dazu gehörten offizielle Benchmark-Methodikseiten, Bestenlistenseiten, GitHub-Repositories, Benchmark-Papiere und Anbieterdokumentation. Wenn eine Primärquelle ein bestimmtes Feld nicht bereitstellte, nutzten wir seriöse Sekundärquellen oder Aggregatoren, um Lücken zu füllen, insbesondere bei Spitzenwerten, aktueller Modellabdeckung und jüngsten Messdaten. Quellspalten wurden im gesamten Datensatz aufgenommen, damit die Belege für jeden Wert zu ihrer Quelle zurückverfolgt werden können.
Diese Forschung zitieren
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{ermut2026,
author = {Ermut, Sıla},
title = {{800+ Führende KI-Benchmarks}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-benchmarks}},
note = {AIMultiple. Abgerufen am 13. August 2026}
}
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.