Wir haben eine Liste mit über 800 KI-Benchmarks für LLMs, GPUs, Cloud GPUs, KI-Agenten, tabellarische KI und Cybersicherheit zusammengestellt, die noch nicht gesättigt sind.
Wachstum der KI-Benchmarks
Wir stellten fest, dass die Benchmarking-Aktivität bis 2024–2025 relativ gering und stabil war und dann Anfang 2026 anstieg. Dies spiegelt das schnelle Wachstum von KI-Systemen wider, die eine Evaluierung erfordern, insbesondere da Modelle in den Bereichen Codierung, logisches Denken, multimodale Aufgaben, Agentenfähigkeiten und geschäftliche Anwendungsfälle leistungsfähiger geworden sind.
KI-Benchmarks nach Kategorien
Wir haben die KI-Benchmarks nach ihren Hauptkategorien aufgelistet. LLM-Benchmarks führen in Bezug auf die größte Anzahl.
KI-Benchmarks nach Unterkategorien
Liste der KI-Benchmarks
Zur Vereinfachung haben wir die letzten 250 Benchmarks aus unserer vollständigen Liste von 836 Benchmarks aufgenommen. Lesen Sie unsere Methodik, um zu erfahren, wie wir diese Liste erstellt haben.
Hinweise zum Lesen der Liste:
Die vier Spalten mit booleschen Flags (T = wahr, F = falsch) zeigen an, welche Bewertungsdimension jeder Benchmark abdeckt. Jedes Flag beantwortet eine Ja/Nein-Frage zum Umfang des Benchmarks:
- Leistung (T/F): Bewertet der Benchmark die Fähigkeit oder Qualität, wie z. B. Ausgabegenauigkeit, Aufgabenerfüllung oder Intelligenz? Dies wird bei fast allen Benchmarks mit T markiert, da die meisten bewerten, wie gut ein Modell oder System funktioniert. Es wird mit F markiert bei Benchmarks, die sich ausschließlich auf Kosten oder Geschwindigkeit konzentrieren und die Ausgabequalität nicht bewerten.
- Preis (T/F): Beinhaltet der Benchmark kostenbezogene Faktoren, wie Dollar pro Token, Preis pro Durchsatz oder Kosten pro Aufgabe?
- Latenz (T/F): Misst der Benchmark die Geschwindigkeit, wie Tokens pro Sekunde, Zeit bis zum ersten Token, Durchsatz oder Antwortzeit? Es ist F für Benchmarks, die Korrektheit bewerten, unabhängig davon, wie lange die Antwort dauert.
- Zuverlässigkeit (T/F): Bewertet der Benchmark die Konsistenz oder Verlässlichkeit, wie z. B. Varianz über Durchläufe, Stabilität der Erfolgsraten oder Robustheit? Dies ist das am wenigsten verbreitete Flag. Es ist T bei Benchmarks, die für diesen Zweck konzipiert sind, einschließlich HAL Reliability, tau-bench/tau2-bench, METR Time Horizons und mehreren Agenten-Benchmarks, bei denen die Konsistenz der Bestehensquote zentral ist. Es ist F für die meisten Bestenlisten, die eine einzige Gesamtpunktzahl angeben.
- Kontaminationsresistent (T/F): Zeigt an, ob der Benchmark darauf ausgelegt ist, das Risiko einer Datenkontamination zu verringern, bei der Testfragen in den Trainingsdaten eines Modells auftauchen und das Modell hohe Punktzahlen durch Wiedererkennung statt durch echte Fähigkeiten erzielt. T bedeutet, dass der Benchmark eine sinnvolle Abwehrmaßnahme aufweist, wie z. B. einen versteckten Holdout, neu generierte oder rotierende Fragen, monatliche Aktualisierungen, sich selbst generierende Elemente oder Wettbewerbsprobleme, die nach dem Trainingsstopp des Modells veröffentlicht wurden. F bedeutet, dass der Benchmark ein fester öffentlicher Datensatz ist, der seit Jahren online ist und möglicherweise in Trainingskorpora aufgenommen wurde. In diesen Fällen sollten hohe Punktzahlen mit größerer Vorsicht interpretiert werden.
In der Praxis stellt eine Zeile, die mit T/F/F/F gekennzeichnet ist, einen reinen Qualitätsbenchmark dar. Im Gegensatz dazu bewertet ein mit T/T/T/T/F gekennzeichneter Benchmark Qualität, Kosten und Geschwindigkeit zusammen. Diese Flags bieten eine kompakte Taxonomie, die anzeigt, welche der vier Bewertungsachsen jeder Benchmark abdeckt.
Warum sind einige Zellen leer?
Kontaminationsresistent & Kontaminationsquelle: Diese beiden Felder sind normalerweise für die gleichen Arten von Zeilen leer, insbesondere für GPU, Cloud GPU, Geschwindigkeits- und Preisbenchmarks. Die Kontaminationsresistenz ist relevant für Wissens- und Logikbenchmarks, bei denen ein Modell Testfragen aus den Trainingsdaten auswendig gelernt haben könnte. Für Hardware-Durchsatz-, Latenz- oder Preisbenchmarks gibt es keine Testfragen, die kontaminiert werden könnten, daher wird das Feld leer gelassen, anstatt mit T oder F markiert zu werden.
Methodik der KI-Benchmarks
Wir haben die Benchmark-Daten durch einen Online-Recherche- und Validierungsprozess gesammelt. Ziel war es, eine strukturierte Liste von Technologie-Benchmarks zu erstellen, die für den Vergleich aktueller KI-Systeme und Infrastrukturen nützlich bleiben und die Bereiche LLMs, GPUs, Cloud GPUs, KI-Agenten, tabellarische KI und Cybersicherheit abdecken.
Zunächst definierten wir den Umfang des Datensatzes. Wir konzentrierten uns auf Benchmarks, die Modellfähigkeit, Infrastrukturleistung, Kosten, Latenz, Zuverlässigkeit oder Resistenz gegen Kontamination messen. Die anfängliche Quellenliste umfasste große Benchmark- und Analyseanbieter wie Artificial Analysis, SemiAnalysis, Vals KI, LMArena, AIMultiple und Epoch KI sowie offizielle Benchmark-Websites, GitHub-Repositories, wissenschaftliche Arbeiten, Bestenlisten-Seiten und relevante Drittanbieter-Benchmark-Aggregatoren.
Für jeden Benchmark erfassten wir sowohl beschreibende als auch bewertende Felder. Beschreibende Felder erfassen, was der Benchmark ist, was er misst, welche Produkte oder Modelle bewertet werden und wie häufig er aktualisiert wird. Die bewertenden Felder klassifizieren, ob der Benchmark Leistung, Preis, Latenz oder Zuverlässigkeit misst. Wir sammelten auch Informationen zur Benchmark-Struktur und Datenintegrität.
Wir priorisierten Primärquellen, wo immer möglich. Dazu gehörten offizielle Benchmark-Methodikseiten, Bestenlisten-Seiten, GitHub-Repositories, Benchmark-Papiere und Anbieterdokumentation. Wenn eine Primärquelle ein bestimmtes Feld nicht bereitstellte, verwendeten wir seriöse Sekundärquellen oder Aggregatoren, um Lücken zu füllen, insbesondere bei Spitzenwerten, aktueller Modellabdeckung und aktuellen Messdaten. Quellspalten wurden im gesamten Datensatz aufgenommen, sodass die Belege für jeden Wert zu seiner Quelle zurückverfolgt werden können.
Diese Forschung zitieren
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{ermut2026,
author = {Ermut, Sıla},
title = {{800+ Führende KI-Benchmarks}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-benchmarks}},
note = {AIMultiple. Abgerufen am 7. August 2026}
}
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.