Dienstleistungen
Kontaktieren

800+ Führende KI-Benchmarks

Sıla Ermut
Sıla Ermut
aktualisiert am 13. Aug. 2026

Wir haben eine Liste mit über 800 KI-Benchmarks für LLMs, GPUs, Cloud-GPUs, KI-Agenten, tabellarische KI und Cybersicherheit zusammengestellt, die noch nicht gesättigt sind.

Wachstum der KI-Benchmarks

Loading Chart

Beachten Sie, dass der größte Teil des Höhepunkts von Mai bis Juni dem Zeitraum entspricht, in dem wir unsere Recherche durchgeführt haben. Benchmarks, die kontinuierlich aktualisiert werden, sind auf den letzten Zeitpunkt datiert, zu dem wir sie überprüft haben, und häufen sich daher tendenziell um die Monate, in denen wir Daten gesammelt haben, statt auf einen echten Anstieg neuer Benchmarks hinzuweisen.

KI-Benchmarks nach Kategorien

Wir haben die KI-Benchmarks anhand ihrer Hauptkategorien aufgelistet. LLM-Benchmarks führen mit der größten Anzahl.

KI-Benchmarks nach Unterkategorien

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Liste der KI-Benchmarks

Der Einfachheit halber haben wir die jüngsten 250 Benchmarks aus unserer vollständigen Liste von 809 Benchmarks aufgenommen. Lesen Sie unsere Methodik, um zu erfahren, wie wir diese Liste zusammengestellt haben.

Hinweise zum Lesen der Liste:

Die vier Spalten mit booleschen Flags (T = wahr, F = falsch) geben an, welche Bewertungsdimension jeder Benchmark abdeckt. Jedes Flag beantwortet eine Ja/Nein-Frage zum Umfang des Benchmarks:

  • Leistung (T/F): Bewertet der Benchmark Fähigkeit oder Qualität, etwa Ausgabegenauigkeit, Aufgabenerfüllung oder Intelligenz? Dies ist für fast alle Benchmarks mit T markiert, da die meisten bewerten, wie gut ein Modell oder System abschneidet. Es ist mit F markiert für Benchmarks, die sich rein auf Kosten oder Geschwindigkeit konzentrieren und die Ausgabequalität nicht bewerten.
  • Preis (T/F): Enthält der Benchmark kostenbezogene Faktoren wie Dollar pro Token, Preis pro Durchsatz oder Kosten pro Aufgabe? 
  • Latenz (T/F): Misst der Benchmark Geschwindigkeit, etwa Tokens pro Sekunde, Zeit bis zum ersten Token, Durchsatz oder Antwortzeit? Er ist F für Benchmarks, die Korrektheit bewerten, unabhängig davon, wie lange die Antwort dauert.
  • Zuverlässigkeit (T/F): Bewertet der Benchmark Konsistenz oder Verlässlichkeit, etwa Varianz über Läufe, Stabilität der Erfolgsquoten oder Robustheit? Dies ist das seltenste Flag. Es ist T für Benchmarks, die für diesen Zweck konzipiert sind, einschließlich HAL Reliability, tau-bench/tau2-bench, METR Time Horizons und mehreren Agenten-Benchmarks, bei denen die Konsistenz der Bestehensquote zentral ist. Es ist F für die meisten Bestenlisten, die eine einzige Gesamtpunktzahl melden.
  • Kontaminationsresistent (T/F): Gibt an, ob der Benchmark darauf ausgelegt ist, das Risiko von Datenkontamination zu verringern, bei der Testfragen in den Trainingsdaten eines Modells erscheinen und das Modell hohe Punktzahlen eher durch Erinnern als durch echte Fähigkeit erreicht. T bedeutet, dass der Benchmark eine sinnvolle Abwehr aufweist, etwa einen verborgenen Holdout, neu generierte oder rotierende Fragen, monatliche Aktualisierungen, selbstgenerierende Elemente oder Wettbewerbsaufgaben, die nach dem Trainingsstichtag eines Modells veröffentlicht wurden. F bedeutet, dass der Benchmark ein fester öffentlicher Datensatz ist, der seit Jahren online ist und möglicherweise in Trainingskorpora aufgenommen wurde. In diesen Fällen sollten hohe Punktzahlen mit größerer Vorsicht interpretiert werden.

In der Praxis stellt eine Zeile mit T/F/F/F einen reinen Qualitäts-Benchmark dar. Im Gegensatz dazu bewertet ein Benchmark mit T/T/T/T/F Qualität, Kosten und Geschwindigkeit gemeinsam. Diese Flags bieten eine kompakte Taxonomie, die zeigt, welche der vier Bewertungsachsen jeder Benchmark abdeckt.

Warum sind einige Zellen leer?

Kontaminationsresistent & Kontaminationsquelle: Diese beiden Felder sind normalerweise bei denselben Zeilentypen leer, insbesondere bei GPU, Cloud-GPU, Geschwindigkeits- und Preis-Benchmarks. Die Kontaminationsresistenz ist für Wissens- und Argumentations-Benchmarks relevant, bei denen ein Modell Testfragen aus den Trainingsdaten auswendig gelernt haben könnte. Bei Hardware-Durchsatz-, Latenz- oder Preis-Benchmarks gibt es keine Testfragen, die kontaminiert werden könnten, daher bleibt das Feld leer, statt mit T oder F markiert zu werden.

Methodik der KI-Benchmarks

Wir haben die Benchmark-Daten durch einen Online-Recherche- und Validierungsprozess gesammelt. Ziel war es, eine strukturierte Liste von Technologie-Benchmarks zu erstellen, die für den Vergleich aktueller KI-Systeme und Infrastrukturen nützlich bleiben und LLMs, GPUs, Cloud-GPUs, KI-Agenten, tabellarische KI und Cybersicherheit abdecken.

Wir begannen mit der Festlegung des Umfangs des Datensatzes. Wir konzentrierten uns auf Benchmarks, die Modellfähigkeit, Infrastrukturleistung, Kosten, Latenz, Zuverlässigkeit oder Widerstandsfähigkeit gegen Kontamination messen. Die anfängliche Quellenliste umfasste große Benchmark- und Analyseanbieter wie Artificial Analysis, SemiAnalysis, Vals KI, LMArena, AIMultiple und Epoch KI sowie offizielle Benchmark-Websites, GitHub-Repositories, wissenschaftliche Arbeiten, Bestenlistenseiten und relevante Drittanbieter-Benchmark-Aggregatoren.

Für jeden Benchmark erfassten wir sowohl beschreibende als auch bewertende Felder. Beschreibende Felder halten fest, was der Benchmark ist, was er misst, welche Produkte oder Modelle bewertet werden und wie häufig er aktualisiert wird. Bewertende Felder klassifizieren, ob der Benchmark Leistung, Preis, Latenz oder Zuverlässigkeit misst. Wir sammelten außerdem Informationen zur Benchmark-Struktur und Datenintegrität.

Wir priorisierten nach Möglichkeit Primärquellen. Dazu gehörten offizielle Benchmark-Methodikseiten, Bestenlistenseiten, GitHub-Repositories, Benchmark-Papiere und Anbieterdokumentation. Wenn eine Primärquelle ein bestimmtes Feld nicht bereitstellte, nutzten wir seriöse Sekundärquellen oder Aggregatoren, um Lücken zu füllen, insbesondere bei Spitzenwerten, aktueller Modellabdeckung und jüngsten Messdaten. Quellspalten wurden im gesamten Datensatz aufgenommen, damit die Belege für jeden Wert zu ihrer Quelle zurückverfolgt werden können.

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Diese Forschung zitieren

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Sıla Ermut (2026) - "800+ Führende KI-Benchmarks". Online veröffentlicht auf AIMultiple.com. Abgerufen am 13. August 2026, von: https://aimultiple.com/ai-benchmarks [Online-Ressource]

Ermut, S. (2026, 13. August). 800+ Führende KI-Benchmarks. AIMultiple. https://aimultiple.com/ai-benchmarks

@misc{ermut2026,
  author = {Ermut, Sıla},
  title  = {{800+ Führende KI-Benchmarks}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-benchmarks}},
  note   = {AIMultiple. Abgerufen am 13. August 2026}
}
Sıla Ermut
Sıla Ermut
Branchenanalystin
Sıla Ermut ist eine Branchenanalystin bei AIMultiple und deckt KI-Modelle, KI-Infrastruktur, KI-Governance und Unternehmensanwendungen von KI ab. Ihre Forschung konzentriert sich überwiegend auf den Einsatz von KI in Marketing, Gesundheitswesen, Lieferketten und Nachhaltigkeit. Zuvor war sie als Recruiterin in Projektmanagement- und Beratungsunternehmen tätig. Sıla hat einen Master of Science in Sozialpsychologie und einen Bachelor of Arts in Internationale Beziehungen.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450