Dienstleistungen
Kontaktieren

800+ Führende KI-Benchmarks

Sıla Ermut
Sıla Ermut
aktualisiert am 17. Aug. 2026

Wir haben eine Liste mit über 800 KI-Benchmarks für LLMs, GPUs, Cloud-GPUs, KI-Agenten, tabellarische KI und Cybersicherheit zusammengestellt, die noch nicht gesättigt sind.

KI-Benchmark-Wachstum

Loading Chart

Beachten Sie, dass der größte Teil des Peaks von Mai bis Juni dem Zeitraum entspricht, in dem wir unsere Recherche durchgeführt haben. Benchmarks, die kontinuierlich aktualisiert werden, sind auf den Zeitpunkt datiert, zu dem wir sie zuletzt überprüft haben. Daher häufen sie sich tendenziell um die Monate, in denen wir Daten gesammelt haben, statt auf einen tatsächlichen Anstieg neuer Benchmarks hinzuweisen.

KI-Benchmarks nach Kategorien

Wir haben die KI-Benchmarks nach ihren Hauptkategorien aufgelistet. LLM-Benchmarks führen hinsichtlich der größten Anzahl.

KI-Benchmarks nach Unterkategorien

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Liste der KI-Benchmarks

Der Einfachheit halber haben wir die neuesten 250 Benchmarks aus unserer vollständigen Liste von 809 Benchmarks aufgenommen. Lesen Sie unsere Methodik, um zu erfahren, wie wir diese Liste zusammengestellt haben.

Hinweise zum Lesen der Liste:

Die vier Spalten mit booleschen Kennzeichen (T = wahr, F = falsch) geben an, welche Bewertungsdimension jeder Benchmark abdeckt. Jedes Kennzeichen beantwortet eine Ja/Nein-Frage zum Umfang des Benchmarks:

  • Leistung (T/F): Bewertet der Benchmark die Fähigkeit oder Qualität, wie z. B. Ausgabegenauigkeit, Aufgabenerfüllung oder Intelligenz? Dies ist bei fast allen Benchmarks mit T gekennzeichnet, da die meisten bewerten, wie gut ein Modell oder System abschneidet. Es ist mit F gekennzeichnet für Benchmarks, die sich ausschließlich auf Kosten oder Geschwindigkeit konzentrieren und keine Ausgabequalität bewerten.
  • Preis (T/F): Enthält der Benchmark kostenbezogene Faktoren, wie Dollar pro Token, Preis pro Durchsatz oder Kosten pro Aufgabe?
  • Latenz (T/F): Misst der Benchmark die Geschwindigkeit, z. B. Token pro Sekunde, Zeit bis zum ersten Token, Durchsatz oder Antwortzeit? Er ist F für Benchmarks, die Korrektheit bewerten, unabhängig davon, wie lange die Antwort dauert.
  • Zuverlässigkeit (T/F): Bewertet der Benchmark die Konsistenz oder Verlässlichkeit, wie z. B. Varianz zwischen Durchläufen, Stabilität der Erfolgsquoten oder Robustheit? Dies ist das am wenigsten verbreitete Kennzeichen. Es ist T für Benchmarks, die für diesen Zweck entwickelt wurden, darunter HAL Reliability, tau-bench/tau2-bench, METR Time Horizons und mehrere Agenten-Benchmarks, bei denen die Konsistenz der Bestehensquote zentral ist. Es ist F für die meisten Bestenlisten, die eine einzige Gesamtpunktzahl ausweisen.
  • Kontaminationsresistent (T/F): Gibt an, ob der Benchmark darauf ausgelegt ist, das Risiko von Datenkontamination zu verringern, bei dem Testfragen in den Trainingsdaten eines Modells vorkommen und das Modell hohe Punktzahlen eher durch Erinnern als durch echte Fähigkeiten erzielt. T bedeutet, dass der Benchmark über eine sinnvolle Abwehr verfügt, z. B. einen verborgenen Hold-out, neu generierte oder rotierende Fragen, monatliche Aktualisierungen, selbsterzeugende Elemente oder Wettbewerbsaufgaben, die nach dem Trainingsstichtag eines Modells veröffentlicht wurden. F bedeutet, dass der Benchmark ein fester öffentlicher Datensatz ist, der seit Jahren online und möglicherweise in Trainingskorpora aufgenommen worden ist. In diesen Fällen sollten hohe Punktzahlen mit größerer Vorsicht interpretiert werden.

In der Praxis steht eine mit T/F/F/F gekennzeichnete Zeile für einen reinen Qualitätsbenchmark. Im Gegensatz dazu bewertet ein mit T/T/T/T/F gekennzeichneter Benchmark Qualität, Kosten und Geschwindigkeit gemeinsam. Diese Kennzeichen bilden eine kompakte Taxonomie, die zeigt, welche der vier Bewertungsachsen jeder Benchmark abdeckt.

Warum sind einige Zellen leer?

Kontaminationsresistent & Kontaminationsquelle: Diese beiden Felder sind normalerweise bei denselben Arten von Zeilen leer, insbesondere bei GPU, Cloud-GPU, Geschwindigkeits- und Preisbenchmarks. Die Kontaminationsresistenz ist für Wissens- und Denkbenchmarks relevant, bei denen ein Modell Testfragen aus den Trainingsdaten auswendig gelernt haben könnte. Bei Hardware-Durchsatz-, Latenz- oder Preisbenchmarks gibt es keine Testfragen, die kontaminiert werden könnten, daher wird das Feld leer gelassen, statt es mit T oder F zu kennzeichnen.

KI-Benchmarks-Methodik

Wir haben die Benchmarkdaten durch einen Online-Recherche- und Validierungsprozess erhoben. Ziel war es, eine strukturierte Liste von Technologie-Benchmarks zu erstellen, die für den Vergleich aktueller KI-Systeme und Infrastrukturen nützlich bleiben und LLMs, GPUs, Cloud-GPUs, KI-Agenten, tabellarische KI und Cybersicherheit abdecken.

Wir begannen mit der Festlegung des Umfangs des Datensatzes. Wir konzentrierten uns auf Benchmarks, die Modellfähigkeiten, Infrastrukturleistung, Kosten, Latenz, Zuverlässigkeit oder Resistenz gegen Kontamination messen. Die anfängliche Quellenliste umfasste große Benchmark- und Analyseanbieter wie Artificial Analysis, SemiAnalysis, Vals KI, LMArena, AIMultiple und Epoch KI sowie offizielle Benchmark-Websites, GitHub-Repositories, wissenschaftliche Arbeiten, Bestenlisten-Seiten und relevante Drittanbieter-Benchmark-Aggregatoren.

Für jeden Benchmark haben wir sowohl beschreibende als auch bewertende Felder erfasst. Beschreibende Felder halten fest, was der Benchmark ist, was er misst, welche Produkte oder Modelle bewertet werden und wie häufig er aktualisiert wird. Bewertende Felder klassifizieren, ob der Benchmark Leistung, Preis, Latenz oder Zuverlässigkeit misst. Außerdem haben wir Informationen zur Benchmark-Struktur und Datenintegrität gesammelt.

Wir haben, wo immer möglich, Primärquellen priorisiert. Dazu gehörten offizielle Benchmark-Methodikseiten, Bestenlisten-Seiten, GitHub-Repositories, Benchmark-Papers und Anbieterdokumentationen. Wenn eine Primärquelle ein bestimmtes Feld nicht bereitstellte, nutzten wir seriöse Sekundärquellen oder Aggregatoren, um Lücken zu schließen, insbesondere bei Spitzenwerten, aktueller Modellabdeckung und jüngsten Messdaten. Quellspalten wurden im gesamten Datensatz aufgenommen, damit die Belege für jeden Wert bis zu ihrer Quelle zurückverfolgt werden können.

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Diese Forschung zitieren

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Sıla Ermut (2026) - "800+ Führende KI-Benchmarks". Online veröffentlicht auf AIMultiple.com. Abgerufen am 17. August 2026, von: https://aimultiple.com/ai-benchmarks [Online-Ressource]

Ermut, S. (2026, 17. August). 800+ Führende KI-Benchmarks. AIMultiple. https://aimultiple.com/ai-benchmarks

@misc{ermut2026,
  author = {Ermut, Sıla},
  title  = {{800+ Führende KI-Benchmarks}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-benchmarks}},
  note   = {AIMultiple. Abgerufen am 17. August 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 250 Datenpunkten. Laden Sie die in diesem Artikel verwendeten Daten als ZIP-Datei herunter, die eine CSV-Datei enthält.

Zuletzt aktualisiert: 17. August 2026
Herunterladen
Sıla Ermut
Sıla Ermut
Branchenanalystin
Sıla Ermut ist Branchenanalystin bei AIMultiple und befasst sich mit KI-Modellen, KI-Infrastruktur, KI-Governance und KI-Anwendungen für Unternehmen. Ihre Forschung konzentriert sich hauptsächlich auf den Einsatz von KI in Marketing, Gesundheitswesen, Lieferketten und Nachhaltigkeit.
Zuvor arbeitete sie als Personalvermittlerin in Projektmanagement- und Beratungsunternehmen. Sıla hat einen Master of Science in Sozialpsychologie und einen Bachelor of Arts in Internationalen Beziehungen.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450