Premium
Dienstleistungen
Premium

+100 Datensätze für ML & KI-Modelle

Cem Dilmegani
Cem Dilmegani
aktualisiert am 2. Sept. 2026

Daten sind erforderlich, um generative KI- oder Conversational-KI-Lösungen zu nutzen oder aufzubauen. Sie können vorhandene Datensätze auf dem Markt nutzen oder einen Datenerfassungsdienst beauftragen.

Wir haben über 100 Datensätze identifiziert, um Machine-Learning- und KI-Modelle zu trainieren und zu evaluieren.

Large Language Models (LLMs) und Agentic-KI-Datensätze

Datensatz / Benchmark
Beschreibung
Kostenlos / Kostenpflichtig
Letzte Aktualisierung
MMLU (Massive Multitask Language Understanding)
Benchmark für allgemeines logisches Denken und akademisches Wissen
Kostenlos
Laufend
HumanEval+
Python-Coding-Benchmark für generativen Code
Kostenlos
Laufend
FineWeb
Hugging Faces Datensatz für LLM-Pre-Training
Kostenlos
Laufend
FineWeb-Edu
Bildungs-Teilmenge von FineWeb
Kostenlos
Laufend
BFCL (Berkeley Function Calling Leaderboard)
Kontinuierlich aktualisierter Standard für die Bewertung von Tool-/Function-Calling
Kostenlos
Laufend
AIMultiple UI Grounding Benchmark
UI-Grounding-Benchmark für Computer-Use- und Vision-Language-Modelle
Kostenlos
2026
Superior-Reasoning-SFT
Long-CoT-Reasoning-Datensatz von Alibaba-Apsara
Kostenlos
2026
Terminal-Bench 2.0
89 realistische Terminal-Aufgaben (Dateimanipulation, Systemadministration, Debugging, Neuimplementierung von Forschungscode)
Kostenlos
2026
MMMU (Massive Multi-disciplinary Multimodal Understanding)
Multimodaler Benchmark (Bild- und Text-Argumentation)
Kostenlos
2025
Humanity’s Last Exam (HLE)
Multimodaler Benchmark, um Frontier-LLMs über MMLU hinaus zu testen
Kostenlos
2025
  • Large Language Model-Benchmarks wie MMLU und GPQA messen allgemeines und wissenschaftliches Denken.
  • Multimodale Datensätze, wie LAION-5B, kombinieren Text und Bilder, um Modelle zu trainieren, die beide Formate verarbeiten können.
  • Frontier-Evaluierungen, wie Humanity’s Last Exam, ARC-AGI-2 und KI Idea Bench, testen Kreativität, faktische Genauigkeit und Anpassungsfähigkeit der Modelle an komplexe Prompts.
  • Agentic- und Tool-Use-Benchmarks, wie GAIA, BFCL (Berkeley Function Calling Leaderboard) und ComplexFuncBench, bewerten mehrstufiges Reasoning, Tool-Calling und Aufgabenerfüllung.
  • UI-Grounding-Benchmarks, wie der AIMultiple UI Grounding Benchmark, bewerten, ob Computer-Use-Modelle das richtige Oberflächenelement identifizieren und dessen Position aus einer natürlichsprachlichen Anweisung vorhersagen können. Siehe den Computer-Use-Agents-Benchmark für Methodik und Modellergebnisse.
  • Pre-Training-Korpora, wie FineWeb, Nemotron-CC und Essential-Web v1.0, bieten umfangreiche Tokensammlungen zum Trainieren von Basismodellen.

KI-Coding- und Software-Engineering-Datensätze

  • Datensätze wie The Heap und MADE-WIC enthalten mehrsprachigen und annotierten Code zur Bewertung der Codegenauigkeit und der technischen Schulden.
  • HumanEval und APPS bieten Programmierprobleme mit Referenzlösungen, um die Qualität der Codegenerierung zu benchmarken.
  • Repository- und agentische Benchmarks, wie SWE-Bench Pro, SWE-Bench Multilingual, SWE-Lancer und Terminal-Bench 2.0, evaluieren Modelle anhand echter GitHub-Issues und End-to-End-Softwareaufgaben statt isolierter Funktionen.
  • Proprietäre Datensätze, wie die von Amazon CodeWhisperer und GitHub Copilot, unterstützen kommerzielle Coding-Assistenten.

Ältere Benchmarks wie HumanEval und SWE-bench Verified gelten mittlerweile weithin als kontaminiert oder gesättigt; infolgedessen sind kontaminationsresistente Nachfolger wie SWE-Bench Pro entstanden.

Cybersicherheit und Datensicherheits-Datensätze

  • CICIDS2017 und TON_IoT werden häufig zum Trainieren von Intrusions- und Anomalieerkennungssystemen verwendet.
  • Die Datensätze EMBER und VirusShare enthalten gekennzeichnete Malware-Daten für die modellbasierte Klassifizierung.
  • Die CVE-MITRE-Datenbank bietet strukturierte Informationen zu bekannten Software-Schwachstellen.

Daten, synthetische Daten und Datenschutz-Datensätze

  • Plattformen wie Appen, Amazon Mechanical Turk, und Telus International liefern menschlich erzeugte Datensätze für überwachtes Lernen.
  • Hazy und Gretel.ai erzeugen synthetische strukturierte Daten für den Unternehmenseinsatz.
  • Offene Repositories wie Kaggle Datasets und Google Dataset Search bieten öffentlich zugängliche Daten aus mehreren Domänen.
Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Webdaten-Datensätze

  • Kommerzielle Webdatenanbieter, wie Bright Data und Coresignal, verkaufen vorab erfasste und individuelle Datensätze zu Quellen wie E-Commerce, Social Media, Immobilien und Stellenausschreibungen. Marktplätze wie Datarade aggregieren diese über Anbieter hinweg.
  • Rohe und gefilterte Crawls, wie Common Crawl, C4, RefinedWeb und RedPajama-Data-v2, liefern große Mengen an Pre-Training-Tokens.
  • Mehrsprachige Korpora, wie FineWeb-2, OSCAR 23.01 und HPLT v2, erweitern die Abdeckung über Englisch hinaus, das in den meisten Crawl-basierten Datensätzen überrepräsentiert ist.
  • Offen lizenzierte Korpora, wie Common Corpus und Common Pile, beschränken die Quellen auf gemeinfreie oder freizügig lizenzierte Seiten und tauschen Skalierung gegen eine nachvollziehbare Herkunftsgeschichte.
  • Strukturierte Webdaten, wie Web Data Commons und seine schema.org-Tabellenkorpora, extrahieren das maschinenlesbare Markup, das Websites einbetten, wodurch das HTML-Parsing für Produkt-, Ereignis- und Organisationsentitäten entfällt.
  • Web-Agent-Benchmarks, wie Online-Mind2Web, WebArena und BrowseComp, testen, ob Modelle Live-Websites navigieren können.
  • Vertikale Webdatensätze, wie Amazon Reviews 2023, das Yelp Open Dataset und GDELT, decken Rezensionen, lokale Unternehmen und Nachrichten ab und werden häufig für Empfehlungs- und Sentimentanalysen verwendet.

Domänenspezifische und Branchendatensätze

  • MIMIC-IV und PhysioNet unterstützen medizinische Forschung und Gesundheitswesen-Analysen.
  • Waymo Open Dataset und KITTI werden für Computer Vision in autonomen Fahrzeugen verwendet.
  • Robotik- und Embodied-KI-Datensätze, wie AGIBOT WORLD 2026, EgoDex und EgoVerse, bieten First-Person-Video (egozentrisch) und Manipulationsdaten zum Trainieren von Physical-KI- und humanoiden Systemen.
  • Multimodale medizinische Benchmarks, wie GMAI-MMBench und OmniMedVQA, evaluieren klinisches visuelles Question Answering über viele Bildgebungsmodalitäten hinweg.
  • World Bank Open Data und OECD-Datensätze liefern Wirtschafts- und Finanzindikatoren.
  • Common Voice und Free Music Archive unterstützen die Audio- und Sprachmodellentwicklung.
Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Was sind ML-Datensätze?

Ein Machine-Learning-Datensatz ist eine strukturierte Datensammlung, die speziell zum Trainieren von Machine-Learning-Modellen gesammelt und aufbereitet wird. Diese ML-Datensätze dienen als Beispiele, die dem Modell helfen, Muster zu lernen, aussagekräftige Merkmale zu extrahieren und Vorhersagen auf ungesehenen Daten zu treffen.

Je nach Aufgabe kann der Machine-Learning-Datensatz aus verschiedenen Datentypen bestehen, darunter:

  • Textdaten: Werden in Anwendungen wie Natural Language Processing, Sentimentanalyse und maschineller Übersetzung verwendet.
  • Bilddaten: Werden hauptsächlich in Computer Vision und Convolutional Neural Networks für Aufgaben wie die Erkennung handschriftlicher Ziffern oder die Erkennung von Stahlplattenfehlern verwendet.
  • Audiodaten: Für Spracherkennung oder Aufgaben zur Klangklassifizierung.
  • Videodaten: Für Objektverfolgung oder Echtzeit-Videoanalyse.
  • Numerische Daten: Werden in Regressions- oder Klassifikationsaufgaben verwendet, manchmal aus Massenspektrometriedaten oder Zeitstempelprotokollen stammend.

Die meisten Machine-Learning-Projekte beginnen mit Rohdaten, die anschließend gelabelt oder annotiert werden. Diese Kennzeichnung hilft dem Machine-Learning-System, das erwartete Ergebnis für Klassifizierungs-, Regressions- oder andere Vorhersageaufgaben zu verstehen.

Ein guter Datensatz, der häufig aus offenen, öffentlichen oder spezialisierten Machine-Learning-Repositories stammt, kann die Modellleistung erheblich verbessern.

Warum Datensätze für Machine Learning aufbereiten?

Die Aufbereitung und Auswahl hochwertiger Datensätze ist einer der entscheidendsten Schritte bei der Entwicklung von KI-Systemen. Viele Unternehmen erkennen, dass die Datenaufbereitung über Erfolg oder Misserfolg ihrer Machine-Learning-Projekte entscheiden kann.

Die Qualität der Trainingsdaten beeinflusst, wie gut Modelle auf reale Szenarien generalisieren und wie genau sie bestimmte Probleme bewältigen. Ein Machine-Learning-Datensatz hat drei Hauptzwecke:

Zum Trainieren des Modells

Der Trainingssatz bringt der Maschine die Beziehungen und Muster in den Daten bei. Dazu werden annotierte oder gelabelte Daten eingespeist, sodass das Modell seine Parameter anpassen und seine Vorhersagen bei ähnlichen Eingaben verbessern kann.

Zum Messen der Modellgenauigkeit

Nach dem Training wird der Testdatensatz (oder das Testset) verwendet, um die Leistung des Modells zu bewerten. Dies hilft festzustellen, wie gut das Modell mit ungesehenen Daten umgeht und ob es auf den Trainingssatz überangepasst ist (Overfitting) oder aussagekräftige Muster lernt.

Zur Verbesserung des Modells nach dem Deployment

Nach dem Deployment verfeinern Teams Machine-Learning-Modelle häufig mithilfe zusätzlicher erfasster Daten, damit sie sich an neue Bedingungen oder Klassen anpassen können. Validierungssets helfen außerdem beim Tunen und verhindern Overfitting.

Diese Forschung zitieren

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Cem Dilmegani and Sıla Ermut (2026) - "+100 Datensätze für ML & KI-Modelle". Online veröffentlicht auf AIMultiple.com. Abgerufen am 2. September 2026, von: https://aimultiple.com/datasets-for-ml [Online-Ressource]

Dilmegani, C., & Ermut, S. (2026, 2. September). +100 Datensätze für ML & KI-Modelle. AIMultiple. https://aimultiple.com/datasets-for-ml

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Ermut, Sıla},
  title  = {{+100 Datensätze für ML & KI-Modelle}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/datasets-for-ml}},
  note   = {AIMultiple. Abgerufen am 2. September 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 118 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die 6 CSV-Dateien enthält.

Zuletzt aktualisiert: 17. August 2026
Herunterladen

Möchten Sie die granularen Daten dahinter? Premium beitreten

Änderungsprotokoll

12 Aktualisierungen
  1. 2026

    Abschnitt Web-Datensätze zu Scraping-, Crawl- und Browsing-Benchmark-Anbietern hinzugefügt

  2. Abschnitt "Arten von ML-Datensätzen" zu Trainings-, Validierungs- und Testteilmengen entfernt.

  3. 2025

    Der Abschnitt „Datensatzkategorien“ wurde durch neue Kategorien ersetzt: Große Sprachmodelle (LLMs) & Agenten-KI, KI-Codierung und Softwareentwicklung, Cybersicherheit und Datensicherheit, Daten, synthetische Daten und Datenschutz sowie Domänenspezifische und Industriedatensätze.

  4. Die URL für Abbildung 1 wurde aktualisiert.

  5. Die Einleitung wurde um eine Liste von Datensatztypen und deren Beschreibungen erweitert.

  6. 2024

    Ein Frage-Antwort-Paar wurde dem FAQ-Bereich hinzugefügt.

  7. Added the "FAQs" section.

  8. 2023

    Eine Tabelle mit ML-Datensätzen und Datenquellen wurde der Einleitung hinzugefügt.

  9. Generative KI wurde zum Abschnitt „Woher können ML-Datensätze bezogen werden?“ hinzugefügt.

  10. Ein neuer Anbieter, Clickworker, wurde der Liste der ML-Datensatzanbieter hinzugefügt.

  11. Der gesponserte Abschnitt wurde aus dem Abschnitt „Was ist der Zweck von KI/ML-Datensätzen?“ entfernt.

  12. Clickworker als gesponsertes Produkt hinzugefügt.

Cem Dilmegani
Cem Dilmegani
Leitender Analyst
Cem ist seit 2017 leitender Analyst bei AIMultiple.

Cems Arbeit bei AIMultiple wurde von führenden globalen Publikationen wie Business Insider, Forbes, Morning Brew und Washington Post, von globalen Unternehmen wie Deloitte und HPE, von NGOs wie dem World Economic Forum und von supranationalen Organisationen wie der European Commission zitiert. [1], [2], [3], [4], [5]

Im Laufe seiner Karriere war Cem als Tech-Berater, Tech-Einkäufer und Tech-Unternehmer tätig. Er beriet Unternehmen bei ihren Technologieentscheidungen bei McKinsey & Company und Altman Solon über mehr als ein Jahrzehnt. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung.

Er leitete Technologiestrategie und -beschaffung eines Telekommunikationsunternehmens und berichtete dabei direkt an den CEO. Außerdem verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von 0 einen siebenstelligen jährlich wiederkehrenden Umsatz und eine neunstellige Bewertung erreichte. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider aufgegriffen.

Cem spricht regelmäßig auf internationalen Technologiekonferenzen. Er absolvierte die Bogazici University als Computeringenieur und hat einen MBA von der Columbia Business School.
Vollständiges Profil anzeigen
Recherchiert von
Sıla Ermut
Sıla Ermut
Branchenanalystin
Sıla Ermut ist Branchenanalystin bei AIMultiple und befasst sich mit KI-Modellen, KI-Infrastruktur, KI-Governance und KI-Anwendungen für Unternehmen. Ihre Forschung konzentriert sich hauptsächlich auf den Einsatz von KI in Marketing, Gesundheitswesen, Lieferketten und Nachhaltigkeit.
Zuvor arbeitete sie als Personalvermittlerin in Projektmanagement- und Beratungsunternehmen. Sıla hat einen Master of Science in Sozialpsychologie und einen Bachelor of Arts in Internationalen Beziehungen.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450