+100 jeux de données pour les modèles de ML et d'IA
Les données sont nécessaires pour exploiter ou créer des solutions d'IA générative ou d'IA conversationnelle. Vous pouvez utiliser des jeux de données existants disponibles sur le marché ou faire appel à un service de collecte de données.
Nous avons identifié plus de 100 jeux de données pour entraîner et évaluer des modèles d'apprentissage automatique et d'IA.
Large Language Models (LLMs) et jeux de données d'IA agentique
Jeu de données / Benchmark | Description | Gratuit / Payant | Dernière mise à jour |
|---|---|---|---|
MMLU (Massive Multitask Language Understanding) | Benchmark de raisonnement général et de connaissances académiques | Gratuit | En cours |
HumanEval+ | Benchmark de codage Python pour le code génératif | Gratuit | En cours |
FineWeb | Jeu de données Hugging Face pour le pré-entraînement des LLMs | Gratuit | En cours |
FineWeb-Edu | Sous-ensemble éducatif de FineWeb | Gratuit | En cours |
BFCL (Berkeley Function Calling Leaderboard) | Norme mise à jour en continu pour l'évaluation des appels de fonctions/d'outils | Gratuit | En cours |
AIMultiple UI Grounding Benchmark | Benchmark de grounding UI pour les modèles d'utilisation informatique et vision-langage | Gratuit | 2026 |
Superior-Reasoning-SFT | Jeu de données de raisonnement Long-CoT d'Alibaba-Apsara | Gratuit | 2026 |
Terminal-Bench 2.0 | 89 tâches de terminal réalistes (manipulation de fichiers, administration système, débogage, réimplémentation de code de recherche) | Gratuit | 2026 |
MMMU (Massive Multi-disciplinary Multimodal Understanding) | Benchmark multimodal (raisonnement image + texte) | Gratuit | 2025 |
Humanity’s Last Exam (HLE) | Benchmark multimodal pour tester les LLMs de pointe au-delà de MMLU | Gratuit | 2025 |
- Large language model benchmarks tels que MMLU et GPQA mesurent le raisonnement général et scientifique.
- multimodaux jeux de données, tels que LAION-5B, combinent texte et images pour entraîner des modèles capables de gérer les deux formats.
- Évaluations de pointe, telles que Humanity’s Last Exam, ARC-AGI-2 et IA Idea Bench, testent la créativité des modèles, l'exactitude factuelle et l'adaptabilité à des prompts complexes.
- Agentiques et benchmarks d'utilisation d'outils, tels que GAIA, BFCL (Berkeley Function Calling Leaderboard) et ComplexFuncBench, évaluent le raisonnement en plusieurs étapes, l'appel d'outils et l'achèvement des tâches.
- Benchmarks de grounding UI, tels que le AIMultiple UI Grounding Benchmark, évaluent si les modèles d'utilisation informatique peuvent identifier le bon élément d'interface et prédire son emplacement à partir d'une instruction en langage naturel. Voir le benchmark des agents d'utilisation informatique pour la méthodologie et les résultats des modèles.
- Corpus de pré-entraînement, tels que FineWeb, Nemotron-CC et Essential-Web v1.0, fournissent des collections de tokens à grande échelle pour l'entraînement des modèles de base.
Jeux de données de codage IA et d'ingénierie logicielle
- Les jeux de données tels que The Heap et MADE-WIC contiennent du code multilingue et annoté pour évaluer l'exactitude du codage et la dette technique.
- HumanEval et APPS fournissent des problèmes de codage avec des solutions de référence pour évaluer la qualité de la génération de code.
- Benchmarks agentiques et au niveau des dépôts, tels que SWE-Bench Pro, SWE-Bench Multilingual, SWE-Lancer et Terminal-Bench 2.0, évaluent les modèles sur de vraies issues GitHub et des tâches logicielles de bout en bout plutôt que sur des fonctions isolées.
- Les jeux de données propriétaires, tels que ceux d'Amazon CodeWhisperer et de GitHub Copilot, soutiennent les assistants de codage commerciaux.
Les benchmarks plus anciens comme HumanEval et SWE-bench Verified sont désormais largement considérés comme contaminés ou saturés ; par conséquent, des successeurs résistants à la contamination tels que SWE-Bench Pro ont émergé.
Cybersécurité et jeux de données de sécurité des données
- CICIDS2017 et TON_IoT sont largement utilisés pour entraîner des systèmes de détection d'intrusion et d'anomalies.
- Les jeux de données EMBER et VirusShare contiennent des données de malwares étiquetées pour la classification basée sur des modèles.
- La base de données CVE-MITRE fournit des informations structurées sur les vulnérabilités logicielles connues.
Données, données synthétiques et jeux de données de confidentialité
- Les plateformes telles que Appen, Amazon Mechanical Turk, et Telus International fournissent des jeux de données générés par l'homme pour l'apprentissage supervisé.
- Hazy et Gretel.ai génèrent des données structurées synthétiques pour un usage en entreprise.
- Les dépôts ouverts comme Kaggle Datasets et Google Dataset Search fournissent des données accessibles au public dans plusieurs domaines.
Jeux de données Web
- Fournisseurs commerciaux de données web, tels que Bright Data et Coresignal, vendent des jeux de données pré-collectés et personnalisés couvrant le e-commerce, les réseaux sociaux, l'immobilier et les offres d'emploi. Des places de marché comme Datarade les agrègent entre fournisseurs.
- Crawls bruts et filtrés, tels que Common Crawl, C4, RefinedWeb et RedPajama-Data-v2, fournissent des tokens de pré-entraînement en masse.
- Corpus multilingues, tels que FineWeb-2, OSCAR 23.01 et HPLT v2, étendent la couverture au-delà de l'anglais, que la plupart des jeux de données issus de crawls surreprésentent.
- Corpus sous licence ouverte, tels que Common Corpus et Common Pile, limitent les sources aux pages du domaine public ou sous licence permissive, sacrifiant l'échelle au profit d'une traçabilité défendable.
- Données web structurées, telles que Web Data Commons et ses corpus de tables schema.org, extraient le balisage lisible par machine intégré par les sites web, ce qui évite l'analyse HTML pour les entités de produits, d'événements et d'organisations.
- Benchmarks d'agents web, tels que Online-Mind2Web, WebArena et BrowseComp, testent si les modèles peuvent naviguer sur des sites en direct.
- Jeux de données web verticaux, tels que Amazon Reviews 2023, le Yelp Open Dataset et GDELT, couvrent les avis, les commerces locaux et l'actualité, et sont couramment utilisés pour la recommandation et l'analyse de sentiment.
Jeux de données spécifiques au domaine et sectoriels
- MIMIC-IV et PhysioNet soutiennent la recherche médicale et l'analytique des soins de santé.
- Waymo Open Dataset et KITTI sont utilisés pour la vision par ordinateur dans les véhicules autonomes.
- Jeux de données de robotique et d'IA incarnée, tels que AGIBOT WORLD 2026, EgoDex et EgoVerse, fournissent des données vidéo égocentriques et de manipulation pour l'entraînement de systèmes d'IA physique et humanoïdes.
- Benchmarks médicaux multimodaux, tels que GMAI-MMBench et OmniMedVQA, évaluent la réponse visuelle à des questions cliniques dans de nombreuses modalités d'imagerie.
- World Bank Open Data et les jeux de données de l'OCDE fournissent des indicateurs économiques et financiers.
- Common Voice et Free Music Archive soutiennent le développement de modèles audio et de langage.
Que sont les jeux de données de ML ?
Un jeu de données d'apprentissage automatique est une collecte de données structurée spécifiquement rassemblée et préparée pour entraîner des modèles d'apprentissage automatique. Ces jeux de données pour le ML agissent comme des exemples qui aident le modèle à apprendre des motifs, à extraire des caractéristiques significatives et à faire des prédictions sur des données inédites.
Selon la tâche, le jeu de données d'apprentissage automatique peut se composer de divers types de données, notamment :
- Données textuelles : Utilisées dans des applications telles que le traitement automatique du langage naturel, l'analyse de sentiment et la traduction automatique.
- Données d'image : Principalement utilisées en vision par ordinateur et dans les réseaux de neurones convolutifs pour des tâches comme la reconnaissance de chiffres manuscrits ou la détection de défauts sur des plaques d'acier.
- Données audio : Pour la reconnaissance vocale ou les tâches de classification sonore.
- Données vidéo : Pour le suivi d'objets ou l'analyse vidéo en temps réel.
- Données numériques : Utilisées dans des tâches de régression ou de classification, provenant parfois de données de spectrométrie de masse ou de journaux d'horodatage.
La plupart des projets d'apprentissage automatique commencent par des données brutes, qui sont ensuite étiquetées ou annotées. Cet étiquetage aide le système d'apprentissage automatique à comprendre le résultat attendu pour des tâches de classification, de régression ou d'autres tâches prédictives.
Un bon jeu de données, souvent issu de dépôts d'apprentissage automatique ouverts, publics ou spécialisés, peut considérablement améliorer les performances du modèle.
Pourquoi préparer des jeux de données pour l'apprentissage automatique ?
La préparation et le choix de jeux de données de haute qualité est l'une des étapes les plus cruciales du développement de systèmes d'intelligence artificielle. De nombreuses organisations reconnaissent que la préparation des données peut faire ou défaire leurs projets d'apprentissage automatique.
La qualité des données d'entraînement affecte la capacité des modèles à généraliser à des scénarios réels et à traiter avec précision des problèmes spécifiques. Un jeu de données d'apprentissage automatique a trois objectifs clés :
Entraîner le modèle
L'ensemble d'entraînement enseigne à la machine les relations et les motifs présents dans les données. Cela consiste à fournir des données annotées ou étiquetées, permettant au modèle d'ajuster ses paramètres et d'améliorer ses prédictions sur des entrées similaires.
Mesurer l'exactitude du modèle
Après l'entraînement, le jeu de données de test (ou ensemble de test) est utilisé pour évaluer la performance du modèle. Cela aide à déterminer dans quelle mesure le modèle gère des données inédites, et s'il fait du surapprentissage sur l'ensemble d'entraînement ou s'il apprend des motifs significatifs.
Améliorer le modèle après le déploiement
Une fois déployé, les équipes affinent souvent les modèles d'apprentissage automatique à l'aide de données collectées supplémentaires, les aidant à s'adapter à de nouvelles conditions ou classes. Les ensembles de validation aident également à l'ajustement et à la prévention du surapprentissage.
Citer cette recherche
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Ermut, Sıla},
title = {{+100 jeux de données pour les modèles de ML et d'IA}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/datasets-for-ml}},
note = {AIMultiple. Consulté le 2 Septembre 2026}
}Résultats et horodatages de 118 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant 6 fichiers CSV.
Journal des modifications
12 mises à jour- 2026
Ajout d'une section sur les jeux de données web couvrant le scraping, le crawl et les benchmarks de navigation
Supprimé la section « Types de jeux de données ML » couvrant les sous-ensembles d'entraînement, de validation et de test.
- 2025
La section « Catégories d'ensembles de données » a été remplacée par de nouvelles catégories : Modèles de langage étendus (LLM) et IA agentique, Codage IA et ingénierie logicielle, Cybersécurité et sécurité des données, Données, données synthétiques et confidentialité, et Ensembles de données spécifiques au domaine et à l'industrie.
L'URL de la Figure 1 a été mise à jour.
L'introduction a été enrichie d'une liste des types de jeux de données et de leurs descriptions.
- 2024
Ajout d'une question et d'une réponse à la section FAQ.
Added the "FAQs" section.
- 2023
Ajout d'un tableau des ensembles de données ML et des sources de données à l'introduction.
Ajout de l'IA générative à la section « Où les ensembles de données ML peuvent-ils être obtenus ? ».
Un nouveau fournisseur, Clickworker, a été ajouté à la liste des fournisseurs de jeux de données ML.
La section sponsorisée a été supprimée de la section "Quel est le but des ensembles de données IA/ML ?".
Ajout de Clickworker en tant que produit sponsorisé.
Le travail de Cem chez AIMultiple a été cité par des publications mondiales de premier plan, notamment Business Insider, Forbes, Morning Brew et Washington Post, par des entreprises mondiales comme Deloitte et HPE, par des ONG comme World Economic Forum et par des organisations supranationales comme European Commission. [1], [2], [3], [4], [5]
Tout au long de sa carrière, Cem a été consultant en technologies, acheteur de technologies et entrepreneur technologique. Il a conseillé des entreprises sur leurs décisions technologiques chez McKinsey & Company et Altman Solon pendant plus de dix ans. Il a également publié un rapport McKinsey sur la digitalisation.
Il a dirigé la stratégie technologique et les achats d'un opérateur télécom, sous la responsabilité du PDG. Il a également dirigé la croissance commerciale de l'entreprise de technologie profonde Hypatos, qui a atteint un revenu récurrent annuel à 7 chiffres et une valorisation à 9 chiffres, passant de 0 à ce résultat en deux ans. Le travail de Cem chez Hypatos a été couvert par des publications technologiques de premier plan comme TechCrunch et Business Insider.
Cem intervient régulièrement lors de conférences technologiques internationales. Il est diplômé de Bogazici University en tant qu'ingénieur informatique et titulaire d'un MBA de la Columbia Business School.
Elle a précédemment travaillé comme recruteuse dans des cabinets de gestion de projet et de conseil. Sıla est titulaire d’un master en psychologie sociale et d’une licence en relations internationales.
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.