Los datos son necesarios para aprovechar o crear soluciones de IA generativa o IA conversacional. Puede usar datasets existentes disponibles en el mercado o contratar un servicio de recopilación de datos.
Identificamos más de 100 datasets para entrenar y evaluar modelos de machine learning e IA.
Large Language Models (LLMs) y datasets de IA agéntica
Dataset / Benchmark | Descripción | Gratis / De pago | Última actualización |
|---|---|---|---|
MMLU (Massive Multitask Language Understanding) | Benchmark para razonamiento general y conocimiento académico | Gratis | En curso |
HumanEval+ | Benchmark de codificación en Python para código generativo | Gratis | En curso |
FineWeb | Dataset de Hugging Face para el preentrenamiento de LLM | Gratis | En curso |
FineWeb-Edu | Subconjunto educativo de FineWeb | Gratis | En curso |
BFCL (Berkeley Function Calling Leaderboard) | Estándar actualizado continuamente para evaluar la llamada de herramientas/funciones | Gratis | En curso |
AIMultiple UI Grounding Benchmark | Benchmark de grounding de UI para modelos de uso de computadora y de lenguaje-visión | Gratis | 2026 |
Superior-Reasoning-SFT | Dataset de razonamiento Long-CoT de Alibaba-Apsara | Gratis | 2026 |
Terminal-Bench 2.0 | 89 tareas realistas de terminal (manipulación de archivos, administración de sistemas, depuración, reimplementación de código de investigación) | Gratis | 2026 |
MMMU (Massive Multi-disciplinary Multimodal Understanding) | Benchmark multimodal (razonamiento con imágenes y texto) | Gratis | 2025 |
Humanity’s Last Exam (HLE) | Benchmark multimodal para evaluar los LLMs de vanguardia más allá de MMLU | Gratis | 2025 |
- Benchmarks de modelos de lenguaje de gran tamaño como MMLU y GPQA miden el razonamiento general y científico.
- Datasets multimodales, como LAION-5B, combinan texto e imágenes para entrenar modelos capaces de manejar ambos formatos.
- Evaluaciones de vanguardia, como Humanity’s Last Exam, ARC-AGI-2 y IA Idea Bench, ponen a prueba la creatividad, la precisión factual y la adaptabilidad de los modelos a prompts complejos.
- Benchmarks agénticos y de uso de herramientas, como GAIA, BFCL (Berkeley Function Calling Leaderboard) y ComplexFuncBench, evalúan el razonamiento de varios pasos, la llamada de herramientas y la finalización de tareas.
- Benchmarks de grounding de UI, como el AIMultiple UI Grounding Benchmark, evalúan si los modelos de uso de computadora pueden identificar el elemento de interfaz correcto y predecir su ubicación a partir de una instrucción en lenguaje natural. Consulte el benchmark de agentes de uso de computadora para conocer la metodología y los resultados de los modelos.
- Corpus de preentrenamiento, como FineWeb, Nemotron-CC y Essential-Web v1.0, proporcionan colecciones de tokens a gran escala para entrenar modelos base.
Datasets de codificación con IA e ingeniería de software
- Datasets como The Heap y MADE-WIC contienen código multilingüe y anotado para evaluar la precisión de la codificación y la deuda técnica.
- HumanEval y APPS proporcionan problemas de codificación con soluciones de referencia para evaluar la calidad de la generación de código.
- Benchmarks de nivel de repositorio y agénticos, como SWE-Bench Pro, SWE-Bench Multilingual, SWE-Lancer y Terminal-Bench 2.0, evalúan los modelos en incidencias reales de GitHub y tareas de software de extremo a extremo en lugar de funciones aisladas.
- Los datasets propietarios, como los de Amazon CodeWhisperer y GitHub Copilot, respaldan los asistentes de codificación comerciales.
Los benchmarks más antiguos, como HumanEval y SWE-bench Verified, se consideran hoy ampliamente contaminados o saturados; como resultado, han surgido sucesores resistentes a la contaminación, como SWE-Bench Pro.
Ciberseguridad y datasets de seguridad de datos
- CICIDS2017 y TON_IoT se utilizan ampliamente para entrenar sistemas de detección de intrusiones y anomalías.
- Los datasets EMBER y VirusShare contienen datos de malware etiquetados para la clasificación basada en modelos.
- La base de datos CVE-MITRE proporciona información estructurada sobre vulnerabilidades de software conocidas.
Datos, datos sintéticos y datasets de privacidad
- Plataformas como Appen, Amazon Mechanical Turk, y Telus International suministran datasets generados por humanos para el aprendizaje supervisado.
- Hazy y Gretel.ai generan datos estructurados sintéticos para uso empresarial.
- Los repositorios abiertos como Kaggle Datasets y Google Dataset Search proporcionan datos de acceso público en múltiples dominios.
Datasets de datos web
- Proveedores comerciales de datos web, como Bright Data y Coresignal, venden datasets pre-recopilados y personalizados que cubren fuentes de comercio electrónico, redes sociales, inmobiliario y ofertas de empleo. Mercados como Datarade los agregan entre distintos proveedores.
- Rastreos sin procesar y filtrados, como Common Crawl, C4, RefinedWeb y RedPajama-Data-v2, suministran tokens de preentrenamiento a granel.
- Corpus multilingües, como FineWeb-2, OSCAR 23.01 y HPLT v2, amplían la cobertura más allá del inglés, que la mayoría de los datasets derivados de rastreos sobrerrepresentan.
- Corpus con licencia abierta, como Common Corpus y Common Pile, restringen las fuentes a páginas de dominio público o con licencias permisivas, sacrificando escala por una procedencia defendible.
- Datos web estructurados, como Web Data Commons y sus corpus de tablas de schema.org, extraen el marcado legible por máquinas que los sitios web incorporan, lo que evita el análisis de HTML para entidades de productos, eventos y organizaciones.
- Benchmarks de agentes web, como Online-Mind2Web, WebArena y BrowseComp, evalúan si los modelos pueden navegar por sitios en vivo.
- Datasets web verticales, como Amazon Reviews 2023, el Yelp Open Dataset y GDELT, cubren reseñas, negocios locales y noticias, y se utilizan habitualmente para trabajos de recomendación y análisis de sentimiento.
Datasets específicos de dominio y de la industria
- MIMIC-IV y PhysioNet respaldan la investigación médica y el análisis de atención sanitaria.
- Waymo Open Dataset y KITTI se utilizan para visión artificial en vehículos autónomos.
- Datasets de robótica e IA corporeizada, como AGIBOT WORLD 2026, EgoDex y EgoVerse, proporcionan video en primera persona (egocéntrico) y datos de manipulación para entrenar sistemas de IA física y humanoides.
- Benchmarks médicos multimodales, como GMAI-MMBench y OmniMedVQA, evalúan la respuesta visual a preguntas clínicas en muchas modalidades de imagen.
- World Bank Open Data y datasets de OECD proporcionan indicadores económicos y financieros.
- Common Voice y Free Music Archive respaldan el desarrollo de modelos de audio y lenguaje.
¿Qué son los datasets de ML?
Un dataset de machine learning es una colección de datos estructurados recopilada y preparada específicamente para entrenar modelos de machine learning. Estos datasets para ML actúan como ejemplos que ayudan al modelo a aprender patrones, extraer características significativas y hacer predicciones sobre datos no vistos.
Según la tarea, el dataset de machine learning puede consistir en varios tipos de datos, entre ellos:
- Datos de texto: se utilizan en aplicaciones como el procesamiento del lenguaje natural, el análisis de sentimiento y la traducción automática.
- Datos de imagen: se utilizan principalmente en visión artificial y redes neuronales convolucionales para tareas como el reconocimiento de dígitos manuscritos o la detección de fallos en placas de acero.
- Datos de audio: para tareas de reconocimiento de voz o clasificación de sonidos.
- Datos de video: para seguimiento de objetos o análisis de video en tiempo real.
- Datos numéricos: se utilizan en tareas de regresión o clasificación, a veces procedentes de datos de espectrometría de masas o registros de marcas de tiempo.
La mayoría de los proyectos de machine learning comienzan con datos sin procesar, que luego se etiquetan o anotan. Este etiquetado ayuda al sistema de machine learning a comprender el resultado esperado para tareas de clasificación, regresión u otras tareas predictivas.
Un buen dataset, a menudo procedente de repositorios de machine learning abiertos, públicos o especializados, puede mejorar significativamente el rendimiento del modelo.
¿Por qué preparar datasets para machine learning?
Preparar y elegir datasets de alta calidad es uno de los pasos más cruciales en el desarrollo de sistemas de inteligencia artificial. Muchas organizaciones reconocen que la preparación de datos puede determinar el éxito o el fracaso de sus proyectos de machine learning.
La calidad de los datos de entrenamiento afecta a la capacidad de los modelos para generalizar a escenarios del mundo real y a la precisión con la que manejan problemas específicos. Hay tres propósitos clave de un dataset de machine learning:
Para entrenar el modelo
El conjunto de entrenamiento enseña a la máquina las relaciones y patrones presentes en los datos. Esto implica alimentar datos anotados o etiquetados, lo que permite al modelo ajustar sus parámetros y mejorar sus predicciones en entradas similares.
Para medir la precisión del modelo
Después del entrenamiento, el dataset de prueba (o conjunto de prueba) se utiliza para evaluar el rendimiento del modelo. Esto ayuda a determinar qué tan bien maneja el modelo los datos no vistos y si está sobreajustando al conjunto de entrenamiento o aprendiendo patrones significativos.
Para mejorar el modelo después del despliegue
Una vez desplegados, los equipos suelen refinar los modelos de machine learning con datos adicionales recopilados, lo que les ayuda a adaptarse a nuevas condiciones o clases. Los conjuntos de validación también ayudan a ajustar y prevenir el sobreajuste.
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Ermut, Sıla},
title = {{+100 Datasets para modelos de ML e IA}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/datasets-for-ml}},
note = {AIMultiple. Recuperado el 2 de Septiembre de 2026}
}Resultados y marcas de tiempo de 118 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene 6 archivos CSV.
Registro de cambios
10 actualizaciones- 2025
Se reemplazó la sección "Categorías de conjuntos de datos" con nuevas categorías: Modelos de lenguaje grandes (LLM) e IA agéntica, Codificación de IA e ingeniería de software, Ciberseguridad y seguridad de datos, Datos, datos sintéticos y privacidad, y Conjuntos de datos específicos de dominio e industria.
Se actualizó la URL de la Figura 1.
Se amplió la introducción con una lista de tipos de conjuntos de datos y sus descripciones.
- 2024
Se añadió una pregunta y respuesta a la sección de Preguntas Frecuentes.
Added the "FAQs" section.
- 2023
Se añadió una tabla de conjuntos de datos de ML y fuentes de datos a la introducción.
Se añadió IA generativa a la sección "¿De dónde se pueden obtener conjuntos de datos de ML?".
Se añadió un nuevo proveedor, Clickworker, a la lista de proveedores de conjuntos de datos de ML.
Se eliminó la sección patrocinada de la sección "¿Cuál es el propósito de los conjuntos de datos de IA/ML?".
Se añadió Clickworker como producto patrocinado.
El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]
A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.
Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.
Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Anteriormente trabajó como reclutadora en empresas de gestión de proyectos y consultoría. Sıla tiene un máster en Psicología Social y una licenciatura en Relaciones Internacionales.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.