Dados são necessários para aproveitar ou criar soluções de IA generativa ou IA conversacional. Você pode usar conjuntos de dados existentes disponíveis no mercado ou contratar um serviço de coleta de dados.
Identificamos mais de 100 conjuntos de dados para treinar e avaliar modelos de aprendizado de máquina e IA.
Conjuntos de dados de grandes modelos de linguagem (LLMs) e IA agêntica
Conjunto de dados / Benchmark | Descrição | Gratuito / Pago | Última atualização |
|---|---|---|---|
MMLU (Massive Multitask Language Understanding) | Benchmark para raciocínio geral e conhecimento acadêmico | Gratuito | Contínuo |
HumanEval+ | Benchmark de programação Python para código generativo | Gratuito | Contínuo |
FineWeb | Conjunto de dados do Hugging Face para pré-treinamento de LLM | Gratuito | Contínuo |
FineWeb-Edu | Subconjunto educacional do FineWeb | Gratuito | Contínuo |
BFCL (Berkeley Function Calling Leaderboard) | Padrão continuamente atualizado para avaliar chamadas de ferramentas/funções | Gratuito | Contínuo |
AIMultiple UI Grounding Benchmark | Benchmark de UI grounding para modelos de uso de computador e de visão-linguagem | Gratuito | 2026 |
Superior-Reasoning-SFT | Conjunto de dados de raciocínio Long-CoT da Alibaba-Apsara | Gratuito | 2026 |
Terminal-Bench 2.0 | 89 tarefas realistas de terminal (manipulação de arquivos, administração de sistemas, depuração, reimplementação de código de pesquisa) | Gratuito | 2026 |
MMMU (Massive Multi-disciplinary Multimodal Understanding) | Benchmark multimodal (raciocínio de imagem + texto) | Gratuito | 2025 |
Humanity’s Last Exam (HLE) | Benchmark multimodal para testar LLMs de fronteira além do MMLU | Gratuito | 2025 |
- Benchmarks de grandes modelos de linguagem como MMLU e GPQA medem o raciocínio geral e científico.
- Conjuntos de dados multimodais, como LAION-5B, combinam texto e imagens para treinar modelos que conseguem lidar com ambos os formatos.
- Avaliações de fronteira, como Humanity’s Last Exam, ARC-AGI-2 e IA Idea Bench, testam a criatividade, a precisão factual e a adaptabilidade dos modelos a prompts complexos.
- Agênticos e benchmarks de uso de ferramentas, como GAIA, BFCL (Berkeley Function Calling Leaderboard) e ComplexFuncBench, avaliam raciocínio em várias etapas, chamada de ferramentas e conclusão de tarefas.
- Benchmarks de UI grounding, como o AIMultiple UI Grounding Benchmark, avaliam se modelos de uso de computador conseguem identificar o elemento de interface correto e prever sua localização a partir de uma instrução em linguagem natural. Veja o benchmark de agentes de uso de computador para metodologia e resultados de modelos.
- Corpora de pré-treinamento, como FineWeb, Nemotron-CC e Essential-Web v1.0, fornecem coleções de tokens em larga escala para treinar modelos de base.
Conjuntos de dados de codificação de IA e engenharia de software
- Conjuntos de dados como The Heap e MADE-WIC contêm código multilíngue e anotado para avaliar a precisão da codificação e a dívida técnica.
- HumanEval e APPS fornecem problemas de codificação com soluções de referência para avaliar a qualidade da geração de código.
- Benchmarks agênticos e em nível de repositório, como SWE-Bench Pro, SWE-Bench Multilingual, SWE-Lancer e Terminal-Bench 2.0, avaliam modelos em issues reais do GitHub e tarefas de software de ponta a ponta, em vez de funções isoladas.
- Conjuntos de dados proprietários, como os da Amazon CodeWhisperer e do GitHub Copilot, apoiam assistentes comerciais de codificação.
Benchmarks mais antigos, como HumanEval e SWE-bench Verified, agora são amplamente considerados contaminados ou saturados; como resultado, sucessores resistentes à contaminação, como o SWE-Bench Pro, surgiram.
Cibersegurança e conjuntos de dados de segurança de dados
- CICIDS2017 e TON_IoT são amplamente usados para treinar sistemas de detecção de intrusão e anomalias.
- Os conjuntos de dados EMBER e VirusShare contêm dados de malware rotulados para classificação baseada em modelos.
- O banco de dados CVE-MITRE fornece informações estruturadas sobre vulnerabilidades de software conhecidas.
Dados, dados sintéticos e conjuntos de dados de privacidade
- Plataformas como Appen, Amazon Mechanical Turk, e Telus International fornecem conjuntos de dados gerados por humanos para aprendizado supervisionado.
- Hazy e Gretel.ai geram dados estruturados sintéticos para uso empresarial.
- Repositórios abertos como Kaggle Datasets e Google Dataset Search fornecem dados publicamente acessíveis em vários domínios.
Conjuntos de dados de dados da web
- Fornecedores comerciais de dados web, como Bright Data e Coresignal, vendem conjuntos de dados pré-coletados e personalizados cobrindo fontes de e-commerce, redes sociais, imóveis e vagas de emprego. Mercados como Datarade agregam esses dados entre fornecedores.
- Rastreamentos brutos e filtrados, como Common Crawl, C4, RefinedWeb e RedPajama-Data-v2, fornecem tokens de pré-treinamento em massa.
- Corpora multilíngues, como FineWeb-2, OSCAR 23.01 e HPLT v2, ampliam a cobertura além do inglês, que a maioria dos conjuntos de dados derivados de rastreamento super-representa.
- Corpora de licença aberta, como Common Corpus e Common Pile, restringem as fontes a páginas de domínio público ou com licenças permissivas, trocando escala por um histórico de proveniência defensável.
- Dados web estruturados, como Web Data Commons e seus corpora de tabelas schema.org, extraem a marcação legível por máquina incorporada nos sites, o que dispensa a análise de HTML para entidades de produto, evento e organização.
- Benchmarks de agentes web, como Online-Mind2Web, WebArena e BrowseComp, testam se os modelos conseguem navegar em sites ativos.
- Conjuntos de dados web verticais, como Amazon Reviews 2023, o Yelp Open Dataset e GDELT, cobrem avaliações, negócios locais e notícias, e são comumente usados para trabalhos de recomendação e sentimento.
Conjuntos de dados específicos de domínio e da indústria
- MIMIC-IV e PhysioNet apoiam a pesquisa médica e a análise de saúde.
- Waymo Open Dataset e KITTI são usados para visão computacional em veículos autônomos.
- Conjuntos de dados de robótica e IA incorporada, como AGIBOT WORLD 2026, EgoDex e EgoVerse, fornecem vídeo em primeira pessoa (egocêntrico) e dados de manipulação para treinar sistemas de IA física e humanoides.
- Benchmarks médicos multimodais, como GMAI-MMBench e OmniMedVQA, avaliam respostas visuais a perguntas clínicas em muitas modalidades de imagem.
- World Bank Open Data e conjuntos de dados da OECD fornecem indicadores econômicos e financeiros.
- Common Voice e Free Music Archive apoiam o desenvolvimento de modelos de áudio e linguagem.
O que são conjuntos de dados de ML?
Um conjunto de dados de aprendizado de máquina é uma coleção estruturada de dados especificamente coletada e preparada para treinar modelos de aprendizado de máquina. Esses conjuntos de dados para ML atuam como exemplos que ajudam o modelo a aprender padrões, extrair características significativas e fazer previsões sobre dados não vistos.
Dependendo da tarefa, o conjunto de dados de aprendizado de máquina pode consistir em vários tipos de dados, incluindo:
- Dados de texto: usados em aplicações como processamento de linguagem natural, análise de sentimentos e tradução automática.
- Dados de imagem: usados principalmente em visão computacional e redes neurais convolucionais para tarefas como reconhecimento de dígitos manuscritos ou detecção de falhas em chapas de aço.
- Dados de áudio: para reconhecimento de fala ou tarefas de classificação de sons.
- Dados de vídeo: para rastreamento de objetos ou análise de vídeo em tempo real.
- Dados numéricos: usados em tarefas de regressão ou classificação, às vezes provenientes de dados de espectrometria de massa ou logs de data e hora.
A maioria dos projetos de aprendizado de máquina começa com dados brutos, que depois são rotulados ou anotados. Essa rotulagem ajuda o sistema de aprendizado de máquina a entender o resultado esperado para classificação, regressão ou outras tarefas preditivas.
Um bom conjunto de dados, frequentemente obtido de repositórios de aprendizado de máquina abertos, públicos ou especializados, pode melhorar significativamente o desempenho do modelo.
Por que preparar conjuntos de dados para aprendizado de máquina?
Preparar e escolher conjuntos de dados de alta qualidade é uma das etapas mais cruciais no desenvolvimento de sistemas de inteligência artificial. Muitas organizações reconhecem que a preparação de dados pode determinar o sucesso ou o fracasso de seus projetos de aprendizado de máquina.
A qualidade dos dados de treinamento afeta a capacidade de os modelos generalizarem para cenários do mundo real e a precisão com que lidam com problemas específicos. Há três propósitos principais de um conjunto de dados de aprendizado de máquina:
Para treinar o modelo
O conjunto de treinamento ensina à máquina as relações e os padrões dentro dos dados. Isso envolve fornecer dados anotados ou rotulados, permitindo que o modelo ajuste seus parâmetros e melhore suas previsões em entradas semelhantes.
Para medir a precisão do modelo
Após o treinamento, o conjunto de dados de teste (ou conjunto de teste) é usado para avaliar o desempenho do modelo. Isso ajuda a determinar quão bem o modelo lida com dados não vistos e se está sofrendo overfitting no conjunto de treinamento ou aprendendo padrões significativos.
Para melhorar o modelo após a implantação
Uma vez implantados, as equipes geralmente refinam os modelos de aprendizado de máquina usando dados coletados adicionais, ajudando-os a se adaptar a novas condições ou classes. Os conjuntos de validação também ajudam a ajustar e a evitar overfitting.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Ermut, Sıla},
title = {{+100 Conjuntos de dados para modelos de ML e IA}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/datasets-for-ml}},
note = {AIMultiple. Acessado em 2 Setembro 2026}
}Resultados e carimbos de data/hora de 118 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 6 arquivos CSV.
Registro de alterações
12 atualizações- 2026
Adicionada seção de conjuntos de dados web sobre provedores de scraping, rastreamento e navegação
Removida a seção "Tipos de conjuntos de dados de ML" sobre subconjuntos de treino, validação e teste.
- 2025
Substituída a seção "Categorias de conjuntos de dados" por novas categorias: Modelos de Linguagem Grandes (LLMs) e IA Agente, Codificação de IA e engenharia de software, Cibersegurança e segurança de dados, Dados, dados sintéticos e privacidade, e Conjuntos de dados específicos de domínio e indústria.
Atualizada a URL da Figura 1.
A introdução foi expandida com uma lista de tipos de conjuntos de dados e suas descrições.
- 2024
Adicionada uma pergunta e resposta à seção de Perguntas Frequentes.
Added the "FAQs" section.
- 2023
Adicionada uma tabela de conjuntos de dados de ML e fontes de dados à introdução.
Adicionada IA Generativa à seção "Onde os conjuntos de dados de ML podem ser obtidos?".
Adicionado um novo fornecedor, Clickworker, à lista de fornecedores de conjuntos de dados de ML.
Removida a seção patrocinada da seção "Qual é o propósito dos conjuntos de dados de IA/ML?".
Adicionado Clickworker como produto patrocinado.
O trabalho de Cem na AIMultiple foi citado por publicações globais líderes, incluindo Business Insider, Forbes, Morning Brew e Washington Post, por empresas globais como Deloitte e HPE, ONGs como o World Economic Forum e organizações supranacionais como a European Commission. [1], [2], [3], [4], [5]
Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas sobre suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.
Ele liderou a estratégia de tecnologia e as compras de uma operadora de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de deep tech Hypatos, que atingiu uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia líderes como TechCrunch e Business Insider.
Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou como engenheiro da computação pela Bogazici University e possui um MBA pela Columbia Business School.
Ela trabalhou anteriormente como recrutadora em empresas de gerenciamento de projetos e consultoria. Sıla possui mestrado em Psicologia Social e bacharelado em Relações Internacionais.
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.