Serviços
Contate-nos

+100 Conjuntos de dados para modelos de ML e IA

Cem Dilmegani
Cem Dilmegani
atualizado em 2 set. 2026

Dados são necessários para aproveitar ou criar soluções de IA generativa ou IA conversacional. Você pode usar conjuntos de dados existentes disponíveis no mercado ou contratar um serviço de coleta de dados.

Identificamos mais de 100 conjuntos de dados para treinar e avaliar modelos de aprendizado de máquina e IA.

Conjuntos de dados de grandes modelos de linguagem (LLMs) e IA agêntica

Conjunto de dados / Benchmark
Descrição
Gratuito / Pago
Última atualização
MMLU (Massive Multitask Language Understanding)
Benchmark para raciocínio geral e conhecimento acadêmico
Gratuito
Contínuo
HumanEval+
Benchmark de programação Python para código generativo
Gratuito
Contínuo
FineWeb
Conjunto de dados do Hugging Face para pré-treinamento de LLM
Gratuito
Contínuo
FineWeb-Edu
Subconjunto educacional do FineWeb
Gratuito
Contínuo
BFCL (Berkeley Function Calling Leaderboard)
Padrão continuamente atualizado para avaliar chamadas de ferramentas/funções
Gratuito
Contínuo
AIMultiple UI Grounding Benchmark
Benchmark de UI grounding para modelos de uso de computador e de visão-linguagem
Gratuito
2026
Superior-Reasoning-SFT
Conjunto de dados de raciocínio Long-CoT da Alibaba-Apsara
Gratuito
2026
Terminal-Bench 2.0
89 tarefas realistas de terminal (manipulação de arquivos, administração de sistemas, depuração, reimplementação de código de pesquisa)
Gratuito
2026
MMMU (Massive Multi-disciplinary Multimodal Understanding)
Benchmark multimodal (raciocínio de imagem + texto)
Gratuito
2025
Humanity’s Last Exam (HLE)
Benchmark multimodal para testar LLMs de fronteira além do MMLU
Gratuito
2025
  • Benchmarks de grandes modelos de linguagem como MMLU e GPQA medem o raciocínio geral e científico.
  • Conjuntos de dados multimodais, como LAION-5B, combinam texto e imagens para treinar modelos que conseguem lidar com ambos os formatos.
  • Avaliações de fronteira, como Humanity’s Last Exam, ARC-AGI-2 e IA Idea Bench, testam a criatividade, a precisão factual e a adaptabilidade dos modelos a prompts complexos.
  • Agênticos e benchmarks de uso de ferramentas, como GAIA, BFCL (Berkeley Function Calling Leaderboard) e ComplexFuncBench, avaliam raciocínio em várias etapas, chamada de ferramentas e conclusão de tarefas.
  • Benchmarks de UI grounding, como o AIMultiple UI Grounding Benchmark, avaliam se modelos de uso de computador conseguem identificar o elemento de interface correto e prever sua localização a partir de uma instrução em linguagem natural. Veja o benchmark de agentes de uso de computador para metodologia e resultados de modelos.
  • Corpora de pré-treinamento, como FineWeb, Nemotron-CC e Essential-Web v1.0, fornecem coleções de tokens em larga escala para treinar modelos de base.

Conjuntos de dados de codificação de IA e engenharia de software

  • Conjuntos de dados como The Heap e MADE-WIC contêm código multilíngue e anotado para avaliar a precisão da codificação e a dívida técnica.
  • HumanEval e APPS fornecem problemas de codificação com soluções de referência para avaliar a qualidade da geração de código.
  • Benchmarks agênticos e em nível de repositório, como SWE-Bench Pro, SWE-Bench Multilingual, SWE-Lancer e Terminal-Bench 2.0, avaliam modelos em issues reais do GitHub e tarefas de software de ponta a ponta, em vez de funções isoladas.
  • Conjuntos de dados proprietários, como os da Amazon CodeWhisperer e do GitHub Copilot, apoiam assistentes comerciais de codificação.

Benchmarks mais antigos, como HumanEval e SWE-bench Verified, agora são amplamente considerados contaminados ou saturados; como resultado, sucessores resistentes à contaminação, como o SWE-Bench Pro, surgiram.

Cibersegurança e conjuntos de dados de segurança de dados

  • CICIDS2017 e TON_IoT são amplamente usados para treinar sistemas de detecção de intrusão e anomalias.
  • Os conjuntos de dados EMBER e VirusShare contêm dados de malware rotulados para classificação baseada em modelos.
  • O banco de dados CVE-MITRE fornece informações estruturadas sobre vulnerabilidades de software conhecidas.

Dados, dados sintéticos e conjuntos de dados de privacidade

  • Plataformas como Appen, Amazon Mechanical Turk, e Telus International fornecem conjuntos de dados gerados por humanos para aprendizado supervisionado.
  • Hazy e Gretel.ai geram dados estruturados sintéticos para uso empresarial.
  • Repositórios abertos como Kaggle Datasets e Google Dataset Search fornecem dados publicamente acessíveis em vários domínios.
Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Conjuntos de dados de dados da web

  • Fornecedores comerciais de dados web, como Bright Data e Coresignal, vendem conjuntos de dados pré-coletados e personalizados cobrindo fontes de e-commerce, redes sociais, imóveis e vagas de emprego. Mercados como Datarade agregam esses dados entre fornecedores.
  • Rastreamentos brutos e filtrados, como Common Crawl, C4, RefinedWeb e RedPajama-Data-v2, fornecem tokens de pré-treinamento em massa.
  • Corpora multilíngues, como FineWeb-2, OSCAR 23.01 e HPLT v2, ampliam a cobertura além do inglês, que a maioria dos conjuntos de dados derivados de rastreamento super-representa.
  • Corpora de licença aberta, como Common Corpus e Common Pile, restringem as fontes a páginas de domínio público ou com licenças permissivas, trocando escala por um histórico de proveniência defensável.
  • Dados web estruturados, como Web Data Commons e seus corpora de tabelas schema.org, extraem a marcação legível por máquina incorporada nos sites, o que dispensa a análise de HTML para entidades de produto, evento e organização.
  • Benchmarks de agentes web, como Online-Mind2Web, WebArena e BrowseComp, testam se os modelos conseguem navegar em sites ativos.
  • Conjuntos de dados web verticais, como Amazon Reviews 2023, o Yelp Open Dataset e GDELT, cobrem avaliações, negócios locais e notícias, e são comumente usados para trabalhos de recomendação e sentimento.

Conjuntos de dados específicos de domínio e da indústria

  • MIMIC-IV e PhysioNet apoiam a pesquisa médica e a análise de saúde.
  • Waymo Open Dataset e KITTI são usados para visão computacional em veículos autônomos.
  • Conjuntos de dados de robótica e IA incorporada, como AGIBOT WORLD 2026, EgoDex e EgoVerse, fornecem vídeo em primeira pessoa (egocêntrico) e dados de manipulação para treinar sistemas de IA física e humanoides.
  • Benchmarks médicos multimodais, como GMAI-MMBench e OmniMedVQA, avaliam respostas visuais a perguntas clínicas em muitas modalidades de imagem.
  • World Bank Open Data e conjuntos de dados da OECD fornecem indicadores econômicos e financeiros.
  • Common Voice e Free Music Archive apoiam o desenvolvimento de modelos de áudio e linguagem.
Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

O que são conjuntos de dados de ML?

Um conjunto de dados de aprendizado de máquina é uma coleção estruturada de dados especificamente coletada e preparada para treinar modelos de aprendizado de máquina. Esses conjuntos de dados para ML atuam como exemplos que ajudam o modelo a aprender padrões, extrair características significativas e fazer previsões sobre dados não vistos.

Dependendo da tarefa, o conjunto de dados de aprendizado de máquina pode consistir em vários tipos de dados, incluindo:

  • Dados de texto: usados em aplicações como processamento de linguagem natural, análise de sentimentos e tradução automática.
  • Dados de imagem: usados principalmente em visão computacional e redes neurais convolucionais para tarefas como reconhecimento de dígitos manuscritos ou detecção de falhas em chapas de aço.
  • Dados de áudio: para reconhecimento de fala ou tarefas de classificação de sons.
  • Dados de vídeo: para rastreamento de objetos ou análise de vídeo em tempo real.
  • Dados numéricos: usados em tarefas de regressão ou classificação, às vezes provenientes de dados de espectrometria de massa ou logs de data e hora.

A maioria dos projetos de aprendizado de máquina começa com dados brutos, que depois são rotulados ou anotados. Essa rotulagem ajuda o sistema de aprendizado de máquina a entender o resultado esperado para classificação, regressão ou outras tarefas preditivas.

Um bom conjunto de dados, frequentemente obtido de repositórios de aprendizado de máquina abertos, públicos ou especializados, pode melhorar significativamente o desempenho do modelo.

Por que preparar conjuntos de dados para aprendizado de máquina?

Preparar e escolher conjuntos de dados de alta qualidade é uma das etapas mais cruciais no desenvolvimento de sistemas de inteligência artificial. Muitas organizações reconhecem que a preparação de dados pode determinar o sucesso ou o fracasso de seus projetos de aprendizado de máquina.

A qualidade dos dados de treinamento afeta a capacidade de os modelos generalizarem para cenários do mundo real e a precisão com que lidam com problemas específicos. Há três propósitos principais de um conjunto de dados de aprendizado de máquina:

Para treinar o modelo

O conjunto de treinamento ensina à máquina as relações e os padrões dentro dos dados. Isso envolve fornecer dados anotados ou rotulados, permitindo que o modelo ajuste seus parâmetros e melhore suas previsões em entradas semelhantes.

Para medir a precisão do modelo

Após o treinamento, o conjunto de dados de teste (ou conjunto de teste) é usado para avaliar o desempenho do modelo. Isso ajuda a determinar quão bem o modelo lida com dados não vistos e se está sofrendo overfitting no conjunto de treinamento ou aprendendo padrões significativos.

Para melhorar o modelo após a implantação

Uma vez implantados, as equipes geralmente refinam os modelos de aprendizado de máquina usando dados coletados adicionais, ajudando-os a se adaptar a novas condições ou classes. Os conjuntos de validação também ajudam a ajustar e a evitar overfitting.

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani and Sıla Ermut (2026) - "+100 Conjuntos de dados para modelos de ML e IA". Publicado on-line em AIMultiple.com. Acessado em 2 Setembro 2026, em: https://aimultiple.com/datasets-for-ml [Recurso on-line]

Dilmegani, C., & Ermut, S. (2026, 2 Setembro). +100 Conjuntos de dados para modelos de ML e IA. AIMultiple. https://aimultiple.com/datasets-for-ml

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Ermut, Sıla},
  title  = {{+100 Conjuntos de dados para modelos de ML e IA}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/datasets-for-ml}},
  note   = {AIMultiple. Acessado em 2 Setembro 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 118 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 6 arquivos CSV.

Última atualização: 17 Agosto 2026
Baixar

Registro de alterações

12 atualizações
  1. 2026

    Adicionada seção de conjuntos de dados web sobre provedores de scraping, rastreamento e navegação

  2. Removida a seção "Tipos de conjuntos de dados de ML" sobre subconjuntos de treino, validação e teste.

  3. 2025

    Substituída a seção "Categorias de conjuntos de dados" por novas categorias: Modelos de Linguagem Grandes (LLMs) e IA Agente, Codificação de IA e engenharia de software, Cibersegurança e segurança de dados, Dados, dados sintéticos e privacidade, e Conjuntos de dados específicos de domínio e indústria.

  4. Atualizada a URL da Figura 1.

  5. A introdução foi expandida com uma lista de tipos de conjuntos de dados e suas descrições.

  6. 2024

    Adicionada uma pergunta e resposta à seção de Perguntas Frequentes.

  7. Added the "FAQs" section.

  8. 2023

    Adicionada uma tabela de conjuntos de dados de ML e fontes de dados à introdução.

  9. Adicionada IA Generativa à seção "Onde os conjuntos de dados de ML podem ser obtidos?".

  10. Adicionado um novo fornecedor, Clickworker, à lista de fornecedores de conjuntos de dados de ML.

  11. Removida a seção patrocinada da seção "Qual é o propósito dos conjuntos de dados de IA/ML?".

  12. Adicionado Clickworker como produto patrocinado.

Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem é o analista principal da AIMultiple desde 2017.

O trabalho de Cem na AIMultiple foi citado por publicações globais líderes, incluindo Business Insider, Forbes, Morning Brew e Washington Post, por empresas globais como Deloitte e HPE, ONGs como o World Economic Forum e organizações supranacionais como a European Commission. [1], [2], [3], [4], [5]

Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas sobre suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.

Ele liderou a estratégia de tecnologia e as compras de uma operadora de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de deep tech Hypatos, que atingiu uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia líderes como TechCrunch e Business Insider.

Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou como engenheiro da computação pela Bogazici University e possui um MBA pela Columbia Business School.
Ver perfil completo
Pesquisado por
Sıla Ermut
Sıla Ermut
Analista do Setor
Sıla Ermut é analista do setor na AIMultiple, cobrindo models de IA, infraestrutura de IA, governança de IA e aplicações empresariais de IA. Sua pesquisa se concentra principalmente no uso de IA em marketing, saúde, cadeias de suprimentos e sustentabilidade.
Ela trabalhou anteriormente como recrutadora em empresas de gerenciamento de projetos e consultoria. Sıla possui mestrado em Psicologia Social e bacharelado em Relações Internacionais.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450