A reprodutibilidade é uma parte central da pesquisa científica. Permite que pesquisadores e equipes de IA verifiquem se um resultado pode ser obtido novamente sob condições claramente descritas.
Um relatório da OCDE sobre IA na ciência argumenta que a pesquisa em IA não escapou da crise mais ampla de reprodutibilidade. Cita evidências de que problemas de reprodutibilidade surgiram em reconhecimento de imagem, processamento de linguagem natural, aprendizado por reforço, sistemas de recomendação, medicina e ciências sociais. Também observa que 70% da pesquisa em IA foi irreprodutível.1
A questão já não é se os pesquisadores compartilham código. A pergunta mais difícil é se os artefatos compartilhados são completos o suficiente para outra equipe verificar o resultado. Isso requer questões de pesquisa claras, acesso a dados e código, configurações do modelo, detalhes do ambiente, scripts de avaliação e documentação.
Saiba por que a reprodutibilidade é importante para a IA e como as empresas podem melhorá-la em projetos de IA.
O que é reprodutibilidade em inteligência artificial?
A reprodutibilidade em IA é a capacidade de obter o mesmo resultado ou um resultado semelhante quando os dados originais, o código, as configurações do modelo e o ambiente estão disponíveis e documentados.
Em IA, três termos relacionados são frequentemente confundidos:
- Repetibilidade: A mesma equipe obtém o mesmo resultado usando o mesmo código, dados e configuração. Por exemplo, uma equipe de ciência de dados reexecuta seu pipeline de treinamento e obtém a mesma métrica.
- Reprodutibilidade: Uma equipe diferente obtém o mesmo resultado usando os artefatos originais. Por exemplo, outro laboratório executa o código e os dados divulgados com um artigo e obtém o mesmo resultado.
- Replicabilidade: Uma equipe diferente obtém a mesma conclusão com novo código, dados ou experimentos. Por exemplo, uma segunda equipe testa a mesma afirmação com uma nova implementação e um novo conjunto de dados.
A reprodutibilidade em IA depende de três componentes principais:
- O conjunto de dados inclui dados de treinamento, validação e teste, divisões de dados, rótulos e etapas de pré-processamento.
- O algoritmo de IA, incluindo tipo de modelo, parâmetros, hiperparâmetros, características, pesos, prompts e código.
- O ambiente, incluindo versões de software, hardware, sistema operacional, drivers, sementes aleatórias e configurações de implantação.
Mudanças em todos os três componentes devem ser rastreadas e registradas.
A reprodutibilidade também tem um limite. Um resultado pode ser reprodutível e ainda assim estar errado. Por exemplo, um bug no código de pré-processamento pode ser reproduzido por todas as equipes que executam o mesmo código. Um resultado que não pode ser reproduzido também não é prova de fraude. Pode refletir detalhes ausentes, dados indisponíveis, hardware diferente ou um protocolo de avaliação ambíguo.
Por que a reprodutibilidade é importante em IA?
A reprodutibilidade é importante tanto para a pesquisa em IA quanto para aplicações empresariais de IA, mas os objetivos diferem.
Para pesquisa em IA e ML, a reprodutibilidade permite que pesquisadores independentes inspecionem resultados, reexecutem o experimento original e construam sobre trabalhos anteriores. O progresso científico depende desse processo. Se um artigo não documenta código, dados, configurações do modelo e detalhes de avaliação, outros pesquisadores podem não conseguir dizer se o resultado é uma descoberta robusta ou um artefato de uma configuração específica.
Para aplicações de IA nos negócios, a reprodutibilidade apoia a depuração, a auditabilidade e a implantação estável. As equipes precisam saber qual versão dos dados, versão do modelo, prompt, ambiente e configuração produziu um determinado resultado. Isso é importante para garantia de qualidade, revisão de incidentes e conformidade.
A reprodutibilidade também está se tornando um requisito de governança. Regulamentos como o EU IA Act exigem documentação técnica e manutenção de registros para sistemas de IA de alto risco. Isso aumenta a necessidade de conjuntos de dados rastreáveis, versões de modelo, logs de avaliação e registros de implantação.
Quais são os desafios da IA reprodutível?
Estágio do ciclo de vida | Desafio | Exemplo |
|---|---|---|
Dados | Disponibilidade do conjunto de dados, dados em mudança e pré-processamento inconsistente | Um conjunto de dados de saúde é proprietário ou o pré-processamento de NLP remove stopwords de forma diferente. |
Treinamento | Aleatoriedade e sensibilidade à semente | Diferentes inicializações de peso ou execuções de gradiente descendente estocástico produzem métricas diferentes. |
Treinamento | Hardware e software não determinísticos | Kernels de GPU, versões CUDA ou atualizações de framework alteram resultados numéricos. |
Treinamento | Busca de hiperparâmetros | Uma taxa de aprendizado ou tamanho de lote é alterado, mas não registrado. |
Avaliação | Sobreajuste a benchmarks e contaminação | Um modelo tem bom desempenho porque dados de benchmark apareceram nos dados de treinamento. |
Avaliação | Diferenças no protocolo de avaliação | Dois harnesses de avaliação de LLM usam formatos de prompt ou analisadores de resposta diferentes. |
Implantação | Deriva de API e atualizações de modelo | Um endpoint de modelo fechado muda de comportamento após uma atualização silenciosa. |
Relatório | Relatório seletivo e variância ausente | Apenas a melhor execução é relatada, sem média, desvio padrão ou intervalo de confiança. |
1. Aleatoriedade e natureza estocástica dos algoritmos
Muitos modelos de IA, especialmente algoritmos de aprendizado profundo, incorporam aleatoriedade durante seus processos de treinamento e inferência. Por exemplo, inicialização aleatória de pesos, camadas de dropout e gradiente descendente estocástico (SGD) contribuem para a variabilidade mesmo quando se usa o mesmo conjunto de dados, base de código e ambiente.
Esse problema é especialmente pronunciado em Modelos de Linguagem de Grande Escala (LLMs), como GPT-5, Gemini ou LLaMA, que são inerentemente probabilísticos. Mesmo quando solicitados com a mesma entrada e configuração, eles podem gerar saídas diferentes, particularmente se os parâmetros de temperatura ou amostragem top-k forem ajustados. Essas configurações controlam a aleatoriedade da geração de saída:
- Temperatura ajusta a distribuição de probabilidade usada durante a amostragem de tokens. Uma temperatura mais alta (por exemplo, 1.0) produz saídas mais diversas e criativas, enquanto uma temperatura mais baixa (por exemplo, 0.2) gera respostas mais determinísticas.
- Top-k ou amostragem top-p (núcleo) controla ainda mais a aleatoriedade ao limitar o intervalo de tokens considerados a cada etapa.
Pedir a um LLM para resumir o mesmo parágrafo duas vezes com uma temperatura de 0.9 pode gerar resumos significativamente diferentes. Essa variabilidade dificulta a verificação ou reprodução do comportamento do modelo, a menos que as configurações sejam fixadas e explicitamente documentadas.
Em aplicações empresariais, como sumarização de contratos, respostas de chatbot ou assistentes de codificação com IA, essa imprevisibilidade impõe desafios para depuração, conformidade e garantia de qualidade. As equipes podem ter dificuldade para rastrear qual configuração levou a uma saída específica, a menos que todos os parâmetros, incluindo a semente aleatória e a temperatura, sejam registrados de forma consistente.
Por exemplo, o Thinking Machines Lab explicou a falha de invariância de lote como uma grande fonte de não determinismo na inferência de LLM. Idealmente, um modelo deveria produzir a mesma saída para um determinado prompt, independentemente de ser processado sozinho ou junto com outras solicitações. No entanto, os sistemas modernos de serving agrupam dinamicamente as solicitações para melhorar a eficiência da GPU, e muitos kernels de GPU variam seus padrões de execução dependendo do tamanho ou layout do lote.
Como as operações de ponto flutuante não são perfeitamente associativas, pequenas mudanças na ordem da computação podem alterar ligeiramente os logits. Durante a decodificação, essas pequenas diferenças podem eventualmente levar o modelo a selecionar tokens diferentes, causando saídas diferentes mesmo com configurações determinísticas (por exemplo, temperatura = 0). Na prática, o resultado do modelo depende de quais outras solicitações compartilham o lote, fazendo a inferência parecer não determinística.2
2. Falta de padronização no pré-processamento de dados
Etapas de pré-processamento como limpeza, filtragem, aumento, normalização, tokenização e extração de características muitas vezes não são totalmente documentadas. Pequenas diferenças podem alterar o resultado final.
Em modelos de imagem, a ordem de redimensionamento, corte ou aumento pode afetar a precisão. Em NLP, tokenização, remoção de stopwords, capitalização ou truncamento podem afetar as métricas. Em modelos tabulares, o tratamento de valores ausentes e o escalonamento de características podem alterar o comportamento do modelo.
As equipes devem tratar o código de pré-processamento como parte do modelo. Ele deve ser versionado, testado e registrado junto com o artefato do modelo.
3. Hardware e software não determinísticos
A execução de algoritmos de IA pode variar entre diferentes hardwares (CPUs, GPUs, TPUs) e até mesmo no mesmo hardware devido a processos não determinísticos subjacentes em bibliotecas. Diferenças nas versões dessas bibliotecas podem introduzir variabilidade adicional, mesmo quando código e dados são idênticos.
Por exemplo, o PyTorch 2.10 introduziu várias melhorias focadas em determinismo e depuração de problemas numéricos em fluxos de trabalho modernos de ML.
À medida que o aprendizado por reforço distribuído e pipelines de pós-treinamento em larga escala se tornam mais comuns, garantir a execução reprodutível e diagnosticar divergências numéricas sutis tornou-se cada vez mais importante. Para lidar com isso, a versão adicionou novos recursos de depuração, como o DebugMode, que rastreia chamadas despachadas e ajuda a identificar fontes de instabilidade numérica durante a execução.3
4. Ajuste de hiperparâmetros
Muitos modelos de IA dependem de hiperparâmetros, como taxa de aprendizado, tamanho do lote ou força de regularização, que precisam ser ajustados. Frequentemente, eles não são compartilhados com detalhes suficientes, ou sua seleção não é explicada de forma rigorosa, dificultando a reprodução dos resultados. Além disso, pequenas mudanças nos hiperparâmetros podem resultar em diferentes desempenhos.
5. Falta de artefatos e documentação completos
Um artigo pode compartilhar código, mas ainda ser difícil de reproduzir. Arquivos ausentes, instruções README incompletas, pesos de modelo indisponíveis, scripts de pré-processamento ocultos ou dependências não documentadas podem impedir a reprodução.
Artefatos úteis incluem:
- Código e hash exato do commit.
- Versões dos dados de treinamento, validação e teste.
- Pesos do modelo e checkpoints.
- Arquivos de ambiente como
requirements.txt,pip freeze, arquivos de ambiente conda, arquivos de lock, Dockerfiles ou configurações Nix. - Logs de treinamento e scripts de avaliação.
- Sementes aleatórias e detalhes de hardware.
- Instruções para executar o pipeline completo.
Padrões de documentação, como Model Cards e Dataset Datasheets, ajudam a tornar essas informações mais fáceis de inspecionar.
6. Problemas de versionamento
A natureza dinâmica dos ecossistemas de software de IA significa que bibliotecas e frameworks estão em constante evolução. Um modelo treinado usando uma versão específica de uma biblioteca pode não ter o mesmo desempenho quando executado em uma versão posterior, mesmo que o código permaneça inalterado. Manter o controle das versões de todas as dependências pode ser difícil, e o versionamento muitas vezes é mal documentado.
7. Disponibilidade e variabilidade do conjunto de dados
Alguns conjuntos de dados usados em pesquisa de IA são proprietários ou não estão disponíveis publicamente, tornando impossível replicar estudos. Mesmo quando os conjuntos de dados estão disponíveis, pode haver variações devido a amostragem, atualizações ou diferentes técnicas de pré-processamento aplicadas no momento da pesquisa.
8. Recursos computacionais
Reproduzir modelos de IA de ponta frequentemente requer recursos computacionais significativos, incluindo hardware especializado como GPUs ou TPUs. Pesquisadores ou profissionais sem acesso ao mesmo nível de recursos podem achar difícil replicar os resultados.
9. Sobreajuste a conjuntos de teste específicos
Em alguns casos, os modelos são inadvertidamente sobreajustados a conjuntos de teste ou benchmarks específicos. Quando esses modelos são testados em ambientes diferentes ou em conjuntos de dados ligeiramente alterados, os resultados podem não generalizar, tornando a reprodutibilidade desafiadora.
10. Viés no relatório e seleção a dedo de resultados
Pesquisadores podem relatar a versão de melhor desempenho de um modelo após múltiplas execuções, sem especificar a variabilidade entre as execuções ou divulgar o número total de experimentos conduzidos. Esse relatório seletivo distorce a reprodutibilidade percebida dos resultados.
Exemplos de IA reprodutível
Programa de Reprodutibilidade do NeurIPS
O programa de reprodutibilidade do NeurIPS 2019 é um exemplo útil de infraestrutura em nível de campo. Combinou uma lista de verificação de reprodutibilidade, uma política de envio de código e um desafio comunitário de reprodutibilidade. Após esses esforços, o compartilhamento de código no NeurIPS aumentou e a reprodutibilidade tornou-se uma parte mais visível do processo de revisão.
Desafio de Reprodutibilidade em ML
O Desafio de Reprodutibilidade em ML oferece aos pesquisadores uma maneira estruturada de testar afirmações publicadas. Os participantes selecionam artigos, reexecutam ou reimplementam experimentos e relatam se as principais conclusões se sustentam. Isso ajuda o campo a aprender tanto com as reproduções bem-sucedidas quanto com as falhas.4
Papers with Code
O Papers with Code conecta artigos de pesquisa com código, conjuntos de dados, métodos e resultados de benchmarks. Isso facilita que pesquisadores e profissionais encontrem artefatos de implementação e comparem métodos.5
Inferência de LLM invariante a lote
O trabalho do Thinking Machines Lab sobre inferência invariante a lote mostra como detalhes de baixo nível de serving podem afetar a reprodutibilidade. No serving moderno de LLM, o agrupamento dinâmico pode alterar a execução numérica. Como pequenas diferenças numéricas podem afetar a seleção de tokens, o mesmo prompt pode produzir saídas diferentes. Kernels invariantes a lote são uma forma de reduzir essa fonte de não determinismo.6
Pipeline empresarial de MLOps
Um exemplo empresarial prático é um pipeline de auditoria de modelo que usa DVC para versionamento de conjunto de dados, MLflow para rastreamento de experimentos e uma imagem Docker fixa para capturar o ambiente. Quando uma decisão do modelo é questionada, a equipe pode recuperar o conjunto de dados exato, a versão do código, o artefato do modelo e o relatório de avaliação usados no momento.
O papel dos pesquisadores de IA no tratamento da reprodutibilidade
Os pesquisadores de IA desenvolvem novos modelos, mas também moldam a base de evidências que outras equipes usam. Seu trabalho é mais fácil de verificar quando os artefatos são completos, documentados e estáveis.
A comunidade de pesquisa melhorou suas práticas de reprodutibilidade. O NeurIPS introduziu um programa de reprodutibilidade em 2019 que incluiu uma política de envio de código, uma lista de verificação de reprodutibilidade e um desafio comunitário de reprodutibilidade.7 Análises posteriores encontraram um claro aumento no compartilhamento de código no NeurIPS após esses esforços.
Para melhorar ainda mais a reprodutibilidade, os pesquisadores de IA devem:
- Compartilhar código, dados, pesos do modelo e scripts de avaliação sempre que possível.
- Arquivar código e artefatos com identificadores persistentes.
- Relatar hiperparâmetros exatos, divisões de dados, prompts, sementes e hardware.
- Relatar a variância em várias execuções em vez da melhor execução.
- Usar padrões de documentação como Model Cards e Dataset Datasheets.
- Seguir listas de verificação estruturadas como a Machine Learning Reproducibility Checklist e a NeurIPS Paper Checklist.
- Incentivar a reprodução e replicação independentes por meio de espaços como o ML Reproducibility Challenge.
Quando dados ou código não puderem ser divulgados, os pesquisadores devem explicar a restrição e fornecer um conjunto de dados proxy, uma amostra sintética, um ambiente executável ou um protocolo de reprodução detalhado.
Como melhorar a reprodutibilidade em IA?
A melhor maneira de alcançar a reprodutibilidade em IA na empresa é aproveitando as melhores práticas de MLOps. MLOps envolve simplificar o ciclo de vida da inteligência artificial e do aprendizado de máquina com automação e uma estrutura unificada dentro de uma organização.
Ferramentas e técnicas úteis incluem:
- Rastreamento de experimentos: Ferramentas como MLflow, Neptune e Comet ajudam a registrar métricas, parâmetros, artefatos e histórico de execuções.
- Versionamento e linhagem de dados: Ferramentas como DVC, LakeFS, Pachyderm e Delta Lake ajudam a rastrear como os conjuntos de dados mudam.
- Versionamento de modelo: Registros de modelo ajudam a armazenar versões de modelo, metadados, assinaturas e estágios de implantação.
- Captura de ambiente: Docker, conda, pip freeze, arquivos de lock e Nix ajudam a preservar as dependências de software.
- Orquestração de pipeline: Fluxos de trabalho reprodutíveis devem definir como a preparação de dados, treinamento, avaliação e implantação são executados de ponta a ponta.
- Logging e trilhas de auditoria: As equipes devem registrar entradas e saídas do modelo, prompts, versões do modelo e metadados do ambiente para decisões importantes.
O que significa IA confiável e como ela se relaciona com IA reprodutível?
IA confiável refere-se a sistemas que têm desempenho consistente e correto sob condições esperadas. A reprodutibilidade apoia a confiabilidade, mas não é a mesma coisa.
Um sistema reprodutível pode ser reexecutado e auditado. Um sistema confiável também deve ser preciso, robusto, seguro, justo e adequado ao uso pretendido. A reprodutibilidade ajuda as equipes a testar essas qualidades, tornando os resultados rastreáveis.
A reprodutibilidade apoia a IA confiável de cinco maneiras:
- Consistência entre execuções: As equipes podem verificar se um resultado é estável sob a mesma configuração.
- Depuração e auditoria: As equipes podem rastrear quais dados, código, modelo e ambiente produziram uma saída.
- Testes robustos: As equipes podem comparar o comportamento entre conjuntos de dados, versões de modelo e configurações de implantação.
- Conformidade: As equipes podem manter documentação e registros para auditorias internas e regulamentações externas.
- Integridade científica: Os pesquisadores podem verificar alegações e construir sobre elas com menos ambiguidade.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{IA Reprodutível: Por que é Importante e Como Melhorá-la}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/reproducible-ai}},
note = {AIMultiple. Acessado em 23 Junho 2026}
}
Comentários 2
Compartilhe suas ideias
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.
I have been working on this and have achieved it with on CPU. Repeatable determinism or reproducibility is a key stone of dependable systems and when applied in convolutional network can have higher accuracy. These are some of the academically peer-reviewed publications made in the IEEE. • [1] R. Rudd-Orthner and L. Mihaylova, “Non-Random weight initialisation in deep learning networks for repeatable determinism,” in Peer Reviewed Proc. of the 10th IEEE International Conference Dependable Systems Services and Technologies (DESSERT-19), Leeds, UK, 2019. o This conference paper proved that an alternative to the random initialisation was possible and provided an almost equal performance but with reproducibility. Presented at the UK Ukraine and Northen Island IEEE branches conference in Leeds. • [2] R. Rudd-Orthner and L. Milhaylova, “Repeatable determinism using non-random weight initialisations in smart city applications of deep learning,” Journal of Reliable Intelligent Environments in a Smart Cities special edition, vol. 6, no. 1, pp. 31-49, 2020. o This Journal paper enhanced the performance to an equivalent performance by using the limits from He and Xavier and made the previous reproducibility a more general case for general use, although it was limited to Dense layers. • [3] R. Rudd-Orthner and L. Milhaylova, “Non-random weight initialisation in deep convolutional networks applied to safety critical artificial intelligence,” in Peer Reviewed Proc. of the 13th International Conference on Developments in eSystems Engineering (DeSe), Liverpool, UK, 2020. o This conference paper proved an approach to Convolutional layers that as alternative to the random initialisation and provided a higher performance with reproducibility. Presented at the UK and UAE IEEE branches conference in Liverpool held virtually. • [4] R. Rudd-Orthner and L. Milhaylova, “Deep convnet: non-random weight initialization for repeatable determinism with FSGM,” Sensors, vol. 21, no. 14, p. 4772, 2021. o This Journal paper extended the work into colour images proofs and used the cyber FSGM attack as a method for measuring effect in transferred learning. • [5] R. Rudd-Orthner and L. Milhaylova, “Multi-type aircraft of remote sensing images: MTARSI2,” Zenodo, 30 June 2021. [Online]. Available: https://zenodo.org/record/5044950#.YcWalmDP2Ul. [Accessed 30 June 2021]. o This was the colour dataset used. • [6] R. Rudd-Orthner, “Artificial Intelligence Methods for Security and Cyber Security Systems,” University of Sheffield, Sheffield, UK, 2022. o This is the final full write up in the context and with other approaches.
I have been working on this and have achieved it with on CPU. Repeatable determinism or reproducibility is a key stone of dependable systems and when applied in convolutional network can have higher accuracy. These are some of the academically peer-reviewed publications made in the IEEE etc about Safety Critical AI. • [1] R. Rudd-Orthner and L. Mihaylova, “Non-Random weight initialisation in deep learning networks for repeatable determinism,” in Peer Reviewed Proc. of the 10th IEEE International Conference Dependable Systems Services and Technologies (DESSERT-19), Leeds, UK, 2019. o This conference paper proved that an alternative to the random initialisation was possible and provided an almost equal performance but with reproducibility. Presented at the UK Ukraine and Northen Island IEEE branches conference in Leeds. • [2] R. Rudd-Orthner and L. Milhaylova, “Repeatable determinism using non-random weight initialisations in smart city applications of deep learning,” Journal of Reliable Intelligent Environments in a Smart Cities special edition, vol. 6, no. 1, pp. 31-49, 2020. o This Journal paper enhanced the performance to an equivalent performance by using the limits from He and Xavier and made the previous reproducibility a more general case for general use, although it was limited to Dense layers. • [3] R. Rudd-Orthner and L. Milhaylova, “Non-random weight initialisation in deep convolutional networks applied to safety critical artificial intelligence,” in Peer Reviewed Proc. of the 13th International Conference on Developments in eSystems Engineering (DeSe), Liverpool, UK, 2020. o This conference paper proved an approach to Convolutional layers that as alternative to the random initialisation and provided a higher performance with reproducibility. Presented at the UK and UAE IEEE branches conference in Liverpool held virtually. • [4] R. Rudd-Orthner and L. Milhaylova, “Deep convnet: non-random weight initialization for repeatable determinism with FSGM,” Sensors, vol. 21, no. 14, p. 4772, 2021. o This Journal paper extended the work into colour images proofs and used the cyber FSGM attack as a method for measuring effect in transferred learning. • [5] R. Rudd-Orthner and L. Milhaylova, “Multi-type aircraft of remote sensing images: MTARSI2,” Zenodo, 30 June 2021. [Online]. Available: https://zenodo.org/record/5044950#.YcWalmDP2Ul. [Accessed 30 June 2021]. o This was the colour dataset used. • [6] R. Rudd-Orthner, “Artificial Intelligence Methods for Security and Cyber Security Systems,” University of Sheffield, Sheffield, UK, 2022. o This is the final full write up in the context and with other approaches.