Serviços
Contate-nos

Top 3 Geradores Sintéticos de Documentos: Benchmark

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
atualizado em 18 mar. 2026

Os geradores de documentos sintéticos criam imagens de documentos realistas e anotadas que ajudam a treinar e avaliar modelos de aprendizado de máquina sem depender de grandes conjuntos de dados rotulados manualmente.

Comparamos 3 geradores de documentos sintéticos — Genalog, DocCreator e Tonic Textual — criando mais de 2.500 documentos sintéticos, avaliando sua eficácia em layouts realistas, dados numéricos precisos e conjuntos de dados de treinamento para tarefas de análise documental.

Resultados do benchmark de geração de documentos

Loading Chart

Os resultados mostram que

  • Genalog e DocCreator se destacam em utilidade e fidelidade, com o Genalog sendo ligeiramente melhor em precisão numérica.
  • Tonic Textual se destaca no realismo visual do layout, mas fica para trás em outras áreas, sendo mais adequado para tarefas que exigem documentos realistas.

Para mais informações sobre as métricas, leia a metodologia do benchmark.

  • Utilidade mede o quão bem os modelos treinados com dados sintéticos se saem em documentos reais.
  • Fidelidade de layout mede o quão bem a disposição espacial dos elementos nos documentos sintéticos corresponde aos reais.
  • Fidelidade numérica verifica se os valores numéricos nos documentos sintéticos se assemelham aos dados reais.

Comentário sobre os resultados: Para entender melhor as diferenças de desempenho, o benchmark também foi conduzido usando o conjunto de treinamento em vez do conjunto de teste separado. Esta segunda avaliação visou determinar se fornecer material de treinamento aos modelos melhoraria sua capacidade de reproduzir saídas estruturadas e numericamente precisas.

Os resultados mostram que, mesmo quando avaliados nos dados de treinamento, os modelos obtiveram pontuações ligeiramente superiores. Isso indica que os resultados refletem o quão bem as ferramentas lidam com a tarefa em si. Os resultados moderados provavelmente são influenciados por limitações na qualidade do OCR e na capacidade do modelo treinado, e não pelo procedimento de benchmark em si.

Genalog

documento sintético criado pelo Genalog, um dos geradores de documentos sintéticos

O Genalog teve o melhor desempenho geral. Seus documentos sintéticos foram eficazes para o treinamento de modelos e mantiveram um bom equilíbrio entre elementos de layout realistas e precisão numérica. Os documentos gerados refletiram de perto a estrutura e o espaçamento de formulários e recibos reais, tornando-os adequados para uma variedade de tarefas de análise documental.

DocCreator

documento sintético criado pelo DocCreator, um dos geradores de documentos sintéticos

O DocCreator também produziu resultados de alta qualidade. Os documentos deste gerador foram quase tão úteis para o treinamento quanto os do Genalog. Os layouts eram realistas e os documentos sintéticos preservaram as propriedades estatísticas dos números. A força do DocCreator está em combinar geração diversificada de layouts com seus modelos de degradação, tornando os resultados visualmente semelhantes a documentos digitalizados do mundo real.

Tonic Textual

documento sintético gerado pelo Tonic Textual, um gerador de documentos sintéticos

O Tonic Textual teve resultados mistos. Embora este gerador de documentos sintéticos tenha produzido layouts limpos e consistentes, os documentos foram menos eficazes para o treinamento de modelos. Além disso, os números sintéticos nem sempre foram estatisticamente semelhantes aos dados reais. Isso sugere que o Tonic Textual é mais adequado para tarefas focadas na aparência do documento ou na substituição de PII com preservação de privacidade, em vez de treinamento em larga escala para estrutura de layout e extração de informações.

Em março de 2026, o Tonic Textual trocou seu componente de vinculação de entidades de um modelo baseado em LLM para um modelo baseado em BERT para melhorar a taxa de transferência.1 A mesma versão (v391) também adicionou melhorias na filtragem e ordenação na página Datasets.1

Visão Geral

Genalog é a ferramenta mais equilibrada, fornecendo layouts realistas e números precisos.

DocCreator é forte para layouts complexos e diversificados e degradação de documentos, com pequenas imprecisões numéricas.

Tonic Textual é ideal para tarefas focadas em layout, mas não para tarefas que exigem dados numéricos precisos.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Visão Geral da Metodologia

Métricas de avaliação

Cada conjunto de dados gerado foi pontuado em comparação com os dados originais usando as seguintes métricas:

Pontuação de utilidade

(Pontuação KIE F1): Uma pontuação entre 0 e 1, onde quanto maior, melhor. É definida pela pontuação F1 do modelo LayoutLMv3 treinado com os dados sintéticos quando avaliado no conjunto de teste real. Uma pontuação alta indica que os dados sintéticos são um substituto altamente eficaz para dados reais.

Pontuações de fidelidade

Essas métricas medem o quão de perto os documentos sintéticos se assemelham aos reais.

  • Fidelidade de Layout (Pontuação EMD): A Distância do Movimento de Terra (dEMD) mede a diferença entre a distribuição dos pontos centrais das caixas delimitadoras nos documentos reais e sintéticos. É um valor de 0 a 1, onde quanto menor, melhor. Uma pontuação baixa significa que os elementos do layout espacial estão bem preservados.
  • Fidelidade Numérica (Distância K-S): A Distância de Kolmogorov-Smirnov (DKS) mede a diferença máxima entre as funções de distribuição acumulada (CDFs) dos valores numéricos (por exemplo, preços, quantidades) nos dados reais e sintéticos. Varia de 0 a 1, onde quanto menor, melhor. Uma pontuação baixa significa que o gerador reproduz com precisão as propriedades estatísticas dos números.

Todas as métricas foram normalizadas durante o cálculo.

Conjuntos de dados

FUNSD: Uma coleção de 199 formulários digitalizados caracterizados por texto ruidoso, layouts complexos e diversificados e anotações manuscritas. Foi baixado mais de 1.500 vezes no mês passado. Isso testa a capacidade de um gerador de lidar com dados não estruturados e imperfeitos. 2

  • Dividimos a amostra em duas: 80% dos dados são usados para treinar o modelo, enquanto os 20% restantes são reservados para teste após o treinamento.
  • Cada ferramenta produziu entre três e seis documentos sintéticos para cada original, resultando em um total de mais de 2.500 documentos sintéticos.

Avaliação da tarefa

Para medir a utilidade, um popular modelo LayoutLMv3 com 22K estrelas no GitHub e mais de 750K downloads foi treinado nos dados sintéticos gerados por cada ferramenta geradora de documentos sintéticos. 3

O desempenho deste modelo foi então avaliado em um conjunto de teste separado de documentos reais dos conjuntos de dados originais. Isso mede diretamente o quão útil os dados sintéticos são para uma tarefa do mundo real.

Ferramentas de geração sintética

Genalog

Uma biblioteca Python de código aberto da Microsoft para gerar imagens de documentos sintéticos com ruído sintético. Funciona pegando modelos de texto + layout (escritos em HTML + CSS) e renderizando-os via WeasyPrint, aplicando em seguida efeitos de degradação (desfoque, sangramento, ruído sal-e-pimenta, operações morfológicas).4

DocCreator

Uma ferramenta multiplataforma de código aberto para gerar imagens de documentos sintéticos com ground truth associada. Tem sido amplamente utilizada em pesquisas de Análise e Reconhecimento de Imagens de Documentos (DIAR).5 ,6

Tonic Textual

Uma solução para redação e síntese em formatos de documento do mundo real (PDF, Word). Alega escanear documentos não estruturados, identificar entidades nomeadas (por exemplo, PII), redigi-las ou substituí-las por valores sintéticos e produzir documentos desidentificados em formatos semelhantes.

8 Métodos de degradação de documentos sintéticos

A geração de documentos sintéticos geralmente inclui a adição de defeitos realistas para que os dados artificiais se assemelhem a documentos do mundo real. Esses defeitos, ou modelos de degradação, ajudam a treinar modelos que têm melhor desempenho em documentos ruidosos, envelhecidos ou digitalizados. Essas ferramentas aplicam várias transformações físicas e visuais para simular imperfeições comuns em documentos.6

1. Degradação de tinta

Este modelo simula desbotamento, manchas ou estrias causadas pelo envelhecimento ou impressão de baixa qualidade. Adiciona pequenas manchas de tinta ou remove partes de letras para imitar a deterioração real da tinta.

2. Caracteres fantasma

Ferramentas de impressão antigas frequentemente deixavam contornos tênues ou marcas 'fantasma' ao redor das letras. O modelo de caracteres fantasma recria isso inserindo defeitos extraídos de digitalizações reais entre os caracteres impressos.

3. Furos no papel

Furos de diferentes formas e tamanhos são adicionados aleatoriamente aos documentos, replicando rasgos ou marcas de perfuração vistos em papéis desgastados.

4. Sangramento

Este efeito imita a tinta que atravessa do outro lado da página. Usa imagens da frente e do verso de um documento para recriar como a tinta se transfere parcialmente através do papel.

5. Desfoque adaptativo

Digitalizar ou fotografar documentos geralmente cria um leve desfoque. Este modelo compara exemplos reais desfocados e aplica um desfoque semelhante usando filtros gaussianos, mantendo o resultado sutil e realista.

6. Deformação de papel em 3D

Documentos podem entortar, dobrar ou curvar quando digitalizados ou fotografados. Usando malhas 3D de papéis reais, este modelo recria essas formas e efeitos de iluminação, ajudando a treinar modelos para análise de documentos baseada em câmera.

7. Iluminação não linear

Iluminação irregular durante a digitalização pode fazer com que um lado do documento pareça mais escuro. Este modelo ajusta o brilho com base em ângulos de luz simulados e curvatura da página, reproduzindo o efeito de iluminação deficiente.

8. Ruído sal-e-pimenta

Adiciona pixels aleatórios em preto e branco para simular poeira, textura do papel ou ruído sensor de digitalização. Esse efeito 'sal-e-pimenta' ajuda a criar a aparência granulada de digitalizações antigas ou de baixa qualidade.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Geração de documentos sintéticos como solução para desafios de análise de layout

O desafio da análise de layout

Compreender a estrutura dos documentos é mais difícil do que ler o texto. Ferramentas de OCR podem extrair palavras, mas não explicam o papel de cada bloco, como títulos, tabelas ou figuras.

Para lidar com esse desafio, foram desenvolvidos métodos:

Métodos iniciais para análise de layout eram baseados em regras. Baseavam-se em regras geométricas e análise de textura para dividir páginas em blocos. Embora úteis, essas abordagens exigiam ajustes manuais pesados e não generalizavam bem.

Abordagens de aprendizado de máquina como Máquinas de Vetores de Suporte (SVMs) e Modelos de Mistura Gaussiana (GMMs) melhoraram isso aprendendo com os dados.7 No entanto, ainda dependiam de características artesanais e tinham dificuldade com a diversidade dos documentos do mundo real.

Aprendizado profundo transformou o campo. Redes neurais convolucionais (CNNs) tornaram possível tratar o reconhecimento de layout como detecção de objetos, identificando tabelas, figuras ou fórmulas da mesma forma que os modelos detectam objetos em imagens naturais.8 Alguns modelos também combinam características de texto e imagem para resultados mais precisos.

O desafio do aprendizado profundo: requer grandes conjuntos de dados rotulados para treinar.

Dados sintéticos como solução: O processo de geração de documentos sintéticos oferece uma maneira escalável de criar dados de treinamento anotados sem o custo de rotulagem manual.

Modelos generativos agora trazem possibilidades mais avançadas. Autoencoders variacionais (VAEs), modelos baseados em atenção e GANs podem aprender padrões estruturais de documentos e produzir novos layouts realistas.9

Principais diferenças entre geradores de documentos sintéticos

Os três geradores de documentos sintéticos comparados diferem em foco, qualidade de saída e usabilidade:

  • Genalog: Melhor equilibrado para layouts realistas e precisão numérica. Seu fluxo de trabalho baseado em Python com modelos HTML/CSS e modelos de degradação o torna ideal para treinar modelos de aprendizado de máquina em diversas tarefas de análise documental.
  • DocCreator: Forte na geração de documentos visualmente complexos e degradados, preservando a diversidade de layout. Ligeiramente menos preciso numericamente que o Genalog, mas eficaz para tarefas que exigem simulação realista de documentos digitalizados.
  • Tonic Textual: Destaca-se em layouts limpos e visualmente consistentes e síntese de dados com preservação de privacidade. Menos adequado para precisão numérica ou conjuntos de dados de treinamento completos, tornando-o melhor para tarefas focadas em layout ou substituição de PII.

Essas diferenças refletem suas abordagens principais: o Genalog equilibra realismo e fidelidade dos dados, o DocCreator enfatiza variedade de layout e degradação de documentos, e o Tonic Textual prioriza aparência e privacidade. Isso ajuda os usuários a selecionar a ferramenta certa com base em se a prioridade é eficácia do treinamento, realismo do layout ou desidentificação de dados.

Outros geradores de documentos sintéticos comumente usados

YData SDK: Oferece um gerador de documentos sintéticos capaz de produzir documentos sintéticos de alta qualidade nos formatos PDF, DOCX ou HTML, frequentemente usado para contornar obstáculos de conformidade com privacidade.10

DoGe: Uma ferramenta de código aberto projetada especificamente para sintetizar digitalizações de documentos realistas com texto significativo, títulos e tabelas para treinamento de IA de documentos.11

DocXPand: Especializado na geração de documentos de identidade (passaportes, carteiras de identidade) com base em normas ISO, preenchendo modelos com informações falsas e rostos gerados por IA.12

Leituras adicionais

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Ezgi Arslan, PhD. (2026) - "Top 3 Geradores Sintéticos de Documentos: Benchmark". Publicado on-line em AIMultiple.com. Acessado em 18 Março 2026, em: https://aimultiple.com/synthetic-document-generator [Recurso on-line]

PhD., E. A. (2026, 18 Março). Top 3 Geradores Sintéticos de Documentos: Benchmark. AIMultiple. https://aimultiple.com/synthetic-document-generator

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Top 3 Geradores Sintéticos de Documentos: Benchmark}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/synthetic-document-generator}},
  note   = {AIMultiple. Acessado em 18 Março 2026}
}
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista da Indústria
Ezgi possui doutorado em Administração de Empresas com especialização em finanças e atua como Analista da Indústria na AIMultiple. Ela conduz pesquisas e insights na interseção entre tecnologia e negócios, com expertise abrangendo sustentabilidade, análise de pesquisas e de sentimento, aplicações de agentes de IA em finanças, otimização de mecanismos de resposta, gerenciamento de firewall e tecnologias de compras.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450