Servicios
Contáctanos

Los 3 mejores generadores de documentos sintéticos evaluados

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
actualizado el 18 de mar. de 2026

Los generadores de documentos sintéticos crean imágenes de documentos realistas y anotadas que ayudan a entrenar y evaluar modelos de aprendizaje automático sin depender de grandes conjuntos de datos etiquetados manualmente.

Evaluamos 3 generadores de documentos sintéticos, Genalog, DocCreator y Tonic Textual, creando más de 2.500 documentos sintéticos, comparando su efectividad en diseños realistas, datos numéricos precisos y conjuntos de datos de entrenamiento para tareas de análisis de documentos.

Resultados del benchmark de generación de documentos

Loading Chart

Los resultados muestran que

  • Genalog y DocCreator tienen un buen rendimiento tanto en utilidad como en fidelidad, siendo Genalog ligeramente mejor en precisión numérica.
  • Tonic Textual destaca en realismo del diseño visual, pero se queda atrás en otras áreas, lo que lo hace más adecuado para tareas que requieren documentos realistas.

Para más información sobre las métricas, lea la metodología del benchmark.

  • Utilidad: mide qué tan bien los modelos entrenados con datos sintéticos se desempeñan en documentos reales.
  • Fidelidad del diseño: mide qué tan bien la disposición espacial de los elementos en los documentos sintéticos coincide con los reales.
  • Fidelidad numérica: comprueba si los valores numéricos en los documentos sintéticos se asemejan a los datos reales.

Comentario sobre los resultados: Para comprender mejor las diferencias de rendimiento, el benchmark también se realizó utilizando el conjunto de entrenamiento en lugar del conjunto de prueba separado. Esta evaluación secundaria tuvo como objetivo determinar si proporcionar a los modelos con material de entrenamiento mejoraría su capacidad para reproducir resultados estructurados y numéricamente precisos.

Los resultados muestran que, incluso cuando se evaluó con los datos de entrenamiento, los modelos obtuvieron puntuaciones ligeramente más altas. Esto indica que los resultados reflejan qué tan bien las herramientas manejan la tarea en sí. Los resultados moderados probablemente están influenciados por las limitaciones en la calidad del OCR y la capacidad del modelo entrenado, más que por el propio procedimiento de benchmarking.

Genalog

documento sintético creado por Genalog, uno de los generadores de documentos sintéticos

Genalog tuvo el mejor rendimiento general. Sus documentos sintéticos fueron eficaces para el entrenamiento de modelos y mantuvieron un buen equilibrio entre elementos de diseño realistas y precisión numérica. Los documentos generados reflejaron fielmente la estructura y el espaciado de formularios y recibos reales, lo que los hace adecuados para una variedad de tareas de análisis de documentos.

DocCreator

documento sintético creado por DocCreator, uno de los generadores de documentos sintéticos

DocCreator también produjo resultados de alta calidad. Los documentos de este generador fueron casi tan útiles para el entrenamiento como los de Genalog. Los diseños eran realistas y los documentos sintéticos preservaron las propiedades estadísticas de los números. La fortaleza de DocCreator radica en combinar una generación de diseños diversa con sus modelos de degradación, haciendo que los resultados sean visualmente similares a documentos reales escaneados.

Tonic Textual

documento sintético generado por Tonic Texual, un generador de documentos sintéticos

Tonic Textual tuvo resultados mixtos. Si bien este generador de documentos sintéticos produjo diseños limpios y consistentes, los documentos fueron menos efectivos para entrenar modelos. Además, los números sintéticos no siempre fueron estadísticamente similares a los datos reales. Esto sugiere que Tonic Textual es más adecuado para tareas centradas en la apariencia del documento o el reemplazo de PII que preserva la privacidad, en lugar del entrenamiento a gran escala para tareas de estructura de diseño y extracción de información.

En marzo de 2026, Tonic Textual cambió su componente de vinculación de entidades de un modelo basado en LLM a un modelo basado en BERT para mejorar el rendimiento.1 La misma versión (v391) también añadió filtrado y ordenación mejorados en la página de Datasets.1

Visión general

Genalog es la herramienta más equilibrada, ya que proporciona tanto diseños realistas como números precisos.

DocCreator es sólido para diseños complejos y diversos y degradación de documentos, con pequeñas imprecisiones numéricas.

Tonic Textual es ideal para tareas centradas en el diseño, pero no para tareas que necesitan datos numéricos precisos.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Descripción general de la metodología

Métricas de evaluación

Cada conjunto de datos generado se puntuó frente a los datos originales utilizando las siguientes métricas:

Puntuación de utilidad

(Puntuación F1 de KIE): Una puntuación entre 0 y 1, donde cuanto más alta, mejor. Se define por la puntuación F1 del modelo LayoutLMv3 entrenado con los datos sintéticos cuando se evalúa en el conjunto de prueba real. Una puntuación alta indica que los datos sintéticos son un sustituto altamente efectivo de los datos reales.

Puntuaciones de fidelidad

Estas métricas miden qué tan cerca se parecen los documentos sintéticos a los reales.

  • Fidelidad del diseño (puntuación EMD): La distancia Earth Mover (dEMD) mide la diferencia entre la distribución de los puntos centrales de los cuadros delimitadores en los documentos reales y los sintéticos. Es un valor de 0 a 1, donde cuanto más bajo, mejor. Una puntuación baja significa que los elementos de diseño espacial se conservan bien.
  • Fidelidad numérica (distancia K-S): La distancia Kolmogorov-Smirnov (DKS) mide la diferencia máxima entre las funciones de distribución acumulada (FDA) de los valores numéricos (por ejemplo, precios, cantidades) en los datos reales y sintéticos. Va de 0 a 1, donde cuanto más bajo, mejor. Una puntuación baja significa que el generador reproduce con precisión las propiedades estadísticas de los números.

Todas las métricas se normalizaron durante el cálculo.

Conjuntos de datos

FUNSD: Una colección de 199 formularios escaneados caracterizados por texto ruidoso, diseños complejos y diversos, y anotaciones manuscritas. Se descargó más de 1.500 veces el mes pasado. Esto prueba la capacidad de un generador para manejar datos no estructurados e imperfectos. 2

  • Dividimos la muestra en dos: el 80 % de los datos se utiliza para entrenar el modelo, mientras que el 20 % restante se reserva para pruebas después del entrenamiento.
  • Cada herramienta produjo entre tres y seis documentos sintéticos por cada original, lo que resultó en un total de más de 2.500 documentos sintéticos.

Evaluación de tareas

Para medir la utilidad, se entrenó un popular modelo LayoutLMv3 con 22K estrellas en GitHub y más de 750K descargas con los datos sintéticos generados por cada herramienta generadora de documentos sintéticos. 3

Luego, el rendimiento de este modelo se evaluó en un conjunto de prueba separado de documentos reales de los conjuntos de datos originales. Esto mide directamente qué tan útiles son los datos sintéticos para una tarea del mundo real.

Herramientas de generación sintética

Genalog

Una biblioteca Python de código abierto de Microsoft para generar imágenes de documentos sintéticos con ruido sintético. Funciona tomando texto + plantillas de diseño (escritas en HTML + CSS) y renderizándolas mediante WeasyPrint, luego aplicando efectos de degradación (desenfoque, sangrado, ruido de sal y pimienta, operaciones morfológicas).4

DocCreator

Una herramienta multiplataforma de código abierto para generar imágenes de documentos sintéticos con verdad fundamental asociada. Se ha utilizado ampliamente en la investigación de Análisis y Reconocimiento de Imágenes de Documentos (DIAR).5 ,6

Tonic Textual

Una solución para la redacción y síntesis en formatos de documentos del mundo real (PDF, Word). Afirma escanear documentos no estructurados, identificar entidades nombradas (por ejemplo, PII), redactarlas o reemplazarlas con valores sintéticos y generar documentos desidentificados en formatos similares.

8 métodos de degradación de documentos sintéticos

La generación de documentos sintéticos a menudo incluye agregar defectos realistas para hacer que los datos artificiales se asemejen a documentos del mundo real. Estos defectos, o modelos de degradación, ayudan a entrenar modelos que funcionan mejor con documentos ruidosos, envejecidos o escaneados. Estas herramientas aplican varias transformaciones físicas y visuales para simular imperfecciones comunes de los documentos.6

1. Degradación de tinta

Este modelo simula el desvanecimiento, las manchas o las rayas causadas por el envejecimiento o la impresión de baja calidad. Agrega pequeñas manchas de tinta o elimina partes de las letras para imitar la degradación real de la tinta.

2. Caracteres fantasma

Las antiguas herramientas de impresión a menudo dejaban contornos tenues o marcas “fantasma” alrededor de las letras. El modelo de caracteres fantasma recrea estos insertando defectos extraídos de escaneos reales entre los caracteres impresos.

3. Agujeros en el papel

Se agregan agujeros de diferentes formas y tamaños aleatoriamente a los documentos, replicando rasgaduras o marcas de perforación que se ven en papeles desgastados.

4. Sangrado

Este efecto imita la tinta que traspasa desde el otro lado de la página. Utiliza tanto las imágenes del anverso como del reverso de un documento para recrear cómo la tinta se transfiere parcialmente a través del papel.

5. Desenfoque adaptativo

Escanea o fotografiar documentos a menudo crea un ligero desenfoque. Este modelo compara ejemplos reales borrosos y aplica un desenfoque similar utilizando filtros gaussianos, manteniendo el resultado sutil y realista.

6. Deformación 3D del papel

Los documentos pueden doblarse, plegarse o curvarse cuando se escanean o fotografían. Utilizando mallas 3D de papeles reales, este modelo recrea estas formas y efectos de iluminación, ayudando a entrenar modelos para el análisis de documentos basado en cámara.

7. Iluminación no lineal

La iluminación desigual durante el escaneo puede hacer que un lado de un documento parezca más oscuro. Este modelo ajusta el brillo en función de los ángulos de luz simulados y la curvatura de la página, reproduciendo el efecto de una iluminación deficiente.

8. Ruido de sal y pimienta

Agrega píxeles aleatorios en blanco y negro para simular polvo, textura del papel o ruido del sensor de escaneo. Este efecto de “sal y pimienta” ayuda a crear la apariencia granulada de los escaneos digitales envejecidos o de baja calidad.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Generación de documentos sintéticos como solución a los desafíos del análisis de diseño

El desafío del análisis de diseño

Comprender la estructura de los documentos es más difícil que leer el texto. Las herramientas de OCR pueden extraer palabras, pero no explican el papel de cada bloque, como títulos, tablas o figuras.

Para hacer frente a este desafío, se han desarrollado métodos:

Los primeros métodos para el análisis de diseño se basaban en reglas. Se basaban en reglas geométricas y análisis de textura para dividir las páginas en bloques. Si bien eran útiles, estos enfoques requerían un ajuste manual intensivo y no se generalizaban bien.

Los enfoques de aprendizaje automático como las Máquinas de Vectores de Soporte (SVM) y los Modelos de Mezcla Gaussiana (GMM) mejoraron esto aprendiendo de los datos.7 Sin embargo, todavía dependían de características diseñadas manualmente y tenían dificultades con la diversidad de documentos del mundo real.

El aprendizaje profundo transformó el campo. Las redes neuronales convolucionales (CNN) hicieron posible tratar el reconocimiento de diseño como la detección de objetos, identificando tablas, figuras o fórmulas de la misma manera que los modelos detectan objetos en imágenes naturales.8 Algunos modelos también combinan características de texto e imagen para obtener resultados más precisos.

El desafío del aprendizaje profundo: requiere conjuntos de datos grandes y etiquetados para entrenar.

Datos sintéticos como solución: El proceso de generación de documentos sintéticos ofrece una forma escalable de crear datos de entrenamiento anotados sin el costo del etiquetado manual.

Los modelos generativos ahora traen posibilidades más avanzadas. Los autocodificadores variacionales (VAE), los modelos basados en atención y las GAN pueden aprender patrones estructurales de documentos y producir nuevos diseños realistas.9

Diferencias clave entre los generadores de documentos sintéticos

Los tres generadores de documentos sintéticos evaluados difieren en enfoque, calidad de salida y usabilidad:

  • Genalog: El más equilibrado tanto en diseños realistas como en precisión numérica. Su flujo de trabajo basado en Python con plantillas HTML/CSS y modelos de degradación lo hace ideal para entrenar modelos de aprendizaje automático en diversas tareas de análisis de documentos.
  • DocCreator: Sólido en la generación de documentos visualmente complejos y degradados, preservando la diversidad de diseño. Ligeramente menos preciso numéricamente que Genalog, pero efectivo para tareas que requieren una simulación realista de documentos escaneados.
  • Tonic Textual: Sobresale en diseños limpios y visualmente consistentes y en la síntesis de datos que preservan la privacidad. Menos adecuado para la precisión numérica o conjuntos de datos de entrenamiento completos, lo que lo hace mejor para tareas centradas en el diseño o el reemplazo de PII.

Estas diferencias reflejan sus enfoques principales: Genalog equilibra realismo y fidelidad de datos, DocCreator enfatiza la variedad de diseño y la degradación de documentos, y Tonic Textual prioriza la apariencia y la privacidad. Esto ayuda a los usuarios a seleccionar la herramienta adecuada en función de si la prioridad es la efectividad del entrenamiento, el realismo del diseño o la desidentificación de datos.

Otros generadores de documentos sintéticos comúnmente utilizados

YData SDK: Ofrece un generador de documentos sintéticos capaz de producir documentos sintéticos de alta calidad en formatos PDF, DOCX o HTML, a menudo utilizado para eludir los obstáculos de cumplimiento de privacidad.10

DoGe: Una herramienta de código abierto diseñada específicamente para sintetizar escaneos de documentos realistas con texto significativo, encabezados y tablas para el entrenamiento de Document IA.11

DocXPand: Especializado para generar documentos de identidad (pasaportes, tarjetas de identificación) basados en estándares ISO, rellenando plantillas con información falsa y rostros generados por IA.12

Lecturas adicionales

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Ezgi Arslan, PhD. (2026) - "Los 3 mejores generadores de documentos sintéticos evaluados". Publicado en línea en AIMultiple.com. Recuperado el 18 de Marzo de 2026, de: https://aimultiple.com/synthetic-document-generator [Recurso en línea]

PhD., E. A. (2026, 18 de Marzo). Los 3 mejores generadores de documentos sintéticos evaluados. AIMultiple. https://aimultiple.com/synthetic-document-generator

@misc{phd2026,
  author = {PhD., Ezgi Arslan,},
  title  = {{Los 3 mejores generadores de documentos sintéticos evaluados}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/synthetic-document-generator}},
  note   = {AIMultiple. Recuperado el 18 de Marzo de 2026}
}
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista de la Industria
Ezgi tiene un doctorado en Administración de Empresas con especialización en finanzas y trabaja como Analista de la Industria en AIMultiple. Ella impulsa la investigación y los conocimientos en la intersección de la tecnología y los negocios, con experiencia en sostenibilidad, análisis de encuestas y sentimientos, aplicaciones de agentes de IA en finanzas, optimización de motores de respuestas, gestión de firewalls y tecnologías de adquisiciones.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450