Los generadores de documentos sintéticos crean imágenes de documentos realistas y anotadas que ayudan a entrenar y evaluar modelos de aprendizaje automático sin depender de grandes conjuntos de datos etiquetados manualmente.
Evaluamos 3 generadores de documentos sintéticos, Genalog, DocCreator y Tonic Textual, creando más de 2.500 documentos sintéticos, comparando su efectividad en diseños realistas, datos numéricos precisos y conjuntos de datos de entrenamiento para tareas de análisis de documentos.
Resultados del benchmark de generación de documentos
Los resultados muestran que
- Genalog y DocCreator tienen un buen rendimiento tanto en utilidad como en fidelidad, siendo Genalog ligeramente mejor en precisión numérica.
- Tonic Textual destaca en realismo del diseño visual, pero se queda atrás en otras áreas, lo que lo hace más adecuado para tareas que requieren documentos realistas.
Para más información sobre las métricas, lea la metodología del benchmark.
- Utilidad: mide qué tan bien los modelos entrenados con datos sintéticos se desempeñan en documentos reales.
- Fidelidad del diseño: mide qué tan bien la disposición espacial de los elementos en los documentos sintéticos coincide con los reales.
- Fidelidad numérica: comprueba si los valores numéricos en los documentos sintéticos se asemejan a los datos reales.
Comentario sobre los resultados: Para comprender mejor las diferencias de rendimiento, el benchmark también se realizó utilizando el conjunto de entrenamiento en lugar del conjunto de prueba separado. Esta evaluación secundaria tuvo como objetivo determinar si proporcionar a los modelos con material de entrenamiento mejoraría su capacidad para reproducir resultados estructurados y numéricamente precisos.
Los resultados muestran que, incluso cuando se evaluó con los datos de entrenamiento, los modelos obtuvieron puntuaciones ligeramente más altas. Esto indica que los resultados reflejan qué tan bien las herramientas manejan la tarea en sí. Los resultados moderados probablemente están influenciados por las limitaciones en la calidad del OCR y la capacidad del modelo entrenado, más que por el propio procedimiento de benchmarking.
Genalog

Genalog tuvo el mejor rendimiento general. Sus documentos sintéticos fueron eficaces para el entrenamiento de modelos y mantuvieron un buen equilibrio entre elementos de diseño realistas y precisión numérica. Los documentos generados reflejaron fielmente la estructura y el espaciado de formularios y recibos reales, lo que los hace adecuados para una variedad de tareas de análisis de documentos.
DocCreator

DocCreator también produjo resultados de alta calidad. Los documentos de este generador fueron casi tan útiles para el entrenamiento como los de Genalog. Los diseños eran realistas y los documentos sintéticos preservaron las propiedades estadísticas de los números. La fortaleza de DocCreator radica en combinar una generación de diseños diversa con sus modelos de degradación, haciendo que los resultados sean visualmente similares a documentos reales escaneados.
Tonic Textual

Tonic Textual tuvo resultados mixtos. Si bien este generador de documentos sintéticos produjo diseños limpios y consistentes, los documentos fueron menos efectivos para entrenar modelos. Además, los números sintéticos no siempre fueron estadísticamente similares a los datos reales. Esto sugiere que Tonic Textual es más adecuado para tareas centradas en la apariencia del documento o el reemplazo de PII que preserva la privacidad, en lugar del entrenamiento a gran escala para tareas de estructura de diseño y extracción de información.
En marzo de 2026, Tonic Textual cambió su componente de vinculación de entidades de un modelo basado en LLM a un modelo basado en BERT para mejorar el rendimiento.1 La misma versión (v391) también añadió filtrado y ordenación mejorados en la página de Datasets.1
Visión general
Genalog es la herramienta más equilibrada, ya que proporciona tanto diseños realistas como números precisos.
DocCreator es sólido para diseños complejos y diversos y degradación de documentos, con pequeñas imprecisiones numéricas.
Tonic Textual es ideal para tareas centradas en el diseño, pero no para tareas que necesitan datos numéricos precisos.
Descripción general de la metodología
Métricas de evaluación
Cada conjunto de datos generado se puntuó frente a los datos originales utilizando las siguientes métricas:
Puntuación de utilidad
(Puntuación F1 de KIE): Una puntuación entre 0 y 1, donde cuanto más alta, mejor. Se define por la puntuación F1 del modelo LayoutLMv3 entrenado con los datos sintéticos cuando se evalúa en el conjunto de prueba real. Una puntuación alta indica que los datos sintéticos son un sustituto altamente efectivo de los datos reales.
Puntuaciones de fidelidad
Estas métricas miden qué tan cerca se parecen los documentos sintéticos a los reales.
- Fidelidad del diseño (puntuación EMD): La distancia Earth Mover (dEMD) mide la diferencia entre la distribución de los puntos centrales de los cuadros delimitadores en los documentos reales y los sintéticos. Es un valor de 0 a 1, donde cuanto más bajo, mejor. Una puntuación baja significa que los elementos de diseño espacial se conservan bien.
- Fidelidad numérica (distancia K-S): La distancia Kolmogorov-Smirnov (DKS) mide la diferencia máxima entre las funciones de distribución acumulada (FDA) de los valores numéricos (por ejemplo, precios, cantidades) en los datos reales y sintéticos. Va de 0 a 1, donde cuanto más bajo, mejor. Una puntuación baja significa que el generador reproduce con precisión las propiedades estadísticas de los números.
Todas las métricas se normalizaron durante el cálculo.
Conjuntos de datos
FUNSD: Una colección de 199 formularios escaneados caracterizados por texto ruidoso, diseños complejos y diversos, y anotaciones manuscritas. Se descargó más de 1.500 veces el mes pasado. Esto prueba la capacidad de un generador para manejar datos no estructurados e imperfectos. 2
- Dividimos la muestra en dos: el 80 % de los datos se utiliza para entrenar el modelo, mientras que el 20 % restante se reserva para pruebas después del entrenamiento.
- Cada herramienta produjo entre tres y seis documentos sintéticos por cada original, lo que resultó en un total de más de 2.500 documentos sintéticos.
Evaluación de tareas
Para medir la utilidad, se entrenó un popular modelo LayoutLMv3 con 22K estrellas en GitHub y más de 750K descargas con los datos sintéticos generados por cada herramienta generadora de documentos sintéticos. 3
Luego, el rendimiento de este modelo se evaluó en un conjunto de prueba separado de documentos reales de los conjuntos de datos originales. Esto mide directamente qué tan útiles son los datos sintéticos para una tarea del mundo real.
Herramientas de generación sintética
Genalog
Una biblioteca Python de código abierto de Microsoft para generar imágenes de documentos sintéticos con ruido sintético. Funciona tomando texto + plantillas de diseño (escritas en HTML + CSS) y renderizándolas mediante WeasyPrint, luego aplicando efectos de degradación (desenfoque, sangrado, ruido de sal y pimienta, operaciones morfológicas).4
DocCreator
Una herramienta multiplataforma de código abierto para generar imágenes de documentos sintéticos con verdad fundamental asociada. Se ha utilizado ampliamente en la investigación de Análisis y Reconocimiento de Imágenes de Documentos (DIAR).5 ,6
Tonic Textual
Una solución para la redacción y síntesis en formatos de documentos del mundo real (PDF, Word). Afirma escanear documentos no estructurados, identificar entidades nombradas (por ejemplo, PII), redactarlas o reemplazarlas con valores sintéticos y generar documentos desidentificados en formatos similares.
8 métodos de degradación de documentos sintéticos
La generación de documentos sintéticos a menudo incluye agregar defectos realistas para hacer que los datos artificiales se asemejen a documentos del mundo real. Estos defectos, o modelos de degradación, ayudan a entrenar modelos que funcionan mejor con documentos ruidosos, envejecidos o escaneados. Estas herramientas aplican varias transformaciones físicas y visuales para simular imperfecciones comunes de los documentos.6
1. Degradación de tinta
Este modelo simula el desvanecimiento, las manchas o las rayas causadas por el envejecimiento o la impresión de baja calidad. Agrega pequeñas manchas de tinta o elimina partes de las letras para imitar la degradación real de la tinta.
2. Caracteres fantasma
Las antiguas herramientas de impresión a menudo dejaban contornos tenues o marcas “fantasma” alrededor de las letras. El modelo de caracteres fantasma recrea estos insertando defectos extraídos de escaneos reales entre los caracteres impresos.
3. Agujeros en el papel
Se agregan agujeros de diferentes formas y tamaños aleatoriamente a los documentos, replicando rasgaduras o marcas de perforación que se ven en papeles desgastados.
4. Sangrado
Este efecto imita la tinta que traspasa desde el otro lado de la página. Utiliza tanto las imágenes del anverso como del reverso de un documento para recrear cómo la tinta se transfiere parcialmente a través del papel.
5. Desenfoque adaptativo
Escanea o fotografiar documentos a menudo crea un ligero desenfoque. Este modelo compara ejemplos reales borrosos y aplica un desenfoque similar utilizando filtros gaussianos, manteniendo el resultado sutil y realista.
6. Deformación 3D del papel
Los documentos pueden doblarse, plegarse o curvarse cuando se escanean o fotografían. Utilizando mallas 3D de papeles reales, este modelo recrea estas formas y efectos de iluminación, ayudando a entrenar modelos para el análisis de documentos basado en cámara.
7. Iluminación no lineal
La iluminación desigual durante el escaneo puede hacer que un lado de un documento parezca más oscuro. Este modelo ajusta el brillo en función de los ángulos de luz simulados y la curvatura de la página, reproduciendo el efecto de una iluminación deficiente.
8. Ruido de sal y pimienta
Agrega píxeles aleatorios en blanco y negro para simular polvo, textura del papel o ruido del sensor de escaneo. Este efecto de “sal y pimienta” ayuda a crear la apariencia granulada de los escaneos digitales envejecidos o de baja calidad.
Generación de documentos sintéticos como solución a los desafíos del análisis de diseño
El desafío del análisis de diseño
Comprender la estructura de los documentos es más difícil que leer el texto. Las herramientas de OCR pueden extraer palabras, pero no explican el papel de cada bloque, como títulos, tablas o figuras.
Para hacer frente a este desafío, se han desarrollado métodos:
Los primeros métodos para el análisis de diseño se basaban en reglas. Se basaban en reglas geométricas y análisis de textura para dividir las páginas en bloques. Si bien eran útiles, estos enfoques requerían un ajuste manual intensivo y no se generalizaban bien.
Los enfoques de aprendizaje automático como las Máquinas de Vectores de Soporte (SVM) y los Modelos de Mezcla Gaussiana (GMM) mejoraron esto aprendiendo de los datos.7 Sin embargo, todavía dependían de características diseñadas manualmente y tenían dificultades con la diversidad de documentos del mundo real.
El aprendizaje profundo transformó el campo. Las redes neuronales convolucionales (CNN) hicieron posible tratar el reconocimiento de diseño como la detección de objetos, identificando tablas, figuras o fórmulas de la misma manera que los modelos detectan objetos en imágenes naturales.8 Algunos modelos también combinan características de texto e imagen para obtener resultados más precisos.
El desafío del aprendizaje profundo: requiere conjuntos de datos grandes y etiquetados para entrenar.
Datos sintéticos como solución: El proceso de generación de documentos sintéticos ofrece una forma escalable de crear datos de entrenamiento anotados sin el costo del etiquetado manual.
Los modelos generativos ahora traen posibilidades más avanzadas. Los autocodificadores variacionales (VAE), los modelos basados en atención y las GAN pueden aprender patrones estructurales de documentos y producir nuevos diseños realistas.9
Diferencias clave entre los generadores de documentos sintéticos
Los tres generadores de documentos sintéticos evaluados difieren en enfoque, calidad de salida y usabilidad:
- Genalog: El más equilibrado tanto en diseños realistas como en precisión numérica. Su flujo de trabajo basado en Python con plantillas HTML/CSS y modelos de degradación lo hace ideal para entrenar modelos de aprendizaje automático en diversas tareas de análisis de documentos.
- DocCreator: Sólido en la generación de documentos visualmente complejos y degradados, preservando la diversidad de diseño. Ligeramente menos preciso numéricamente que Genalog, pero efectivo para tareas que requieren una simulación realista de documentos escaneados.
- Tonic Textual: Sobresale en diseños limpios y visualmente consistentes y en la síntesis de datos que preservan la privacidad. Menos adecuado para la precisión numérica o conjuntos de datos de entrenamiento completos, lo que lo hace mejor para tareas centradas en el diseño o el reemplazo de PII.
Estas diferencias reflejan sus enfoques principales: Genalog equilibra realismo y fidelidad de datos, DocCreator enfatiza la variedad de diseño y la degradación de documentos, y Tonic Textual prioriza la apariencia y la privacidad. Esto ayuda a los usuarios a seleccionar la herramienta adecuada en función de si la prioridad es la efectividad del entrenamiento, el realismo del diseño o la desidentificación de datos.
Otros generadores de documentos sintéticos comúnmente utilizados
YData SDK: Ofrece un generador de documentos sintéticos capaz de producir documentos sintéticos de alta calidad en formatos PDF, DOCX o HTML, a menudo utilizado para eludir los obstáculos de cumplimiento de privacidad.10
DoGe: Una herramienta de código abierto diseñada específicamente para sintetizar escaneos de documentos realistas con texto significativo, encabezados y tablas para el entrenamiento de Document IA.11
DocXPand: Especializado para generar documentos de identidad (pasaportes, tarjetas de identificación) basados en estándares ISO, rellenando plantillas con información falsa y rostros generados por IA.12
Lecturas adicionales
- Benchmark de generación de datos sintéticos y mejores prácticas
- Los 25 principales casos de uso de datos sintéticos
- Usuarios sintéticos explicados: Las 7 mejores herramientas de investigación de usuarios con IA
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{phd2026,
author = {PhD., Ezgi Arslan,},
title = {{Los 3 mejores generadores de documentos sintéticos evaluados}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/synthetic-document-generator}},
note = {AIMultiple. Recuperado el 18 de Marzo de 2026}
}
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.