Les générateurs de documents synthétiques créent des images de documents annotées et réalistes qui aident à entraîner et évaluer des modèles de machine learning sans dépendre de grands jeux de données étiquetés manuellement.
Nous comparons 3 générateurs de documents synthétiques, Genalog, DocCreator et Tonic Textual, en créant plus de 2 500 documents synthétiques, et en évaluant leur efficacité en matière de mises en page réalistes, de données numériques précises et de jeux de données d'entraînement pour les tâches d'analyse de documents.
Résultats du comparatif de génération de documents
Les résultats montrent que
- Genalog et DocCreator sont performants à la fois en termes d'utilité et de fidélité, Genalog étant légèrement meilleur pour la précision numérique.
- Tonic Textual excelle en réalisme de mise en page visuelle mais reste en retrait dans d'autres domaines, ce qui le rend plus adapté aux tâches nécessitant des documents réalistes.
Pour plus d'informations sur les métriques, consultez la méthodologie du comparatif.
- L'utilité mesure les performances sur des documents réels des modèles entraînés sur des données synthétiques.
- La fidélité de mise en page mesure à quel point la disposition spatiale des éléments dans les documents synthétiques correspond à celle des documents réels.
- La fidélité numérique vérifie si les valeurs numériques dans les documents synthétiques ressemblent aux données réelles.
Commentaire sur les résultats : Pour mieux comprendre les différences de performance, le comparatif a également été réalisé en utilisant le jeu d'entraînement au lieu du jeu de test séparé. Cette seconde évaluation visait à déterminer si fournir aux modèles du matériel d'entraînement améliorerait leur capacité à reproduire des résultats structurés et numériquement précis.
Les résultats montrent que, même évalués sur les données d'entraînement, les modèles ont obtenu des scores légèrement plus élevés. Cela indique que les résultats reflètent la manière dont les outils gèrent la tâche elle-même. Les résultats modérés sont probablement influencés par les limites de la qualité de l'OCR et la capacité du modèle entraîné, plutôt que par la procédure de comparaison elle-même.
Genalog

Genalog a obtenu les meilleurs résultats globaux. Ses documents synthétiques se sont révélés efficaces pour l'entraînement de modèles et ont maintenu un bon équilibre entre des éléments de mise en page réalistes et la précision numérique. Les documents générés reflétaient fidèlement la structure et l'espacement des formulaires et reçus réels, ce qui les rend adaptés à une variété de tâches d'analyse de documents.
DocCreator

DocCreator a également produit des résultats de haute qualité. Les documents de ce générateur étaient presque aussi utiles pour l'entraînement que ceux de Genalog. Les mises en page étaient réalistes et les documents synthétiques préservaient les propriétés statistiques des nombres. La force de DocCreator réside dans sa capacité à combiner une génération de mises en page diversifiées avec ses modèles de dégradation, rendant les résultats visuellement similaires à des documents numérisés du monde réel.
Tonic Textual

Tonic Textual a obtenu des résultats mitigés. Bien que ce générateur de documents synthétiques produise des mises en page propres et cohérentes, les documents étaient moins efficaces pour l'entraînement des modèles. De plus, les nombres synthétiques n'étaient pas toujours statistiquement similaires aux données réelles. Cela suggère que Tonic Textual est mieux adapté aux tâches axées sur l'apparence des documents ou le remplacement d'informations personnelles pour préserver la confidentialité, plutôt qu'à l'entraînement complet pour les tâches de structure de mise en page et d'extraction d'informations.
En mars 2026, Tonic Textual a remplacé son composant de liaison d'entités, passant d'un modèle basé sur un LLM à un modèle basé sur BERT pour améliorer le débit.1 La même version (v391) a également ajouté un filtrage et un tri améliorés sur la page Datasets.1
Aperçu général
Genalog est l'outil le mieux équilibré, offrant à la fois des mises en page réalistes et des nombres précis.
DocCreator est solide pour les mises en page complexes et diversifiées ainsi que pour la dégradation de documents, avec de légères inexactitudes numériques.
Tonic Textual est idéal pour les tâches axées sur la mise en page, mais pas pour les tâches nécessitant des données numériques précises.
Aperçu de la méthodologie
Métriques d'évaluation
Chaque jeu de données généré a été noté par rapport aux données originales en utilisant les métriques suivantes :
Score d'utilité
(Score F1 KIE) : Un score entre 0 et 1, où plus il est élevé, mieux c'est. Il est défini par le score F1 du modèle LayoutLMv3 entraîné sur les données synthétiques lorsqu'il est évalué sur le jeu de test réel. Un score élevé indique que les données synthétiques constituent un substitut très efficace aux données réelles.
Scores de fidélité
Ces métriques mesurent à quel point les documents synthétiques ressemblent aux documents réels.
- Fidélité de mise en page (Score EMD) : La distance du déménageur de terre (dEMD) mesure la différence entre la distribution des points centraux des boîtes englobantes dans les documents réels par rapport aux documents synthétiques. C'est une valeur de 0 à 1, où plus elle est basse, mieux c'est. Un score bas signifie que les éléments de mise en page spatiale sont bien préservés.
- Fidélité numérique (Distance K-S) : La distance de Kolmogorov-Smirnov (DKS) mesure la différence maximale entre les fonctions de distribution cumulative (CDF) des valeurs numériques (par ex., prix, quantités) dans les données réelles et synthétiques. Elle varie de 0 à 1, où plus elle est basse, mieux c'est. Un score bas signifie que le générateur reproduit avec précision les propriétés statistiques des nombres.
Toutes les métriques ont été normalisées pendant le calcul.
Jeux de données
FUNSD : Une collection de 199 formulaires numérisés caractérisés par un texte bruité, des mises en page complexes et diversifiées, et des annotations manuscrites. Il a été téléchargé plus de 1 500 fois le mois dernier. Ce jeu de données teste la capacité d'un générateur à gérer des données non structurées et imparfaites. 2
- Nous divisons l'échantillon en deux : 80 % des données sont utilisées pour entraîner le modèle, tandis que les 20 % restants sont réservés pour les tests après l'entraînement.
- Chaque outil a produit entre trois et six documents synthétiques pour chaque original, ce qui donne un total de plus de 2 500 documents synthétiques.
Évaluation des tâches
Pour mesurer l'utilité, un modèle LayoutLMv3 populaire avec 22K étoiles GitHub et plus de 750K téléchargements a été entraîné sur les données synthétiques générées par chaque outil générateur de documents synthétiques. 3
La performance de ce modèle a ensuite été évaluée sur un jeu de test réservé de documents réels provenant des jeux de données originaux. Cela mesure directement l'utilité des données synthétiques pour une tâche du monde réel.
Outils de génération synthétique
Genalog
Une bibliothèque Python open-source de Microsoft pour générer des images de documents synthétiques avec du bruit synthétique. Elle fonctionne en prenant des modèles de texte + mise en page (écrits en HTML + CSS) et en les rendant via WeasyPrint, puis en appliquant des effets de dégradation (flou, effet de transparence, bruit sel et poivre, opérations morphologiques).4
DocCreator
Un outil open-source multiplateforme pour générer des images de documents synthétiques avec vérité terrain associée. Il a été largement utilisé dans la recherche en analyse et reconnaissance d'images de documents (DIAR).5 ,6
Tonic Textual
Une solution de caviardage et de synthèse pour les formats de documents du monde réel (PDF, Word). Elle prétend analyser des documents non structurés, identifier les entités nommées (par ex., informations personnelles), les caviarder ou les remplacer par des valeurs synthétiques, et produire des documents dé-identifiés dans des formats similaires.
8 méthodes de dégradation de documents synthétiques
La génération de documents synthétiques inclut souvent l'ajout de défauts réalistes pour que les données artificielles ressemblent à des documents du monde réel. Ces défauts, ou modèles de dégradation, aident à entraîner des modèles qui performent mieux sur des documents bruités, vieillis ou numérisés. Ces outils appliquent plusieurs transformations physiques et visuelles pour simuler les imperfections courantes des documents.6
1. Dégradation de l'encre
Ce modèle simule la décoloration, les taches ou les traînées causées par le vieillissement ou une impression de mauvaise qualité. Il ajoute de petites taches d'encre ou supprime des parties de lettres pour imiter la dégradation réelle de l'encre.
2. Caractères fantômes
Les anciens outils d'impression laissaient souvent des contours pâles ou des marques « fantômes » autour des lettres. Le modèle de caractères fantômes les recrée en insérant des défauts extraits de scans réels entre les caractères imprimés.
3. Trous dans le papier
Des trous de différentes formes et tailles sont ajoutés aléatoirement aux documents, reproduisant les déchirures ou les perforations observées sur les papiers usés.
4. Effet de transparence
Cet effet imite l'encre qui traverse depuis l'autre côté de la page. Il utilise les images du recto et du verso d'un document pour recréer la façon dont l'encre se transfère partiellement à travers le papier.
5. Flou adaptatif
La numérisation ou la photographie de documents crée souvent un léger flou. Ce modèle compare des exemples réels flous et applique un flou similaire en utilisant des filtres gaussiens, gardant le résultat subtil et réaliste.
6. Déformation du papier en 3D
Les documents peuvent se plier, se courber ou s'enrouler lorsqu'ils sont numérisés ou photographiés. En utilisant des maillages 3D de papiers réels, ce modèle recrée ces formes et effets de lumière, aidant à entraîner des modèles pour l'analyse de documents par caméra.
7. Éclairage non linéaire
Un éclairage inégal pendant la numérisation peut rendre un côté d'un document plus sombre. Ce modèle ajuste la luminosité en fonction des angles de lumière simulés et de la courbure de la page, reproduisant l'effet d'un mauvais éclairage.
8. Bruit sel et poivre
Ajoute des pixels noirs et blancs aléatoires pour simuler la poussière, la texture du papier ou le bruit du capteur de numérisation. Cet effet « sel et poivre » aide à créer l'apparence granuleuse des numérisations numériques vieillies ou de mauvaise qualité.
La génération de documents synthétiques comme solution aux défis de l'analyse de mise en page
Le défi de l'analyse de mise en page
Comprendre la structure des documents est plus difficile que lire le texte. Les outils d'OCR peuvent extraire des mots, mais ils n'expliquent pas le rôle de chaque bloc, tel que les titres, les tableaux ou les figures.
Pour relever ce défi, des méthodes ont été développées :
Les premières méthodes d'analyse de mise en page étaient basées sur des règles. Elles s'appuyaient sur des règles géométriques et l'analyse de texture pour diviser les pages en blocs. Bien qu'utiles, ces approches nécessitaient un réglage manuel important et ne se généralisaient pas bien.
Les approches de machine learning comme les machines à vecteurs de support (SVM) et les modèles de mélange gaussien (GMM) ont amélioré cela en apprenant à partir des données.7 Cependant, elles dépendaient encore de caractéristiques artisanales et peinaient face à la diversité des documents du monde réel.
Le deep learning a transformé le domaine. Les réseaux de neurones convolutifs (CNN) ont permis de traiter la reconnaissance de mise en page comme la détection d'objets, en identifiant les tableaux, les figures ou les formules de la même manière que les modèles détectent des objets dans les images naturelles.8 Certains modèles combinent également les caractéristiques du texte et de l'image pour des résultats plus précis.
Le défi du deep learning : nécessite de grands jeux de données étiquetés pour l'entraînement.
Les données synthétiques comme solution : Le processus de génération de documents synthétiques offre un moyen évolutif de créer des données d'entraînement annotées sans le coût de l'étiquetage manuel.
Les modèles génératifs apportent désormais des possibilités plus avancées. Les autoencodeurs variationnels (VAE), les modèles basés sur l'attention et les GAN peuvent apprendre les motifs structurels des documents et produire de nouvelles mises en page réalistes.9
Différences clés entre les générateurs de documents synthétiques
Les trois générateurs de documents synthétiques comparés diffèrent par leur orientation, la qualité des résultats et leur facilité d'utilisation :
- Genalog : Le mieux équilibré pour des mises en page réalistes et la précision numérique. Son flux de travail basé sur Python avec des modèles HTML/CSS et des modèles de dégradation le rend idéal pour l'entraînement de modèles de machine learning sur diverses tâches d'analyse de documents.
- DocCreator : Solide pour générer des documents visuellement complexes et dégradés, en préservant la diversité des mises en page. Légèrement moins précis numériquement que Genalog, mais efficace pour les tâches nécessitant une simulation réaliste de documents numérisés.
- Tonic Textual : Excelle dans les mises en page propres et visuellement cohérentes et la synthèse de données préservant la confidentialité. Moins adapté à la précision numérique ou aux jeux de données d'entraînement complets, ce qui le rend meilleur pour les tâches axées sur la mise en page ou le remplacement d'informations personnelles.
Ces différences reflètent leurs approches principales : Genalog équilibre le réalisme et la fidélité des données, DocCreator met l'accent sur la variété des mises en page et la dégradation des documents, et Tonic Textual privilégie l'apparence et la confidentialité. Cela aide les utilisateurs à choisir le bon outil selon que la priorité est l'efficacité de l'entraînement, le réalisme de la mise en page ou la dé-identification des données.
Autres générateurs de documents synthétiques couramment utilisés
YData SDK : Propose un générateur de documents synthétiques capable de produire des documents synthétiques de haute qualité aux formats PDF, DOCX ou HTML, souvent utilisé pour contourner les obstacles de conformité en matière de confidentialité.10
DoGe : Un outil open-source spécifiquement conçu pour synthétiser des numérisations de documents réalistes comportant du texte significatif, des titres et des tableaux pour l'entraînement de l'IA documentaire.11
DocXPand : Spécialisé dans la génération de documents d'identité (passeports, cartes d'identité) basés sur les normes ISO, remplissant des modèles avec de fausses informations et des visages générés par IA.12
Lectures complémentaires
- Comparatif et meilleures pratiques de génération de données synthétiques
- Top 25 cas d'usage des données synthétiques
- Utilisateurs synthétiques expliqués : Top 7 des outils de recherche utilisateur par IA
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{phd2026,
author = {PhD., Ezgi Arslan,},
title = {{Top 3 des générateurs de documents synthétiques comparés}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/synthetic-document-generator}},
note = {AIMultiple. Consulté le 18 Mars 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.