Fattura OCR Benchmark: Precisione di estrazione di LLMs vs OCRs
Elaborazione delle fatture è un'operazione aziendale critica ma ad alta intensità di lavoro che tradizionalmente richiede l'estrazione manuale dei dati e l'inserimento nei sistemi contabili. Questo approccio manuale richiede molto tempo ed è soggetto a errori umani. Per valutare alternative automatizzate, abbiamo condotto un'analisi comparativa delle principali soluzioni di elaborazione documentale e degli LLMs:
- Amazon Textract API
- Claude Sonnet 3.5
- Docsumo
- Google Document IA
- Microsoft Azure Document Intelligence
- Rossum
Il nostro studio ha valutato le capacità di questi strumenti nell'estrarre accuratamente dati da diversi formati e qualità di fatture, con l'obiettivo di quantificare la loro efficacia come alternative all'elaborazione manuale.
Risultati del benchmark
Abbiamo valutato le prestazioni di elaborazione delle fatture su fatture di diversa qualità e livelli di contrasto. Mentre tutti gli strumenti hanno dimostrato prestazioni elevate con immagini di alta qualità, la loro accuratezza è diminuita significativamente quando si elaborano documenti di qualità inferiore. Tra gli strumenti testati, Claude Sonnet 3.5 ha mostrato la massima accuratezza complessiva e resilienza su tutto lo spettro delle qualità documentali.
Metodologia
Misurazione: La nostra metodologia di valutazione si è concentrata sull'accuratezza dell'estrazione di coppie chiave-valore. Ogni campo estratto è stato valutato utilizzando una classificazione binaria: estrazione corretta o estrazione errata/mancante. La metrica di accuratezza è stata calcolata utilizzando la seguente formula:
Accuratezza = (Numero di coppie chiave-valore estratte correttamente) / (Numero totale di coppie chiave-valore)
Questa metodologia ha permesso un confronto oggettivo delle prestazioni di estrazione tra diversi strumenti e tipi di documenti.
Dimensione del campione: Trovare dati sulle fatture è difficile poiché coinvolge informazioni personali come email e nomi. Abbiamo utilizzato più di 400 coppie chiave-valore da 20 campioni di fatture pubblicamente disponibili.
Campioni: Mentre tutte le soluzioni hanno elaborato correttamente immagini di alta qualità, la qualità dell'estrazione è diminuita in immagini come queste:
Fine-tuning: Sebbene i prodotti che abbiamo provato siano riusciti a trovare gli importi totali, hanno avuto problemi nell'estrarre i dettagli dei prezzi. È possibile ottenere risultati migliori eseguendo il fine-tuning di alcuni prodotti. In alcuni prodotti, gli utenti possono fare clic su un valore nell'immagine per correggere l'output del modello.
Per essere equi con tutti i fornitori, non abbiamo eseguito alcun fine-tuning. Con il fine-tuning, tutti i fornitori dovrebbero essere in grado di ottenere tassi di successo più elevati la seconda volta che elaborano questi documenti. Tuttavia, il nostro obiettivo in questo benchmark sono le operazioni autonome, che richiedono che i modelli producano risultati corretti e affidabili da documenti che non hanno mai visto prima.
Cronologia: Tutti i test sono stati completati a dicembre 2024.
Passi successivi
Aumento dei partecipanti: Poiché questo studio fornisce approfondimenti sulle attuali capacità di elaborazione delle fatture attraverso Large Language Models (LLMs), tecnologie OCR e strumenti specializzati di elaborazione delle fatture, prevediamo di ampliare la nostra analisi incorporando ulteriori LLM all'avanguardia per fornire un benchmark più completo delle soluzioni di elaborazione automatizzata delle fatture.
Aumento della dimensione e della diversità del campione.
Cos'è l'OCR delle fatture?
L'analisi delle fatture utilizza strumenti automatizzati come NLP, NLU, OCR e altre tecnologie di estrazione dei dati per estrarre dati dalle fatture in vari formati, come PDF e immagini.
Un parser di fatture è un programma software che estrae informazioni come
Nome del fornitore
Numero della fattura
Importo dovuto
e lo inserisce in un formato leggibile dalla macchina. Questi dati possono essere utilizzati per molteplici funzioni, come l'automazione della contabilità fornitori, la chiusura contabile di fine mese e la gestione delle fatture.
Il software parser è solitamente integrato in un sistema di elaborazione delle fatture che automatizza l'intero processo, dalla ricezione di una fattura al pagamento.
Come funzionano gli strumenti OCR per le fatture?
I documenti scritti in un certo linguaggio di markup vengono letti e gestiti dai parser. Essi suddividono il documento in pezzi più piccoli, chiamati token, ed esaminano ogni token per determinare cosa significa e dove si inserisce nella struttura del documento.
Per fare ciò, i parser devono conoscere a fondo la grammatica del linguaggio di markup in questione. Ciò consente loro di riconoscere ogni token e determinare le connessioni esatte tra di essi.
Il processo include 5 fasi:
1. Input
Le fatture possono essere ricevute in una varietà di formati, tra cui cartaceo, e-mail o formati elettronici come PDF o XML. Il software parser di fatture in genere accetta queste fatture come input.
2. Riconoscimento ottico dei caratteri (OCR)
Se la fattura è in formato cartaceo scannerizzato o immagine, il parser utilizzerà la tecnologia OCR per estrarre il testo dall'immagine. Ciò consente al parser di accedere ai dati contenuti nella fattura.
Alcune soluzioni di analisi delle fatture utilizzano strumenti OCR basati sull'IA o LLMs che estraggono automaticamente informazioni da PDF, foto e documenti scannerizzati senza la necessità di nuove regole o modelli. Questo perché l'IA può gestire documenti semi-strutturati e non familiari e migliorare nel tempo. Le informazioni estratte possono essere personalizzate per includere solo tabelle specifiche o voci di dati.
3. Estrazione dei dati
Il parser estrarrà quindi informazioni specifiche dalla fattura, come il nome del fornitore, il numero della fattura, la data e i dettagli degli articoli. Ciò si ottiene in genere utilizzando una combinazione di riconoscimento di pattern e algoritmi di apprendimento automatico.
Alcuni software di analisi delle fatture hanno la capacità di estrarre informazioni chiave come la data della fattura, il numero, i numeri di identificazione fiscale e vari totali utilizzando filtri predefiniti:
Alcuni strumenti parser offrono la possibilità di estrarre informazioni sugli articoli da fatture con un formato coerente creando un parser di documenti separato per ogni specifico fornitore o layout del partner commerciale:
4. Validazione dei dati
Una volta estratti i dati, il parser convaliderà le informazioni per garantire che siano accurate e complete. Ciò può includere la verifica che la data sia nel formato corretto, che il nome del fornitore corrisponda a un elenco predefinito di fornitori o che i dettagli degli articoli corrispondano al formato previsto.
5. Output dei dati
I dati estratti e convalidati vengono quindi restituiti in un formato che può essere facilmente importato nel sistema contabile o ERP dell'utente. Può trattarsi di un file CSV, di un record di database o direttamente in un software di contabilità.
Sfide con l'estrazione manuale dei dati delle fatture
L'estrazione manuale dei dati dalle fatture e il loro inserimento in un sistema può essere impegnativo per le aziende, poiché ci sono diverse complessità:
Errore umano
Le fatture possono contenere una grande quantità di dati e l'inserimento manuale aumenta il rischio di errori, come errori di battitura, trasposizione di numeri e inserimento errato dei dati. Le imprecisioni nell'inserimento dei dati sono responsabili di una perdita annua stimata di $600 miliardi.1 Processi come la contabilità fornitori richiedono un'esportazione corretta dei dati dai documenti finanziari.
Dispendioso in termini di tempo
In media, ci vogliono 17 giorni, o circa 75% di un mese, per elaborare manualmente una singola fattura.2
Molte informazioni importanti sono incluse nelle fatture e sono tutte presentate in uno stile chiave-valore dove ogni voce funge sia da chiave che da valore. Il processo di estrazione manuale di queste coppie richiede tempo e richiede molteplici ispezioni per garantire l'accuratezza. Anche alcuni algoritmi di OCR faticano a rilevare i valori estratti senza contesto. L'elaborazione automatizzata delle fatture può aiutare i dipendenti a concentrarsi su attività più complesse.
Mancanza di standardizzazione
Le fatture di fornitori diversi possono avere formati diversi. Ogni fattura viene generata con un formato unico che può creare difficoltà nell'elaborazione e nell'interpretazione di questi modelli. I documenti, come e-mail, carta e PDF, possono passare attraverso molti record digitali e cartacei prima di essere approvati per il pagamento, rendendo l'estrazione manuale dei dati impegnativa e soggetta a errori.
Inefficienza del processo
La gestione manuale delle fatture, che comporta un costo medio di quasi $23 per fattura2 , può essere sia dispendiosa in termini di tempo che costosa, portando a un processo inefficiente e ripetitivo.
Potenziale perdita di dati
Esiste il rischio di perdere dati se le fatture vengono smarrite o danneggiate o se i dati non vengono inseriti correttamente nel sistema.
OCR spesso incontrano difficoltà anche nell'estrarre le voci delle righe dalle fatture. Questo perché le tabelle delle transazioni possono mancare di linee orizzontali o verticali, rendendo difficile per l'elaborazione delle fatture tramite OCR stabilire il contesto per gli elementi estratti. Le fatture digitali raccolte o le immagini delle fatture possono essere utilizzate in questo processo.
Come scegliere il proprio fornitore di elaborazione delle fatture?
1. Fornisce una soluzione in linea con le politiche sulla privacy dei dati della propria azienda.
La politica sulla privacy dei dati della vostra azienda può rappresentare un ostacolo all'utilizzo di APIs esterne come Amazon AWS Textract. La maggior parte dei fornitori offre soluzioni on-premise, quindi le politiche sulla privacy dei dati non impedirebbero necessariamente alla vostra azienda di utilizzare una soluzione di acquisizione delle fatture. Il flusso di lavoro della contabilità fornitori deve essere trattato con attenzione poiché spesso coinvolge informazioni aziendali e finanziarie riservate.
2. Fornisce una struttura dati coerente indipendentemente dal testo sui documenti.
Ci sono due modi in cui operano le aziende di acquisizione delle fatture basate sul deep learning. Aziende come Textract restituiscono coppie chiave-valore. Quindi, per esempio, se una fattura chiama l'importo totale "Importo lordo", un'altra lo chiama "Importo totale" e un'altra fattura tedesca lo chiama "Summe", Textract fornisce i dati in 3 strutture diverse per questi 3 documenti.
In una, si ha una coppia chiave-valore con la chiave "Importo lordo", in un'altra "Importo totale" e in quella tedesca si ottiene "Summe". Altri fornitori hanno progettato strutture dati coerenti che funzionano per tutte le fatture. In tutti e 3 gli scenari, si otterrebbe "Importo totale", che è la chiave che usano nel loro file di output. Questo rende l'analisi e l'elaborazione più semplici poiché non è necessario gestire molti formati di dati strutturati diversi.
3. Chiedere i tassi di falsi positivi e di estrazione manuale dei dati
Quindi eseguire un progetto Proof of Concept (PoC) per vedere i tassi effettivi sulle fatture ricevute dalla propria azienda.
Falsi positivi sono fatture che vengono auto-elaborate ma presentano errori nell'estrazione dei dati. Sono difficili da identificare e possono interrompere le operazioni. Ad esempio, un'estrazione errata degli importi dei pagamenti sarebbe problematica. Ridurre al minimo questo dovrebbe essere l'obiettivo assoluto.
Estrazione manuale dei dati è necessaria quando il sistema di estrazione automatizzata ha una fiducia limitata nel suo risultato. Ciò potrebbe essere dovuto a un formato di fattura diverso, una scarsa qualità dell'immagine o un errore di stampa da parte del fornitore. Anche questo è importante da minimizzare, ma c'è un compromesso tra falsi positivi ed estrazione manuale dei dati. Avere più estrazione manuale dei dati può essere preferibile ad avere falsi positivi.
Questo è il primo benchmarking quantitativo che abbiamo visto in questo ambito e seguiremo una metodologia simile per preparare il nostro benchmarking.
4. Sfruttare un PoC per misurare il potenziale tasso di automazione
Ciò dipende dal numero di campi che ci si aspetta di acquisire dai documenti. Un insieme tipico di circa 10 campi, compresi elementi come l'ID dell'ordine di acquisto, il nome del fornitore, ecc., può consentire l'inserimento dei dati nell'ERP e nei pagamenti.
I fornitori best practice raggiungono circa l'80% di STP estraendo tutti questi circa 10 campi con quasi nessun errore circa l'80% delle volte. Anche se occasionalmente possono verificarsi errori, il controllo manuale dei pagamenti più grandi può garantire che nessun pagamento errato significativo sfugga alla rete.
5. Chiedere le opzioni di elaborazione avanzate fornite dal fornitore
L'estrazione è il primo passo nella raccolta dei dati; nella maggior parte dei casi deve essere seguita dall'elaborazione dei dati. Ad esempio, le fatture devono essere verificate per la conformità IVA (ad esempio, le fatture nazionali senza IVA devono spiegare perché l'IVA è esclusa) e la mancata conformità potrebbe comportare multe significative per l'azienda, a seconda del paese.
6. Chiedere come la soluzione apprende dalle nuove fatture
Le migliori soluzioni hanno un'interfaccia per consentire al tuo team di aiutare a guidare la soluzione. Quando il dipendente della tua azienda seleziona le coppie chiave-valore, la soluzione di acquisizione delle fatture prende nota in modo da poter essere più sicura di fronte a una fattura simile la prossima volta.
7. Valutare la facilità d'uso della loro soluzione di inserimento manuale dei dati
Sarà utilizzata dal personale di back-office della tua azienda mentre elabora manualmente le fatture che non possono essere elaborate automaticamente con sicurezza.
Oltre a questo, ha senso porsi domande sulle migliori pratiche di procurement. Ad esempio:
- Quanto è diffusa la loro soluzione? Hanno clienti Fortune 500?
- I loro clienti sono soddisfatti della soluzione e del supporto? Potrebbe essere utile chiedere a un conoscente di un'azienda che sta già utilizzando la loro soluzione. Poiché l'automazione delle fatture non è una soluzione che migliorerebbe il marketing o le vendite di un'azienda, anche i concorrenti potrebbero scambiarsi le loro opinioni sulle soluzioni di automazione delle fatture.
- Quali sono le opzioni per integrare la soluzione nei sistemi della tua azienda (ad es. ERP)? L'IT è d'accordo con l'approccio di integrazione?
- Qual è il loro costo totale di proprietà (TCO)? Diverse soluzioni utilizzano diverse unità di prezzo (ad esempio, prezzo per pagina o prezzo per documento), il che rende difficile questo confronto. Tuttavia, utilizzando un campione dei tuoi archivi, potresti avere una stima del costo.
Ulteriori letture
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Fattura OCR Benchmark: Precisione di estrazione di LLMs vs OCRs}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/invoice-ocr}},
note = {AIMultiple. Consultato il 4 Agosto 2026}
}Collegamenti di riferimento
Il lavoro di Cem è stato citato da importanti pubblicazioni globali tra cui Business Insider, Forbes, Washington Post, aziende globali come Deloitte, HPE e ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione europea.
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente di tecnologia e imprenditore tecnologico. Ha consigliato aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un rapporto McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha anche guidato la crescita commerciale dell'azienda deep tech Hypatos che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da 0 in 2 anni. Il lavoro di Cem in Hypatos è stato trattato da importanti pubblicazioni tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato in ingegneria informatica all'Università Bogazici e ha conseguito un MBA presso la Columbia Business School.




Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.