OCR Benchmark: Accuratezza nell'Estrazione / Acquisizione del Testo
L'accuratezza dell'OCR è fondamentale per molte attività di elaborazione documentale, e i modelli LLM multimodali SOTA stanno ora offrendo un'alternativa all'OCR. Abbiamo confrontato i principali servizi di OCR nel DeltOCR Bench per identificare i loro livelli di accuratezza su diversi tipi di documenti:
- Scrittura a mano: GPT-5 (%95) si distingue come il miglior performer, seguito da vicino da olmOCR-2-7B (%94) e Gemini 2.5 Pro (%93).
- Supporti stampati: Gemini 2.5 Pro, Google Vision e Claude Sonnet 4.5 guidano questa categoria con il punteggio più alto (%85)
- Testo stampato: Microsoft Azure Document Intelligence API è in testa con un punteggio del %96.
OCR Benchmark: DeltOCR Bench
Di seguito sono elencati i nomi completi dei prodotti sopra citati e le loro versioni in uso a novembre 2025. Il nostro studio copre sia servizi API facilmente accessibili, sia soluzioni che richiedono infrastrutture on-premises, confrontando i principali modelli sul mercato in un ambiente di test approfondito.
- Scrittura a mano:
- Intervallo di accuratezza: un ampio intervallo dal %46 al %95.
- In evidenza: GPT-5 (%95), olmOCR-2-7B (%94) e Gemini 2.5 Pro (%93) mostrano le prestazioni più elevate. Questi punteggi elevati dimostrano lo straordinario potenziale di accuratezza dei modelli LLM multimodali, come GPT-5 e Gemini 2.5 Pro, in questo ambito.
- Raccomandazione: Per il riconoscimento di scrittura a mano altamente complessa, si consigliano le migliori soluzioni LLM come GPT-5 o Gemini 2.5 Pro per la loro accessibilità via API e facilità di integrazione.
- Supporti stampati:
- Intervallo di accuratezza: un intervallo dal %54 al %85.
- In evidenza: Soluzioni come Gemini 2.5 Pro, Google Vision e Claude Sonnet 4.5 condividono il punteggio più alto (%85). Questa categoria è altamente competitiva tra i modelli LLM e i servizi OCR tradizionali basati su cloud (Azure, Dots OCR, Amazon Textract). GPT-5 resta indietro rispetto ad altri LLM leader in questa categoria (%77).
- Raccomandazione: Per documenti con layout visivi complessi (font multipli, bassa risoluzione, ecc.), si consigliano LLM come Gemini 2.5 Pro, o servizi basati su cloud come Google Vision, oppure Microsoft Azure Document Intelligence API.
- Testo stampato:
- Intervallo di accuratezza: un intervallo elevato dal %55 al %96, sebbene la maggior parte delle soluzioni leader abbia raggiunto punteggi del %94 e superiori.
- In evidenza: Microsoft Azure Document Intelligence API (%96) è in testa, seguita da vicino da soluzioni come GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision e Amazon Textract, tutte con un punteggio del %95. Questa categoria è un ambito in cui tutte le soluzioni SOTA raggiungono livelli di accuratezza estremamente elevati.
- Raccomandazione: Per semplici testi stampati che richiedono alta accuratezza, si possono utilizzare con fiducia soluzioni cloud consolidate come Microsoft Azure Document Intelligence API o Google Vision, oppure LLM con punteggi elevati (Gemini/GPT-5).
Soluzioni API
I seguenti modelli sono stati inclusi nella nostra lista di benchmarking per la loro facilità di accesso e le loro prestazioni.
- Claude Sonnet 4.5
- OpenAI GPT-5
- Gemini 2.5 Pro
- Gemini 3 Pro Preview
- Amazon Textract API
- Google Cloud Vision API
- Microsoft Azure Document Intelligence API
- Moondream OCR
- Mistral OCR 3
- Mistral OCR 2
Microsoft Azure Document Intelligence API fa parte della famiglia di Azure Cognitive Services.
Modelli Distribuiti Localmente (On-Premise)
Testare questi modelli è più complesso rispetto alle soluzioni API a causa di installazione, gestione delle dipendenze e requisiti hardware. Tutti i test locali sono stati condotti in un ambiente server dedicato.
- olmOCR-2-7B
- PaddleOCR-VL
- Nanonets-OCR2-3B
- Deepseek-OCR
- Dots-OCR
Abbiamo calcolato l'accuratezza dei risultati come punteggio di similarità del coseno per testo stampato, supporti stampati e scrittura a mano. Ogni punteggio visibile nel grafico rappresenta la prestazione del modello corrispondente all'interno di quella categoria.
Durante i nostri test, abbiamo osservato che il modello Nanonets-OCR2-3B ha offerto le prestazioni più deboli nel benchmark, ottenendo i punteggi più bassi. In generale, abbiamo riscontrato che alcuni modelli hanno avuto difficoltà soprattutto con la scrittura corsiva e i layout di testo disorganizzati (ordinamento delle righe misto, maiuscole incoerenti). Problemi di prestazioni simili sono emersi anche nella categoria dei supporti stampati, specialmente con immagini a bassa risoluzione e quelle contenenti più stili di font.
Dataset
Abbiamo utilizzato un totale di 300 documenti in questo benchmark, con 100 documenti per categoria su 3 categorie:
Testo stampato include lettere, screenshot di siti web, email, report, ecc.
Supporti stampati include poster, copertine di libri, pubblicità, ecc. Abbiamo voluto verificare il successo degli strumenti OCR con diversi font e posizionamenti del testo.
I file in queste 2 categorie sono stati reperiti dall'Industry Documents Library (IDL).1
Scrittura a mano: Nella categoria scrittura a mano, poiché alcuni documenti IDL non erano facili da leggere, il nostro team ha generato documenti simili a quelli IDL. Abbiamo preparato manualmente campioni di scrittura a mano leggibile da persone. Tutti i campioni erano in stile di scrittura corsiva.
Metodologia di DeltOCR Bench
Questo benchmark si concentra sull'accuratezza dell'estrazione del testo dei prodotti.
Il preprocessing viene eseguito solo per la categoria scrittura a mano. Abbiamo fotografato i documenti scritti a mano con i nostri smartphone e utilizzato un'app di scansione mobile:
- Le immagini sono state convertite in bianco e nero
- Il contrasto è stato aumentato e lo sfondo è stato rimosso.
OCR: Abbiamo eseguito tutti i prodotti sullo stesso dataset e generato output di testo come file di testo semplice (.txt). Successivamente, abbiamo preparato manualmente la ground truth includendo il testo corretto in tutti questi file. La ground truth è stata verificata due volte da esseri umani.
Confronto: Abbiamo misurato l'accuratezza delle soluzioni OCR confrontando i loro output con i testi originali. A questo scopo, abbiamo utilizzato il framework Sentence-BERT (SBERT) per calcolare i punteggi di similarità del coseno. Nel benchmark, abbiamo utilizzato il modello multilingue ad alte prestazioni MiniLM-L12-v2 per calcolare il punteggio di similarità tra l'output di ciascun prodotto e i testi della ground truth. Questo punteggio rappresenta il livello di accuratezza del testo.
La funzione di similarità utilizza una metrica di distanza del coseno per calcolare la similarità tra due testi. Non abbiamo utilizzato la distanza di Levenshtein per questo benchmark perché prodotti diversi generano output di testo in ordini diversi.2
Mentre la distanza di Levenshtein tiene conto di queste differenze, noi stiamo solo verificando quanto accuratamente viene rilevato il testo, non dove si trova. La distanza del coseno ha penalità trascurabili per tali casi, quindi abbiamo deciso di utilizzarla in questo benchmark.
Selezione dei prodotti
Ci sono molti prodotti OCR sul mercato. Dobbiamo concentrarci su quelli che possono fornire risultati di testo semplice. I prodotti per questo benchmark sono stati scelti in base a:
- Capacità di estrarre testo. Non abbiamo incluso in questo confronto soluzioni che estraggono solo dati leggibili da macchina (cioè dati strutturati)
- La loro popolarità sul mercato
Questa non è una revisione completa del mercato e potremmo aver escluso alcuni prodotti con capacità significative. In tal caso, vi preghiamo di lasciare un commento e saremo lieti di ampliare il benchmark.
Limitazioni
Capacità avanzate come il rilevamento della posizione del testo, l'abbinamento chiave-valore e la classificazione dei documenti non sono state valutate in questo benchmark.
La dimensione del campione sarà aumentata nella prossima iterazione. Se state cercando OCR per la scrittura a mano, consultate il nostro benchmark OCR per scrittura a mano con 50 campioni.
Potete anche consultare il nostro benchmark OCR per fatture e il benchmark OCR per ricevute se siete interessati.
Risultati precedenti del benchmark OCR
- Google Cloud Vision e AWS Textract sono le tecnologie leader nel mercato per tutti i casi
- Abbyy ha anche alte prestazioni per documenti non scritti a mano
- Tutti gli OCR testati, incluso l'open source Tesseract, hanno performato bene sugli screenshot digitali.
Lo strumento OCR Vision di Google Cloud Platform raggiunge la massima accuratezza del testo del 98,0% quando viene testato l'intero set di dati. Mentre tutti i prodotti performano sopra il 99,2% con la Categoria 1, dove sono inclusi testi dattiloscritti, le immagini scritte a mano nella Categoria 2 e 3 creano la vera differenza tra i prodotti.
I risultati complessivi mostrano che GCP Vision e AWS Textract sono i prodotti OCR dominanti, con la massima accuratezza nel riconoscere il testo dato.
Note dai risultati complessivi:
- C'è una singola occasione in cui AWS Textract non è riuscito a riconoscere il testo scritto a mano. Questa situazione riduce significativamente le prestazioni di categoria e totali di AWS Textract. Aumenta anche la deviazione all'interno della categoria e complessiva, perché AWS Textract performa molto bene in tutte le altre istanze.
- Azure è il prodotto leader nella Categoria 1 con un'accuratezza del 99,8%. Tuttavia, il prodotto spesso non riesce a riconoscere il testo scritto a mano, come mostrato nei risultati per la seconda categoria. Questo è il motivo per cui Azure resta indietro nella terza categoria e complessivamente.
- Tesseract OCR è un prodotto open-source che può essere utilizzato gratuitamente. Rispetto ad Azure e ABBYY, performa meglio nelle istanze di scrittura a mano e può essere considerato per il riconoscimento della scrittura a mano se l'utente non può ottenere prodotti AWS o GCP. Tuttavia, potrebbe performare male nelle immagini scansionate.
- A differenza di altri prodotti, ABBYY produce un file .txt più strutturato. ABBYY considera anche la posizione del testo all'interno dell'immagine durante la generazione del file di output. Sebbene il prodotto abbia ulteriori capacità utili, in questo benchmark ci concentriamo solo sull'accuratezza del testo. E ha performato male nel riconoscimento della scrittura a mano.
Rimozione dell'immagine "Problematica"
Come menzionato nei risultati complessivi, c'era una singola immagine "anomala" in cui AWS Textract non è riuscito a riconoscere alcun testo. Mentre il prodotto mostra un'accuratezza del testo superiore al 95% in tutte le altre immagini, questa istanza ha ridotto le prestazioni di AWS e ampliato il suo intervallo di confidenza.
Poiché questa istanza potrebbe essere un'eccezione, abbiamo anche voluto confrontare i prodotti senza di essa. Abbiamo chiamato questa immagine la "problematica" e rieseguito i nostri risultati per vedere se facevano una differenza.
Ecco i nuovi risultati dopo aver escluso la "problematica" dal dataset.
Quando la "problematica" è esclusa, AWS Textract diventa il miglior performer con un livello di accuratezza del testo quasi perfetto (99,3%) e un intervallo di confidenza ristretto. Sebbene i punteggi non cambino molto, GCP Vision e AWS Textract rimangono i primi 2 prodotti, con una migliore accuratezza del testo rispetto agli altri.
Risultati senza Riconoscimento della Scrittura a Mano
Il principale fattore che riduce l'accuratezza del testo di alcuni prodotti è la presenza di scrittura a mano nelle immagini. Pertanto, abbiamo escluso tutte le immagini (tutta la categoria 2 e 6 immagini della categoria 3) e rivalutato nuovamente le prestazioni di accuratezza del testo.
I risultati sono più testa a testa quando le immagini scritte a mano sono escluse. AWS Textract e GCP Vision rimangono i primi 2 prodotti nel benchmark, ma anche ABBYY FineReader performa molto bene (99,3%) questa volta. Sebbene tutti i prodotti raggiungano oltre il 95% di accuratezza quando la scrittura a mano è esclusa, Azure Computer Vision e Tesseract OCR faticano ancora con i documenti scansionati, collocandosi dietro in questo confronto.
Prodotti testati
Abbiamo testato cinque prodotti OCR per misurare le loro prestazioni di accuratezza del testo. Abbiamo utilizzato le versioni disponibili a maggio 2021. I prodotti utilizzati sono:
- ABBYY FineReader 15
- Amazon Textract
- Google Cloud Platform Vision API
- Microsoft Azure Computer Vision API
- Tesseract OCR Engine
Dataset
Sebbene esistano molti dataset di immagini per l'OCR, questi sono
- per lo più a livello di carattere e non sono conformi ai casi d'uso aziendali reali
- oppure si concentrano sulla posizione del testo piuttosto che sul testo stesso.
Pertanto, abbiamo deciso di creare il nostro dataset suddiviso in tre categorie principali:
- Categoria 1 – Screenshot di pagine web che includono testi: Questa categoria include screenshot da pagine Wikipedia casuali e risultati di ricerca Google con query casuali.
- Categoria 2 – Scrittura a mano: Questa categoria include foto casuali che presentano diversi stili di scrittura a mano.
- Categoria 3 – Ricevute, fatture e contratti scansionati: Questa categoria include una raccolta casuale di ricevute, fatture scritte a mano e contratti assicurativi scansionati raccolti da internet.
Tutti i file di input sono in formato .jpg o .png.
Limitazioni
- Dataset limitato: In origine, avevamo una quarta categoria composta da foto di giornali per valutare le prestazioni dei prodotti su documenti stampati. Tuttavia, queste foto contengono troppo testo, rendendo difficile generare la ground truth. Pertanto, abbiamo deciso di non utilizzarle.
- Incoerenze nei formati di output: Molte immagini includono istanze di testo separato sui lati sinistro e destro. I prodotti estraggono questi testi in ordini diversi, causando differenze nei file di output sebbene i testi siano rilevati accuratamente. Questa situazione ci ha impedito di utilizzare altre misure di distanza (come la distanza di Levenshtein) e ha limitato le nostre opzioni per il calcolo dell'accuratezza del testo.
- Possibile problema con la distanza del coseno: La distanza del coseno utilizza gli embedding durante il calcolo della similarità. Ad esempio, confrontare le frasi "Mi piace il tè" e "Mi piace il caffè" darebbe un punteggio di similarità più alto del dovuto. Tuttavia, casi come confondere la parola "tè" con "caffè" sarebbero rari, quindi non abbiamo considerato questa possibilità in questo esercizio.
Utilizziamo altri dati di mercato (es. recensioni software, casi studio dei clienti) per classificare i fornitori di software. Tuttavia, poiché la maggior parte delle aziende utilizza il termine "OCR" quando cerca soluzioni di estrazione dati (cioè, incluse quelle che generano dati leggibili da macchina), la nostra lista ha un ambito più ampio e più aziende rispetto a quelle presentate in questo esercizio di benchmarking.
FAQ
Il Riconoscimento Ottico dei Caratteri (OCR) è un campo dell'apprendimento automatico specializzato nel distinguere i caratteri all'interno di immagini come documenti scansionati, libri stampati o foto. Sebbene sia una tecnologia matura, non esistono ancora prodotti OCR in grado di riconoscere tutti i tipi di testo con un'accuratezza del 100%. Tra i prodotti che abbiamo testato, solo pochi sono riusciti a produrre risultati soddisfacenti dal nostro set di test.
Gli strumenti OCR sono utilizzati dalle aziende per identificare i testi e le loro posizioni nelle immagini, classificare i documenti aziendali in base agli argomenti o condurre l'abbinamento chiave-valore all'interno dei documenti. Basandosi sui risultati dell'OCR, altre aziende tecnologiche sviluppano applicazioni come l'automazione documentale. Per tutti questi casi aziendali, un riconoscimento accurato del testo è fondamentale per un prodotto OCR.
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{OCR Benchmark: Accuratezza nell'Estrazione / Acquisizione del Testo}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/ocr-accuracy}},
note = {AIMultiple. Consultato il 29 Giugno 2026}
}



Commenti 8
Condividi i tuoi pensieri
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.
Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?
Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.
Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.
Hi there, thank you for the detailed comment, we are updating the article to include these details.
Hello, great work! Just curious, did you use a trained Tesseract when making these testing?
Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.
The graph images are not working for me at the moment. Otherwise great
Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.
Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html
Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.
What version of Tesseract did you test with? They recently released v5.
Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.
This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.
Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.
interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!
Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.