Servizi
Contattaci

OCR Benchmark: Accuratezza nell'Estrazione / Acquisizione del Testo

Cem Dilmegani
Cem Dilmegani
aggiornato il 29 giu. 2026

L'accuratezza dell'OCR è fondamentale per molte attività di elaborazione documentale, e i modelli LLM multimodali SOTA stanno ora offrendo un'alternativa all'OCR. Abbiamo confrontato i principali servizi di OCR nel DeltOCR Bench per identificare i loro livelli di accuratezza su diversi tipi di documenti:

  • Scrittura a mano: GPT-5 (%95) si distingue come il miglior performer, seguito da vicino da olmOCR-2-7B (%94) e Gemini 2.5 Pro (%93).
  • Supporti stampati: Gemini 2.5 Pro, Google Vision e Claude Sonnet 4.5 guidano questa categoria con il punteggio più alto (%85)
  • Testo stampato: Microsoft Azure Document Intelligence API è in testa con un punteggio del %96.

OCR Benchmark: DeltOCR Bench

Loading Chart

Di seguito sono elencati i nomi completi dei prodotti sopra citati e le loro versioni in uso a novembre 2025. Il nostro studio copre sia servizi API facilmente accessibili, sia soluzioni che richiedono infrastrutture on-premises, confrontando i principali modelli sul mercato in un ambiente di test approfondito.

  • Scrittura a mano:
    • Intervallo di accuratezza: un ampio intervallo dal %46 al %95.
    • In evidenza: GPT-5 (%95), olmOCR-2-7B (%94) e Gemini 2.5 Pro (%93) mostrano le prestazioni più elevate. Questi punteggi elevati dimostrano lo straordinario potenziale di accuratezza dei modelli LLM multimodali, come GPT-5 e Gemini 2.5 Pro, in questo ambito.
    • Raccomandazione: Per il riconoscimento di scrittura a mano altamente complessa, si consigliano le migliori soluzioni LLM come GPT-5 o Gemini 2.5 Pro per la loro accessibilità via API e facilità di integrazione.
  • Supporti stampati:
    • Intervallo di accuratezza: un intervallo dal %54 al %85.
    • In evidenza: Soluzioni come Gemini 2.5 Pro, Google Vision e Claude Sonnet 4.5 condividono il punteggio più alto (%85). Questa categoria è altamente competitiva tra i modelli LLM e i servizi OCR tradizionali basati su cloud (Azure, Dots OCR, Amazon Textract). GPT-5 resta indietro rispetto ad altri LLM leader in questa categoria (%77).
    • Raccomandazione: Per documenti con layout visivi complessi (font multipli, bassa risoluzione, ecc.), si consigliano LLM come Gemini 2.5 Pro, o servizi basati su cloud come Google Vision, oppure Microsoft Azure Document Intelligence API.
  • Testo stampato:
    • Intervallo di accuratezza: un intervallo elevato dal %55 al %96, sebbene la maggior parte delle soluzioni leader abbia raggiunto punteggi del %94 e superiori.
    • In evidenza: Microsoft Azure Document Intelligence API (%96) è in testa, seguita da vicino da soluzioni come GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision e Amazon Textract, tutte con un punteggio del %95. Questa categoria è un ambito in cui tutte le soluzioni SOTA raggiungono livelli di accuratezza estremamente elevati.
    • Raccomandazione: Per semplici testi stampati che richiedono alta accuratezza, si possono utilizzare con fiducia soluzioni cloud consolidate come Microsoft Azure Document Intelligence API o Google Vision, oppure LLM con punteggi elevati (Gemini/GPT-5).

Soluzioni API

I seguenti modelli sono stati inclusi nella nostra lista di benchmarking per la loro facilità di accesso e le loro prestazioni.

  • Claude Sonnet 4.5
  • OpenAI GPT-5
  • Gemini 2.5 Pro
  • Gemini 3 Pro Preview
  • Amazon Textract API
  • Google Cloud Vision API
  • Microsoft Azure Document Intelligence API
  • Moondream OCR
  • Mistral OCR 3
  • Mistral OCR 2

Microsoft Azure Document Intelligence API fa parte della famiglia di Azure Cognitive Services.

Modelli Distribuiti Localmente (On-Premise)

Testare questi modelli è più complesso rispetto alle soluzioni API a causa di installazione, gestione delle dipendenze e requisiti hardware. Tutti i test locali sono stati condotti in un ambiente server dedicato.

  • olmOCR-2-7B
  • PaddleOCR-VL
  • Nanonets-OCR2-3B
  • Deepseek-OCR
  • Dots-OCR

Abbiamo calcolato l'accuratezza dei risultati come punteggio di similarità del coseno per testo stampato, supporti stampati e scrittura a mano. Ogni punteggio visibile nel grafico rappresenta la prestazione del modello corrispondente all'interno di quella categoria.

Durante i nostri test, abbiamo osservato che il modello Nanonets-OCR2-3B ha offerto le prestazioni più deboli nel benchmark, ottenendo i punteggi più bassi. In generale, abbiamo riscontrato che alcuni modelli hanno avuto difficoltà soprattutto con la scrittura corsiva e i layout di testo disorganizzati (ordinamento delle righe misto, maiuscole incoerenti). Problemi di prestazioni simili sono emersi anche nella categoria dei supporti stampati, specialmente con immagini a bassa risoluzione e quelle contenenti più stili di font.

Dataset

Abbiamo utilizzato un totale di 300 documenti in questo benchmark, con 100 documenti per categoria su 3 categorie:

Testo stampato include lettere, screenshot di siti web, email, report, ecc.

Supporti stampati include poster, copertine di libri, pubblicità, ecc. Abbiamo voluto verificare il successo degli strumenti OCR con diversi font e posizionamenti del testo.

I file in queste 2 categorie sono stati reperiti dall'Industry Documents Library (IDL).1

Scrittura a mano: Nella categoria scrittura a mano, poiché alcuni documenti IDL non erano facili da leggere, il nostro team ha generato documenti simili a quelli IDL. Abbiamo preparato manualmente campioni di scrittura a mano leggibile da persone. Tutti i campioni erano in stile di scrittura corsiva.

Figura 1: Campioni dal nostro dataset.

Metodologia di DeltOCR Bench

Questo benchmark si concentra sull'accuratezza dell'estrazione del testo dei prodotti.

Il preprocessing viene eseguito solo per la categoria scrittura a mano. Abbiamo fotografato i documenti scritti a mano con i nostri smartphone e utilizzato un'app di scansione mobile:

  • Le immagini sono state convertite in bianco e nero
  • Il contrasto è stato aumentato e lo sfondo è stato rimosso.

OCR: Abbiamo eseguito tutti i prodotti sullo stesso dataset e generato output di testo come file di testo semplice (.txt). Successivamente, abbiamo preparato manualmente la ground truth includendo il testo corretto in tutti questi file. La ground truth è stata verificata due volte da esseri umani.

Confronto: Abbiamo misurato l'accuratezza delle soluzioni OCR confrontando i loro output con i testi originali. A questo scopo, abbiamo utilizzato il framework Sentence-BERT (SBERT) per calcolare i punteggi di similarità del coseno. Nel benchmark, abbiamo utilizzato il modello multilingue ad alte prestazioni MiniLM-L12-v2 per calcolare il punteggio di similarità tra l'output di ciascun prodotto e i testi della ground truth. Questo punteggio rappresenta il livello di accuratezza del testo.

La funzione di similarità utilizza una metrica di distanza del coseno per calcolare la similarità tra due testi. Non abbiamo utilizzato la distanza di Levenshtein per questo benchmark perché prodotti diversi generano output di testo in ordini diversi.2

Mentre la distanza di Levenshtein tiene conto di queste differenze, noi stiamo solo verificando quanto accuratamente viene rilevato il testo, non dove si trova. La distanza del coseno ha penalità trascurabili per tali casi, quindi abbiamo deciso di utilizzarla in questo benchmark.

Selezione dei prodotti

Ci sono molti prodotti OCR sul mercato. Dobbiamo concentrarci su quelli che possono fornire risultati di testo semplice. I prodotti per questo benchmark sono stati scelti in base a:

  • Capacità di estrarre testo. Non abbiamo incluso in questo confronto soluzioni che estraggono solo dati leggibili da macchina (cioè dati strutturati)
  • La loro popolarità sul mercato

Questa non è una revisione completa del mercato e potremmo aver escluso alcuni prodotti con capacità significative. In tal caso, vi preghiamo di lasciare un commento e saremo lieti di ampliare il benchmark.

Limitazioni

Capacità avanzate come il rilevamento della posizione del testo, l'abbinamento chiave-valore e la classificazione dei documenti non sono state valutate in questo benchmark.

La dimensione del campione sarà aumentata nella prossima iterazione. Se state cercando OCR per la scrittura a mano, consultate il nostro benchmark OCR per scrittura a mano con 50 campioni.

Potete anche consultare il nostro benchmark OCR per fatture e il benchmark OCR per ricevute se siete interessati.

Risultati precedenti del benchmark OCR

Risultati complessivi dell'accuratezza del testo OCR con intervalli di confidenza del 90%
  • Google Cloud Vision e AWS Textract sono le tecnologie leader nel mercato per tutti i casi
  • Abbyy ha anche alte prestazioni per documenti non scritti a mano
  • Tutti gli OCR testati, incluso l'open source Tesseract, hanno performato bene sugli screenshot digitali.

Lo strumento OCR Vision di Google Cloud Platform raggiunge la massima accuratezza del testo del 98,0% quando viene testato l'intero set di dati. Mentre tutti i prodotti performano sopra il 99,2% con la Categoria 1, dove sono inclusi testi dattiloscritti, le immagini scritte a mano nella Categoria 2 e 3 creano la vera differenza tra i prodotti.

I risultati complessivi mostrano che GCP Vision e AWS Textract sono i prodotti OCR dominanti, con la massima accuratezza nel riconoscere il testo dato.

Note dai risultati complessivi:

  • C'è una singola occasione in cui AWS Textract non è riuscito a riconoscere il testo scritto a mano. Questa situazione riduce significativamente le prestazioni di categoria e totali di AWS Textract. Aumenta anche la deviazione all'interno della categoria e complessiva, perché AWS Textract performa molto bene in tutte le altre istanze.
  • Azure è il prodotto leader nella Categoria 1 con un'accuratezza del 99,8%. Tuttavia, il prodotto spesso non riesce a riconoscere il testo scritto a mano, come mostrato nei risultati per la seconda categoria. Questo è il motivo per cui Azure resta indietro nella terza categoria e complessivamente.
  • Tesseract OCR è un prodotto open-source che può essere utilizzato gratuitamente. Rispetto ad Azure e ABBYY, performa meglio nelle istanze di scrittura a mano e può essere considerato per il riconoscimento della scrittura a mano se l'utente non può ottenere prodotti AWS o GCP. Tuttavia, potrebbe performare male nelle immagini scansionate.
  • A differenza di altri prodotti, ABBYY produce un file .txt più strutturato. ABBYY considera anche la posizione del testo all'interno dell'immagine durante la generazione del file di output. Sebbene il prodotto abbia ulteriori capacità utili, in questo benchmark ci concentriamo solo sull'accuratezza del testo. E ha performato male nel riconoscimento della scrittura a mano.

Rimozione dell'immagine "Problematica"

Come menzionato nei risultati complessivi, c'era una singola immagine "anomala" in cui AWS Textract non è riuscito a riconoscere alcun testo. Mentre il prodotto mostra un'accuratezza del testo superiore al 95% in tutte le altre immagini, questa istanza ha ridotto le prestazioni di AWS e ampliato il suo intervallo di confidenza.

Poiché questa istanza potrebbe essere un'eccezione, abbiamo anche voluto confrontare i prodotti senza di essa. Abbiamo chiamato questa immagine la "problematica" e rieseguito i nostri risultati per vedere se facevano una differenza.
Ecco i nuovi risultati dopo aver escluso la "problematica" dal dataset.

Risultati di accuratezza del testo OCR quando la "problematica" è esclusa. È mostrato l'intervallo di confidenza del 90%

Quando la "problematica" è esclusa, AWS Textract diventa il miglior performer con un livello di accuratezza del testo quasi perfetto (99,3%) e un intervallo di confidenza ristretto. Sebbene i punteggi non cambino molto, GCP Vision e AWS Textract rimangono i primi 2 prodotti, con una migliore accuratezza del testo rispetto agli altri.

Risultati senza Riconoscimento della Scrittura a Mano

Il principale fattore che riduce l'accuratezza del testo di alcuni prodotti è la presenza di scrittura a mano nelle immagini. Pertanto, abbiamo escluso tutte le immagini (tutta la categoria 2 e 6 immagini della categoria 3) e rivalutato nuovamente le prestazioni di accuratezza del testo.

Accuratezza del testo OCR senza casi di riconoscimento della scrittura a mano

I risultati sono più testa a testa quando le immagini scritte a mano sono escluse. AWS Textract e GCP Vision rimangono i primi 2 prodotti nel benchmark, ma anche ABBYY FineReader performa molto bene (99,3%) questa volta. Sebbene tutti i prodotti raggiungano oltre il 95% di accuratezza quando la scrittura a mano è esclusa, Azure Computer Vision e Tesseract OCR faticano ancora con i documenti scansionati, collocandosi dietro in questo confronto.

Prodotti testati

Abbiamo testato cinque prodotti OCR per misurare le loro prestazioni di accuratezza del testo. Abbiamo utilizzato le versioni disponibili a maggio 2021. I prodotti utilizzati sono:

  • ABBYY FineReader 15
  • Amazon Textract
  • Google Cloud Platform Vision API
  • Microsoft Azure Computer Vision API
  • Tesseract OCR Engine

Dataset

Sebbene esistano molti dataset di immagini per l'OCR, questi sono

  • per lo più a livello di carattere e non sono conformi ai casi d'uso aziendali reali
  • oppure si concentrano sulla posizione del testo piuttosto che sul testo stesso.

Pertanto, abbiamo deciso di creare il nostro dataset suddiviso in tre categorie principali:

  1. Categoria 1 – Screenshot di pagine web che includono testi: Questa categoria include screenshot da pagine Wikipedia casuali e risultati di ricerca Google con query casuali.
  2. Categoria 2 – Scrittura a mano: Questa categoria include foto casuali che presentano diversi stili di scrittura a mano.
  3. Categoria 3 – Ricevute, fatture e contratti scansionati: Questa categoria include una raccolta casuale di ricevute, fatture scritte a mano e contratti assicurativi scansionati raccolti da internet.

Tutti i file di input sono in formato .jpg o .png.

Limitazioni

  • Dataset limitato: In origine, avevamo una quarta categoria composta da foto di giornali per valutare le prestazioni dei prodotti su documenti stampati. Tuttavia, queste foto contengono troppo testo, rendendo difficile generare la ground truth. Pertanto, abbiamo deciso di non utilizzarle.
  • Incoerenze nei formati di output: Molte immagini includono istanze di testo separato sui lati sinistro e destro. I prodotti estraggono questi testi in ordini diversi, causando differenze nei file di output sebbene i testi siano rilevati accuratamente. Questa situazione ci ha impedito di utilizzare altre misure di distanza (come la distanza di Levenshtein) e ha limitato le nostre opzioni per il calcolo dell'accuratezza del testo.
  • Possibile problema con la distanza del coseno: La distanza del coseno utilizza gli embedding durante il calcolo della similarità. Ad esempio, confrontare le frasi "Mi piace il tè" e "Mi piace il caffè" darebbe un punteggio di similarità più alto del dovuto. Tuttavia, casi come confondere la parola "tè" con "caffè" sarebbero rari, quindi non abbiamo considerato questa possibilità in questo esercizio.

Utilizziamo altri dati di mercato (es. recensioni software, casi studio dei clienti) per classificare i fornitori di software. Tuttavia, poiché la maggior parte delle aziende utilizza il termine "OCR" quando cerca soluzioni di estrazione dati (cioè, incluse quelle che generano dati leggibili da macchina), la nostra lista ha un ambito più ampio e più aziende rispetto a quelle presentate in questo esercizio di benchmarking.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

FAQ

Il Riconoscimento Ottico dei Caratteri (OCR) è un campo dell'apprendimento automatico specializzato nel distinguere i caratteri all'interno di immagini come documenti scansionati, libri stampati o foto. Sebbene sia una tecnologia matura, non esistono ancora prodotti OCR in grado di riconoscere tutti i tipi di testo con un'accuratezza del 100%. Tra i prodotti che abbiamo testato, solo pochi sono riusciti a produrre risultati soddisfacenti dal nostro set di test.
Gli strumenti OCR sono utilizzati dalle aziende per identificare i testi e le loro posizioni nelle immagini, classificare i documenti aziendali in base agli argomenti o condurre l'abbinamento chiave-valore all'interno dei documenti. Basandosi sui risultati dell'OCR, altre aziende tecnologiche sviluppano applicazioni come l'automazione documentale. Per tutti questi casi aziendali, un riconoscimento accurato del testo è fondamentale per un prodotto OCR.

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani and Şevval Alper (2026) - "OCR Benchmark: Accuratezza nell'Estrazione / Acquisizione del Testo". Pubblicato online su AIMultiple.com. Consultato il 29 Giugno 2026, da: https://aimultiple.com/ocr-accuracy [Risorsa online]

Dilmegani, C., & Alper, Ş. (2026, 29 Giugno). OCR Benchmark: Accuratezza nell'Estrazione / Acquisizione del Testo. AIMultiple. https://aimultiple.com/ocr-accuracy

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{OCR Benchmark: Accuratezza nell'Estrazione / Acquisizione del Testo}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/ocr-accuracy}},
  note   = {AIMultiple. Consultato il 29 Giugno 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è analista principale presso AIMultiple dal 2017. AIMultiple fornisce informazioni a centinaia di migliaia di aziende (secondo SimilarWeb), tra cui il 55% delle aziende Fortune 500, ogni mese. Il lavoro di Cem è stato citato da importanti pubblicazioni globali come Business Insider, Forbes, Washington Post, società globali come Deloitte e HPE, ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione Europea. È possibile consultare l'elenco di altre aziende e risorse autorevoli che hanno citato AIMultiple. Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, responsabile acquisti tecnologici e imprenditore nel settore tecnologico. Ha fornito consulenza alle aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un report di McKinsey sulla digitalizzazione. Ha guidato la strategia tecnologica e gli acquisti di un'azienda di telecomunicazioni, riportando direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da zero in soli 2 anni. Il lavoro di Cem in Hypatos è stato oggetto di articoli su importanti pubblicazioni tecnologiche come TechCrunch e Business Insider. Cem partecipa regolarmente come relatore a conferenze internazionali di settore. Si è laureato in ingegneria informatica presso l'Università di Bogazici e ha conseguito un MBA presso la Columbia Business School.
Visualizza il profilo completo
Ricercato da
Şevval Alper
Şevval Alper
Ricercatore di intelligenza artificiale
Şevval è un analista di settore di AIMultiple specializzato in strumenti di programmazione per l'IA, agenti di IA e tecnologie quantistiche.
Visualizza il profilo completo

Commenti 8

Condividi i tuoi pensieri

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450
Serhat Cinar
Serhat Cinar
Feb 28, 2025 at 09:34

Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:59

Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.

DLJ
DLJ
Oct 17, 2024 at 11:14

Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:15

Hi there, thank you for the detailed comment, we are updating the article to include these details.

Webster
Webster
Feb 05, 2023 at 07:24

Hello, great work! Just curious, did you use a trained Tesseract when making these testing?

Bardia Eshghi
Bardia Eshghi
Feb 06, 2023 at 12:29

Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.

Bobby
Bobby
Aug 14, 2022 at 23:54

The graph images are not working for me at the moment. Otherwise great

Cem Dilmegani
Cem Dilmegani
Aug 15, 2022 at 14:48

Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.

samsun
samsun
Jun 07, 2022 at 14:10

Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html

Cem Dilmegani
Cem Dilmegani
Aug 17, 2022 at 07:46

Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.

Scott
Scott
Jan 20, 2022 at 20:42

What version of Tesseract did you test with? They recently released v5.

Cem Dilmegani
Cem Dilmegani
Aug 23, 2022 at 12:01

Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.

Bob
Bob
Jan 12, 2022 at 15:09

This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.

Cem Dilmegani
Cem Dilmegani
Jan 15, 2022 at 13:52

Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.

kin
kin
Jun 21, 2021 at 02:22

interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!

Cem Dilmegani
Cem Dilmegani
Jun 22, 2021 at 07:50

Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.