Servizi
Contattaci

OCR benchmark: Accuratezza nell'estrazione / cattura del testo

Şevval Alper
Şevval Alper
aggiornato il 29 lug. 2026

L'accuratezza dell'OCR è fondamentale per molte attività di elaborazione dei documenti, e i SOTA LLM multimodali stanno ora offrendo un'alternativa al OCR. Abbiamo confrontato i principali servizi OCR nel DeltOCR Bench per identificare i loro livelli di accuratezza in diversi tipi di documento:

  • Scrittura a mano: GPT-5 (95%) si distingue come il miglior performer, seguito da vicino da olmOCR-2-7B (94%) e Gemini 2.5 Pro (93%).
  • Supporti stampati: Gemini 2.5 Pro, Google Vision e Claude Sonnet 4.5 guidano questa categoria con il punteggio più alto (85%)
  • Testo stampato: Microsoft Azure Document Intelligence API guida con un punteggio del 96%.

OCR benchmark: DeltOCR Bench

Loading Chart

Di seguito sono elencati i nomi completi dei prodotti sopra menzionati e le loro versioni in uso a novembre 2025. Il nostro studio copre sia i servizi API facilmente accessibili che le soluzioni che richiedono un'infrastruttura on-premise, confrontando i modelli chiave del mercato in un ambiente di test approfondito.

  • Scrittura a mano:
    • Intervallo di accuratezza: Un'ampia gamma dal 46% al 95%.
    • Aspetti salienti: GPT-5 (95%), olmOCR-2-7B (94%) e Gemini 2.5 Pro (93%) mostrano le prestazioni più elevate. Questi punteggi elevati dimostrano lo straordinario potenziale di accuratezza dei LLM multimodali, come GPT-5 e Gemini 2.5 Pro, in questo ambito.
    • Raccomandazione: Per il riconoscimento di scrittura a mano altamente complessa, si consigliano le migliori soluzioni LLM come GPT-5 o Gemini 2.5 Pro, grazie alla loro accessibilità via API e alla facilità di integrazione.
  • Supporti stampati:
    • Intervallo di accuratezza: Un intervallo dal 54% all'85%.
    • Aspetti salienti: Soluzioni come Gemini 2.5 Pro, Google Vision e Claude Sonnet 4.5 condividono il punteggio più alto (85%). Questa categoria è altamente competitiva tra LLM e servizi OCR tradizionali basati su cloud (Azure, Dots OCR, Amazon Textract). GPT-5 è in ritardo rispetto ad altri LLM leader in questa categoria (77%).
    • Raccomandazione: Per documenti con layout visivi complessi (più font, bassa risoluzione, ecc.), si consigliano LLM come Gemini 2.5 Pro, o servizi basati su cloud come Google Vision, o Microsoft Azure Document Intelligence API.
  • Testo stampato:
    • Intervallo di accuratezza: Un intervallo elevato dal 55% al 96%, sebbene la maggior parte delle soluzioni leader abbia raggiunto punteggi del 94% e superiori.
    • Aspetti salienti: Microsoft Azure Document Intelligence API (96%) è in testa, seguita da vicino da soluzioni come GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision e Amazon Textract, tutte con un punteggio del 95%. Questa è un'area in cui tutte le soluzioni SOTA raggiungono livelli di accuratezza estremamente elevati.
    • Raccomandazione: Per testi stampati semplici che richiedono elevata accuratezza, si possono usare con fiducia soluzioni cloud consolidate come Microsoft Azure Document Intelligence API o Google Vision, o LLM ad alto punteggio (Gemini/GPT-5).

API Soluzioni

I seguenti modelli sono stati inclusi nella nostra lista di benchmark per la loro facilità di accesso e le loro prestazioni.

  • Claude Sonnet 4.5
  • OpenAI GPT-5
  • Gemini 2.5 Pro
  • Gemini 3 Pro Preview
  • Amazon Textract API
  • Google Cloud Vision API
  • Microsoft Azure Document Intelligence API
  • Moondream OCR
  • Mistral OCR 3
  • Mistral OCR 2

Microsoft Azure Document Intelligence API fa parte della famiglia Azure Cognitive Services.

Modelli distribuiti localmente (on-premise)

Testare questi modelli è più impegnativo delle soluzioni API a causa dei requisiti di installazione, gestione delle dipendenze e hardware. Tutti i test locali sono stati condotti in un ambiente server dedicato.

  • olmOCR-2-7B
  • PaddleOCR-VL
  • Nanonets-OCR2-3B
  • Deepseek-OCR
  • Dots-OCR

Abbiamo calcolato l'accuratezza dei risultati come punteggio di similarità coseno per testo stampato, supporti stampati e scrittura a mano. Ogni punteggio visibile nel grafico rappresenta la prestazione del modello corrispondente in quella categoria.

Durante i nostri test, abbiamo osservato che il modello Nanonets-OCR2-3B ha fornito le prestazioni più deboli nel benchmark, ottenendo i punteggi più bassi. In generale, abbiamo riscontrato che alcuni modelli hanno faticato particolarmente con la scrittura a mano in corsivo e con layout di testo disorganizzati (ordine delle righe misto, maiuscole inconsistenti). Problemi di prestazioni simili sono emersi anche nella categoria dei supporti stampati, specialmente con immagini a bassa risoluzione e quelle contenenti più stili di carattere.

Dataset

Abbiamo utilizzato un totale di 300 documenti in questo benchmark, con 100 documenti per categoria su 3 categorie:

Testo stampato include lettere, screenshot di siti web, email, report, ecc.

Supporti stampati includono poster, copertine di libri, pubblicità, ecc. Abbiamo voluto verificare il successo degli strumenti OCR in diversi font e posizionamenti del testo.

I Files in queste 2 categorie provengono dall'Industry Documents Library (IDL).1

Scrittura a mano: Nella categoria della scrittura a mano, poiché alcuni documenti IDL non erano facili da leggere, il nostro team ha generato documenti simili ai documenti IDL. Abbiamo preparato manualmente campioni di scrittura a mano leggibili dall'uomo. Tutti i campioni erano in stile di scrittura corsiva.

Figura 1: Campioni dal nostro dataset.

Metodologia del DeltOCR Bench

Questo benchmark si concentra sull'accuratezza dell'estrazione del testo dei prodotti.

Il preprocessamento viene eseguito solo per la categoria della scrittura a mano. Abbiamo scattato foto di documenti scritti a mano con i nostri smartphone e abbiamo utilizzato un'app di scansione mobile:

  • Le immagini sono state convertite in bianco e nero
  • Il contrasto è stato aumentato e lo sfondo è stato rimosso.

OCR: Abbiamo eseguito tutti i prodotti sullo stesso dataset e generato output di testo come file di testo semplice (.txt). Quindi, abbiamo preparato manualmente la ground truth includente il testo corretto in tutti questi file. La ground truth è stata verificata due volte da esseri umani.

Confronto: Abbiamo misurato l'accuratezza delle soluzioni OCR confrontando i loro output con i testi originali. A tal fine, abbiamo utilizzato il framework Sentence-BERT (SBERT) per calcolare i punteggi di similarità coseno. Nel benchmark, abbiamo utilizzato il modello di parafrasi multilingue ad alte prestazioni, MiniLM-L12-v2, per calcolare il punteggio di similarità tra l'output di ciascun prodotto e i testi di ground-truth. Questo punteggio rappresenta il livello di accuratezza del testo.

La funzione di similarità utilizza una metrica di distanza coseno per calcolare la similarità tra due testi. Non abbiamo utilizzato la distanza di Levenshtein per questo benchmark perché prodotti diversi restituiscono testi in ordini diversi.2

Mentre la distanza di Levenshtein tiene conto di queste differenze, noi cerchiamo solo quanto accuratamente il testo viene rilevato, non dove si trova. La distanza coseno ha penalità trascurabili per questi casi, quindi abbiamo deciso di utilizzarla in questo benchmark.

Selezione dei prodotti

Ci sono molti prodotti OCR sul mercato. Dobbiamo concentrarci su quelli che possono produrre risultati di testo semplice. I prodotti per questo benchmark sono stati scelti in base a:

  • Capacità di estrarre testo. Non abbiamo incluso soluzioni che estraggono solo dati machine-readable (cioè dati strutturati) in questo confronto.
  • La loro popolarità sul mercato

Questa non è una revisione di mercato completa e potremmo aver escluso alcuni prodotti con capacità significative. Se è così, lascia un commento e saremo lieti di ampliare il benchmark.

Limitazioni

Capacità avanzate come il rilevamento della posizione del testo, l'abbinamento chiave-valore e la classificazione dei documenti non sono state valutate in questo benchmark.

La dimensione del campione sarà aumentata nella prossima iterazione. Se stai cercando OCR per la scrittura a mano, consulta il nostro benchmark di scrittura a mano OCR con 50 campioni.

Puoi anche consultare il nostro benchmark per fatture OCR e benchmark per ricevute OCR se sei interessato.

FAQ

Riconoscimento ottico dei caratteri (OCR) è un campo dell'apprendimento automatico specializzato nel distinguere i caratteri all'interno di immagini come documenti scansionati, libri stampati o foto. Sebbene sia una tecnologia matura, non esistono ancora prodotti OCR in grado di riconoscere tutti i tipi di testo con un'accuratezza del 100%. Tra i prodotti che abbiamo testato, solo pochi hanno prodotto risultati positivi dal nostro set di test.
Gli strumenti OCR sono utilizzati dalle aziende per identificare testi e le loro posizioni nelle immagini, classificare documenti aziendali in base all'argomento o eseguire l'abbinamento chiave-valore all'interno dei documenti. Sulla base dei risultati OCR, altre aziende tecnologiche creano applicazioni come l'automazione documentale. Per tutti questi casi aziendali, un riconoscimento accurato del testo è fondamentale per un prodotto OCR.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Şevval Alper (2026) - "OCR benchmark: Accuratezza nell'estrazione / cattura del testo". Pubblicato online su AIMultiple.com. Consultato il 29 Luglio 2026, da: https://aimultiple.com/ocr-accuracy [Risorsa online]

Alper, Ş. (2026, 29 Luglio). OCR benchmark: Accuratezza nell'estrazione / cattura del testo. AIMultiple. https://aimultiple.com/ocr-accuracy

@misc{alper2026,
  author = {Alper, Şevval},
  title  = {{OCR benchmark: Accuratezza nell'estrazione / cattura del testo}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ocr-accuracy}},
  note   = {AIMultiple. Consultato il 29 Luglio 2026}
}
Şevval Alper
Şevval Alper
Ricercatore di intelligenza artificiale
Şevval è un analista di settore di AIMultiple specializzato in strumenti di programmazione per l'IA, agenti di IA e tecnologie quantistiche.
Visualizza il profilo completo

Commenti 8

Condividi i tuoi pensieri

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450
Serhat Cinar
Serhat Cinar
Feb 28, 2025 at 09:34

Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:59

Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.

DLJ
DLJ
Oct 17, 2024 at 11:14

Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:15

Hi there, thank you for the detailed comment, we are updating the article to include these details.

Webster
Webster
Feb 05, 2023 at 07:24

Hello, great work! Just curious, did you use a trained Tesseract when making these testing?

Bardia Eshghi
Bardia Eshghi
Feb 06, 2023 at 12:29

Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.

Bobby
Bobby
Aug 14, 2022 at 23:54

The graph images are not working for me at the moment. Otherwise great

Cem Dilmegani
Cem Dilmegani
Aug 15, 2022 at 14:48

Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.

samsun
samsun
Jun 07, 2022 at 14:10

Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html

Cem Dilmegani
Cem Dilmegani
Aug 17, 2022 at 07:46

Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.

Scott
Scott
Jan 20, 2022 at 20:42

What version of Tesseract did you test with? They recently released v5.

Cem Dilmegani
Cem Dilmegani
Aug 23, 2022 at 12:01

Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.

Bob
Bob
Jan 12, 2022 at 15:09

This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.

Cem Dilmegani
Cem Dilmegani
Jan 15, 2022 at 13:52

Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.

kin
kin
Jun 21, 2021 at 02:22

interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!

Cem Dilmegani
Cem Dilmegani
Jun 22, 2021 at 07:50

Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.