OCR Confronto: Estrazione del testo / Accuratezza della cattura
OCR accuratezza è critica per molti processi di elaborazione documentale, e i modelli multi-modali SOTA LLM stanno ora offrendo un'alternativa al OCR. Abbiamo confrontato i principali servizi OCR in DeltOCR Bench per identificare i loro livelli di accuratezza in diversi tipi di documenti:
- Scrittura a mano: GPT-5 (95%) si distingue come il miglior performer, seguito da vicino da olmOCR-2-7B (94%) e Gemini 2.5 Pro (93%).
- Supporti stampati: Gemini 2.5 Pro, Google Vision, e Claude Sonnet 4.5 conducono questa categoria con il punteggio più alto (85%)
- Testo stampato: Microsoft Azure Document Intelligence API guida con un punteggio di 96%.
OCR Confronto: DeltOCR Bench
I nomi completi dei prodotti sopra elencati e le loro versioni in uso a novembre 2025 sono riportati di seguito. Il nostro studio copre sia servizi API facilmente accessibili sia soluzioni che richiedono infrastrutture locali, confrontando i modelli chiave sul mercato in un ambiente di test approfondito.
- Scrittura a mano:
- Intervallo di accuratezza: Un'ampia gamma dal 46% al 95%.
- In evidenza: GPT-5 (95%), olmOCR-2-7B (94%) e Gemini 2.5 Pro (93%) mostrano le prestazioni più elevate. Questi punteggi alti dimostrano lo straordinario potenziale di accuratezza dei modelli multimodali LLM, come GPT-5 e Gemini 2.5 Pro, in questo ambito.
- Raccomandazione: Per il riconoscimento di scrittura a mano altamente complessa, si consigliano le migliori soluzioni LLM come GPT-5 o Gemini 2.5 Pro, grazie alla loro accessibilità tramite API e facilità di integrazione.
- Supporti stampati:
- Intervallo di accuratezza: Una gamma dal 54% al 85%.
- In evidenza: Soluzioni come Gemini 2.5 Pro, Google Vision e Claude Sonnet 4.5 condividono il punteggio più alto (85%). Questa categoria è altamente competitiva tra i modelli LLM e i servizi OCR cloud tradizionali (Azure, Dots OCR, Amazon Textract). GPT-5 è indietro rispetto ad altri modelli LLM leader in questa categoria (77%).
- Raccomandazione: Per documenti con layout visivi complessi (font multipli, bassa risoluzione, ecc.), si consigliano LLM come Gemini 2.5 Pro, servizi cloud come Google Vision, o Microsoft Azure Document Intelligence API.
- Testo stampato:
- Intervallo di accuratezza: Un'ampia gamma dal 55% al 96%, sebbene la maggior parte delle soluzioni leader abbia ottenuto punteggi pari o superiori a 94%.
- In evidenza: Microsoft Azure Document Intelligence API (96%) è in testa, seguita da vicino da soluzioni come GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision e Amazon Textract, tutte con un punteggio del 95%. In questa categoria tutte le soluzioni SOTA raggiungono livelli di accuratezza estremamente elevati.
- Raccomandazione: Per testi stampati semplici che richiedono alta accuratezza, si possono utilizzare con sicurezza soluzioni cloud consolidate come Microsoft Azure Document Intelligence API o Google Vision, oppure LLM con punteggi elevati (Gemini/GPT-5).
API Soluzioni
I seguenti modelli sono stati inclusi nel nostro elenco di benchmark sia per la facilità di accesso che per le prestazioni.
- Claude Sonnet 4.5
- OpenAI GPT-5
- Gemini 2.5 Pro
- Gemini 3 Pro Preview
- Amazon Textract API
- Google Cloud Vision API
- Microsoft Azure Document Intelligence API
- Moondream OCR
- Mistral OCR 3
- Mistral OCR 2
Microsoft Azure Document Intelligence API fa parte della famiglia di Servizi Cognitivi di Azure.
Modelli distribuiti localmente (on-premise)
Testare questi modelli è più complesso rispetto alle soluzioni API a causa di installazione, gestione delle dipendenze e requisiti hardware. Tutti i test locali sono stati condotti in un ambiente server dedicato.
- olmOCR-2-7B
- PaddleOCR-VL
- Nanonets-OCR2-3B
- Deepseek-OCR
- Dots-OCR
Abbiamo calcolato l'accuratezza dei risultati come punteggio di similarità coseno per testo stampato, supporti stampati e scrittura a mano. Ogni punteggio visibile nel grafico rappresenta la performance del modello corrispondente in quella categoria.
Durante i nostri test, abbiamo osservato che il modello Nanonets-OCR2-3B ha fornito le prestazioni più deboli nel benchmark, ottenendo i punteggi più bassi. In generale, abbiamo riscontrato che alcuni modelli hanno avuto difficoltà soprattutto con la scrittura corsiva e i layout di testo disorganizzati (ordinamento misto delle linee, uso incoerente delle maiuscole). Problemi di prestazioni simili sono emersi anche nella categoria dei supporti stampati, specialmente con immagini a bassa risoluzione e quelle contenenti più stili di carattere.
Dataset
Abbiamo utilizzato un totale di 300 documenti in questo benchmark, con 100 documenti per categoria suddivisi in 3 categorie:
Testo stampato include lettere, screenshot di siti web, email, report, ecc.
Supporti stampati include poster, copertine di libri, pubblicità, ecc. Abbiamo voluto verificare il successo degli strumenti OCR con diversi caratteri e posizionamenti del testo.
Files in queste 2 categorie provengono dall'Industry Documents Library (IDL).1
Scrittura a mano: Nella categoria scrittura a mano, poiché alcuni documenti IDL non erano facilmente leggibili, il nostro team ha generato documenti simili a quelli IDL. Abbiamo preparato manualmente campioni di scrittura a mano leggibile da un essere umano. Tutti i campioni erano in stile corsivo.
Metodologia di DeltOCR Bench
Questo benchmark si concentra sull'accuratezza dell'estrazione del testo dei prodotti.
Il preprocessing viene eseguito solo per la categoria scrittura a mano. Abbiamo scattato foto dei documenti scritti a mano con i nostri smartphone e utilizzato un'app di scansione mobile:
- Le immagini sono state convertite in bianco e nero
- Il contrasto è stato aumentato e lo sfondo rimosso.
OCR: Abbiamo eseguito tutti i prodotti sullo stesso dataset e generato output testuali come file di testo semplice (.txt). Successivamente, abbiamo preparato manualmente la ground truth includendo il testo corretto in tutti questi file. La ground truth è stata verificata due volte da esseri umani.
Confronto: Abbiamo misurato l'accuratezza delle soluzioni OCR confrontando i loro output con i testi originali. A questo scopo, abbiamo utilizzato il framework Sentence-BERT (SBERT) per calcolare i punteggi di similarità coseno. Nel benchmark, abbiamo impiegato il modello multilingue ad alte prestazioni MiniLM-L12-v2 per calcolare il punteggio di similarità tra l'output di ciascun prodotto e i testi della ground truth. Questo punteggio rappresenta il livello di accuratezza del testo.
La funzione di similarità utilizza una metrica di distanza coseno per calcolare la similarità tra due testi. Non abbiamo utilizzato la distanza di Levenshtein per questo benchmark perché prodotti diversi restituiscono i testi in ordini diversi.2
Mentre la distanza di Levenshtein tiene conto di queste differenze, noi cerchiamo solo quanto accuratamente il testo viene rilevato, non la sua posizione. La distanza coseno ha penalità trascurabili per tali casi, quindi abbiamo deciso di utilizzarla in questo benchmark.
Selezione dei prodotti
Esistono molti prodotti OCR sul mercato. Dobbiamo concentrarci su quelli in grado di restituire risultati in testo semplice. I prodotti per questo benchmark sono stati scelti in base a:
- Capacità di estrarre testo. Non abbiamo incluso soluzioni che estraggono solo dati leggibili dalla macchina (cioè dati strutturati) in questo confronto
- La loro popolarità sul mercato
Questa non è una revisione di mercato completa e potremmo aver escluso alcuni prodotti con capacità significative. In tal caso, lasciate un commento e saremo lieti di ampliare il benchmark.
Limitazioni
Capacità avanzate come il rilevamento della posizione del testo, l'abbinamento chiave-valore e la classificazione dei documenti non sono state valutate in questo benchmark.
La dimensione del campione sarà aumentata nella prossima iterazione. Se siete interessati all'OCR per la scrittura a mano, consultate il nostro benchmark OCR per la scrittura a mano con 50 campioni.
Potete anche consultare il nostro benchmark OCR per fatture e il benchmark OCR per ricevute se interessati.
FAQ
Riconoscimento Ottico dei Caratteri (OCR) è un campo dell'apprendimento automatico specializzato nel distinguere i caratteri all'interno di immagini come documenti scansionati, libri stampati o foto. Sebbene sia una tecnologia matura, non esistono ancora prodotti OCR in grado di riconoscere qualsiasi tipo di testo con un'accuratezza del 100%. Tra i prodotti che abbiamo testato, solo pochi sono riusciti a produrre risultati soddisfacenti dal nostro set di test.
Gli strumenti OCR vengono utilizzati dalle aziende per identificare testi e le loro posizioni nelle immagini, classificare documenti aziendali in base all'argomento o eseguire l'associazione chiave-valore all'interno dei documenti. Sulla base dei risultati OCR, altre aziende tecnologiche sviluppano applicazioni come l'automazione documentale. Per tutti questi casi aziendali, un riconoscimento accurato del testo è fondamentale per un prodotto OCR.
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{alper2026,
author = {Alper, Şevval},
title = {{OCR Confronto: Estrazione del testo / Accuratezza della cattura}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ocr-accuracy}},
note = {AIMultiple. Consultato il 29 Luglio 2026}
}
Commenti 8
Condividi i tuoi pensieri
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.
Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?
Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.
Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.
Hi there, thank you for the detailed comment, we are updating the article to include these details.
Hello, great work! Just curious, did you use a trained Tesseract when making these testing?
Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.
The graph images are not working for me at the moment. Otherwise great
Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.
Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html
Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.
What version of Tesseract did you test with? They recently released v5.
Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.
This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.
Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.
interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!
Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.