Stato della tecnologia OCR: è morta o un problema risolto?
Il riconoscimento ottico dei caratteri (OCR) è una delle prime aree della ricerca sull'intelligenza artificiale. Oggi, la tecnologia OCR è relativamente matura e non viene più chiamata IA, il che è un buon esempio della citazione di Douglas Hofstadter, vincitore del Premio Pulitzer: l'IA è qualunque cosa non sia ancora stata fatta.1
Nel nostro OCR benchmark, DeltOCR, un large language model, legge correttamente più del 95% dei caratteri nel testo stampato.
Gli strumenti OCR sono ancora inferiori agli esseri umani sugli input difficili: scansioni di bassa qualità, scritture arabe corsive come il Nastaliq e la scrittura a mano.
Che cos'è l'OCR?
L'OCR è una tecnologia che identifica i caratteri da libri stampati, documenti scritti a mano o immagini. Con questa tecnologia, le aziende possono trasferire rapidamente i documenti nei loro sistemi digitali e gli strumenti di analisi dei dati possono elaborare i dati rilevanti.
Quali progressi tecnologici forniscono l'OCR di oggi?
Visione artificiale
Nella visione artificiale, OCR rileva prima i caratteri uno per uno. Successivamente, utilizza la classificazione delle immagini per identificare ciascun carattere. Se questi due passaggi funzionano correttamente, OCR produce risultati accurati. Tuttavia, i caratteri a volte possono essere troppo vicini tra loro e potrebbero non essere riconosciuti. Pertanto, OCR richiede più delle tecnologie di visione artificiale.
Elaborazione del linguaggio naturale (NLP)
Anche se l'OCR identifica i caratteri, quei caratteri formano parole, frasi e paragrafi. La ricerca sul NLP ha portato a numerosi algoritmi per correggere gli errori di riconoscimento dei caratteri utilizzando metodi probabilistici. Ad esempio, i caratteri mancanti possono essere stimati utilizzando il contesto.
Apprendimento profondo supervisionato
L'OCR utilizza algoritmi di deep learning per migliorare le sue prestazioni. I modelli OCR apprendono da campioni di addestramento etichettati. Con un numero sufficiente di esempi, possono:
- Riconoscere caratteri con font diversi. Ogni carattere può essere scritto in un'ampia gamma di forme e un ampio set di dati etichettati aiuta il software OCR a identificare i caratteri nonostante le variazioni dei font
- Rilevare gli errori e correggerli. Gli strumenti OCR possono saltare i caratteri che non possono essere identificati. Riconoscendo i modelli nei campioni di addestramento, OCR può rilevare quegli errori e correggere i propri errori.
Modelli visione-linguaggio (VLM)
L'OCR sta passando da pipeline multi-fase a modelli visione-linguaggio (VLM). I sistemi OCR tradizionali spesso utilizzano strumenti separati per il rilevamento del testo, il riconoscimento del testo, l'analisi del layout e l'estrazione delle tabelle. I VLM combinano queste attività in un unico modello.
Questo cambiamento ha migliorato le prestazioni sui documenti con:
- Tabelle
- Moduli
- Formule matematiche
- Layout complessi
- Testo e immagini misti
Diversi VLM open-source sono apparsi nel 2025 e nel 2026, tra cui dots.ocr, GOT-OCR 2.0, DeepSeek-OCR, PaddleOCR-VL, olmOCR e GLM-OCR. Molti possono essere eseguiti su una singola GPU ottenendo ottimi risultati nei benchmark di comprensione dei documenti.
Anche opzioni commerciali come Mistral OCR, Gemini e i modelli GPT vengono utilizzate per il parsing dei documenti e l'estrazione di informazioni.
Una tendenza degna di nota è l'ascesa di modelli più piccoli incentrati sull'OCR. Modelli come GLM-OCR e PaddleOCR-VL raggiungono risultati competitivi nei benchmark richiedendo significativamente meno parametri rispetto a molti modelli visione-linguaggio generici.
Quali sono i limiti degli strumenti OCR?
L'OCR da solo non produce dati strutturati
L'OCR restituisce testo semplice, non campi organizzati. Per trasformare un documento in dati strutturati, come le voci di una fattura, l'OCR deve essere abbinato ad altri strumenti.
Gli OCR non riescono ancora a eguagliare l'accuratezza a livello umano nella maggior parte delle applicazioni.
Gli errori includono la lettura errata delle lettere, il salto delle lettere illeggibili o la combinazione di testo proveniente da colonne adiacenti o didascalie di immagini. Sebbene molti fattori influenzino le prestazioni degli strumenti OCR, il numero di errori dipende dalla qualità e dalla forma del testo, incluso il font utilizzato.
Tuttavia, anche con documenti di alta qualità, gli strumenti OCR possono commettere errori perché esiste una varietà di formati di documento, font e stili per ciascun carattere. I limiti che impediscono agli strumenti OCR di raggiungere un'accuratezza del 100% possono essere elencati come segue:
Limitazioni legate al documento
- Sfondi colorati: I motivi di sfondo colorati possono essere problematici perché possono ridurre il riconoscimento del testo
- Testi sfocati o con riflessi: Le immagini sfocate o con riflessi sono difficili da leggere sia per gli esseri umani sia per i computer.
- Documenti inclinati o non orientati: Nelle situazioni in cui l'immagine può essere inclinata, l'OCR avrà più difficoltà a identificare i caratteri perché il testo non è allineato.
Limitazioni legate al testo
- Varietà di lettere: Le forme delle lettere in alcuni alfabeti sono più difficili da riconoscere. Ad esempio, poiché anche i caratteri arabi stampati sono in forma corsiva, il riconoscimento dei caratteri diventa una sfida.
- Varietà di tipi e dimensioni di font: Sebbene sia difficile riconoscere tutti i diversi tipi di font, anche i caratteri troppo piccoli o troppo grandi sono difficili da identificare.
- Caratteri simili: Alcuni caratteri si assomigliano così tanto che gli strumenti OCR potrebbero non distinguerli. Ad esempio, è difficile distinguere tra il numero “0” e la lettera “O”.
- Testo scritto a mano: Poiché ognuno ha il proprio modo di scrivere i caratteri, gli strumenti OCR potrebbero non riconoscere tutti i caratteri con stili diversi.
Come misurare l'accuratezza dell'OCR?
L'accuratezza viene solitamente misurata tramite il tasso di errore sui caratteri o il tasso di errore sulle parole, che conta quanti caratteri o parole lo strumento sbaglia. Alcuni benchmark utilizzano anche la distanza di modifica, che misura il numero di modifiche necessarie per corrispondere al testo corretto.2
L'accuratezza dell'OCR può essere misurata dalla porzione di caratteri in un testo che lo strumento OCR può estrarre senza errori. Ad esempio, un'accuratezza del 99% significa che 990 caratteri su 1000 vengono riconosciuti correttamente.
Esiste una ricerca attiva per superare queste limitazioni?
Da quando è stato introdotto per la prima volta, l'OCR si è evoluto ed è utilizzato oggi in quasi tutti i principali settori. Poiché ha ancora aree da migliorare, la ricerca sull'OCR è continuata. I progressi nella visione artificiale e negli algoritmi di deep learning contribuiscono alla maggiore accuratezza di questa tecnologia.
Al momento, gli strumenti OCR possono raggiungere un'accuratezza superiore al 99% nei testi dattiloscritti. Tuttavia, si desiderano livelli di accuratezza più elevati poiché le aziende fanno ancora ricorso all'intervento umano per verificare eventuali errori.
L'attuale focus della ricerca sulla tecnologia OCR è principalmente sul riconoscimento della scrittura a mano e sul riconoscimento del testo corsivo.
All'inizio del 2026, sono stati introdotti nuovi modelli OCR open source:
PaddleOCR-VL-1.5, introdotto a gennaio 2026, ha affermato di superare i migliori modelli raggiungendo un'accuratezza del 95% nel benchmark autorevole di parsing dei documenti.3
RapidOCR v3.6.0, raccoglie modelli OCR (incluso PaddleOCR) per essere eseguiti su runtime comuni come ONNX Runtime e OpenVINO, con un'attenzione alla distribuzione locale facile e veloce.4
Riconoscimento della scrittura a mano
La ricerca sul riconoscimento della scrittura a mano sfrutta anche il movimento dinamico creato durante il processo di scrittura per identificare i caratteri. Sebbene il problema principale del riconoscimento della scrittura a mano sia la varietà degli stili dei caratteri, l'accuratezza dell'OCR in quest'area sta migliorando costantemente ma lentamente.
Potete leggere il nostro benchmark sul riconoscimento della scrittura a mano se siete interessati.
Riconoscimento del testo corsivo
Le lettere unite sono chiaramente più difficili da riconoscere rispetto ai testi stampati. Questa situazione comporta più errori negli strumenti OCR, e le forme delle lettere non forniscono abbastanza informazioni per consentire al software di percepirle correttamente.
Allucinazione
I vecchi OCR potevano leggere male o saltare i caratteri. L'OCR basato su VLM può fare qualcosa di diverso: inventare testo che non è mai stato sulla pagina. Ciò accade più spesso nei documenti lunghi o densi e nelle figure complesse. Poiché il testo inventato scorre fluentemente, gli errori possono essere più difficili da individuare rispetto a una lettura errata classica.
Ulteriori letture
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and PhD., Ezgi Arslan,},
title = {{Stato della tecnologia OCR: è morta o un problema risolto?}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/ocr-technology}},
note = {AIMultiple. Consultato il 17 Giugno 2026}
}Collegamenti di riferimento
Il lavoro di Cem è stato citato da importanti pubblicazioni globali tra cui Business Insider, Forbes, Washington Post, aziende globali come Deloitte, HPE e ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione europea.
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente di tecnologia e imprenditore tecnologico. Ha consigliato aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un rapporto McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha anche guidato la crescita commerciale dell'azienda deep tech Hypatos che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da 0 in 2 anni. Il lavoro di Cem in Hypatos è stato trattato da importanti pubblicazioni tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato in ingegneria informatica all'Università Bogazici e ha conseguito un MBA presso la Columbia Business School.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.