Stato della tecnologia OCR: è morta o un problema risolto?
Il riconoscimento ottico dei caratteri (OCR) è una delle prime aree di ricerca sull’intelligenza artificiale. Oggi, la tecnologia OCR è relativamente matura e non viene più chiamata IA, un buon esempio della citazione del vincitore del Premio Pulitzer Douglas Hofstadter: l’IA è tutto ciò che non è ancora stato fatto.1
Nel nostro benchmark OCR, DeltOCR, un grande modello linguistico, legge correttamente più del 95% dei caratteri nel testo stampato.
Gli strumenti OCR sono ancora inferiori agli umani su input difficili: scansioni di bassa qualità, scrittura araba corsiva come il Nastaliq e la scrittura a mano.
Che cos’è l’OCR?
L’OCR è una tecnologia che identifica i caratteri da libri stampati, documenti scritti a mano o immagini. Con questa tecnologia, le aziende possono trasferire rapidamente i documenti nei loro sistemi digitali e gli strumenti di analisi dei dati possono elaborare i dati rilevanti.
Quali progressi tecnologici forniscono l’OCR di oggi?
Visione artificiale
Nella visione artificiale, l’OCR rileva prima i caratteri uno per uno. Successivamente, utilizza la classificazione delle immagini per identificare ciascun carattere. Se questi due passaggi funzionano correttamente, l’OCR produce risultati accurati. Tuttavia, a volte i caratteri possono essere troppo vicini tra loro e potrebbero non essere riconosciuti. Pertanto, l’OCR richiede più delle tecnologie di visione artificiale.
Elaborazione del linguaggio naturale (NLP)
Anche se l’OCR identifica i caratteri, questi caratteri formano parole, frasi e paragrafi. La ricerca nell’NLP ha portato a numerosi algoritmi per correggere gli errori di riconoscimento dei caratteri utilizzando metodi probabilistici. Ad esempio, i caratteri mancanti possono essere stimati utilizzando il contesto.
Apprendimento profondo supervisionato
L’OCR utilizza algoritmi di deep learning per migliorare le sue prestazioni. I modelli OCR apprendono da campioni di addestramento etichettati. Con un numero sufficiente di esempi, possono:
- Riconoscere i caratteri con font diversi. Ogni carattere può essere scritto in un’ampia gamma di forme e un ampio set di dati etichettati aiuta il software OCR a identificare i caratteri nonostante le variazioni di font
- Rilevare gli errori e correggerli. Gli strumenti OCR possono saltare i caratteri che non possono essere identificati. Riconoscendo i modelli nei campioni di addestramento, l’OCR può rilevare quegli errori e correggere i propri sbagli.
Modelli visione-linguaggio (VLM)
L’OCR sta passando da pipeline a più fasi a modelli visione-linguaggio (VLM). I sistemi OCR tradizionali utilizzano spesso strumenti separati per il rilevamento del testo, il riconoscimento del testo, l’analisi del layout e l’estrazione delle tabelle. I VLM combinano queste attività in un unico modello.
Questo cambiamento ha migliorato le prestazioni su documenti con:
- Tabelle
- Moduli
- Formule matematiche
- Layout complessi
- Testo e immagini misti
Diversi VLM open source sono apparsi nel 2025 e nel 2026, tra cui dots.ocr, GOT-OCR 2.0, DeepSeek-OCR, PaddleOCR-VL, olmOCR e GLM-OCR. Molti possono essere eseguiti su una singola GPU ottenendo risultati validi nei benchmark di comprensione dei documenti.
Anche opzioni commerciali come Mistral OCR, Gemini e i modelli GPT vengono utilizzati per l’analisi dei documenti e l’estrazione delle informazioni.
Una tendenza degna di nota è l’ascesa di modelli più piccoli focalizzati sull’OCR. Modelli come GLM-OCR e PaddleOCR-VL ottengono risultati competitivi nei benchmark richiedendo molti meno parametri rispetto a molti modelli visione-linguaggio di uso generale.
Quali sono i limiti degli strumenti OCR?
L’OCR da solo non produce dati strutturati
L’OCR restituisce testo semplice, non campi organizzati. Per trasformare un documento in dati strutturati, come le voci di una fattura, l’OCR deve essere abbinato ad altri strumenti.
Gli OCR non riescono ancora a eguagliare la precisione umana nella maggior parte delle applicazioni.
Gli errori includono la lettura errata delle lettere, il saltare lettere illeggibili o la combinazione di testo da colonne adiacenti o didascalie di immagini. Sebbene molti fattori influenzino le prestazioni degli strumenti OCR, il numero di errori dipende dalla qualità e dalla forma del testo, incluso il font utilizzato.
Tuttavia, anche con documenti di alta qualità, gli strumenti OCR possono commettere errori perché esiste una varietà di formati di documento, font e stili per ogni carattere. Le limitazioni che impediscono agli strumenti OCR di raggiungere un’accuratezza del 100% possono essere elencate come segue:
Limitazioni basate sul documento
- Sfondi colorati: I motivi di sfondo colorati possono essere problematici perché possono ridurre il riconoscimento del testo
- Testo sfocato o con riflessi: Le immagini sfocate o con riflessi sono difficili da leggere sia per gli umani che per i computer.
- Documenti inclinati o non orientati: Per le situazioni in cui l’immagine potrebbe essere inclinata, l’OCR avrà più difficoltà a identificare i caratteri perché il testo non è allineato.
Limitazioni basate sul testo
- Varietà di lettere: Le forme delle lettere in alcuni alfabeti sono più difficili da riconoscere. Ad esempio, poiché anche i caratteri arabi stampati sono in forma corsiva, il riconoscimento dei caratteri diventa una sfida.
- Varietà di tipi e dimensioni di font: Sebbene sia difficile riconoscere tutti i diversi tipi di font, anche i caratteri troppo piccoli/grandi sono difficili da identificare.
- Caratteri simili: Alcuni caratteri sono così simili che gli strumenti OCR potrebbero non distinguerli. Ad esempio, è difficile distinguere tra il numero “0” e la lettera “O”.
- Testo scritto a mano: Poiché ognuno ha il proprio modo di scrivere i caratteri, gli strumenti OCR potrebbero non riconoscere tutti i caratteri con stili diversi.
Come misurare la precisione dell’OCR?
La precisione viene solitamente misurata dal tasso di errore dei caratteri o dal tasso di errore delle parole, che conta quanti caratteri o parole lo strumento sbaglia. Alcuni benchmark utilizzano anche la distanza di modifica, che misura il numero di modifiche necessarie per ottenere il testo corretto.2
La precisione dell’OCR può essere misurata in base alla porzione di caratteri in un testo che lo strumento OCR può estrarre senza errori. Ad esempio, una precisione del 99% significa che 990 caratteri su 1000 vengono riconosciuti correttamente.
Esiste una ricerca attiva per superare queste limitazioni?
Da quando è stato introdotto per la prima volta, l’OCR si è evoluto ed è ora utilizzato in quasi tutti i principali settori industriali. Poiché presenta ancora aree da migliorare, la ricerca sull’OCR è continuata. I progressi nella visione artificiale e negli algoritmi di deep learning contribuiscono all’aumento della precisione di questa tecnologia.
Attualmente, gli strumenti OCR possono raggiungere una precisione superiore al 99% nei testi dattiloscritti. Tuttavia, si desiderano livelli di precisione più elevati poiché le aziende fanno ancora ricorso all’intervento umano per verificare eventuali errori.
L’attuale focus della ricerca sulla tecnologia OCR è principalmente sul riconoscimento della scrittura a mano e sul riconoscimento del testo corsivo.
All’inizio del 2026, sono stati introdotti nuovi modelli OCR open source:
PaddleOCR-VL-1.5, introdotto a gennaio 2026, ha affermato di superare i migliori modelli raggiungendo una precisione del 95% nel benchmark autorevole di analisi dei documenti.3
RapidOCR v3.6.0, include modelli OCR (incluso PaddleOCR) per essere eseguiti su runtime comuni come ONNX Runtime e OpenVINO, con un focus su un’implementazione locale facile e veloce.4
Riconoscimento della scrittura a mano
La ricerca sul riconoscimento della scrittura a mano sfrutta anche il movimento dinamico creato durante il processo di scrittura per identificare i caratteri. Sebbene il problema principale del riconoscimento della scrittura a mano sia la varietà degli stili di carattere, la precisione dell’OCR in quest’area sta migliorando costantemente ma lentamente.
Puoi leggere il nostro benchmark sul riconoscimento della scrittura a mano se sei interessato.
Riconoscimento del testo corsivo
Le lettere unite sono chiaramente più difficili da riconoscere rispetto ai testi stampati. Questa situazione comporta più errori negli strumenti OCR e le forme delle lettere non forniscono informazioni sufficienti per consentire al software di percepirle correttamente.
Allucinazione
I vecchi OCR potevano leggere male o saltare i caratteri. L’OCR basato su VLM può fare qualcosa di diverso: inventare testo che non è mai stato sulla pagina. Ciò accade maggiormente in documenti lunghi o densi e in figure complesse. Poiché il testo inventato risulta fluente, gli errori possono essere più difficili da individuare rispetto a una classica lettura errata.
Letture consigliate
- Benchmark sul riconoscimento della scrittura a mano
- Benchmark di fatturazione OCR: Accuratezza dell’estrazione di LLM rispetto agli OCR
- Benchmark OCR
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and PhD., Ezgi Arslan,},
title = {{Stato della tecnologia OCR: è morta o un problema risolto?}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/ocr-technology}},
note = {AIMultiple. Consultato il 17 Giugno 2026}
}Collegamenti di riferimento
Il lavoro di Cem è stato citato da importanti pubblicazioni globali tra cui Business Insider, Forbes, Washington Post, aziende globali come Deloitte, HPE e ONG come il World Economic Forum e organizzazioni sovranazionali come la Commissione europea.
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente di tecnologia e imprenditore tecnologico. Ha consigliato aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per oltre un decennio. Ha anche pubblicato un rapporto McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha anche guidato la crescita commerciale dell'azienda deep tech Hypatos che ha raggiunto un fatturato annuo ricorrente a 7 cifre e una valutazione a 9 cifre partendo da 0 in 2 anni. Il lavoro di Cem in Hypatos è stato trattato da importanti pubblicazioni tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato in ingegneria informatica all'Università Bogazici e ha conseguito un MBA presso la Columbia Business School.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.