OCR La precisión del OCR es fundamental para muchas tareas de procesamiento de documentos, y los LLMs multimodales de última generación (SOTA) ahora ofrecen una alternativa al OCR. Comparamos los principales servicios de OCR en DeltOCR Bench para identificar sus niveles de precisión en diferentes tipos de documentos:
- Escritura a mano: GPT-5 (%95) destaca como el de mejor rendimiento, seguido de cerca por olmOCR-2-7B (%94) y Gemini 2.5 Pro (%93).
- Medios impresos: Gemini 2.5 Pro, Google Vision y Claude Sonnet 4.5 lideran esta categoría con la puntuación más alta (%85)
- Texto impreso: Microsoft Azure Document Intelligence API lidera con una puntuación de %96.
OCR Comparativa: DeltOCR Bench
A continuación se enumeran los nombres completos de los productos anteriores y sus versiones en uso a noviembre de 2025. Nuestro estudio abarca tanto servicios API de fácil acceso como soluciones que requieren infraestructura local, comparando los principales modelos del mercado en un entorno de pruebas profundo.
- Escritura a mano:
- Rango de precisión: Un amplio rango desde %46 hasta %95.
- Aspectos destacados: GPT-5 (%95), olmOCR-2-7B (%94), y Gemini 2.5 Pro (%93) exhiben el rendimiento más alto. Estas puntuaciones altas demuestran el extraordinario potencial de precisión de los LLMs multimodales, como GPT-5 y Gemini 2.5 Pro, en este ámbito.
- Recomendación: Para reconocer escritura a mano muy compleja, se recomiendan las principales soluciones LLM como GPT-5 o Gemini 2.5 Pro debido a su accesibilidad mediante API y facilidad de integración.
- Medios impresos:
- Rango de precisión: Un rango desde %54 hasta %85.
- Aspectos destacados: Soluciones como Gemini 2.5 Pro, Google Vision, y Claude Sonnet 4.5 comparten la puntuación más alta (%85). Esta categoría es muy competitiva entre los LLMs y los servicios tradicionales de OCR basados en la nube (Azure, Dots OCR, Amazon Textract). GPT-5 se queda atrás frente a otros LLMs líderes en esta categoría (%77).
- Recomendación: Para documentos con diseños visuales complejos (múltiples fuentes, baja resolución, etc.), se recomiendan LLMs como Gemini 2.5 Pro, o servicios basados en la nube como Google Vision, o Microsoft Azure Document Intelligence API.
- Texto impreso:
- Rango de precisión: Un alto rango desde %55 hasta %96, aunque la mayoría de las soluciones líderes alcanzaron puntuaciones de %94 y superiores.
- Aspectos destacados: Microsoft Azure Document Intelligence API (%96) toma la delantera, seguido de cerca por soluciones como GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision, y Amazon Textract, todas con una puntuación de %95. Esta categoría es un área donde todas las soluciones de última generación (SOTA) logran niveles de precisión extremadamente altos.
- Recomendación: Para textos impresos simples que requieren alta precisión, se pueden usar con confianza soluciones en la nube consolidadas como Microsoft Azure Document Intelligence API o Google Vision, o LLMs de alta puntuación (Gemini/GPT-5).
API Soluciones
Los siguientes modelos se incluyeron en nuestra lista de comparativas debido tanto a su facilidad de acceso como a su rendimiento.
- Claude Sonnet 4.5
- OpenAI GPT-5
- Gemini 2.5 Pro
- Gemini 3 Pro Preview
- Amazon Textract API
- Google Cloud Vision API
- Microsoft Azure Document Intelligence API
- Moondream OCR
- Mistral OCR 3
- Mistral OCR 2
Microsoft Azure Document Intelligence API es parte de la familia Azure Cognitive Services.
Modelos desplegados localmente (On-Premise)
Probar estos modelos es más desafiante que las soluciones API debido a la instalación, gestión de dependencias y requisitos de hardware. Todas las pruebas locales se realizaron en un entorno de servidor dedicado.
- olmOCR-2-7B
- PaddleOCR-VL
- Nanonets-OCR2-3B
- Deepseek-OCR
- Dots-OCR
Calculamos la precisión de los resultados como la puntuación de similitud coseno para texto impreso, medios impresos y escritura a mano. Cada puntuación visible en el gráfico representa el rendimiento del modelo correspondiente dentro de esa categoría.
Durante nuestras pruebas, observamos que el modelo Nanonets-OCR2-3B ofreció el rendimiento más débil en la comparativa, obteniendo las puntuaciones más bajas. En general, encontramos que algunos modelos tuvieron dificultades especialmente con la escritura cursiva y los diseños de texto desorganizados (orden de líneas mezclado, capitalización inconsistente). Problemas de rendimiento similares también surgieron en la categoría de medios impresos, especialmente con imágenes de baja resolución y aquellas que contienen múltiples estilos de fuente.
Dataset
Utilizamos un total de 300 documentos en esta comparativa, con 100 documentos por categoría en 3 categorías:
Texto impreso incluye cartas, capturas de pantalla de sitios web, correos electrónicos, informes, etc.
Medios impresos incluye carteles, portadas de libros, anuncios, etc. Nuestro objetivo era ver el éxito de las herramientas de OCR en diferentes fuentes de texto y ubicaciones.
Files en estas 2 categorías se obtuvieron de la Industry Documents Library (IDL).1
Escritura a mano: En la categoría de escritura a mano, dado que algunos documentos IDL no eran fáciles de leer, nuestro equipo generó documentos similares a los documentos IDL. Preparamos manualmente muestras de escritura a mano legible para humanos. Todas las muestras tenían un estilo de escritura cursiva.
Metodología de DeltOCR Bench
Esta comparativa se centra en la precisión de extracción de texto de los productos.
El preprocesamiento se realiza solo para la categoría de escritura a mano. Tomamos fotos de documentos escritos a mano con nuestros smartphones y usamos una aplicación de escaneo móvil:
- Las imágenes se convirtieron a blanco y negro
- Se aumentó el contraste y se eliminó el fondo.
OCR: Ejecutamos todos los productos en el mismo conjunto de datos y generamos salidas de texto como archivos de texto sin formato (.txt). Luego, preparamos manualmente la verdad fundamental incluyendo el texto correcto en todos estos archivos. La verdad fundamental fue verificada dos veces por humanos.
Comparación: Medimos la precisión de las soluciones de OCR comparando sus salidas con los textos originales. Para ello, utilizamos el marco Sentence-BERT (SBERT) para calcular las puntuaciones de similitud coseno. En la comparativa, utilizamos el modelo multilingüe de parafraseo de alto rendimiento, MiniLM-L12-v2, para calcular la puntuación de similitud entre la salida de cada producto y los textos de verdad fundamental. Esta puntuación representa el nivel de precisión del texto.
La función de similitud utiliza una métrica de distancia coseno para calcular la similitud entre dos textos. No utilizamos la distancia de Levenshtein para esta comparativa porque diferentes productos generan textos en diferentes órdenes.2
Mientras que la distancia de Levenshtein tiene en cuenta estas diferencias, nosotros sólo buscamos la precisión con la que se detecta el texto, pero no dónde se encuentra. La distancia coseno tiene penalizaciones insignificantes para estos casos, por lo que decidimos utilizarla en esta comparativa.
Selección de productos
Hay muchos productos de OCR en el mercado. Necesitamos centrarnos en aquellos que pueden generar resultados de texto sin formato. Los productos para esta comparativa se eligen en función de:
- Capacidad para extraer texto. No incluimos soluciones que solo extraen datos legibles por máquina (es decir, datos estructurados) en esta comparación
- Su popularidad en el mercado
Esto no es una revisión exhaustiva del mercado, y es posible que hayamos excluido algunos productos con capacidades significativas. Si es el caso, por favor deje un comentario y estaremos encantados de ampliar la comparativa.
Limitaciones
Capacidades avanzadas como la detección de ubicación de texto, el emparejamiento clave-valor y la clasificación de documentos no se evaluaron en esta comparativa.
El tamaño de la muestra se incrementará en la próxima iteración. Si busca OCR para escritura a mano, consulte nuestra comparativa de OCR para escritura a mano con 50 muestras.
También puede consultar nuestra comparativa de OCR para facturas y comparativa de OCR para recibos si está interesado.
Resultados previos de la comparativa de OCR
- Google Cloud Vision y AWS Textract son las tecnologías líderes en el mercado para todos los casos
- Abbyy también tiene un alto rendimiento para documentos no escritos a mano
- Todos los OCR evaluados, incluyendo el código abierto Tesseract, funcionaron bien en capturas de pantalla digitales.
La herramienta Vision OCR de Google Cloud Platform alcanza la mayor precisión de texto del 98.0% cuando se prueba todo el conjunto de datos. Si bien todos los productos funcionan por encima del 99.2% en la Categoría 1, donde se incluyen textos mecanografiados, las imágenes escritas a mano en las Categorías 2 y 3 marcan la verdadera diferencia entre los productos.
Los resultados generales muestran que GCP Vision y AWS Textract son los productos OCR dominantes, con la mayor precisión en el reconocimiento del texto dado.
Notas de los resultados generales:
- Hay una sola ocasión en la que AWS Textract no reconoció el texto escrito a mano. Esta situación reduce significativamente el rendimiento de categoría y total de AWS Textract. También aumenta la desviación dentro de la categoría y en general, porque AWS Textract funciona muy bien en todas las demás instancias.
- Azure es el producto líder en la Categoría 1 con 99.8% de precisión. Sin embargo, el producto a menudo falla en el reconocimiento de texto escrito a mano, como se muestra en los resultados de la segunda categoría. Esta es la razón por la que Azure se queda atrás en la tercera categoría y en general.
- Tesseract OCR es un producto de código abierto que se puede usar de forma gratuita. En comparación con Azure y ABBYY, funciona mejor en instancias de escritura a mano y puede considerarse para el reconocimiento de escritura a mano si el usuario no puede obtener productos de AWS o GCP. Sin embargo, puede tener un rendimiento deficiente en imágenes escaneadas.
- A diferencia de otros productos, ABBYY genera un archivo .txt más estructurado. ABBYY también considera la ubicación del texto dentro de la imagen al generar el archivo de salida. Si bien el producto tiene capacidades útiles adicionales, en esta comparativa nos centramos solo en la precisión del texto. Y tuvo un rendimiento deficiente en el reconocimiento de escritura a mano.
Eliminando la imagen "Problemática"
Como se mencionó en los resultados generales, hubo una sola imagen "atípica" en la que AWS Textract no pudo reconocer ningún texto. Si bien el producto muestra más del 95% de precisión de texto en todas las demás imágenes, esta instancia redujo el rendimiento de AWS y amplió su intervalo de confianza.
Dado que esta instancia podría ser una excepción, también quisimos comparar los productos sin ella. Llamamos a esta imagen la "problemática" y volvimos a ejecutar nuestros resultados para ver si marcaban una diferencia.
Estos son los nuevos resultados después de excluir la "problemática" del conjunto de datos.
Cuando se excluye la "problemática", AWS Textract se convierte en el mejor con un nivel de precisión de texto casi perfecto (99.3%) y un intervalo de confianza estrecho. Si bien las puntuaciones no cambian mucho, GCP Vision y AWS Textract siguen siendo los 2 principales productos, con mejor precisión de texto que los demás.
Resultados sin reconocimiento de escritura a mano
El principal factor que reduce la precisión del texto de ciertos productos es la presencia de escritura a mano en las imágenes. Por lo tanto, excluimos todas las imágenes (toda la categoría 2 y 6 imágenes de la categoría 3) y reevaluamos el rendimiento de precisión del texto, nuevamente.
Los resultados son más reñidos cuando se excluyen las imágenes escritas a mano. AWS Textract y GCP Vision siguen siendo los 2 principales productos en la comparativa, pero ABBYY FineReader también funciona muy bien (99.3%) esta vez. Aunque todos los productos logran más del 95% de precisión cuando se excluye la escritura a mano, Azure Computer Vision y Tesseract OCR todavía tienen dificultades con los documentos escaneados, quedando rezagados en esta comparación.
Productos evaluados
Probamos cinco productos de OCR para medir su rendimiento de precisión de texto. Utilizamos las versiones disponibles en mayo de 2021. Los productos utilizados son:
- ABBYY FineReader 15
- Amazon Textract
- Google Cloud Platform Vision API
- Microsoft Azure Computer Vision API
- Tesseract OCR Engine
Dataset
Aunque hay muchos conjuntos de datos de imágenes para OCR, estos son
- en su mayoría a nivel de caracteres y no se ajustan a casos de uso empresarial reales
- o se centran en la ubicación del texto en lugar del texto en sí.
Por lo tanto, decidimos crear nuestro propio conjunto de datos bajo tres categorías principales:
- Categoría 1 - Capturas de pantalla de páginas web que incluyen textos: Esta categoría incluye capturas de pantalla de páginas aleatorias de Wikipedia y resultados de búsqueda de Google con consultas aleatorias.
- Categoría 2 - Escritura a mano: Esta categoría incluye fotos aleatorias que incluyen diferentes estilos de escritura a mano.
- Categoría 3 - Recibos, facturas y contratos escaneados: Esta categoría incluye una colección aleatoria de recibos, facturas escritas a mano y contratos de seguros escaneados recopilados de Internet.
Todos los archivos de entrada están en formato .jpg o .png.
Limitaciones
- Conjunto de datos limitado: Originalmente, teníamos una cuarta categoría que consistía en fotos de periódicos para evaluar el rendimiento de los productos en documentos impresos. Sin embargo, estas fotos contienen demasiado texto, lo que dificulta la generación de la verdad fundamental. Por lo tanto, decidimos no usarlas.
- Inconsistencias en los formatos de salida: Muchas imágenes incluyen instancias de texto separado en los lados izquierdo y derecho. Los productos extraen estos textos en diferentes órdenes, lo que hace que los archivos de salida sean diferentes, aunque los textos se detectan con precisión. Esta situación nos impidió usar otras medidas de distancia (como la distancia de Levenshtein) y limitó nuestras opciones para calcular la precisión del texto.
- Posible problema con la distancia coseno: La distancia coseno utiliza embeddings al calcular la similitud. Por ejemplo, comparar las frases "I like tea" y "I like coffee" daría una puntuación de similitud más alta de lo que debería. Sin embargo, casos como confundir la palabra "tea" por "coffee" serían raros, por lo que no consideramos esta posibilidad en este ejercicio.
Utilizamos otros datos de mercado (por ejemplo, reseñas de software, estudios de casos de clientes) para clasificar a los proveedores de software. Sin embargo, dado que la mayoría de las empresas utilizan el término “OCR” al buscar soluciones de extracción de datos (es decir, incluidas aquellas que generan datos legibles por máquina), nuestra lista tiene un alcance más amplio y más empresas que las presentadas en este ejercicio de comparativa.
Preguntas frecuentes
Reconocimiento Óptico de Caracteres (OCR) es un campo del aprendizaje automático que se especializa en distinguir caracteres dentro de imágenes como documentos escaneados, libros impresos o fotos. Aunque es una tecnología madura, todavía no hay productos de OCR que puedan reconocer todo tipo de texto con una precisión del 100%. Entre los productos que evaluamos, solo unos pocos pudieron obtener resultados exitosos de nuestro conjunto de pruebas.
Las herramientas de OCR son utilizadas por empresas para identificar textos y sus posiciones en imágenes, clasificar documentos comerciales según temas o realizar emparejamiento clave-valor dentro de los documentos. Basándose en los resultados de OCR, otras empresas tecnológicas construyen aplicaciones como la automatización de documentos. Para todos estos casos de negocio, el reconocimiento preciso del texto es fundamental para un producto de OCR.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{OCR Comparativa: Precisión en Extracción / Captura de Texto}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/ocr-accuracy}},
note = {AIMultiple. Recuperado el 29 de Junio de 2026}
}



Comentarios 8
Comparte tus ideas
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.
Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?
Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.
Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.
Hi there, thank you for the detailed comment, we are updating the article to include these details.
Hello, great work! Just curious, did you use a trained Tesseract when making these testing?
Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.
The graph images are not working for me at the moment. Otherwise great
Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.
Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html
Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.
What version of Tesseract did you test with? They recently released v5.
Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.
This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.
Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.
interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!
Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.