Servicios
Contáctanos

Benchmark de OCR: Precisión en la Extracción / Captura de Texto

Şevval Alper
Şevval Alper
actualizado el 29 de jul. de 2026
Loading Chart

La precisión del OCR es crítica para muchas tareas de procesamiento de documentos, y los LLM multimodales SOTA ahora ofrecen una alternativa al OCR. Evaluamos los principales servicios de OCR en DeltOCR Bench para identificar sus niveles de precisión en diferentes tipos de documentos:

  • Escritura a mano: GPT-5 (95 %) se destaca como el de mejor rendimiento, seguido de cerca por olmOCR-2-7B (94 %) y Gemini 2.5 Pro (93 %).
  • Medios impresos: Gemini 2.5 Pro, Google Vision y Claude Sonnet 4.5 lideran esta categoría con la puntuación más alta (85 %)
  • Texto impreso: Microsoft Azure Document Intelligence API lidera con una puntuación de 96 %.

Benchmark de OCR: DeltOCR Bench

Los nombres completos de los productos anteriores y sus versiones en uso a noviembre de 2025 se enumeran a continuación. Nuestro estudio abarca tanto servicios API de fácil acceso como soluciones que requieren infraestructura local, comparando modelos clave del mercado en un entorno de pruebas profundo.

  • Escritura a mano:
    • Rango de precisión: Un amplio rango desde 46 % hasta 95 %.
    • Aspectos destacados: GPT-5 (95 %), olmOCR-2-7B (94 %) y Gemini 2.5 Pro (93 %) muestran el rendimiento más alto. Estas puntuaciones elevadas demuestran el extraordinario potencial de precisión de los LLM multimodales, como GPT-5 y Gemini 2.5 Pro, en este ámbito.
    • Recomendación: Para reconocer escritura a mano altamente compleja, se recomiendan las mejores soluciones de LLM como GPT-5 o Gemini 2.5 Pro debido a su accesibilidad mediante API y facilidad de integración.
  • Medios impresos:
    • Rango de precisión: Un rango desde 54 % hasta 85 %.
    • Aspectos destacados: Soluciones como Gemini 2.5 Pro, Google Vision y Claude Sonnet 4.5 comparten la puntuación más alta (85 %). Esta categoría es altamente competitiva entre los LLM y los servicios tradicionales de OCR basados en la nube (Azure, Dots OCR, Amazon Textract). GPT-5 queda rezagado respecto a otros LLM líderes en esta categoría (77 %).
    • Recomendación: Para documentos con diseños visuales complejos (múltiples fuentes, baja resolución, etc.), se recomiendan LLM como Gemini 2.5 Pro, o servicios basados en la nube como Google Vision, o Microsoft Azure Document Intelligence API.
  • Texto impreso:
    • Rango de precisión: Un rango alto desde 55 % hasta 96 %, aunque la mayoría de las soluciones líderes alcanzaron puntuaciones de 94 % y superiores.
    • Aspectos destacados: Microsoft Azure Document Intelligence API (96 %) toma la delantera, seguida de cerca por soluciones como GPT-5, Gemini 2.5 Pro, Gemini 3 Pro Preview, Google Vision y Amazon Textract, todas con 95 %. Esta categoría es un área donde todas las soluciones SOTA alcanzan niveles extremadamente altos de precisión.
    • Recomendación: Para textos impresos simples que requieren alta precisión, se pueden usar con confianza soluciones en la nube consolidadas como Microsoft Azure Document Intelligence API o Google Vision, o LLM de alta puntuación (Gemini/GPT-5).

Soluciones API

Los siguientes modelos se incluyeron en nuestra lista de evaluación comparativa debido tanto a su facilidad de acceso como a su rendimiento.

  • Claude Sonnet 4.5
  • OpenAI GPT-5
  • Gemini 2.5 Pro
  • Gemini 3 Pro Preview
  • Amazon Textract API
  • Google Cloud Vision API
  • Microsoft Azure Document Intelligence API
  • Moondream OCR
  • Mistral OCR 3
  • Mistral OCR 2

Microsoft Azure Document Intelligence API forma parte de la familia de Azure Cognitive Services.

Modelos Desplegados Localmente (On-Premise)

Probar estos modelos es más desafiante que las soluciones API debido a la instalación, la gestión de dependencias y los requisitos de hardware. Todas las pruebas locales se realizaron en un entorno de servidor dedicado.

  • olmOCR-2-7B
  • PaddleOCR-VL
  • Nanonets-OCR2-3B
  • Deepseek-OCR
  • Dots-OCR

Calculamos la precisión de los resultados como la puntuación de similitud coseno para texto impreso, medios impresos y escritura a mano. Cada puntuación visible en el gráfico representa el rendimiento del modelo correspondiente dentro de esa categoría.

Durante nuestras pruebas, observamos que el modelo Nanonets-OCR2-3B ofreció el rendimiento más débil en el benchmark, obteniendo las puntuaciones más bajas. En general, encontramos que algunos modelos tuvieron dificultades particularmente con la escritura cursiva y los diseños de texto desorganizados (orden de líneas mezclado, uso inconsistente de mayúsculas). Problemas de rendimiento similares también surgieron en la categoría de medios impresos, especialmente con imágenes de baja resolución y aquellas que contenían múltiples estilos de fuente.

Dataset

Usamos un total de 300 documentos en este benchmark, con 100 documentos por categoría en 3 categorías:

Texto impreso incluye cartas, capturas de pantalla de sitios web, correos electrónicos, informes, etc.

Medios impresos incluye pósteres, portadas de libros, anuncios, etc. Nuestro objetivo fue observar el éxito de las herramientas de OCR en diferentes fuentes y ubicaciones de texto.

Los archivos de estas 2 categorías se obtuvieron de la Industry Documents Library (IDL).1

Escritura a mano: En la categoría de escritura a mano, dado que algunos documentos IDL no eran fáciles de leer, nuestro equipo generó documentos similares a los documentos IDL. Preparamos manualmente muestras de escritura a mano legible por humanos. Todas las muestras tenían un estilo de escritura cursiva.

Figura 1: Muestras de nuestro dataset.

Metodología de DeltOCR Bench

Este benchmark se centra en la precisión de extracción de texto de los productos.

Solo se realiza preprocesamiento para la categoría de escritura a mano. Tomamos fotos de documentos manuscritos con nuestros teléfonos inteligentes y usamos una aplicación móvil de escaneo:

  • Las imágenes se convirtieron a blanco y negro
  • Se aumentó el contraste y se eliminó el fondo.

OCR: Ejecutamos todos los productos en el mismo dataset y generamos salidas de texto como archivos de texto sin formato (.txt). Luego, preparamos manualmente la verdad de referencia incluyendo el texto correcto en todos estos archivos. La verdad de referencia fue verificada dos veces por humanos.

Comparación: Medimos la precisión de las soluciones de OCR comparando sus salidas con los textos originales. Para este propósito, utilizamos el framework Sentence-BERT (SBERT) para calcular puntuaciones de similitud coseno. En el benchmark, utilizamos el modelo multilingüe de alto rendimiento, MiniLM-L12-v2, para calcular la puntuación de similitud entre la salida de cada producto y los textos de verdad de referencia. Esta puntuación representa el nivel de precisión del texto.

La función de similitud utiliza una métrica de distancia coseno para calcular la similitud entre dos textos. No utilizamos la distancia de Levenshtein para este benchmark porque diferentes productos generan textos en diferentes órdenes.2

Mientras que la distancia de Levenshtein tiene en cuenta estas diferencias, nosotros solo buscamos con qué precisión se detecta el texto, pero no dónde se encuentra. La distancia coseno tiene penalizaciones insignificantes para tales casos, por lo que decidimos usarla en este benchmark.

Selección de productos

Hay muchos productos de OCR en el mercado. Necesitamos centrarnos en aquellos que pueden generar resultados de texto sin formato. Los productos para este benchmark se eligieron en función de:

  • Capacidad para extraer texto. No incluimos soluciones que solo extraen datos legibles por máquina (es decir, datos estructurados) en esta comparación
  • Su popularidad en el mercado

Esta no es una revisión exhaustiva del mercado, y es posible que hayamos excluido algunos productos con capacidades significativas. Si ese es el caso, por favor deje un comentario y estaremos encantados de ampliar el benchmark.

Limitaciones

Capacidades avanzadas como la detección de ubicación de texto, el emparejamiento clave-valor y la clasificación de documentos no se evaluaron en este benchmark.

El tamaño de la muestra se incrementará en la próxima iteración. Si busca OCR para escritura a mano, consulte nuestro benchmark de OCR para escritura a mano con 50 muestras.

También puede consultar nuestro benchmark de OCR para facturas y nuestro benchmark de OCR para recibos si está interesado.

Preguntas frecuentes

El Reconocimiento Óptico de Caracteres (OCR) es un campo del aprendizaje automático que se especializa en distinguir caracteres dentro de imágenes como documentos escaneados, libros impresos o fotos. Aunque es una tecnología madura, todavía no hay productos de OCR que puedan reconocer todo tipo de texto con una precisión del 100 %. Entre los productos que evaluamos, solo unos pocos pudieron obtener resultados exitosos de nuestro conjunto de pruebas.
Las herramientas de OCR son utilizadas por las empresas para identificar textos y sus posiciones en imágenes, clasificar documentos empresariales según temas o realizar emparejamiento clave-valor dentro de los documentos. Basándose en los resultados del OCR, otras empresas tecnológicas crean aplicaciones como la automatización de documentos. Para todos estos casos de negocio, el reconocimiento preciso de texto es crítico para un producto de OCR.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Şevval Alper (2026) - "Benchmark de OCR: Precisión en la Extracción / Captura de Texto". Publicado en línea en AIMultiple.com. Recuperado el 29 de Julio de 2026, de: https://aimultiple.com/ocr-accuracy [Recurso en línea]

Alper, Ş. (2026, 29 de Julio). Benchmark de OCR: Precisión en la Extracción / Captura de Texto. AIMultiple. https://aimultiple.com/ocr-accuracy

@misc{alper2026,
  author = {Alper, Şevval},
  title  = {{Benchmark de OCR: Precisión en la Extracción / Captura de Texto}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ocr-accuracy}},
  note   = {AIMultiple. Recuperado el 29 de Julio de 2026}
}
Şevval Alper
Şevval Alper
Investigador de IA
Şevval es analista del sector en AIMultiple, especializado en herramientas de codificación de IA, agentes de IA y tecnologías cuánticas.
Ver perfil completo

Comentarios 8

Comparte tus ideas

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450
Serhat Cinar
Serhat Cinar
Feb 28, 2025 at 09:34

Did you ever think of oncluding multimodal llms in your comparison, like gpt4o, llama 3.2. gemini, claude etc.?

Cem Dilmegani
Cem Dilmegani
Mar 17, 2025 at 02:59

Hi Serhat and thank you for your comment, Yes, we added those for which we have API access like Claude and GPT-4o.

DLJ
DLJ
Oct 17, 2024 at 11:14

Just stumbled on this milestone assessment update. Could you kindly elaborate further on the three revised datasets: Thanks for this work. Character Sets When someone refers to 'handriting', that can mean many things: 'handwriting style' typefaces (per Docusign, etc.), and hand-printed (block printing and mixed-case printing) as often found in combs and box delineators, and finally, cursive or longhand writing (exclusive of signatures). Character Context Structured content, semi-structured content, and unstructured content. Image Qualities (bitonal, greyscale, full colour, spatial dpi, from a scanner/cell-phone/native rendering, image 'enhancements' prior to OCR (thickening, local gamma, background dropout, sharpening, smoothing, noise removal, etc.) These can have significant impacts, and some don't realize the importance of including these benchmark differentiators.

Cem Dilmegani
Cem Dilmegani
Oct 22, 2024 at 03:15

Hi there, thank you for the detailed comment, we are updating the article to include these details.

Webster
Webster
Feb 05, 2023 at 07:24

Hello, great work! Just curious, did you use a trained Tesseract when making these testing?

Bardia Eshghi
Bardia Eshghi
Feb 06, 2023 at 12:29

Hi, Webster. Glad you enjoyed the article. The tools we tested were: ABBYY FineReader 15 Amazon Textract Google Cloud Platform Vision API Microsoft Azure Computer Vision API Tesseract OCR Engine Hope this answers your question.

Bobby
Bobby
Aug 14, 2022 at 23:54

The graph images are not working for me at the moment. Otherwise great

Cem Dilmegani
Cem Dilmegani
Aug 15, 2022 at 14:48

Thank you Bobby! We have a glitch in the CMS and we are fixing it. Apologies for the issue, it should be fixed next week.

samsun
samsun
Jun 07, 2022 at 14:10

Thanks for sharing, can you add a free OCR for everyone to use? https://www.geekersoft.com/ocr-online.html

Cem Dilmegani
Cem Dilmegani
Aug 17, 2022 at 07:46

Hi Samsun, unfortunately, we don't share all OCR providers on this page, there are thousands of them. We tried to put together the largest ones in terms of market presence. If you have evidence that your solution is one of the top 10 globally, please share it with us at info@aimultiple.com so we can consider it.

Scott
Scott
Jan 20, 2022 at 20:42

What version of Tesseract did you test with? They recently released v5.

Cem Dilmegani
Cem Dilmegani
Aug 23, 2022 at 12:01

Hi Scott, we did the benchmarking before Tesseract 5. We will redo it soon and include the versions in the methodology section as well.

Bob
Bob
Jan 12, 2022 at 15:09

This is very informative, nice work. I assume your tests used documents/images in English? I've been experimenting with OCR tools on other languages and finding relatively poor accuracy.

Cem Dilmegani
Cem Dilmegani
Jan 15, 2022 at 13:52

Exactly, all text were in English. I hear similar things about OCR on non-Latin characters. We have an Arabic speaker in the team who claims that accuracy in Arabic is much lower compared to English. We can do a benchmark on non-Latin characters if there is demand for it.

kin
kin
Jun 21, 2021 at 02:22

interesting post!!! do you have any suggestion about improving accuracy on scanned image ? i'm using tesseract right now. anyway , great work!

Cem Dilmegani
Cem Dilmegani
Jun 22, 2021 at 07:50

Thank you for the comment. There are pre-processing approaches that can be implemented to improve image quality. But such approaches may already be used in Tesseract. A detailed research into Tesseract image processing would be helpful in your case.