Invoice OCR Benchmark: Precisión de extracción de LLMs frente a OCRs
El procesamiento de facturas es una operación empresarial crítica pero intensiva en mano de obra que tradicionalmente requiere la extracción manual de datos y su introducción en sistemas contables. Este enfoque manual consume mucho tiempo y es susceptible a errores humanos. Para evaluar alternativas automatizadas, realizamos un análisis comparativo de las principales soluciones de procesamiento de documentos y LLMs:
- Amazon Textract API
- Claude Sonnet 3.5
- Docsumo
- Google Document IA
- Microsoft Azure Document Intelligence
- Rossum
Nuestro estudio evaluó las capacidades de estas herramientas para extraer datos con precisión de diversos formatos y calidades de facturas, con el objetivo de cuantificar su eficacia como alternativas al procesamiento manual.
Resultados de la evaluación comparativa
Evaluamos el rendimiento del procesamiento de facturas en facturas de diversa calidad y niveles de contraste. Si bien todas las herramientas mostraron un buen rendimiento con imágenes de alta calidad, su precisión disminuyó significativamente al procesar documentos de menor calidad. Entre las herramientas probadas, Claude Sonnet 3.5 mostró la mayor precisión general y resistencia en todo el espectro de calidades de documentos.
Metodología
Medición: Nuestra metodología de evaluación se centró en la precisión de la extracción de pares clave-valor. Cada campo extraído se evaluó mediante una clasificación binaria: extracción correcta o extracción incorrecta/ausente. La métrica de precisión se calculó utilizando la siguiente fórmula:
Precisión = (Número de pares clave-valor extraídos correctamente) / (Número total de pares clave-valor)
Esta metodología permitió una comparación objetiva del rendimiento de extracción entre diferentes herramientas y tipos de documentos.
Tamaño de la muestra: Encontrar datos de facturas es un desafío porque involucra información personal como correos electrónicos y nombres. Utilizamos más de 400 pares clave-valor de 20 muestras de facturas disponibles públicamente.
Muestras: Aunque todas las soluciones procesaron correctamente imágenes de alta calidad, la calidad de la extracción disminuyó en imágenes como estas:
Fine-tuning: Aunque los productos que probamos tuvieron éxito en encontrar los montos totales, tuvieron problemas para extraer los detalles de precios. Es posible obtener mejores resultados afinando algunos productos. En unos pocos productos, los usuarios pueden hacer clic en un valor de la imagen para corregir la salida del modelo.
Para ser justos con todos los proveedores, no realizamos ningún fine-tuning. Con fine-tuning, todos los proveedores deberían poder alcanzar mayores tasas de éxito la segunda vez que procesan estos documentos. Sin embargo, nuestro enfoque en esta evaluación comparativa está en las operaciones autónomas, que requieren que los modelos produzcan resultados correctos y confiables a partir de documentos que no han visto antes.
Cronología: Todas las pruebas se completaron en diciembre de 2024.
Próximos pasos
Aumento de participantes: Dado que este estudio proporciona información sobre las capacidades actuales de procesamiento de facturas en los modelos de lenguaje de gran tamaño (LLMs), las tecnologías OCR y las herramientas especializadas de procesamiento de facturas, planeamos ampliar nuestro análisis incorporando LLMs adicionales de última generación para ofrecer una evaluación comparativa más completa de las soluciones automatizadas de procesamiento de facturas.
Aumento del tamaño y la diversidad de la muestra.
¿Qué es el OCR de facturas?
El análisis sintáctico de facturas utiliza herramientas automatizadas como NLP, NLU, OCR y otras tecnologías de extracción de datos para extraer datos de facturas en varios formatos, como PDF e imágenes.
Un analizador de facturas es un programa de software que extrae información como
Nombre del proveedor
Número de factura
Importe a pagar
y la ingresa en un formato legible por máquina. Estos datos se pueden utilizar para múltiples funciones, como automatizar las cuentas por pagar, completar los cierres contables mensuales y gestionar facturas.
El software analizador generalmente se integra en un sistema de procesamiento de facturas que automatiza todo el proceso, desde la recepción de la factura hasta el pago.
¿Cómo funcionan las herramientas de OCR de facturas?
Los documentos escritos en un determinado lenguaje de marcado son leídos y procesados por los analizadores. Estos dividen el documento en partes más pequeñas, llamados tokens, y examinan cada token para determinar qué significa y dónde encaja dentro de la estructura del documento.
Para ello, los analizadores necesitan conocer en profundidad la gramática del lenguaje de marcado en cuestión. Esto les permite reconocer cada token y determinar las conexiones exactas entre ellos.
El proceso incluye 5 pasos:
1. Entrada
Las facturas se pueden recibir en una variedad de formatos, incluidos papel, correo electrónico o formatos electrónicos como PDF o XML. El software analizador de facturas normalmente aceptará estas facturas como entrada.
2. Reconocimiento Óptico de Caracteres (OCR)
Si la factura está en formato de papel escaneado o imagen, el analizador utilizará la tecnología OCR para extraer texto de la imagen. Esto permite al analizador acceder a los datos contenidos en la factura.
Algunas soluciones de análisis de facturas utilizan herramientas OCR impulsadas por IA o LLMs que extraen automáticamente información de PDFs, fotos y documentos escaneados sin necesidad de nuevas reglas o plantillas. Esto se debe a que la IA puede manejar documentos semiestructurados y desconocidos y mejorar con el tiempo. La información extraída se puede personalizar para incluir solo tablas o entradas de datos específicas.
3. Extracción de datos
A continuación, el analizador extraerá información específica de la factura, como el nombre del proveedor, el número de factura, la fecha y los detalles de los artículos. Esto se logra generalmente mediante una combinación de reconocimiento de patrones y algoritmos de aprendizaje automático.
Algunos programas de análisis de facturas tienen la capacidad de extraer información clave como la fecha de la factura, el número, los números de identificación fiscal y varios totales mediante filtros predefinidos:
Algunas herramientas de análisis ofrecen la posibilidad de extraer información de líneas de pedido de facturas con un formato consistente creando un analizador de documentos separado para cada diseño de proveedor o socio comercial específico:
4. Validación de datos
Una vez extraídos los datos, el analizador validará la información para garantizar que sea precisa y completa. Esto puede incluir comprobar que la fecha tenga el formato correcto, que el nombre del proveedor coincida con una lista predefinida de proveedores o que los detalles del artículo coincidan con el formato esperado.
5. Salida de datos
Los datos extraídos y validados se emiten luego en un formato que se puede importar fácilmente al sistema contable o ERP del usuario. Esto puede ser en forma de archivo CSV, registro de base de datos o directamente en un software de contabilidad.
Desafíos de la extracción manual de datos de facturas
Extraer manualmente datos de facturas e introducirlos en un sistema puede resultar desafiante para las empresas, ya que existen varias complejidades:
Error humano
Las facturas pueden contener una gran cantidad de datos, y la entrada manual aumenta el riesgo de errores, como errores tipográficos, transposición de números y entrada de datos incorrecta. Las imprecisiones en la entrada de datos son responsables de pérdidas anuales estimadas de $600 mil millones.1 Procesos como las cuentas por pagar necesitan una exportación correcta de datos de los documentos financieros.
Requiere mucho tiempo
En promedio, se necesitan 17 días, o aproximadamente el 75 % de un mes, para procesar manualmente una sola factura.2
Las facturas incluyen muchos datos importantes, y todos se presentan en un formato clave-valor donde cada elemento sirve tanto como clave como valor. El proceso de extraer manualmente estos pares consume mucho tiempo y requiere múltiples inspecciones para garantizar la precisión. Incluso algunos algoritmos de OCR tienen dificultades para detectar valores extraídos sin contexto. El procesamiento automatizado de facturas puede ayudar a los empleados a centrarse en tareas más complejas.
Falta de estandarización
Las facturas de diferentes proveedores pueden tener diferentes formatos. Cada factura se genera con un formato único que puede plantear dificultades al procesar e interpretar estos patrones. Los documentos, como correos electrónicos, papel y PDFs, pueden pasar por muchos registros digitales y en papel antes de ser aprobados para el pago, lo que hace que la extracción manual de datos sea difícil y propensa a errores.
Ineficiencia del proceso
La gestión manual de facturas, que incurre en un coste medio de casi $23 por factura2 , puede ser a la vez costosa y lenta, lo que conduce a un proceso ineficiente y repetitivo.
Potencial de pérdida de datos
Existe el riesgo de perder datos si las facturas se pierden o dañan o si los datos no se introducen correctamente en el sistema.
El software OCR también suele tener dificultades para extraer líneas de pedido de las facturas. Esto se debe a que las tablas de transacciones pueden carecer de líneas horizontales o verticales, lo que dificulta que el procesamiento de facturas por OCR establezca el contexto de los elementos extraídos. Las facturas digitales o imágenes de facturas recopiladas se pueden utilizar en este proceso.
¿Cómo elegir su proveedor de procesamiento de facturas?
1. Ofrece una solución acorde con las políticas de privacidad de datos de su empresa.
La política de privacidad de datos de su empresa puede ser un obstáculo para utilizar APIs externas como Amazon AWS Textract. La mayoría de los proveedores ofrecen soluciones locales, por lo que las políticas de privacidad de datos no impedirían necesariamente que su empresa utilice una solución de captura de facturas. El flujo de trabajo de cuentas por pagar debe tratarse con especial cuidado, ya que con frecuencia involucra información confidencial empresarial y financiera.
2. Proporciona una estructura de datos coherente independientemente del texto de los documentos.
Hay dos formas en que funcionan las empresas de captura de facturas basadas en aprendizaje profundo. Empresas como Textract devuelven pares clave-valor. Así, por ejemplo, si una factura denomina el importe total como “Importe bruto”, otra lo llama “Importe total” y una factura alemana lo llama “Summe”, Textract le proporciona los datos en 3 estructuras diferentes para estos 3 documentos.
En una, tiene un par clave-valor con la clave “Importe bruto”, en otra “Importe total” y en la alemana, obtiene “Summe”. Otros proveedores diseñaron estructuras de datos coherentes que funcionan para todas las facturas. En los 3 escenarios, obtendría “Importe total”, que es la clave que utilizan en su archivo de salida. Esto facilita el análisis y el procesamiento, ya que no es necesario lidiar con muchos formatos de datos estructurados diferentes.
3. Pregunte por las tasas de falsos positivos y de extracción manual de datos
A continuación, realice un proyecto de Prueba de Concepto (PoC) para ver las tasas reales en las facturas recibidas por su empresa.
Falsos positivos son facturas que son autoprocesadas pero tienen errores en la extracción de datos. Son difíciles de identificar y pueden interrumpir las operaciones. Por ejemplo, la extracción incorrecta de los importes de pago sería problemática. Minimizar esto debería ser el enfoque absoluto.
La extracción manual de datos es necesaria cuando el sistema automatizado de extracción de datos tiene una confianza limitada en su resultado. Esto podría deberse a un formato de factura diferente, mala calidad de imagen o una errata del proveedor. También es importante minimizar esto, pero existe un equilibrio entre los falsos positivos y la extracción manual de datos. Tener más extracción manual de datos puede ser preferible a tener falsos positivos.
Esta es la primera evaluación comparativa cuantitativa que hemos visto en este ámbito y seguiremos una metodología similar para preparar nuestra propia evaluación comparativa.
4. Aproveche una PoC para medir la tasa potencial de automatización
Esto depende de la cantidad de campos que espera capturar de los documentos. Un conjunto típico de ~10 campos, que incluya elementos como ID de pedido de compra, nombre del proveedor, etc., puede permitir la entrada de datos en el ERP y los pagos.
Los proveedores de mejores prácticas logran un ~80 % de STP extrayendo todos estos ~10 campos casi sin errores ~80 % de las veces. Aunque puede haber errores de vez en cuando, la verificación manual de los pagos más grandes puede garantizar que ningún pago erróneo significativo escape.
5. Pregunte por las opciones de procesamiento avanzadas que ofrece el proveedor
La extracción es el primer paso en la recopilación de datos; en la mayoría de los casos, debe ir seguida del procesamiento de datos. Por ejemplo, las facturas deben verificarse en cuanto a la conformidad con el IVA (por ejemplo, las facturas nacionales sin IVA deben explicar por qué se excluye el IVA), y no hacerlo podría dar lugar a multas significativas para la empresa, dependiendo del país.
6. Pregunte cómo aprende la solución sobre facturas nuevas
Las mejores soluciones tienen una interfaz que permite a su equipo ayudar a guiar la solución. A medida que el empleado de su empresa selecciona los pares clave-valor, la solución de captura de facturas toma nota para poder estar más segura ante una factura similar la próxima vez.
7. Evalúe la facilidad de uso de su solución de entrada manual de datos
Será utilizada por el personal administrativo de su empresa cuando procese manualmente facturas que no pueden procesarse automáticamente con confianza.
Más allá de esto, las preguntas de adquisición según las mejores prácticas tienen sentido. Por ejemplo:
- ¿Qué tan ampliamente adoptada está su solución? ¿Tienen clientes de Fortune 500?
- ¿Están satisfechos sus clientes con su solución y soporte? Podría ser bueno preguntar a un conocido de una empresa que ya esté utilizando su solución. Dado que la automatización de facturas no es una solución que mejoraría el marketing o las ventas de una empresa, incluso los competidores podrían compartir entre sí su opinión sobre las soluciones de automatización de facturas.
- ¿Cuáles son las opciones para integrar la solución en los sistemas de su empresa (por ejemplo, ERP)? ¿El departamento de TI está de acuerdo con el enfoque de integración?
- ¿Cuál es su Coste Total de Propiedad (TCO)? Las distintas soluciones utilizan diferentes unidades de precio (por ejemplo, precio por página o precio por documento), lo que dificulta esta comparación. Sin embargo, utilizando una muestra de sus archivos, podría obtener una estimación del coste.
Lecturas adicionales
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Invoice OCR Benchmark: Precisión de extracción de LLMs frente a OCRs}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/invoice-ocr}},
note = {AIMultiple. Recuperado el 4 de Agosto de 2026}
}Enlaces de referencia
El trabajo de Cem ha sido citado por publicaciones globales líderes como Business Insider, Forbes, Washington Post, firmas globales como Deloitte, HPE y ONG como el Foro Económico Mundial y organizaciones supranacionales como la Comisión Europea.
A lo largo de su carrera, Cem se ha desempeñado como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.
Lideró la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando directamente al CEO. También lideró el crecimiento comercial de la empresa de tecnología profunda Hypatos, que alcanzó ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.
Cem habla regularmente en conferencias internacionales de tecnología. Se graduó de la Universidad de Bogazici como ingeniero informático y tiene un MBA de Columbia Business School.




Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.