Realizamos un benchmark de 15 models de IA multimodal líderes en razonamiento visual utilizando 200 preguntas basadas en imágenes. La evaluación consistió en dos áreas: 100 preguntas de comprensión de gráficos que evaluaban la interpretación de visualizaciones de datos, y 100 preguntas de lógica visual que evaluaban el reconocimiento de patrones y el razonamiento espacial. Cada pregunta se ejecutó 5 veces para garantizar resultados consistentes y fiables.
Benchmark de razonamiento visual
Consulte nuestra metodología del benchmark para conocer nuestros procedimientos de prueba.
gemini-3.1-pro-preview y gemini-3-pro-preview lideran la clasificación. Les siguen gpt-5.2, kimi-k2.5 y gpt-5.2-pro que lideran el siguiente grupo de models. Aunque la mayoría de los models tienen un buen rendimiento en tareas basadas en datos, persiste una brecha para llama-4-maverick en la conexión de entradas visuales con pasos lógicos.
Lógica visual
La lógica visual requiere reconocimiento de patrones y razonamiento espacial. gemini-3.1-pro-preview lidera la prueba de lógica visual, mostrando el mayor rendimiento en tareas de razonamiento abstracto. Muchos models muestran una disminución en el rendimiento en comparación con los resultados en análisis de gráficos. llama-4-maverick muestra una limitación en estas tareas.
Comprensión de gráficos
Los models demuestran una mejor competencia en la interpretación de gráficos que en lógica visual. gemini-3.1-pro-preview tiene la puntuación más alta en las pruebas de comprensión de gráficos, seguido de cerca por gemini-3-pro-preview y gemini-2.5-pro, mostrando una gran capacidad para decodificar datos estructurados y visualizaciones. claude-opus-4.6 y claude-sonnet-4.6 muestran resultados más altos al interpretar gráficos en comparación con sus puntuaciones de lógica. Las tareas visuales basadas en datos son más accesibles para los models multimodales actuales que el reconocimiento de patrones.
Fiabilidad estadística del rendimiento en razonamiento visual (IC 95 %)
Calculamos los Intervalos de Confianza (IC) al 95 % mediante 10.000 remuestreos bootstrap para definir el margen de error de cada model, mostrando el rango dentro del cual probablemente se encuentra su verdadero rendimiento.
Preguntas del benchmark sobre dónde destacan y tienen más dificultades los LLMs
Pregunta de gráficos con la tasa de éxito más baja de los LLMs
Figura 1: Gráfico de barras que muestra los volúmenes de ventas Star en 12 meses con cuatro barras agrupadas por mes (datos de 1998-2000). Cada mes muestra barras sólidas, blancas y rayadas en agrupación cerrada.
Nota: Todos los gráficos se obtuvieron de Hitbullseye.1
Pregunta: Si las ventas de tres años consecutivos están aumentando o disminuyendo constantemente, entonces se denomina tendencia constante. ¿Qué meses muestran una tendencia de aumento constante en tres años consecutivos?
Por ejemplo, en junio de 1999, el valor real fue inferior al de 1998, mostrando una disminución, pero el model lo interpretó incorrectamente como un aumento constante. La mayoría de los models cometen el mismo error en esta pregunta.
Cuando hay 4 barras agrupadas por mes, los models tuvieron dificultades con la asignación barra-año y la percepción de alturas relativas. No pudieron distinguir con precisión qué barra rayada/sólida/blanca pertenecía a cada año, lo que llevó a leer las barras en el orden incorrecto o a confundir sus alturas.
Esto reveló una limitación fundamental en el razonamiento visoespacial: los models actuales carecían de la percepción precisa a nivel de píxel necesaria para medir y secuenciar correctamente barras densamente agrupadas, lo que condujo a una identificación errónea sistemática de las tendencias.
Pregunta de gráficos con la tasa de éxito más alta de los LLMs
Figura 2: Gráfico de barras que muestra los porcentajes de participación electoral en las elecciones generales de India de 1952 a 1998. Una barra por año electoral con espaciado claro entre barras.
Pregunta: ¿En qué años se registraron respectivamente la mayor y la menor participación electoral (en porcentaje)?
Todos los models respondieron correctamente a esta pregunta. Este éxito demuestra que los models destacan en la identificación simple de mínimo-máximo, encontrando las barras más altas y más bajas.
A diferencia de los grupos agrupados de 4 barras, que resultan confusos, este gráfico tiene una sola barra por año con un espaciado claro, lo que facilita la comparación visual directa. Los models tienen un buen rendimiento en tareas puramente observacionales que no requieren una asignación compleja de barra a categoría.
Pregunta de lógica visual con la tasa de éxito más alta de los LLMs

Figura 3: Dos cuadrículas 3×3 alineadas que muestran correspondencia de patrones algebraicos. La cuadrícula superior contiene variables y sus operaciones (multiplicación, división, exponentes). La cuadrícula inferior muestra valores numéricos, con algunas celdas completadas (6, 36, 3/4) y dos incógnitas (A, B). La pregunta pide encontrar B-A.
El éxito provino del claro patrón matemático visible en la estructura de la tabla (relaciones algebraicas como a×b, c×d). El diseño simple de la cuadrícula, sin complejidad visual, permitió a los models centrarse únicamente en la inferencia numérica y la deducción lógica.
Los models destacan cuando los problemas implican patrones matemáticos explícitos que pueden resolverse mediante razonamiento paso a paso, demostrando su fortaleza en lógica simbólica y reconocimiento de patrones cuando las distracciones visuales son mínimas.
Pregunta de lógica visual con la tasa de éxito más baja de los LLMs

Figura 4: Rompecabezas de reconocimiento de patrones con círculos que contienen diferentes patrones de líneas internas y formas geométricas. Dos secuencias de ejemplo con flechas mostradas en la parte superior, seguidas de una pregunta que pide completar la tercera secuencia entre cinco opciones de respuesta múltiple.
La dificultad radica en que requiere reconocimiento abstracto de patrones visuales, identificando reglas de transformación geométrica a través de múltiples ejemplos.
Esto exige razonamiento espacial puro para comprender cómo las formas rotan, se transforman y se relacionan entre sí. Los models tienen dificultades con la inferencia de reglas a partir de secuencias visuales cuando no hay guía numérica o textual explícita disponible, solo patrones espaciales.
¿Qué es el razonamiento visual?
El razonamiento visual es la capacidad de un model para interpretar imágenes, conectar elementos visuales y responder preguntas que requieren comprender tanto información visual como textual. Esta capacidad va más allá del simple reconocimiento de objetos e incluye tareas como analizar visualizaciones de datos, identificar patrones espaciales y comprender relaciones entre elementos visuales.
Nuestro benchmark evaluó esto a través de dos áreas distintas para probar diferentes aspectos cognitivos: comprensión de gráficos, donde los models interpretaron gráficos de barras, gráficos de líneas y diagramas de dispersión para evaluar su capacidad de extraer información estructurada de visualizaciones de datos; y lógica visual, donde abordaron rompecabezas de reconocimiento de patrones y problemas de razonamiento espacial para medir el razonamiento abstracto sin guía numérica explícita. Esta división refleja la distinción fundamental en cómo los models procesan datos explícitos frente a patrones implícitos.
Los models logran el razonamiento visual a través de diferentes enfoques arquitectónicos. Por ejemplo, el framework Cola coordina múltiples models de visión-lenguaje donde cada uno proporciona descripciones y respuestas plausibles, luego un LLM central evalúa estas opciones y selecciona la respuesta más precisa.
Figura 5: Gráfico que muestra cómo Cola aprovecha un model de lenguaje coordinativo para el razonamiento visual.2
Otro ejemplo es el framework CVR-LLM, que mejora el razonamiento convirtiendo imágenes en descripciones conscientes del contexto utilizando el método CaID y seleccionando ejemplos relevantes con el procedimiento CVR-ICL. Este framework trata la información de la imagen como representaciones basadas en texto, lo que permite al LLM analizar asociaciones de manera más efectiva en varios tipos de tareas multimodales.3
Cómo funciona el razonamiento visual en los LLMs
Los LLMs no perciben las imágenes directamente. Dependen de codificadores de visión que convierten las imágenes en representaciones estructuradas adaptadas para models de lenguaje. El codificador identifica objetos, texturas, relaciones espaciales y patrones visuales. Luego, el LLM combina esta representación con la consulta de texto para construir una cadena de razonamiento.
Coordinación o refinamiento
Existen dos mecanismos principales para escenarios visuales complejos: coordinación, donde un LLM integra los resultados de múltiples models de visión para verificar interpretaciones de forma cruzada; y refinamiento, donde el LLM mejora iterativamente las descripciones de imágenes a través de bucles de retroalimentación que identifican información faltante. Ambos abordan las limitaciones donde los models individuales no logran analizar escenarios complejos.
Aprendizaje en contexto para razonamiento multimodal
Algunos frameworks recuperan ejemplos similares de los datos de entrenamiento, proporcionando al model plantillas para interpretar entradas visuales. Estas demostraciones ayudan al model a aplicar patrones de razonamiento aprendidos a nuevos problemas.
Producción de la explicación final
El LLM produce una respuesta respaldada por un proceso de razonamiento, explicando cómo interpretó la imagen, en qué elementos visuales se basó y las conexiones lógicas que estableció.
Razonamiento Chain-of-Thought en tareas visuales
El razonamiento Chain-of-Thought (CoT) ha surgido como un enfoque importante en el razonamiento visual. En lugar de analizar una imagen de una sola vez, los models ahora descomponen los problemas visuales en pasos más pequeños y secuenciales, de forma similar a cómo los humanos resuelven problemas complejos pensando paso a paso.
El CoT visual permite a los models ajustar dinámicamente el enfoque en diferentes regiones espaciales de una imagen, abordando una limitación clave donde los models anteriormente dependían del procesamiento de imágenes con granularidad fija. Por ejemplo, al analizar un gráfico complejo, el model podría identificar primero los ejes, luego examinar puntos de datos individuales y finalmente comparar tendencias, en lugar de intentar comprender todo simultáneamente.
Este enfoque integra aprendizaje por refuerzo y aprendizaje por imitación para alinear los models más estrechamente con los patrones de razonamiento humano. Esto representa un cambio fundamental del reconocimiento pasivo de patrones a la resolución activa de problemas visuales, donde los models exploran y razonan activamente sobre lo que ven. 4
Aplicaciones empresariales del razonamiento visual en LLMs
Los LLMs con capacidades visuales pueden respaldar múltiples escenarios empresariales. Estas aplicaciones dependen de la capacidad del model para analizar imágenes, vincularlas con datos de texto y producir información fiable.
Análisis de documentos y contenido
Las empresas manejan diagramas, dibujos de ingeniería, figuras de revistas científicas y diversas formas de datos visuales. Un model de razonamiento visual puede:
- Detectar elementos faltantes o incorrectos.
- Identificar objetos o señales en la parte inferior o en las esquinas de los diagramas.
- Conectar segmentos de texto e imagen para controles de calidad.
- Extraer información estructurada para su posterior despliegue o generación de informes.
Por ejemplo, Intuit integró Doc IA de Google Cloud y models Gemini para autocompletar declaraciones de impuestos en formularios fiscales comunes de EE. UU., mejorando tanto la velocidad como la precisión en el procesamiento de documentos.5
Inspección de calidad y operaciones
En fabricación y logística, los models pueden inspeccionar productos o paquetes. El razonamiento visual ayuda a detectar defectos, desalineaciones o patrones inusuales. El model puede comparar imágenes con una referencia y generar una explicación de lo que cambió o lo que falta.
Intel, por ejemplo, utiliza sistemas de inspección por visión artificial que ahorran $2 millones anuales, y los fabricantes suelen lograr un ROI en un plazo de 6 a 12 meses mediante la reducción de desechos y menos devoluciones de clientes. 6
Comercio minorista y comercio electrónico
Los models analizan imágenes de productos, identifican atributos clave y los relacionan con datos del catálogo. Las capacidades de búsqueda visual permiten a los clientes subir imágenes para encontrar productos similares mediante visión artificial, mientras que los motores de recomendación de tallas impulsados por IA han reducido las tasas de devolución en un 20-30 %. Estos sistemas también detectan incoherencias entre las descripciones de productos y las imágenes.7
Seguridad y monitorización
El razonamiento visual respalda las tareas de inspección de video e imágenes mediante el análisis de secuencias de fotogramas y la detección de patrones inusuales. Cambridge Industries implementó un sistema de seguridad impulsado por IA para obras de construcción que redujo los costes de reparación de emergencia en casi un 50 %. 8
Marketing y experiencia de usuario
El razonamiento visual ayuda a los equipos a comprender cómo interactúan los usuarios con el contenido digital. Un model puede evaluar capturas de pantalla o creatividades y proporcionar información sobre el diseño, la ubicación de objetos y posibles problemas. Esto es especialmente relevante al evaluar diferentes categorías de activos visuales.
Por ejemplo, Comeen utiliza Gemini IA para generar subtítulos multilingües para videos en el lugar de trabajo en 40 idiomas con un solo clic, eliminando el proceso de varios días y múltiples proveedores que anteriormente dejaba el contenido obsoleto antes de su publicación. 5
Panorama comparativo: principales actores y sus enfoques
Chance IA
Chance IA es una de las primeras herramientas comerciales construidas en torno a la comprensión centrada en la visión. Su sistema de razonamiento visual analiza imágenes a través de lentes culturales, históricos, funcionales y estéticos. En lugar de asignar etiquetas simples, ofrece información estructurada que explica por qué un objeto, figura o escena importa, como el estilo, simbolismo y contexto histórico de una obra de arte, junto con su tema.
El diseño prioriza la experiencia del usuario al permitir una exploración guiada por el significado a través de imágenes sin consultas escritas. Esto va más allá de la visión artificial tradicional hacia la interpretación, la narración y la explicación de tipo humano, lo que la hace especialmente relevante para industrias creativas, educación y turismo, donde el contexto añade valor más allá del reconocimiento.9
Meta IA
El framework UniBench de Meta introdujo un enfoque unificado para evaluar el razonamiento visual combinando más de cincuenta benchmarks de comprensión espacial, razonamiento compositivo y conteo. Al probar casi sesenta models de visión-lenguaje, Meta descubrió que escalar los datos y el tamaño del model mejora la percepción pero no el razonamiento, y que incluso los models avanzados fallan en tareas simples como el reconocimiento de dígitos y el conteo de objetos.
Estos hallazgos cambiaron la forma en que se mide el progreso del razonamiento visual, destacando la necesidad de datos de mayor calidad, objetivos específicos y aprendizaje estructurado en lugar de depender únicamente de models más grandes. Para las empresas, UniBench ofrece una forma transparente de comparar el rendimiento de razonamiento en tareas multimodales antes del despliegue.10
Figura 6: El gráfico muestra el rendimiento medio de 59 VLM en 53 benchmarks, revelando que, a pesar del progreso, muchos models todavía tienen un rendimiento cercano al nivel de azar, particularmente en tareas como Winoground, iNaturalist, DSPR y otras (azul: mediana sin ejemplos; gris: nivel de azar).11
OpenAI
OpenAI avanzó en el razonamiento visual con los models o3 y o4-mini, que pueden pensar con imágenes integrando la manipulación de imágenes en su razonamiento. Durante el análisis, amplían, recortan o rotan imágenes para centrarse en detalles relevantes, imitando cómo los humanos ajustan la atención visual al interpretar diagramas o dibujos.
Probados en benchmarks multimodales como interpretación de gráficos, resolución visual de problemas y razonamiento matemático, los models mostraron claras mejoras en precisión y comprensión contextual. Sin embargo, los resultados también expusieron limitaciones, incluyendo razonamiento inconsistente y errores de percepción ocasionales, lo que subraya el desafío continuo de la fiabilidad en los sistemas de razonamiento visual.
Figura 7: El gráfico muestra los resultados de todos los models evaluados bajo configuraciones de alto «esfuerzo de razonamiento».12
Esfuerzos académicos y de investigación abierta
VisuLogic: Un Benchmark para Evaluar el Razonamiento Visual en Models de Lenguaje Grandes Multimodales
Este artículo presenta VisuLogic, un benchmark para evaluar el rendimiento de models multimodales en tareas de razonamiento visual. Combina más de cincuenta datasets que cubren varios tipos de razonamiento, incluyendo relaciones espaciales, lógica compositiva y conteo de objetos.
Los autores analizan docenas de models existentes y descubren que aumentar el tamaño o la escala de datos mejora el reconocimiento de imágenes pero no el razonamiento. Los models a menudo detectan patrones sin comprender las relaciones entre objetos. El artículo enfatiza que el entrenamiento específico en razonamiento, una mejor calidad de datos y una evaluación detallada son esenciales para un progreso significativo.
VisuLogic ofrece un framework unificado que ayuda a investigadores y empresas a analizar las capacidades de razonamiento en lugar de depender únicamente de métricas de percepción, lo que lo convierte en un recurso valioso para evaluar sistemas de razonamiento multimodal.13
Explain Before You Answer: Un Estudio sobre Razonamiento Visual Compositivo
Este estudio revisa los enfoques actuales del razonamiento visual compositivo, centrándose en cómo los models combinan señales visuales y textuales para llegar a una respuesta correcta. Identifica debilidades en los métodos existentes que dependen del reconocimiento en lugar del razonamiento estructurado.
Los autores proponen entrenar a los models para que expliquen antes de responder, asegurando que cada proceso de razonamiento sea transparente e interpretable. Discuten técnicas para alinear representaciones visuales y lingüísticas para que los models puedan comprender mejor diagramas, figuras y asociaciones de objetos.
El artículo concluye que el razonamiento alineado y explicable mejora la fiabilidad e interpretabilidad en tareas multimodales. Destaca que el futuro de la investigación en razonamiento visual depende de integrar el aprendizaje basado en explicaciones en el diseño de models.14
Desafíos en las capacidades de razonamiento visual de los LLMs
El progreso en el razonamiento visual también conlleva desafíos técnicos y éticos que deben considerarse.
La fiabilidad sigue siendo una preocupación clave. Como se observa en nuestro benchmark, los models tienen dificultades con visualizaciones densamente agrupadas, fallando en la asignación barra-año y la percepción de alturas relativas en gráficos complejos, lo que conduce a errores sistemáticos en la identificación de tendencias. Incluso los models avanzados fallan en tareas simples como el reconocimiento de dígitos y el conteo de objetos, y escalar los datos mejora la percepción pero no el razonamiento.
Los problemas de sesgo e interpretación están generalizados. Los models de razonamiento visual aprenden y reflejan sesgos presentes en sus datos de entrenamiento al interpretar imágenes. Los models reflejan suposiciones culturales y estereotipos de los datos de entrenamiento, incluyendo sesgos de género, raza, edad y discapacidad. Por ejemplo, al predecir las profesiones de personas en una imagen o interpretar escenarios, estos sesgos pueden distorsionar los resultados.
La explicabilidad es fundamental para la confianza. Los models deben explicar su proceso de razonamiento de forma transparente, especialmente en aplicaciones de alto riesgo como la sanidad, la contratación y la justicia penal, donde los resultados sesgados causan daño.
Metodología del benchmark
Todos los models se evaluaron a través de la API de OpenRouter con parámetros estandarizados: temperatura ajustada a 0,8 y el parámetro de max tokens no se estableció para evitar limitar las capacidades de razonamiento. Se instruyó a los models para que respondieran solo con una sola letra (A-E) sin explicación, aunque algunos models aún proporcionaron razonamiento detallado, que analizamos para extraer las respuestas finales. La evaluación se ejecutó en paralelo en todos los models simultáneamente. Cada pregunta se ejecutó 5 veces para garantizar resultados consistentes y fiables.
El benchmark consistió en 200 preguntas divididas en dos categorías: Comprensión de gráficos (100 preguntas) que abarcan gráficos de barras, gráficos de líneas, diagramas de dispersión y visualizaciones de datos complejas, y Lógica visual (10 preguntas) que evalúan reconocimiento de patrones, razonamiento espacial y lógica visual matemática. Todas las preguntas se presentaron en formato de opción múltiple con cinco opciones (A-E), requiriendo que los models analizaran imágenes y seleccionaran la respuesta correcta.
Questions:
1. Comprensión de gráficos Evaluamos a los models en su capacidad para extraer, interpretar y analizar información de diversas visualizaciones de datos:
- Gráficos de barras: Configuraciones horizontales y verticales, formatos apilados y agrupados
- Gráficos de líneas: Tendencias de series únicas y múltiples, datos de series temporales
- Diagramas de dispersión: Análisis de correlación, identificación de patrones con ejes etiquetados
- Gráficos circulares: Distribuciones porcentuales y razonamiento proporcional
- Visualizaciones complejas: Gráficos combinados, gráficos de doble eje y presentaciones multipanel
2. Lógica visual Evaluamos el razonamiento abstracto y la inteligencia espacial mediante:
- Reconocimiento de patrones: Identificación de secuencias y compleción de patrones visuales
- Razonamiento espacial: Visualización 3D, desarrollos de cubos y transformaciones geométricas
- Lógica matemática: Patrones numéricos, razonamiento algebraico y combinatoria
- Pensamiento abstracto: Manipulación de símbolos, deducción lógica e inferencia de reglas
Formato de pregunta
- Formato de respuesta: Opción múltiple (A, B, C, D, E)
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{ermut2026,
author = {Ermut, Sıla and Şipi, Nazlı},
title = {{Comparativa de Models de IA Multimodal en Razonamiento Visual}},
year = {2026},
month = feb,
howpublished = {\url{https://aimultiple.com/visual-reasoning}},
note = {AIMultiple. Recuperado el 20 de Febrero de 2026}
}




Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.