Evaluamos el rendimiento de los grandes models multimodales (LMMs) en tareas de razonamiento financiero mediante un dataset cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los models para procesar y razonar con datos multimodales en el dominio financiero.
La sección de metodología ofrece información detallada sobre el dataset y el framework de evaluación empleado.
Explora los grandes models multimodales y compáralos con los large language models.
¿Por qué los models rindieron de manera diferente?
La variación en las tasas de éxito refleja diferencias en cómo cada model procesa tareas financieras multimodales. Dado que el benchmark utiliza muestras del dataset FinMME, que requieren integrar texto y elementos visuales financieros como gráficos y documentos estructurados, el rendimiento depende en gran medida de la arquitectura del model, la calidad del entrenamiento y la alineación multimodal.
Arquitectura del model y diseño de parámetros
Los models difieren en cómo combinan codificadores de texto e imagen, el número de parámetros activos y la complejidad de su enrutamiento experto.
- Llama 4 Maverick, por ejemplo, utiliza un diseño más grande basado en expertos, lo que permite un razonamiento más sólido.
- Los models más pequeños o centrados en la eficiencia tienen menos parámetros alineados con el razonamiento multimodal, lo que limita el rendimiento.
Estas diferencias arquitectónicas afectan la capacidad de cada model para interpretar relaciones numéricas, estructuras de gráficos y elementos visuales específicos del dominio.
Cobertura de datos de entrenamiento
Algunos models se entrenan con datasets multimodales extensos, mientras que otros dependen principalmente de datos de propósito general.
- Los models de las familias Claude 4 y Qwen 2.5 incorporan datos visuales y textuales a gran escala, lo que mejora su capacidad de alinear señales numéricas y visuales.
- Los models entrenados con corpus multimodales más limitados tienen dificultades con gráficos financieros y diagramas estructurados.
Los datos de entrenamiento influyen directamente en la fiabilidad con la que un model maneja conceptos financieros multimodales.
Fine-tuning para razonamiento multimodal
El benchmark requiere coordinación entre la interpretación de imágenes y el razonamiento basado en texto.
- Los models Claude 4 se describen como sólidos en tareas que implican gráficos y diagramas.
- Los models sin fine-tuning multimodal dedicado pueden detectar características visuales correctamente, pero se quedan cortos al conectarlas con el lenguaje o la lógica financiera.
La estrategia de fine-tuning de un model afecta su capacidad para combinar señales textuales y visuales durante el análisis.
Capacidad de gestión del contexto
Las muestras financieras suelen contener múltiples elementos que deben leerse juntos, como gráficos de varias partes o descripciones extensas.
- Los models con ventanas de contexto más amplias pueden mantener relaciones a lo largo de entradas largas.
- Los models más limitados pueden pasar por alto dependencias, lo que reduce la precisión en tareas que requieren rastrear múltiples componentes visuales y textuales.
El tamaño de la ventana de contexto influye en la capacidad de un model para mantener la alineación entre los detalles cuantitativos y visuales.
Tamaño del model y prioridades de eficiencia
Algunos models se diseñan deliberadamente para un despliegue ligero en lugar de un razonamiento de alta complejidad.
- Phi-4 multimodal y models similares priorizan la eficiencia, lo que limita la profundidad del procesamiento multimodal.
- Los models más grandes mantienen una mayor capacidad para tareas de razonamiento que implican una comprensión detallada de gráficos.
Esta contrapartida da lugar a puntuaciones más bajas para los models más pequeños.
Diferencias en la comprensión visual
La evaluación incluye tareas que requieren una lectura precisa de gráficos, identificación de objetos en documentos financieros y extracción de detalles visuales.
- Los models con pipelines visuales avanzados, como las variantes Qwen 2.5-VL, gestionan estas tareas de manera más eficaz.
- Otros pueden manejar bien imágenes genéricas, pero tienen un rendimiento inconsistente con elementos visuales financieros estructurados.
La solidez del razonamiento visual afecta considerablemente los resultados en muestras de estilo FinMME.
Características del dataset de evaluación
El dataset se centra en el razonamiento financiero multimodal en lugar de tareas de propósito general.
- Los models entrenados o ajustados para tareas financieras, numéricas o basadas en gráficos rinden mejor.
- Los models generalistas sin exposición al dominio muestran menor precisión en datasets financieros.
La especialización del dataset hace que el rendimiento sea más sensible a la calidad del razonamiento multimodal.
¿Qué son los grandes models multimodales de código abierto?
LMMs de código abierto con su número de estrellas de GitHub:
El gráfico muestra que la popularidad en GitHub de varios LMMs de código abierto ha aumentado, y algunos models experimentaron una adopción rápida poco después de su lanzamiento.
Janus-Series de DeepSeek ganó miles de estrellas de GitHub en cuestión de días después del lanzamiento de Janus-Pro el 27 de enero de 2025, superando a sus competidores, que tardaron meses en alcanzar cifras similares. Este rápido ascenso se debió al éxito de Janus-Pro y estuvo influido por el impulso creado por DeepSeek-R1.
- Gemma 3 de Google: Gemma 3 es una familia de models abiertos ligeros y de última generación derivados de la tecnología Gemini 2.0. Estos models ofrecen capacidades avanzadas de razonamiento visual y textual, una ventana de contexto de 128k tokens, soporte para llamadas a funciones y versiones cuantizadas para un rendimiento optimizado. Incluye ShieldGemma 2 para la seguridad de imágenes y admite diversas herramientas y opciones de despliegue.1
- Janus-Pro de DeepSeek: Janus-Pro es una versión avanzada del model Janus, diseñado para comprender y generar tanto texto como imágenes. Cuenta con una estrategia de entrenamiento optimizada, datos de entrenamiento ampliados y un mayor tamaño de model, lo que mejora sus capacidades multimodales.2
- Qwen2.5-VL de Alibaba: Qwen2.5-VL de Alibaba es una extensión multimodal del model de lenguaje Qwen2.5, diseñado tanto para la comprensión de texto como de imágenes. Cuenta con un pretraining a gran escala (hasta 18T tokens), una ventana de contexto ampliada (hasta 128K tokens), una mayor capacidad de seguir instrucciones y un sólido soporte multilingüe, lo que lo hace adecuado para tareas como el subtitulado de imágenes y la respuesta visual a preguntas. 3
- Sobre la base de la serie Qwen2.5-VL, Alibaba optimizó y publicó como código abierto Qwen2.5-VL-32B-Instruct, un model VL de 32B que incorpora una comprensión y un razonamiento de imágenes de grano fino mejorados. Esto da como resultado un mejor rendimiento y un análisis detallado en tareas como el análisis de imágenes, el reconocimiento de contenido y la deducción de lógica visual.4
- CLIP (Contrastive Language–Image Pretraining) de OpenAI: CLIP está diseñado para comprender imágenes en el contexto del lenguaje natural. Puede realizar tareas como la clasificación de imágenes de zero-shot, en la que puede clasificar con precisión imágenes incluso en categorías para las que no ha sido entrenado explícitamente, al comprender descripciones de texto.5
- Sobre la base de la serie Qwen2.5-VL, Alibaba optimizó y publicó como código abierto Qwen2.5-VL-32B-Instruct, un model VL de 32B que incorpora una comprensión y un razonamiento de imágenes de grano fino mejorados. Esto da como resultado un mejor rendimiento y un análisis detallado en tareas como el análisis de imágenes, el reconocimiento de contenido y la deducción de lógica visual.4
- Flamingo de DeepMind: Flamingo está diseñado para aprovechar los puntos fuertes de la comprensión lingüística y visual, lo que le permite realizar tareas que requieren interpretar e integrar información tanto de texto como de imágenes.6
Figura 1: Un ejemplo tomado de Chip Huyen7
¿Cuáles son los LMMs líderes?
Características de UI y API de los LLMs de propósito general
Los proveedores se seleccionan entre los LLMs multimodales más populares según la comparabilidad, la disponibilidad de datos y la puntualidad.
LMMs con su precio por token:
Para seleccionar el model más adecuado, ten en cuenta factores como tu presupuesto, las capacidades y el nivel de rendimiento requeridos, y el volumen esperado de tokens de entrada/salida necesario para tu caso de uso específico.
Lee más sobre LLM pricing.
¿Cuáles son los últimos avances en los models multimodales?
Los avances recientes en los models multimodales han introducido nuevas capacidades y eficiencias en el desarrollo de la IA.
Models fundacionales multimodales centrados en vídeo
Los models fundacionales multimodales centrados en vídeo están yendo más allá de generar subtítulos o resúmenes de alto nivel y, en cambio, están aprendiendo a localizar explícitamente la evidencia dentro de los vídeos.
En lugar de decir qué ocurre, pueden identificar cuándo ocurre (marcas de tiempo) y dónde ocurre (cuadros delimitadores alrededor de objetos o regiones).
Este cambio hacia el grounding espaciotemporal hace que la comprensión de vídeo sea más precisa y verificable. También permite tareas como encontrar momentos exactos, rastrear objetos, editar vídeos mediante lenguaje natural y dar soporte a la robótica y a los sistemas críticos para la seguridad.
Por ejemplo, Vidi8es un proyecto de código abierto de ByteDance centrado en grandes models multimodales para la comprensión y edición de vídeo.
El repositorio aloja el código y los recursos para una familia de models (p. ej., Vidi-7B, Vidi1.5-9B, Vidi2 y Vidi2.5) que reciben visión, audio y texto como entradas para realizar tareas como:
- Recuperación temporal (encontrar los segmentos de tiempo de un vídeo que coinciden con una consulta de texto)
- Grounding espaciotemporal (localizar objetos con cuadros delimitadores)
- Respuesta a preguntas sobre vídeo
Lanzamiento multimodal de vanguardia de Mistral 3
Mistral IA ha desarrollado una nueva familia de models de IA de código abierto llamada Mistral 3. La suite Mistral 3 comprende tanto models multimodales/multilingües de nivel frontera como models más pequeños y eficientes diseñados para ejecutarse en una variedad de dispositivos, desde la nube hasta el edge, e incluso en una sola GPUs.
Publicados bajo una licencia de código abierto permisiva (Apache 2.0), estos models buscan democratizar el acceso a la IA avanzada, permitir la personalización y la flexibilidad de despliegue, y fortalecer la posición de Europa en el desarrollo de la IA, donde existen preocupaciones por quedarse rezagados frente a EE. UU. y China en tecnologías de vanguardia.9
Models de visión-lenguaje MoE de código abierto
Kimi-VL (de Moonshot IA) es un model multimodal de visión-lenguaje de código abierto construido con una arquitectura Mixture-of-Experts (MoE), con buen rendimiento en tareas que combinan texto, imágenes y vídeo manteniendo un cálculo eficiente.
Tiene una columna vertebral de 16 B de parámetros totales, pero normalmente activa ~2.8 B de parámetros durante la inference, lo que ayuda a equilibrar la capacidad y el coste.
Kimi-VL está diseñado para el razonamiento multimodal avanzado, la comprensión de contexto largo (hasta ~128 K tokens) y las interacciones de estilo agente, y compite bien con models más grandes en benchmarks como la comprensión de vídeo, el reconocimiento óptico de caracteres (OCR), el razonamiento matemático y las tareas con múltiples imágenes.
Variantes como Kimi-VL-A3B-Thinking se someten a fine-tuning adicional para tareas de cadena de pensamiento y razonamiento, mientras que el encoder visual MoonViT admite la comprensión de entradas de alta resolución.
Figura 2: Diseño de la arquitectura de Kimi-VL.10
La serie Claude 4 de Anthropic
La serie Claude 4 de Anthropic integra una comprensión visual avanzada con su motor de razonamiento basado en texto, incorporando la visión directamente en los flujos de trabajo de resolución de problemas.
Los models Claude 4 demuestran un rendimiento sólido en benchmarks de razonamiento multimodal como MMMU, en particular en la interpretación de gráficos, diagramas y datos visuales complejos. Una característica distintiva de Claude Opus 4.1 es su capacidad para evaluar cualidades estéticas en las imágenes, más allá del reconocimiento hacia evaluaciones más matizadas.
Estas capacidades, combinadas con las funciones agentic de Claude, hacen que la serie sea eficaz para tareas como sintetizar investigaciones a partir de informes con texto y elementos visuales mixtos o ayudar en el diseño de interfaces mediante el análisis de maquetas visuales.
Gemini 3 de Google
Google lanzó Gemini 3 en noviembre de 2025; Gemini 3 Pro estuvo disponible de inmediato y el modo Gemini 3 Deep Think se desplegó para los suscriptores de Google IA Ultra poco después. Gemini 3 está posicionado por Google como su model multimodal más inteligente y capaz, con soporte nativo para texto, imágenes, vídeo, audio y código en una única arquitectura.
Gemini 3 Pro incluye una ventana de contexto de 1 millón de tokens y logra resultados sólidos en benchmarks multimodales, incluidos 81 % en MMMU-Pro y 87.6 % en Video-MMMU. Encabezó la tabla de líderes LMArena en su lanzamiento con una puntuación de 1501 Elo, y obtuvo 91.9 % en GPQA Diamond para razonamiento de nivel de posgrado y 76.2 % en SWE-bench Verified para tareas de codificación agentic.
Gemini 3 Deep Think es un modo de razonamiento mejorado que aumenta aún más el rendimiento en las tareas más exigentes, con 41.0 % en Humanity’s Last Exam (sin herramientas) y 45.1 % en ARC-AGI-2. Junto con Gemini 3, Google también lanzó Google Antigravity, una plataforma de desarrollo agentic que combina Gemini 3 con el model Gemini 2.5 Computer Use para el control del navegador y el model de edición de imágenes Nano Banana, lo que permite flujos de trabajo de desarrollo de software de extremo a extremo en los que el model puede planificar, codificar y validar tareas de forma autónoma.11
GPT-5 de OpenAI
GPT-5 introduce una multimodalidad nativa mejorada en texto, voz, imagen y vídeo. A diferencia de los sistemas anteriores que dependían en gran medida de plugins, GPT-5 integra estas modalidades dentro de una arquitectura unificada, lo que da lugar a una interacción más fluida. El model se adapta con flexibilidad a varios tipos de entrada y puede hacer transiciones entre ellos.
Una característica destacada es su Modo de voz en tiempo real, que puede ajustar el tono, el ritmo y el estilo según las instrucciones del usuario. Esto crea una experiencia conversacional más natural y adaptativa. El procesamiento visual también ha mejorado, lo que reduce las alucinaciones al interpretar o generar imágenes, diagramas y gráficos. Otro avance radica en sus capacidades de memoria, que permiten al sistema recordar entradas anteriores y mantener el contexto en interacciones prolongadas.
Estas mejoras hacen que GPT-5 sea especialmente valioso para interfaces multimodales accesibles, en particular para personas con discapacidades sensoriales.
Models multimodales centrados en robótica de Google DeepMind
Google DeepMind ha desarrollado Gemini Robotics y Gemini Robotics-ER, models diseñados para integrar visión, lenguaje y acción en sistemas robóticos. Estos models permiten a los robots realizar tareas en entornos no estructurados, como doblar papel o desenroscar tapas de botellas.
Una característica clave de estos models es su mecanismo de seguridad. Antes de ejecutar acciones, el sistema realiza comprobaciones integradas para minimizar los riesgos y garantizar el manejo adecuado de las tareas. Este enfoque aborda uno de los retos importantes de la robótica: unir el razonamiento avanzado de la IA con una ejecución segura y fiable en el mundo real.
Llama 4 Scout y Llama 4 Maverick de Meta IA
Llama 4 Scout es un model multimodal con 17 mil millones de parámetros activos y 16 expertos. Este model supera a los models Llama de la generación anterior y está diseñado para funcionar en una sola H100 GPU. Cuenta con una ventana de contexto de 10 millones de tokens para procesar grandes cantidades de información. Los resultados de los benchmarks indican que Llama 4 Scout logra mejores resultados que Gemma 3, Gemini 2.0 Flash-Lite y Mistral 3.1 en una serie de benchmarks ampliamente reportados.
Llama 4 Maverick es un model multimodal con 17 mil millones de parámetros activos y 128 expertos. Este model se presenta como uno de los mejores de su clase, superando a GPT-4o y a Gemini 2.0 Flash en una serie de benchmarks. Logra un rendimiento comparable al de DeepSeek v3 en razonamiento y codificación, utilizando menos parámetros activos. Una versión experimental de chat de Llama 4 Maverick logró una puntuación ELO de 1417 en la plataforma LMArena.
ChatGPT Images 2.0 de OpenAI
ChatGPT Images 2.0 de OpenAI mejora la generación de imágenes con mayor precisión, control y razonamiento visual. El model mejora el seguimiento de instrucciones, la representación de texto y el soporte multilingüe. Puede producir elementos visuales más sofisticados y realistas en fotografía, ilustración, manga, infografías, carteles y otros estilos. También admite relaciones de aspecto flexibles, lo que hace que el contenido generado sea adecuado para formatos que van desde pantallas móviles hasta banners y materiales impresos.
Cuando se combina con las capacidades de razonamiento de ChatGPT, ChatGPT Images 2.0 puede interpretar materiales de origen e incorporar información contextual y del mundo real. Esto permite a los usuarios desarrollar gráficos más complejos y ricos en información y perfeccionar conceptos creativos de manera conversacional, manteniendo una mayor coherencia en la composición, la tipografía y la dirección visual.
Qwen3-VL de Alibaba
La serie Qwen3-VL de Alibaba, lanzada a partir de septiembre de 2025, se basa en el model de lenguaje Qwen3 añadiendo capacidades más profundas de percepción visual y razonamiento. La familia incluye variantes densas de 2B a 32B parámetros y variantes Mixture-of-Experts de hasta 235B parámetros totales (22B activos), todas publicadas bajo la licencia Apache 2.0.
Las características clave incluyen una ventana de contexto nativa de 256K (ampliable a 1 millón de tokens), OCR multilingüe ampliado en 32 idiomas, grounding de objetos en 2D y 3D para razonamiento espacial e IA encarnada, comprensión de vídeo de varias horas con indexación a nivel de segundos y capacidades de agente visual para el control de GUI.
Las variantes Thinking están ajustadas para razonamiento STEM y multimodal, mientras que las variantes Instruct están orientadas a tareas generales de visión-lenguaje como el análisis de documentos, la extracción de gráficos y la respuesta visual a preguntas.
Gemma 3 de Google
Gemma 3 de Google se basa en la tecnología de sus models Gemini 2.0. Está disponible en cuatro tamaños (1B, 4B, 12B y 27B) para diferentes requisitos de hardware y ofrece una ventana de contexto de 128k tokens. Gemma 3 funciona bien en configuraciones con un solo acelerador e incluye razonamiento visual y textual, llamada a funciones y soporte para más de 35 idiomas, con pretraining para más de 140. Las versiones cuantizadas reducen el tamaño del model y las necesidades de cómputo. El sistema ShieldGemma 2 proporciona clasificación de seguridad del contenido.
Phi-4-multimodal de Microsoft
Phi-4-multimodal de Microsoft es un model de 5.6B parámetros que procesa voz, visión y texto en una arquitectura unificada. Utiliza aprendizaje multimodal para interacciones conscientes del contexto entre diferentes tipos de entrada. El model maneja múltiples formatos de entrada sin requerir sistemas de procesamiento separados y está diseñado para el despliegue en dispositivos y el edge computing. Las aplicaciones incluyen IA para teléfonos inteligentes, sistemas automotrices y servicios multilingües.
¿Qué es un gran model multimodal (LMM)?
Un gran model multimodal es un tipo avanzado de model de inteligencia artificial que puede procesar y comprender múltiples tipos de modalidades de datos. Estos datos multimodales pueden incluir texto, imágenes, audio, vídeo y, potencialmente, otros. La característica clave de un model multimodal es su capacidad para integrar e interpretar información de estas diferentes fuentes de datos, a menudo de manera simultánea.
Estos pueden entenderse como versiones más avanzadas de los large language models (LLMs) que pueden trabajar con texto y también con diversos tipos de datos. Además, las salidas de los models de lenguaje multimodales están diseñadas para ser textuales, visuales, auditivas, etc.
Los models de lenguaje multimodales se consideran el siguiente paso hacia la inteligencia artificial general.
¿Qué es un agente de IA multimodal?
Los agentes de IA multimodales son sistemas diseñados para interactuar con el mundo utilizando varios tipos de datos, incluidas imágenes, vídeos y texto, lo que les permite operar tanto en entornos digitales como físicos. Los models multimodales son el componente central de estos agentes, ya que les permiten percibir y comprender información de diversas fuentes.
Por ejemplo, models como Magma utilizan la comprensión de visión-lenguaje y la inteligencia espacial, logradas mediante técnicas como Set-of-Mark y Trace-of-Mark durante el pretraining con datasets multimodales.
Esto permite al agente realizar tareas que van desde comprender el contenido de vídeo y responder preguntas hasta navegar por interfaces de usuario y controlar robots, lo que demuestra las capacidades versátiles que los models multimodales aportan a los agentes de IA al aprovechar diferentes modalidades de datos. La siguiente ilustración muestra a Magma planificando trayectorias de robots para realizar tareas, lo que demuestra su inteligencia espacial en acción.12
¿Cuál es la diferencia entre LMMs y LLMs?
1. Modalidades de datos
- LMMs: Están diseñados para comprender y procesar múltiples tipos de entradas de datos, o modalidades. Esto incluye texto, imágenes, audio, vídeo y, a veces, otros tipos de datos como datos sensoriales. La capacidad clave de los LMMs es su habilidad para integrar y dar sentido a estos diferentes formatos de datos, a menudo de manera simultánea.
- LLMs: Estos models están especializados en procesar y generar datos textuales. Se entrenan principalmente con grandes corpus de texto y son expertos en comprender y generar lenguaje humano en diversos contextos. No procesan de forma inherente datos no textuales como imágenes o audio.
2. Aplicaciones y tareas
- LMMs: Debido a su naturaleza multimodal, estos models pueden aplicarse a tareas que requieren comprender e integrar información de diferentes tipos de datos. Por ejemplo, un LMM podría analizar un artículo de noticias (texto), sus fotografías adjuntas (imágenes) y videoclips relacionados para obtener una comprensión integral.
- LLMs: Sus aplicaciones se centran en tareas relacionadas con el texto, como redactar artículos, traducir idiomas, responder preguntas, resumir documentos y crear contenido basado en texto.
¿Cuáles son las modalidades de datos de los grandes models multimodales?
Texto
Esto incluye cualquier forma de contenido escrito, como libros, artículos, páginas web y publicaciones en redes sociales. El model puede comprender, interpretar y generar contenido textual, incluidas tareas de procesamiento de lenguaje natural como la traducción, el resumen y la respuesta a preguntas.
Imágenes
Estos models pueden analizar y generar datos visuales. Esto incluye comprender el contenido y el contexto de fotografías, ilustraciones y otras representaciones gráficas. Tareas como la clasificación de imágenes, la detección de objetos y la generación de imágenes a partir de descripciones textuales se incluyen en esta categoría.
Audio
Esto abarca grabaciones de sonido, música y lenguaje hablado. Los models pueden entrenarse para reconocer el habla, la música, los sonidos ambientales y otras entradas auditivas. Pueden transcribir el habla, comprender comandos hablados e incluso generar habla o música sintéticas.
Vídeo
Al combinar elementos visuales y auditivos, el procesamiento de vídeo implica comprender imágenes en movimiento y sus sonidos asociados. Esto puede incluir analizar contenido de vídeo, reconocer acciones o eventos en vídeos y generar videoclips.
Aunque la mayoría de los grandes models multimodales de lenguaje actuales pueden procesar texto e imágenes, la investigación futura pretende incluir entradas de datos de audio y vídeo.
¿Cómo se entrenan los grandes models multimodales?
El entrenamiento de los grandes models multimodales (LMMs) difiere significativamente del entrenamiento de los grandes models de lenguaje (LLMs) en varios aspectos clave:
1. Recopilación y preparación de datos
- LLMs: Se centran en datos de texto procedentes de libros, sitios web y fuentes escritas, con énfasis en la diversidad lingüística para las fuentes de datos de entrenamiento de LLM.
- LMMs: Requieren datos de texto, imágenes, audio y vídeo. La recopilación es más compleja debido a los formatos variados. La anotación de datos y la alineación entre modalidades son esenciales.
2. Diseño de la arquitectura del model
- LLMs: Utilizan arquitecturas transformer optimizadas para el procesamiento secuencial de texto.
- LMMs: Emplean arquitecturas más complejas que integran múltiples tipos de redes neuronales (CNN para imágenes, transformers para texto) con mecanismos para conectar estas modalidades.
3. Preentrenamiento
- LLMs: Se preentrenan con corpus de texto mediante técnicas como el modelado de lenguaje enmascarado.
- LMMs: Se preentrenan con múltiples tipos de datos, aprendiendo a correlacionar texto con imágenes o a comprender secuencias de vídeo.
4. Fine-tuning
- LLMs: Fine-tune con datasets de texto especializados para tareas específicas.
- LMMs: Requieren fine-tuning tanto en datasets específicos de cada modalidad como en datasets multimodales para establecer relaciones entre los diferentes tipos de datos.
5. Evaluación e iteración
- LLMs: Las métricas de evaluación se centran en tareas de comprensión y generación de lenguaje, incluidas la fluidez, la coherencia y la relevancia.
- LMMs: Se evalúan con métricas más amplias que cubren el reconocimiento de imágenes, el procesamiento de audio y las capacidades de integración multimodal.
¿Cómo funcionan los LMMs?
Los grandes models multimodales comparten similitudes con los grandes models de lenguaje en su proceso de entrenamiento, diseño y funcionamiento. Utilizan la misma arquitectura transformer y las mismas estrategias de entrenamiento. Los grandes models multimodales se entrenan con:
- Datos de texto
- Millones o miles de millones de imágenes con descripciones de texto
- Videoclips
- Fragmentos de audio
- Otros datos de entrada, como código
Este entrenamiento implica el aprendizaje simultáneo de múltiples modalidades de datos, lo que permite al model:
- Reconocer una foto de un gato
- Identificar una palabra en un clip de audio
- Comprender conceptos y detalles sensoriales más allá del texto
De este modo, los usuarios pueden subir:
- Una imagen para:
- Obtener una descripción de lo que sucede
- Utilizar la imagen como parte de un prompt para generar texto o imágenes
- Hacer preguntas de seguimiento sobre elementos específicos de la imagen
- Traducir el texto de la imagen a otro idioma (p. ej., un menú)
Figura 3: Subir una imagen de un gato a ChatGPT para que la describa.
- Gráficos y diagramas para:
- Hacer preguntas de seguimiento complicadas sobre lo que muestran
- Maqueta de diseño para:
- Obtener el código HTML y CSS necesario para crearla.
Figura 4: Creación de un prompt para la imagen al estilo de la película de Wes Anderson. ChatGPT envía el prompt a un model de generación de imágenes (como DALL·E), que interpreta la solicitud y produce la imagen estilizada.
Después del proceso de entrenamiento, los models podrían incorporar estereotipos poco saludables e ideas tóxicas. Para refinarlos, se pueden utilizar técnicas como:
- Reinforcement learning con retroalimentación humana (RLHF)
- Models de IA de supervisión
- Red teaming (probar la robustez del model).
Además, las herramientas de gobernanza de la IA y las herramientas de IA responsable, que funcionan como soluciones de cumplimiento de la IA, también pueden permitir la optimización del inventario de IA, ayudando a prevenir los sesgos de la IA y otros dilemas éticos. A continuación se muestra un ejemplo de cómo estas herramientas abordan las cuestiones de derechos de autor de la IA generativa:
Figura 5: ChatGPT rechaza mi solicitud debido a las directrices de la política de contenido para proteger los derechos de autor.
El objetivo es desarrollar un sistema multimodal funcional capaz de manejar:
- Generación de imágenes a partir de texto
- Subtitulado de imágenes
- Recuperación de imágenes basada en texto
- Respuesta visual a preguntas.
De esta manera, la IA multimodal puede integrar diversas modalidades, proporcionando capacidades avanzadas para tareas que implican tanto lenguaje como visión.
¿Cuáles son las limitaciones de los grandes models de lenguaje?
- Requisitos de datos y sesgo: Estos models requieren datasets masivos y diversos para el entrenamiento. Sin embargo, la disponibilidad y la calidad de dichos datasets pueden ser un reto. Además, si los datos de entrenamiento contienen sesgos, es probable que el model los herede y posiblemente los amplifique, lo que da lugar a resultados injustos o poco éticos.
- Recursos computacionales: Entrenar y ejecutar grandes models multimodales requiere recursos computacionales significativos, lo que los hace costosos y menos accesibles para organizaciones más pequeñas o investigadores independientes.
- Interpretabilidad y explicabilidad: Al igual que ocurre con los models de IA complejos, entender cómo toman decisiones puede ser difícil. Esta falta de transparencia puede ser un problema crítico, especialmente en aplicaciones sensibles como la atención sanitaria o las fuerzas del orden.
- Integración de modalidades: Integrar eficazmente diferentes tipos de datos (como texto, imágenes y audio) de manera que se comprendan realmente los matices de cada modalidad es extremadamente difícil. Es posible que el model no siempre capte con precisión el contexto o las sutilezas de la comunicación humana derivadas de la combinación de estas modalidades.
- Generalización y overfitting: Aunque estos models se entrenan con datasets muy amplios, podrían tener dificultades para generalizar a datos o escenarios nuevos no vistos que difieran significativamente de sus datos de entrenamiento. Por el contrario, podrían sufrir overfitting de los datos de entrenamiento, capturando ruido y anomalías como patrones.
Para obtener más información, explora los retos y riesgos asociados con los models generativos y de lenguaje.
Metodología de benchmark para LMMs
Evaluamos el rendimiento de los grandes models multimodales (LMMs) utilizando un subconjunto del dataset FinMME13, un benchmark integral diseñado para evaluar las capacidades de razonamiento multimodal financiero. FinMME comprende más de 11.000 muestras financieras de alta calidad en 18 dominios financieros y 6 clases de activos, lo que proporciona un framework sólido para evaluar los LMMs en el dominio financiero.
Para este benchmarking, utilizamos una selección cuidada de 100 muestras del dataset FinMME para analizar la capacidad de los models para procesar y razonar con datos financieros multimodales.
Aviso legal
Esta evaluación utilizó un subconjunto curado de 100 muestras de un dataset más amplio para evaluar los LMMs con benchmarks. Para una evaluación integral del rendimiento de los models, se deben considerar todas las muestras del dataset de referencia completo.
Conclusión
Los grandes models multimodales (LMMs) están integrando diversos tipos de datos, como texto, imágenes, audio y vídeo, superando así las capacidades basadas en texto de los grandes models de lenguaje (LLMs). Con avances como Llama 4 de Meta IA, GPT-4o de OpenAI y Qwen2.5-VL de Alibaba, los LMMs permiten aplicaciones más ricas, desde el razonamiento visual hasta la generación de imágenes consciente del contexto.
Sin embargo, su complejidad, sus altas demandas computacionales y los retos relacionados con la integración de datos y la mitigación de sesgos siguen siendo obstáculos. A medida que evolucionan los LMMs, allanan el camino hacia agentes de IA más versátiles, acercándonos a la inteligencia artificial general. Para las organizaciones y los investigadores, seleccionar el model adecuado implica lograr un equilibrio entre el rendimiento, el coste y las necesidades específicas del caso de uso.
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Grandes models multimodales (LMMs) vs LLMs}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/large-multimodal-models}},
note = {AIMultiple. Recuperado el 17 de Agosto de 2026}
}Resultados y marcas de tiempo de 30 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene 3 archivos CSV.
Registro de cambios
22 actualizaciones- 2026
Se reemplazó la entrada del modelo Qwen3-VL por Qwen2.5-VL en la sección de productos.
Añadida una sección sobre Gemini 3 y reemplazadas las entradas de Qwen2.5-VL por descripciones del modelo Qwen3-VL.
Se añadieron modelos fundacionales multimodales "Video-first", la versión "Mistral 3 multimodal frontier" y modelos de visión-lenguaje MoE de código abierto a la sección sobre avances recientes en modelos multimodales.
- 2025
Se añadió una sección sobre por qué los modelos tuvieron un rendimiento diferente a la introducción.
Se añadió la serie Claude 4 de Anthropic a la lista de modelos multimodales.
Se añadió GPT-5 de OpenAI a la sección sobre los últimos avances en modelos multimodales.
Se actualizó la introducción con una descripción de la evaluación de los LMM en tareas de razonamiento financiero.
Se añadió una sección de metodología.
Se agregaron modelos multimodales grandes de código abierto a la sección de LMM líderes.
Se añadieron Llama 4 Scout y Llama 4 Maverick de Meta AI.
Se añadió 4o Generación de Imágenes de OpenAI a la sección de últimos avances.
Se añadió una nueva sección, "¿Qué es un agente de IA multimodal?", a la sección "¿Cuál es la diferencia entre LMMs y LLMs?".
Se añadió Qwen2.5-VL-32B-Instruct de Alibaba a la lista de modelos.
Se añadió Gemma 3 de Google a la sección '¿Cuáles son los últimos avances en modelos multimodales?'.
Se añadió una sección que describe el modelo Phi-4-multimodal de Microsoft.
Se añadió Qwen2.5-VL de Alibaba a la lista de LMM de código abierto.
Se añadieron los modelos o3-mini y DeepSeek-R1 a la introducción.
Se añadió una tabla a la sección "¿Qué son los LMM líderes?".
- 2024
Eliminados los LMM con sus fechas de lanzamiento de la sección ¿Cuáles son los LMM líderes?
Se añadieron la Figura 1, la Figura 2, la Figura 3 y la Figura 4 al artículo.
Se añadió la sección "¿Cómo funcionan los LLM?".
Se añadió OpenAI GPT-4o, Gemini 1.5 y Qwen-VL-Plus/Max a los LMM principales.
Enlaces de referencia
El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]
A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.
Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.
Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.






Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.