Evaluamos el rendimiento de los modelos multimodales grandes (LMMs) en tareas de razonamiento financiero utilizando un dataset cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los modelos para procesar y razonar con datos multimodales en el ámbito financiero.
La sección de metodología ofrece información detallada sobre el dataset y el framework de evaluación empleado.
Explora los modelos multimodales grandes y compáralos con los modelos de lenguaje grandes.
¿Por qué los modelos rindieron de manera diferente?
La variación en las tasas de éxito refleja diferencias en cómo cada modelo procesa las tareas financieras multimodales. Dado que el benchmark utiliza muestras del dataset FinMME, que requieren integrar texto y elementos visuales financieros como gráficos y documentos estructurados, el rendimiento depende en gran medida de la arquitectura del modelo, la calidad del entrenamiento y la alineación multimodal.
Arquitectura del modelo y diseño de parámetros
Los modelos difieren en cómo combinan los codificadores de texto e imagen, el número de parámetros activos y la complejidad de su enrutamiento de expertos.
- Llama 4 Maverick, por ejemplo, utiliza un diseño basado en expertos más grande, lo que permite un razonamiento más sólido.
- Los modelos más pequeños o centrados en la eficiencia tienen menos parámetros alineados con el razonamiento multimodal, lo que limita el rendimiento.
Estas diferencias arquitectónicas afectan la precisión con la que cada modelo puede interpretar relaciones numéricas, estructuras de gráficos y elementos visuales específicos del dominio.
Cobertura de datos de entrenamiento
Algunos modelos se entrenan con datasets multimodales extensos, mientras que otros se basan principalmente en datos de propósito general.
- Los modelos de las familias Claude 4 y Qwen 2.5 incorporan datos visuales y textuales a gran escala, lo que mejora su capacidad para alinear señales numéricas y visuales.
- Los modelos entrenados con corpus multimodales más limitados tienen dificultades con los gráficos financieros y los diagramas estructurados.
Los datos de entrenamiento influyen directamente en la fiabilidad con la que un modelo maneja conceptos financieros intermodales.
Fine-tuning para razonamiento intermodal
El benchmark requiere coordinación entre la interpretación de imágenes y el razonamiento basado en texto.
- Los modelos Claude 4 se describen como sólidos en tareas que implican gráficos y diagramas.
- Los modelos sin fine-tuning intermodal dedicado pueden detectar características visuales correctamente, pero se quedan cortos a la hora de conectarlas con el lenguaje o la lógica financieros.
La estrategia de fine-tuning de un modelo afecta su capacidad para fusionar señales textuales y visuales durante el análisis.
Capacidad de manejo del contexto
Las muestras financieras suelen contener múltiples elementos que deben leerse en conjunto, como gráficos de varias partes o descripciones extensas.
- Los modelos con ventanas de contexto más amplias pueden retener relaciones a lo largo de entradas largas.
- Los modelos más limitados pueden pasar por alto dependencias, lo que reduce la precisión en tareas que requieren seguir múltiples componentes visuales y textuales.
El tamaño de la ventana de contexto influye en la capacidad de un modelo para mantener la alineación entre los detalles cuantitativos y visuales.
Tamaño del modelo y prioridades de eficiencia
Algunos modelos están diseñados deliberadamente para un despliegue ligero en lugar de para razonamiento de alta complejidad.
- Phi-4 multimodal y modelos similares priorizan la eficiencia, lo que limita la profundidad del procesamiento multimodal.
- Los modelos más grandes mantienen una mayor capacidad para tareas de razonamiento que implican una comprensión detallada de gráficos.
Esta compensación da como resultado puntuaciones más bajas para los modelos más pequeños.
Diferencias en la comprensión visual
La evaluación incluye tareas que requieren una lectura precisa de gráficos, la identificación de objetos dentro de documentos financieros y la extracción de detalles visuales.
- Los modelos con pipelines visuales avanzados, como las variantes Qwen 2.5-VL, gestionan estas tareas de manera más eficaz.
- Otros pueden manejar bien imágenes genéricas, pero rinden de manera inconsistente con elementos visuales financieros estructurados.
La solidez del razonamiento visual afecta en gran medida los resultados en muestras de estilo FinMME.
Características del dataset de evaluación
El dataset se centra en el razonamiento financiero multimodal en lugar de en tareas de propósito general.
- Los modelos entrenados o fine-tuneados para tareas financieras, numéricas o basadas en gráficos rinden mejor.
- Los modelos generalistas sin exposición al dominio muestran una menor precisión en los datasets financieros.
La especialización del dataset hace que el rendimiento sea más sensible a la calidad del razonamiento intermodal.
¿Qué son los modelos multimodales grandes de código abierto?
LMMs de código abierto con su número de estrellas de GitHub:
El gráfico muestra que la popularidad en GitHub de varios LMM de código abierto ha ido aumentando, y algunos modelos experimentan una adopción rápida poco después de su lanzamiento.
La serie Janus de DeepSeek ganó miles de estrellas en GitHub a los pocos días del lanzamiento de Janus-Pro el 27 de enero de 2025, superando a sus competidores, que tardaron meses en alcanzar cifras similares. Este rápido ascenso se debió al éxito de Janus-Pro y estuvo influido por el impulso generado por DeepSeek-R1.
- Gemma 3 de Google: Gemma 3 es una familia de modelos abiertos ligeros y de vanguardia derivados de la tecnología Gemini 2.0. Estos modelos ofrecen capacidades avanzadas de razonamiento visual y de texto, una ventana de contexto de 128k tokens, soporte para llamada de funciones y versiones cuantizadas para un rendimiento optimizado. Incluye ShieldGemma 2 para la seguridad de imágenes y admite diversas herramientas y opciones de despliegue.1
- Janus-Pro de DeepSeek: Janus-Pro es una versión avanzada del modelo Janus, diseñado para comprender y generar texto e imágenes. Cuenta con una estrategia de entrenamiento optimizada, datos de entrenamiento ampliados y un mayor tamaño de modelo, lo que mejora sus capacidades multimodales.2
- Qwen2.5-VL de Alibaba: Qwen2.5-VL de Alibaba es una extensión multimodal del modelo de lenguaje Qwen2.5, diseñada para la comprensión tanto de texto como de imágenes. Cuenta con un preentrenamiento a gran escala (hasta 18T tokens), una ventana de contexto ampliada (hasta 128K tokens), un mejor seguimiento de instrucciones y un sólido soporte multilingüe, lo que lo hace adecuado para tareas como el subtitulado de imágenes y la respuesta a preguntas visuales. 3
- Partiendo de la serie Qwen2.5-VL, Alibaba optimizó y liberó como código abierto Qwen2.5-VL-32B-Instruct, un modelo VL de 32B que incorpora una comprensión y razonamiento de imágenes detallados mejorados. Esto se traduce en un mejor rendimiento y análisis detallado en tareas como el análisis de imágenes, el reconocimiento de contenido y la deducción de lógica visual.4
- CLIP (Contrastive Language–Image Pretraining) de OpenAI: CLIP está diseñado para comprender imágenes en el contexto del lenguaje natural. Puede realizar tareas como la clasificación de imágenes zero-shot, en la que puede clasificar imágenes con precisión incluso en categorías en las que no ha sido entrenado explícitamente, entendiendo descripciones de texto.5
- Partiendo de la serie Qwen2.5-VL, Alibaba optimizó y liberó como código abierto Qwen2.5-VL-32B-Instruct, un modelo VL de 32B que incorpora una comprensión y razonamiento de imágenes detallados mejorados. Esto se traduce en un mejor rendimiento y análisis detallado en tareas como el análisis de imágenes, el reconocimiento de contenido y la deducción de lógica visual.4
- Flamingo de DeepMind: Flamingo está diseñado para aprovechar las fortalezas de la comprensión tanto lingüística como visual, lo que le permite realizar tareas que requieren interpretar e integrar información de texto e imágenes.6
Figura 1: Un ejemplo tomado de Chip Huyen7
¿Cuáles son los principales LMMs?
Características de los LLMs de propósito general: interfaz de usuario y API
Los proveedores se seleccionan entre los LLMs multimodales más populares en función de la comparabilidad, la disponibilidad de datos y la actualidad.
LMMs con su precio por token:
Para seleccionar el modelo más adecuado, ten en cuenta factores como tu presupuesto, las capacidades y el nivel de rendimiento requeridos, y el volumen esperado de tokens de entrada/salida necesario para tu caso de uso específico.
Lee más sobre los precios de LLM.
¿Cuáles son los últimos avances en modelos multimodales?
Los avances recientes en modelos multimodales han introducido nuevas capacidades y eficiencias en el desarrollo de la IA.
Modelos fundacionales multimodales centrados en vídeo
Los modelos fundacionales multimodales centrados en vídeo están yendo más allá de generar subtítulos o resúmenes de alto nivel y, en cambio, están aprendiendo a localizar explícitamente la evidencia dentro de los vídeos.
En lugar de decir qué ocurre, pueden identificar cuándo ocurre (marcas de tiempo) y dónde ocurre (cuadros delimitadores alrededor de objetos o regiones).
Este cambio hacia la localización espaciotemporal hace que la comprensión de vídeo sea más precisa y verificable. También permite tareas como encontrar momentos exactos, rastrear objetos, editar vídeos mediante lenguaje natural y dar soporte a la robótica y a los sistemas críticos para la seguridad.
Por ejemplo, Vidi8 es un proyecto de código abierto de ByteDance centrado en modelos multimodales grandes para la comprensión y edición de vídeo.
El repositorio aloja el código y los recursos de una familia de modelos (p. ej., Vidi-7B, Vidi1.5-9B, Vidi2 y Vidi2.5) que reciben visión, audio y texto como entradas para realizar tareas como:
- Recuperación temporal (encontrar los segmentos de tiempo de un vídeo que coinciden con una consulta de texto)
- Localización espaciotemporal (localizar objetos con cuadros delimitadores)
- Respuesta a preguntas sobre vídeo
Lanzamiento de Mistral 3 en la frontera multimodal
Mistral IA ha desarrollado una nueva familia de modelos de IA de código abierto llamada Mistral 3. La suite Mistral 3 comprende tanto modelos multimodales/multilingües de nivel frontera como modelos más pequeños y eficientes diseñados para ejecutarse en una variedad de dispositivos, desde la nube hasta el edge, e incluso en una sola GPU.
Publicados bajo una licencia de código abierto permisiva (Apache 2.0), estos modelos pretenden democratizar el acceso a la IA avanzada, permitir la personalización y la flexibilidad de despliegue, y reforzar la posición de Europa en el desarrollo de la IA, donde existen preocupaciones por quedarse atrás frente a Estados Unidos y China en tecnologías de vanguardia.9
Modelos de visión y lenguaje MoE de código abierto
Kimi-VL (de Moonshot IA) es un modelo de visión y lenguaje multimodal de código abierto construido con una arquitectura Mixture-of-Experts (MoE), que rinde en tareas que combinan texto, imágenes y vídeo manteniendo un cómputo eficiente.
Tiene una columna vertebral de 16 B de parámetros totales, pero normalmente activa ~2.8 B de parámetros durante la inference, lo que ayuda a equilibrar capacidad y coste.
Kimi-VL está diseñado para razonamiento multimodal avanzado, comprensión de contexto largo (hasta ~128 K tokens) e interacciones de estilo agente, y compite bien con modelos más grandes en benchmarks como comprensión de vídeo, reconocimiento óptico de caracteres (OCR), razonamiento matemático y tareas con múltiples imágenes.
Las variantes como Kimi-VL-A3B-Thinking se fine-tunean aún más para tareas de cadena de pensamiento y razonamiento, mientras que el codificador visual MoonViT admite la comprensión de entradas de alta resolución.
Figura 2: Diseño de la arquitectura de Kimi-VL.10
Anthropic: serie Claude 4
Anthropic integra en su serie Claude 4 una comprensión visual avanzada con su motor de razonamiento basado en texto, incorporando la visión directamente en los flujos de trabajo de resolución de problemas.
Los modelos Claude 4 demuestran un sólido rendimiento en benchmarks de razonamiento multimodal como MMMU, especialmente en la interpretación de gráficos, diagramas y datos visuales complejos. Una característica distintiva de Claude Opus 4.1 es su capacidad para evaluar cualidades estéticas dentro de las imágenes, yendo más allá del reconocimiento hacia evaluaciones más matizadas.
Estas capacidades, combinadas con Claude y sus funciones agénticas, hacen que la serie sea eficaz para tareas como sintetizar investigaciones a partir de informes con texto y elementos visuales mixtos o ayudar en el diseño de interfaces mediante el análisis de maquetas visuales.
El Gemini 3 de Google
Google presentó Gemini 3 en noviembre de 2025: Gemini 3 Pro estuvo disponible de inmediato y el modo Gemini 3 Deep Think comenzó a implementarse poco después para los suscriptores de Google IA Ultra. Google posiciona a Gemini 3 como su modelo multimodal más inteligente y capaz, con soporte nativo para texto, imágenes, vídeo, audio y código en una única arquitectura.
Gemini 3 Pro viene con una ventana de contexto de un millón de tokens y logra buenos resultados en benchmarks multimodales, incluido un 81 % en MMMU-Pro y un 87.6 % en Video-MMMU. En el momento del lanzamiento, encabezó la tabla LMArena Leaderboard con una puntuación de 1501 Elo, y obtuvo un 91.9 % en GPQA Diamond para razonamiento de nivel posgrado y un 76.2 % en SWE-bench Verified para tareas de programación agéntica.
Gemini 3 Deep Think es un modo de razonamiento mejorado que aumenta aún más el rendimiento en las tareas más exigentes, con un 41.0 % en Humanity’s Last Exam (sin herramientas) y un 45.1 % en ARC-AGI-2. Junto con Gemini 3, Google también lanzó Google Antigravity, una plataforma de desarrollo agéntica que combina Gemini 3 con el modelo Gemini 2.5 Computer Use para el control del navegador y el modelo de edición de imágenes Nano Banana, lo que permite flujos de trabajo de desarrollo de software de extremo a extremo en los que el modelo puede planificar, programar y validar tareas de forma autónoma.11
GPT-5 de OpenAI
GPT-5 introduce una multimodalidad nativa mejorada en texto, voz, imagen y vídeo. A diferencia de los sistemas anteriores que dependían en gran medida de plugins, GPT-5 integra estas modalidades dentro de una arquitectura unificada, lo que da como resultado una interacción más fluida. El modelo se adapta con flexibilidad a varios tipos de entrada y puede alternar entre ellos.
Una característica destacada es su modo de voz en tiempo real, que puede ajustar el tono, el ritmo y el estilo según las instrucciones del usuario. Esto crea una experiencia conversacional más natural y adaptativa. El procesamiento visual también ha mejorado, reduciendo las alucinaciones al interpretar o generar imágenes, diagramas y gráficos. Otro avance reside en sus capacidades de memoria, que permiten al sistema recordar entradas anteriores y mantener el contexto durante interacciones prolongadas.
Estas mejoras hacen que GPT-5 sea especialmente valioso para interfaces multimodales accesibles, sobre todo para personas con discapacidades sensoriales.
Modelos multimodales de Google DeepMind centrados en robótica
Google DeepMind ha desarrollado Gemini Robotics y Gemini Robotics-ER, modelos diseñados para integrar visión, lenguaje y acción en sistemas robóticos. Estos modelos permiten a los robots realizar tareas en entornos no estructurados, como doblar papel o desenroscar tapas de botellas.
Una característica clave de estos modelos es su mecanismo de seguridad. Antes de ejecutar acciones, el sistema realiza comprobaciones integradas para minimizar los riesgos y garantizar el manejo adecuado de las tareas. Este enfoque aborda uno de los retos importantes de la robótica: unir el razonamiento avanzado de la IA con una ejecución segura y fiable en el mundo real.
Llama 4 Scout y Llama 4 Maverick de Meta IA
Llama 4 Scout es un modelo multimodal con 17 mil millones de parámetros activos y 16 expertos. Este modelo supera a los modelos Llama de la generación anterior y está diseñado para funcionar en una única H100 GPU. Cuenta con una ventana de contexto de 10 millones de tokens para procesar grandes cantidades de información. Los resultados de los benchmarks indican que Llama 4 Scout obtiene mejores resultados que Gemma 3, Gemini 2.0 Flash-Lite y Mistral 3.1 en una serie de benchmarks ampliamente difundidos.
Llama 4 Maverick es un modelo multimodal con 17 mil millones de parámetros activos y 128 expertos. Este modelo se presenta como uno de los mejores de su clase, superando a GPT-4o y a Gemini 2.0 Flash en una serie de benchmarks. Logra un rendimiento comparable al de DeepSeek v3 en razonamiento y programación, usando menos parámetros activos. Una versión de chat experimental de Llama 4 Maverick obtuvo una puntuación ELO de 1417 en la plataforma LMArena.
ChatGPT Images 2.0 de OpenAI
ChatGPT Images 2.0 de OpenAI hace avanzar la generación de imágenes con mayor precisión, control y razonamiento visual. El modelo mejora el seguimiento de instrucciones, la representación de texto y el soporte multilingüe. Puede producir elementos visuales más sofisticados y realistas en fotografía, ilustración, manga, infografías, pósteres y otros estilos. También admite relaciones de aspecto flexibles, lo que hace que el contenido generado sea adecuado para formatos que van desde pantallas móviles hasta pancartas y materiales impresos.
Cuando se combina con las capacidades de razonamiento de ChatGPT, ChatGPT Images 2.0 puede interpretar materiales de origen e incorporar información contextual y del mundo real. Esto permite a los usuarios desarrollar gráficos más complejos y ricos en información, y refinar conceptos creativos de manera conversacional manteniendo una mayor coherencia en la composición, la tipografía y la dirección visual.
Qwen3-VL de Alibaba
La serie Qwen3-VL de Alibaba, cuyo lanzamiento comenzó en septiembre de 2025, se basa en el modelo de lenguaje Qwen3 añadiendo capacidades de percepción visual y razonamiento más profundas. La familia incluye variantes densas desde 2B hasta 32B parámetros y variantes Mixture-of-Experts con hasta 235B parámetros totales (22B activos), todas publicadas bajo la licencia Apache 2.0.
Las características clave incluyen una ventana de contexto nativa de 256K (ampliable a 1 millón de tokens), OCR multilingüe ampliado en 32 idiomas, localización de objetos 2D y 3D para razonamiento espacial e IA corporal, comprensión de vídeo de horas de duración con indexación a nivel de segundos y capacidades de agente visual para el control de GUI.
Las variantes Thinking están ajustadas para STEM y razonamiento multimodal, mientras que las variantes Instruct se centran en tareas generales de visión y lenguaje, como el análisis de documentos, la extracción de gráficos y la respuesta a preguntas visuales.
Gemma 3 de Google
Gemma 3 de Google se basa en la tecnología de sus modelos Gemini 2.0. Se presenta en cuatro tamaños (1B, 4B, 12B y 27B) para diferentes requisitos de hardware y ofrece una ventana de contexto de 128k tokens. Gemma 3 rinde bien en configuraciones de un solo acelerador e incluye razonamiento textual y visual, llamada de funciones y soporte para más de 35 idiomas, con preentrenamiento para más de 140. Las versiones cuantizadas reducen el tamaño del modelo y las necesidades de cómputo. El sistema ShieldGemma 2 proporciona clasificación de seguridad del contenido.
Phi-4-multimodal de Microsoft
Phi-4-multimodal de Microsoft es un modelo de 5.6B parámetros que procesa voz, visión y texto en una arquitectura unificada. Utiliza aprendizaje intermodal para interacciones conscientes del contexto entre diferentes tipos de entrada. El modelo maneja múltiples formatos de entrada sin necesidad de sistemas de procesamiento independientes y está diseñado para el despliegue en dispositivos y el edge computing. Las aplicaciones incluyen IA para smartphones, sistemas automotrices y servicios multilingües.
¿Qué es un modelo multimodal grande (LMM)?
Un modelo multimodal grande es un tipo avanzado de modelo de inteligencia artificial que puede procesar y comprender múltiples tipos de modalidades de datos. Estos datos multimodales pueden incluir texto, imágenes, audio, vídeo y, potencialmente, otros. La característica clave de un modelo multimodal es su capacidad para integrar e interpretar información de estas diferentes fuentes de datos, a menudo simultáneamente.
Estos pueden entenderse como versiones más avanzadas de los modelos de lenguaje grandes (LLMs) que pueden trabajar con texto y también con diversos tipos de datos. Además, las salidas de los modelos de lenguaje multimodales están diseñadas para ser textuales, visuales, auditivas, etc.
Se considera que los modelos de lenguaje multimodales son el siguiente paso hacia la inteligencia artificial general.
¿Qué es un agente de IA multimodal?
Los agentes de IA multimodales son sistemas diseñados para interactuar con el mundo utilizando varios tipos de datos, incluidas imágenes, vídeos y texto, lo que les permite operar tanto en entornos digitales como físicos. Los modelos multimodales son el componente central de estos agentes, ya que les permiten percibir y comprender información de fuentes diversas.
Por ejemplo, modelos como Magma utilizan la comprensión de visión y lenguaje y la inteligencia espacial, logradas mediante técnicas como Set-of-Mark y Trace-of-Mark durante el preentrenamiento en datasets multimodales.
Esto permite al agente realizar tareas que van desde comprender el contenido de vídeo y responder preguntas hasta navegar por interfaces de usuario y controlar robots, lo que demuestra las capacidades versátiles que los modelos multimodales aportan a los agentes de IA al aprovechar diferentes modalidades de datos. La siguiente ilustración muestra a Magma planificando trayectorias de robot para realizar tareas, mostrando su inteligencia espacial en acción.12
¿Cuál es la diferencia entre LMMs y LLMs?
1. Modalidades de datos
- LMMs: Están diseñados para comprender y procesar múltiples tipos de datos de entrada, o modalidades. Esto incluye texto, imágenes, audio, vídeo y, a veces, otros tipos de datos como datos sensoriales. La capacidad clave de los LMM es su habilidad para integrar y dar sentido a estos formatos de datos diferentes, a menudo de forma simultánea.
- LLMs: Estos modelos están especializados en procesar y generar datos textuales. Se entrenan principalmente con grandes corpus de texto y son expertos en comprender y generar lenguaje humano en una variedad de contextos. No procesan de forma inherente datos no textuales como imágenes o audio.
2. Aplicaciones y tareas
- LMMs: Debido a su naturaleza multimodal, estos modelos pueden aplicarse a tareas que requieren comprender e integrar información de diferentes tipos de datos. Por ejemplo, un LMM podría analizar una noticia (texto), sus fotografías adjuntas (imágenes) y los videoclips relacionados para lograr una comprensión integral.
- LLMs: Sus aplicaciones se centran en tareas que implican texto, como redactar artículos, traducir idiomas, responder preguntas, resumir documentos y crear contenido basado en texto.
¿Cuáles son las modalidades de datos de los modelos multimodales grandes?
Texto
Esto incluye cualquier forma de contenido escrito, como libros, artículos, páginas web y publicaciones en redes sociales. El modelo puede comprender, interpretar y generar contenido textual, incluidas tareas de procesamiento del lenguaje natural como traducción, resumen y respuesta a preguntas.
Imágenes
Estos modelos pueden analizar y generar datos visuales. Esto incluye comprender el contenido y el contexto de fotografías, ilustraciones y otras representaciones gráficas. Tareas como la clasificación de imágenes, la detección de objetos y la generación de imágenes a partir de descripciones textuales entran en esta categoría.
Audio
Esto abarca grabaciones de sonido, música y lenguaje hablado. Los modelos pueden entrenarse para reconocer el habla, la música, los sonidos ambientales y otras entradas auditivas. Pueden transcribir el habla, comprender órdenes habladas e incluso generar voz o música sintéticas.
Vídeo
Al combinar elementos visuales y auditivos, el procesamiento de vídeo implica comprender las imágenes en movimiento y sus sonidos asociados. Esto puede incluir analizar el contenido de vídeo, reconocer acciones o eventos en los vídeos y generar clips de vídeo.
Aunque la mayoría de los modelos de lenguaje multimodales grandes actuales pueden procesar texto e imágenes, la investigación futura pretende incluir entradas de datos de audio y vídeo.
¿Cómo se entrenan los modelos multimodales grandes?
Entrenar modelos multimodales grandes (LMMs) difiere significativamente de entrenar modelos de lenguaje grandes (LLMs) en varios aspectos clave:
1. Recopilación y preparación de datos
- LLMs: Se centran en datos de texto de libros, sitios web y fuentes escritas, con un énfasis en la diversidad lingüística para las fuentes de datos de entrenamiento de LLM.
- LMMs: Requieren datos de texto, imágenes, audio y vídeo. La recopilación es más compleja debido a la variedad de formatos. La anotación de datos y la alineación entre modalidades son esenciales.
2. Diseño de la arquitectura del modelo
- LLMs: Utilizan arquitecturas transformer optimizadas para el procesamiento secuencial de texto.
- LMMs: Emplean arquitecturas más complejas que integran múltiples tipos de redes neuronales (CNNs para imágenes, transformers para texto) con mecanismos para conectar estas modalidades.
3. Preentrenamiento
- LLMs: Se preentrenan con corpus de texto mediante técnicas como el modelado de lenguaje enmascarado.
- LMMs: Se preentrenan con múltiples tipos de datos, aprendiendo a correlacionar texto con imágenes o a comprender secuencias de vídeo.
4. Fine-tuning
- LLMs: Fine-tune con datasets de texto especializados para tareas específicas.
- LMMs: Requieren fine-tuning tanto en datasets específicos de cada modalidad como en datasets intermodales para establecer relaciones entre los diferentes tipos de datos.
5. Evaluación e iteración
- LLMs: Las métricas de evaluación se centran en tareas de comprensión y generación de lenguaje, incluidas la fluidez, la coherencia y la relevancia.
- LMMs: Se evalúan con métricas más amplias que cubren el reconocimiento de imágenes, el procesamiento de audio y las capacidades de integración intermodal.
¿Cómo funcionan los LMM?
Los modelos multimodales grandes comparten similitudes con los modelos de lenguaje grandes en su proceso de entrenamiento, diseño y funcionamiento. Utilizan la misma arquitectura transformer y las mismas estrategias de entrenamiento. Los modelos multimodales grandes se entrenan con:
- Datos de texto
- Millones o miles de millones de imágenes con descripciones de texto
- Clips de vídeo
- Fragmentos de audio
- Otros datos de entrada, como código
Este entrenamiento implica el aprendizaje simultáneo de múltiples modalidades de datos, lo que permite al modelo:
- Reconocer la foto de un gato
- Identificar una palabra en un clip de audio
- Comprender conceptos y detalles sensoriales más allá del texto
De esta manera, los usuarios pueden subir:
- Una imagen para:
- Obtener una descripción de lo que está sucediendo
- Usar la imagen como parte de un prompt para generar texto o imágenes
- Hacer preguntas de seguimiento sobre elementos concretos de la imagen
- Traducir el texto de la imagen a otro idioma (p. ej., un menú)
Figura 3: Subir una imagen de un gato a ChatGPT para que la describa.
- Gráficos y diagramas para:
- Hacer preguntas de seguimiento complicadas sobre lo que muestran
- Maquetas de diseño para:
- Obtener el código HTML y CSS necesario para crearla.
Figura 4: Pedir la imagen al estilo de las películas de Wes Anderson. ChatGPT introduce el prompt en un modelo de generación de imágenes (como DALL·E), que interpreta la solicitud y produce la imagen con ese estilo.
Tras el proceso de entrenamiento, los modelos pueden incorporar estereotipos perjudiciales e ideas tóxicas. Para refinarlos, se pueden utilizar técnicas como:
- Aprendizaje por refuerzo con retroalimentación humana (RLHF)
- Modelos de IA supervisores
- Red teaming (probar la solidez del modelo).
Además, las herramientas de gobernanza de la IA y las herramientas de IA responsable, que funcionan como soluciones de cumplimiento de la IA, también pueden permitir la optimización del inventario de IA, lo que ayuda a prevenir el sesgo de la IA y otros dilemas éticos. Aquí hay un ejemplo de cómo estas herramientas abordan las preocupaciones sobre los derechos de autor de la IA generativa:
Figura 5: ChatGPT rechaza mi solicitud debido a las directrices de la política de contenido para proteger los derechos de autor.
El objetivo es desarrollar un sistema multimodal funcional capaz de manejar:
- Síntesis de texto a imagen
- Subtitulado de imágenes
- Recuperación de imágenes basada en texto
- Respuesta a preguntas visuales.
De esta manera, la IA multimodal puede integrar varias modalidades, proporcionando capacidades avanzadas para tareas que implican tanto el lenguaje como la visión.
¿Cuáles son las limitaciones de los modelos de lenguaje grandes?
- Requisitos de datos y sesgo: Estos modelos requieren datasets masivos y diversos para el entrenamiento. Sin embargo, la disponibilidad y la calidad de dichos datasets puede ser un reto. Además, si los datos de entrenamiento contienen sesgos, es probable que el modelo los herede y posiblemente los amplifique, lo que da lugar a resultados injustos o poco éticos.
- Recursos computacionales: Entrenar y ejecutar modelos multimodales grandes requiere importantes recursos computacionales, lo que los hace caros y menos accesibles para organizaciones pequeñas o investigadores independientes.
- Interpretabilidad y explicabilidad: Como ocurre con los modelos de IA complejos, entender cómo toman decisiones puede ser difícil. Esta falta de transparencia puede ser un problema crítico, especialmente en aplicaciones sensibles como la atención sanitaria o la aplicación de la ley.
- Integración de modalidades: Integrar de manera eficaz diferentes tipos de datos (como texto, imágenes y audio) de un modo que comprenda realmente los matices de cada modalidad es extremadamente difícil. Es posible que el modelo no siempre capte con precisión el contexto o las sutilezas de la comunicación humana que surgen al combinar estas modalidades.
- Generalización y sobreajuste: Aunque estos modelos se entrenan con datasets enormes, pueden tener dificultades para generalizar a datos nuevos no vistos o a escenarios que difieren significativamente de sus datos de entrenamiento. A la inversa, pueden sobreajustarse a los datos de entrenamiento, capturando ruido y anomalías como patrones.
Para obtener más información, explora los retos y riesgos asociados a los modelos generativos y de lenguaje.
Metodología de benchmark para LMMs
Evaluamos el rendimiento de los modelos multimodales grandes (LMMs) utilizando un subconjunto del dataset FinMME13 , un benchmark integral diseñado para evaluar las capacidades de razonamiento financiero multimodal. FinMME comprende más de 11.000 muestras financieras de alta calidad en 18 dominios financieros y 6 clases de activos, lo que proporciona un framework sólido para evaluar los LMM en el ámbito financiero.
Para este benchmarking, utilizamos una selección curada de 100 muestras del dataset FinMME para analizar la capacidad de los modelos para procesar y razonar con datos financieros multimodales.
Descargo de responsabilidad
Esta evaluación utilizó un subconjunto curado de 100 muestras de un dataset más amplio para hacer un benchmark de los LMM. Para una evaluación integral del rendimiento del modelo, deben considerarse todas las muestras del dataset de benchmark completo.
Conclusión
Los modelos multimodales grandes (LMMs) están integrando diversos tipos de datos, como texto, imágenes, audio y vídeo, superando así las capacidades basadas en texto de los modelos de lenguaje grandes (LLMs). Con avances como Meta IA y su Llama 4, OpenAI y su GPT-4o, y Qwen2.5-VL de Alibaba, los LMM permiten aplicaciones más ricas, desde el razonamiento visual hasta la generación de imágenes consciente del contexto.
Sin embargo, su complejidad, sus altas exigencias computacionales y los retos relacionados con la integración de datos y la mitigación de sesgos siguen siendo obstáculos. A medida que los LMM evolucionan, allanan el camino hacia agentes de IA más versátiles, acercándonos a la inteligencia artificial general. Para las organizaciones y los investigadores, seleccionar el modelo adecuado implica encontrar un equilibrio entre rendimiento, coste y las necesidades específicas del caso de uso.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Modelos multimodales grandes (LMMs) frente a LLMs}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/large-multimodal-models}},
note = {AIMultiple. Recuperado el 17 de Agosto de 2026}
}Resultados y marcas de tiempo de 0 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene 0 archivos CSV y un README.
Enlaces de referencia
El trabajo de Cem ha sido citado por publicaciones globales líderes como Business Insider, Forbes, Washington Post, firmas globales como Deloitte, HPE y ONG como el Foro Económico Mundial y organizaciones supranacionales como la Comisión Europea.
A lo largo de su carrera, Cem se ha desempeñado como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.
Lideró la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando directamente al CEO. También lideró el crecimiento comercial de la empresa de tecnología profunda Hypatos, que alcanzó ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.
Cem habla regularmente en conferencias internacionales de tecnología. Se graduó de la Universidad de Bogazici como ingeniero informático y tiene un MBA de Columbia Business School.






Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.