Servicios
Contáctanos

Modelos Fundamentales del Mundo: 10 casos de uso

Cem Dilmegani
Cem Dilmegani
actualizado el 10 de ago. de 2026

Entrenar robots y vehículos autónomos (AV) en el mundo físico puede ser costoso, lento y arriesgado. Los Modelos Fundamentales del Mundo ofrecen una alternativa escalable al permitir simulaciones realistas de entornos del mundo real.

Estos modelos aceleran el desarrollo y la implementación en robótica, vehículos autónomos y otros ámbitos al reducir la dependencia de las pruebas físicas.

Descubra cómo funcionan los Modelos Fundamentales del Mundo, sus casos de uso reales y los beneficios tangibles que ofrecen.

Los 10 principales Modelos Fundamentales del Mundo

1) Alpamayo de NVIDIA

Alpamayo de NVIDIA es una nueva familia de modelos de IA de código abierto, herramientas de simulación y datasets diseñados para hacer que los vehículos autónomos sean más seguros mediante una toma de decisiones basada en el razonamiento.

Para respaldar este enfoque, Alpamayo integra tres componentes clave:

  • Alpamayo 1, un modelo VLA de cadena de pensamiento de 10 mil millones de parámetros que explica sus decisiones de conducción
  • AlpaSim, un framework de simulación de código abierto para pruebas y validación
  • Physical IA Open Datasets, que incluyen más de 1.700 horas de datos diversos de conducción en el mundo real.

Estos modelos no están pensados para ejecutarse directamente en los vehículos. En cambio, sirven como grandes modelos maestros que los desarrolladores pueden fine-tune y destilar en stacks de producción para vehículos autónomos, mejorando así la seguridad y la escalabilidad.1

2) GR00T N1.6 de NVIDIA Research

GR00T N1.6 de NVIDIA Research es un modelo fundacional abierto actualizado para robots humanoides de propósito general. Sobre la base de GR00T N1.5, la nueva versión ofrece un rendimiento más sólido tanto en pruebas de simulación como en el mundo real, incluidas tareas de manipulación bimanual y locomoción de cuerpo completo en robots como YAM, AgiBot Genie-1 y Unitree G1 (ver figura a continuación).

Figura 1: Gráficos de comparación de GR00T N1.6 frente a GR00T N1.5.

GR00T N1.6 incluye mejoras arquitectónicas y de entrenamiento, como un transformer de difusión más grande, un modelo de lenguaje-visión más capaz y datos de preentrenamiento ampliados que añaden miles de horas de demostraciones de robots teleoperados. Estos cambios ayudan al modelo a aprender movimientos más suaves y precisos y a adaptarse más rápidamente durante el post-entrenamiento.

En lugar de centrarse en un único robot o tarea, GR00T N1.6 está diseñado como una política generalista que puede transferirse entre diferentes plataformas humanoides.

NVIDIA informa de una convergencia más rápida, mejor destreza y un rendimiento mejorado en tareas de largo horizonte, lo que convierte a N1.6 en un paso significativo hacia el aprendizaje abierto y escalable de robots humanoides.2

Mire el siguiente video para ver a GR00T N1.6 en acción.

Video que muestra el despliegue de la política de GR00T N1.6.

3) PAN

PAN es un modelo del mundo interactivo general diseñado para predicción de largo horizonte y simulación condicionada por acciones. Se basa en una arquitectura de Predicción Latente Generativa que combina un modelo autorregresivo de dinámica latente con un decodificador de difusión de video.

Este diseño permite al sistema simular cómo evoluciona un entorno en respuesta a acciones específicas proporcionadas en lenguaje natural, manteniendo la coherencia temporal y visual.

PAN admite la generación de rollouts de varios pasos en la que un agente puede proponer acciones, simular sus resultados probables y seleccionar secuencias que logren mejor un objetivo definido. El modelo también puede realizar razonamiento contrafactual evaluando cómo podrían cambiar los resultados de una tarea si se alteran las interacciones con objetos o las trayectorias de movimiento.

Los resultados experimentales muestran que logra un rendimiento sólido en predicción visual de largo horizonte, razonamiento físico y benchmarks de planificación en comparación con modelos de código abierto comparables.

En robótica, estas capacidades permiten a los robots o sistemas de entrenamiento pronosticar la dinámica del entorno, probar estrategias internamente antes de ejecutarlas y refinar las políticas de tareas, reduciendo así los costes y riesgos de repetidos ensayos físicos.

Figura 2: Imagen que muestra la arquitectura del modelo PAN, que combina un backbone autorregresivo basado en LLM para la simulación del mundo de largo horizonte.3

4) Marble de World Labs

Marble de World Labs genera entornos 3D persistentes y editables a partir de prompts de texto, una o varias imágenes, videos, panorámicas y diseños 3D.

A diferencia de los sistemas generativos en tiempo real que transforman continuamente las escenas durante la exploración, Marble produce mundos estables que se pueden exportar como Gaussian splats, mallas o videos. La plataforma incluye Chisel, un editor 3D híbrido que separa la estructura espacial del estilo visual.

Esta herramienta permite a los desarrolladores disponer elementos geométricos básicos, como paredes u objetos grandes, y luego aplicar prompts estilísticos para completar la escena.

Los usuarios también pueden reposicionar objetos directamente dentro del editor y ampliar el mundo generado para incluir regiones cercanas adicionales. Estas funciones permiten a los equipos de robótica crear gemelos digitales realistas de los espacios de trabajo, probar la navegación y la manipulación en entornos controlados e iterar rápidamente sobre el diseño o el planteamiento de tareas sin tener que reconstruir escenas completas.

La capacidad de Marble de aceptar entradas visuales multiángulo favorece la creación de alta fidelidad. Estos entornos de simulación consistentes pueden mejorar la eficiencia del entrenamiento robótico y reducir la necesidad de prototipado físico extenso.

Figura 3: El gráfico muestra el pipeline de entrada a salida de Marble.4

5) V-JEPA 2 de Meta

Meta ha presentado V-JEPA 2, un modelo del mundo avanzado basado en video que establece nuevos benchmarks en razonamiento físico, predicción visual y planificación robótica zero-shot.

Construido sobre la Arquitectura de Predicción de Embeddings Conjuntos (JEPA), el modelo de 1.2 mil millones de parámetros está entrenado con más de un millón de horas de video y datos adicionales de interacción de robots, lo que le permite comprender y predecir la dinámica de objetos y entornos desconocidos.

V-JEPA 2 admite la planificación mediante una arquitectura codificador-predictor y aprendizaje autosupervisado, y logra resultados avanzados en tareas como reconocimiento de acciones, anticipación y respuesta a preguntas sobre video.

Meta también publicó tres benchmarks: IntPhys 2, MVPBench y CausalVQA, para evaluar el razonamiento físico en la IA, destacando las brechas actuales entre el rendimiento de la IA y el humano.

El modelo es de código abierto tanto para uso comercial como de investigación, lo que marca un paso significativo hacia el objetivo de Meta de lograr una inteligencia de máquinas avanzada (AMI) y el desarrollo de agentes de IA prácticos y adaptables.5

Figura 4: V-JEPA 2 se preentrena con datos de video e imágenes a gran escala, luego se alinea con un modelo de lenguaje para tareas visuales y se amplía con una pequeña cantidad de datos de robots para la planificación y el control en robótica.6

6) Modelos Fundamentales del Mundo Cosmos de NVIDIA

Los Modelos Fundamentales del Mundo Cosmos de NVIDIA son una plataforma avanzada diseñada para acelerar el desarrollo de sistemas de IA física, incluidos los vehículos autónomos (AV) y los robots.

La Suite Cosmos de NVIDIA integra modelos fundacionales del mundo (WFM) generativos, tokenizers avanzados, barreras de protección incorporadas y un pipeline de procesamiento de video de alta velocidad.

NVIDIA NeMo Curator, junto con el pipeline acelerado por CUDA, procesa 20 millones de horas de video en dos semanas, reduciendo así costes y tiempo.

El Tokenizer de Cosmos de NVIDIA logra una compresión superior y un procesamiento más rápido de datos de imagen y video. Estas son las características clave de la Suite Cosmos de NVIDIA:

  • Permite la creación de grandes cantidades de datos sintéticos fotorrealistas basados en la física para entrenar y evaluar modelos de IA.
  • Genera videos basados en la física a partir de entradas diversas como texto, imágenes, video y datos de sensores.
  • Simula entornos industriales y de conducción complejos, incluidos almacenes y diversas condiciones de la carretera.
  • Facilita la búsqueda de video para escenarios específicos y la evaluación de modelos en condiciones simuladas.
  • Los desarrolladores pueden fine-tune los WFM para crear modelos personalizados adaptados a aplicaciones específicas.
  • Los WFM son accesibles bajo una licencia abierta para fomentar la colaboración dentro de las comunidades de robótica y vehículos autónomos.
  • Los modelos se pueden previsualizar a través del catálogo de API de NVIDIA o descargarse desde las plataformas NVIDIA NGC y Hugging Face.7

Figura 5: Componentes principales de la Suite Cosmos de NVIDIA: curador de video, tokenizer de video, modelo fundacional del mundo preentrenado, muestras de post-entrenamiento del modelo fundacional del mundo y barrera de protección.8

Waabi, Foretellix, XPENG y Wayve utilizan los Modelos Fundamentales del Mundo Cosmos de NVIDIA para simular escenarios de tráfico, condiciones meteorológicas y comportamientos de peatones. Estas empresas ejecutan pruebas en entornos virtuales sin ensayos físicos.9

La plataforma utiliza NVIDIA NeMo Curator para procesar y etiquetar más de 20 millones de horas de video mediante aceleración CUDA en aproximadamente dos semanas.

Características clave:

  • Genera escenarios etiquetados de tráfico, clima, iluminación y peatones.
  • Produce video fotorrealista con datos de sensores.
  • Simula normas de conducción regionales para la localización.
  • Permite la validación de sistemas AV sin gratis.

7) Genie 3 de DeepMind

Google DeepMind ha lanzado Genie 3, un sistema de IA diseñado para generar entornos virtuales interactivos a partir de descripciones textuales en tiempo real.

Especificaciones técnicas:

  • Características de rendimiento: El sistema funciona a 24 fotogramas por segundo y produce una salida de resolución 720p, manteniendo la coherencia del entorno durante varios minutos de interacción.
    • El modelo demuestra capacidades de memoria visual que se extienden aproximadamente a un minuto en las interacciones pasadas.
  • Categorías de entornos: Genie 3 genera múltiples tipos de mundos virtuales:
    • Simulaciones físicas que incorporan dinámica de fluidos, efectos de iluminación y física ambiental.
    • Ecosistemas biológicos con flora, fauna e interacciones ecológicas.
    • Entornos ficticios con elementos no realistas y personajes animados.
    • Reconstrucciones geográficas e históricas de ubicaciones del mundo real y periodos de tiempo.
  • Mecanismos de interacción:
    • Eventos del mundo provocables mediante prompts que permiten modificar en tiempo de ejecución las condiciones del entorno y la colocación de objetos.
    • Consistencia temporal que mantiene propiedades físicas coherentes durante sesiones de interacción prolongadas.
    • Integración de agentes que admite agentes autónomos que realizan tareas orientadas a objetivos dentro de los entornos generados.
  • Arquitectura técnica: El sistema emplea generación autorregresiva de fotogramas en lugar de representaciones explícitas de escenas 3D.
    • Este enfoque permite la creación dinámica de entornos al tiempo que aborda el desafío computacional de mantener la coherencia a lo largo de secuencias temporales crecientes durante la interacción en tiempo real.

Aplicaciones de investigación y acceso:

El acceso está actualmente restringido a investigadores académicos y creadores de contenido seleccionados mediante un programa de vista previa limitado. Las posibles aplicaciones de investigación incluyen simulación educativa, entrenamiento de sistemas autónomos, evaluación del comportamiento de agentes y análisis de escenarios contrafactuales para sistemas de aprendizaje automático.10

Video que explica Genie 3, un modelo del mundo que crea entornos interactivos diversos a partir de descripciones de texto.

8) Earth-2 de NVIDIA

Earth-2 de NVIDIA es una iniciativa diseñada para utilizar IA y computación de alto rendimiento (HPC) para simular el clima y los sistemas meteorológicos de la Tierra en alta resolución. Representa un nuevo enfoque para la predicción meteorológica y la modelización climática.

¿Cuál es la tecnología que hay detrás?

NVIDIA utiliza su plataforma Omniverse, construida sobre las unidades de procesamiento gráfico (GPUs) y las herramientas de IA de NVIDIA, para crear simulaciones realistas. La idea es generar simulaciones altamente detalladas y precisas del clima de la Tierra aprovechando la IA para modelar patrones meteorológicos complejos y realizar previsiones más precisas.

¿Cuál es el impacto?

El objetivo final de Earth-2 es proporcionar mejores pronósticos meteorológicos, ayudar a comprender las tendencias climáticas a largo plazo y mitigar el cambio climático.

Unas simulaciones más precisas pueden conducir a una mejor preparación ante fenómenos meteorológicos extremos, un uso más eficiente de la energía y mejores estrategias de respuesta ante desastres.11

Para explorar cómo avanza la tecnología de IA de NVIDIA en la predicción meteorológica y la modelización climática, mire el siguiente video para ver en detalle la plataforma Earth-2 y su impacto en la predicción de tormentas:

La plataforma Earth-2 de NVIDIA combina modelos basados en IA para ofrecer pronósticos meteorológicos globales y regionales, aportando información valiosa para minimizar los daños. Earth-2 incluye servicios de predicción impulsada por IA, simulaciones en la nube, federación de datos y visualización interactiva, todo optimizado para la plataforma NVIDIA IA Enterprise.

9) DreamDojo de NVIDIA

DreamDojo es un modelo del mundo robótico generalista de NVIDIA, creado para adquirir conocimiento físico a partir de video humano a gran escala y transferirlo a robots mediante post-entrenamiento en la encarnación de destino.

El sistema se entrena con DreamDojo-HV, un dataset curado de aproximadamente 44.000 horas de video humano egocéntrico. Según se informa, es la mayor colección utilizada hasta la fecha para el preentrenamiento de modelos del mundo y cubre sustancialmente más habilidades y escenas que los datasets anteriores de esta categoría.

En comparación con una referencia de Cosmos-Predict 2.5 post-entrenada, DreamDojo produce rollouts condicionados por acciones más precisos desde el punto de vista físico en diversos entornos e interacciones con objetos.

Características clave:

  • Lanzamiento de código abierto a través del GitHub de NVIDIA.
  • Preentrenado con aproximadamente 44k horas de video humano egocéntrico.
  • Preentrenamiento de acciones latentes seguido de post-entrenamiento específico para cada robot.
  • Generación autorregresiva en tiempo real de 10 FPS tras la destilación.
  • Generaliza a través de múltiples encarnaciones humanoides y manipuladoras.
  • Admite la evaluación de políticas y la planificación basada en modelos como aplicaciones posteriores.

Figura 6: Descripción general de DreamDojo, que muestra el preentrenamiento de acciones latentes en video humano seguido del post-entrenamiento con acciones continuas del robot en la encarnación de destino.12

10) DreamZero de NVIDIA

DreamZero es un Modelo de Acción del Mundo (WAM) de NVIDIA construido sobre un backbone de difusión de video preentrenado. A diferencia de los modelos estándar de Visión-Lenguaje-Acción, que tienen dificultades con movimientos físicos desconocidos, DreamZero aprende la dinámica prediciendo conjuntamente los estados futuros del mundo y las acciones futuras en una única pasada hacia adelante, tratando el video como una representación densa de cómo evoluciona el entorno.

Este modelado conjunto permite al sistema aprender habilidades diversas a partir de datasets de robots heterogéneos sin depender de demostraciones repetitivas. En experimentos con robots reales, DreamZero informa de una mejora de más de 2x en la generalización a nuevas tareas y entornos en comparación con las líneas base VLA de última generación.

DreamZero también demuestra una sólida transferencia entre encarnaciones. Aproximadamente entre 10 y 20 minutos de demostraciones en video de humanos u otros robots producen una mejora de más del 42 % en tareas no vistas. El modelo se adapta a una plataforma robótica completamente nueva (YAM) a partir de 30 minutos de datos de juego, preservando la generalización zero-shot.

Características clave:

  • Modelo de Acción del Mundo que predice conjuntamente video y acciones del robot.
  • Construido sobre un backbone de difusión de video autorregresivo de 14B parámetros.
  • Mejora de más de 2x en la generalización a nuevas tareas en comparación con los VLA de última generación.
  • Control en bucle cerrado de 7 Hz en tiempo real tras una aceleración de inferencia de 38x.
  • Admite prompting interactivo de cero disparos en tareas novedosas en entornos reales.

Casos de uso de los Modelos Fundamentales del Mundo

Robótica

En robótica, los Modelos Fundamentales del Mundo desempeñan un papel fundamental a la hora de permitir que los robots operen eficazmente en entornos dinámicos del mundo real mediante:

1. Desarrollar la inteligencia espacial

Los robots adquieren una comprensión de su entorno a través de entornos de entrenamiento simulados, lo que les permite navegar y manipular objetos con precisión.

2. Mayor eficiencia del aprendizaje

Los entornos simulados aceleran el entrenamiento al proporcionar escenarios controlados donde los robots pueden experimentar y aprender de los errores sin consecuencias físicas.

3. Generalización de tareas

Al integrar entradas de diversas modalidades, como sensores visuales, auditivos y táctiles, los Modelos Fundamentales del Mundo apoyan el aprendizaje por transferencia, lo que permite a los robots adaptarse a nuevos entornos y tareas con un reentrenamiento mínimo.

4. Planificación de tareas complejas

Estos modelos permiten a los robots realizar una planificación de largo horizonte, como ensamblar objetos, predecir acciones humanas o coordinarse con otros robots en entornos industriales o colaborativos.

Vehículos autónomos

Los modelos fundacionales del mundo pueden mejorar el ciclo de desarrollo de los vehículos autónomos (AV) mediante:

5. Entrenamiento con datos preetiquetados

Proporcionan datasets de video preetiquetados y codificados que permiten a los sistemas de vehículos autónomos identificar e interpretar con precisión los vehículos, peatones y objetos circundantes en condiciones diversas.

6. Generación de escenarios

Estos modelos pueden crear escenarios simulados, como diversos patrones de tráfico, condiciones meteorológicas y comportamientos de peatones, que llenan las lagunas de los datos de entrenamiento del mundo real.

7. Escalabilidad y localización

Los desarrolladores pueden utilizar entornos virtuales para replicar las condiciones de nuevas ubicaciones geográficas, lo que permite que los vehículos autónomos se adapten a diversas normativas viales, comportamientos culturales de conducción y diseños de infraestructura sin necesidad de pruebas exhaustivas en carretera.

8. Sensor fusion y calibración

Los WFM pueden simular entradas multisensor, como cámara, LiDAR, radar y GPS, dentro del mismo entorno. Esto ayuda a los sistemas AV a entrenarse para una fusion y calibración de sensores precisa, esencial para comprender la profundidad, la velocidad y el movimiento en contextos de conducción complejos.

9. Seguridad y eficiencia de costes

Los sistemas de vehículos autónomos pueden iterar y optimizarse en un entorno riesgo-free mediante pruebas en entornos virtuales, reduciendo los costes y la posibilidad de accidentes durante las pruebas en el mundo real.

Integración multimodal

10. WFM con otros recursos

La integración de los WFM con modelos de lenguaje de gran tamaño (LLMs) y otros recursos informáticos, como la computación de alto rendimiento (HPC), mejora los sistemas de IA física al añadir comprensión semántica.

Esta combinación es compatible con los modelos de lenguaje visual y las capacidades multimodales, lo que permite interacciones más sofisticadas con datos de imagen y video.

Tecnologías centrales de los Modelos Fundamentales del Mundo

La construcción de los Modelos Fundamentales del Mundo implica múltiples capas de procesos y tecnologías complejas, como la curación de datos, la tokenización, las redes neuronales, la representación interna y el fine-tuning y la especialización:

Obtención de datos

Los pipelines de curación se ejecutan sobre video recopilado, y el tamaño de ese conjunto establece un límite superior de lo que un modelo puede aprender. Cosmos cura 20 millones de horas de video, y DreamDojo se preentrena con aproximadamente 44.000 horas de material humano egocéntrico. Es difícil alcanzar volúmenes de ese nivel mediante la recopilación propia, ya que un solo laboratorio puede registrar un conjunto limitado de entornos, condiciones de iluminación y casos de fallo.

El video web público cubre una gama más amplia de escenas, tareas y geografías, por lo que los equipos suelen complementar el material grabado con material recopilado de fuentes abiertas. Dos requisitos determinan si una configuración de recopilación se mantiene a escala de entrenamiento:

  • Fiabilidad de la extracción: Herramientas como yt-dlp están diseñadas para descargas individuales, no para un rendimiento sostenido de petabytes. Por ejemplo, Bright Data informa de más del 99 % de éxito de extracción a ese volumen, en comparación con entre el 60 % y el 75 % de las herramientas de código abierto.
  • Búsqueda por contenido visual: Los títulos y las etiquetas rara vez describen lo que ocurre en un clip, lo que limita la búsqueda por palabras clave al ensamblar familias de tareas como pick-and-place o cruces de peatones bajo la lluvia. La API de búsqueda de video de Bright Data indexa más de mil millones de videos web y admite la recuperación basada en el contenido del material.

Curación de datos

La curación de datos es el primer paso en el desarrollo de modelos del mundo. Implica organizar, limpiar y preparar sistemáticamente extensos datasets del mundo real para garantizar que el modelo se entrene con información de alta calidad. Estos son los pasos de la curación de datos:

  • Filtrado: Identifica y conserva datos de alta calidad.
  • Anotación: Etiqueta objetos, acciones y eventos clave mediante modelos de lenguaje-visión.
  • Clasificación: Categoriza los datos para objetivos de entrenamiento específicos.
  • Deduplicación: Utiliza embeddings de video para identificar y eliminar datos redundantes y mejorar la eficiencia.

Procesamiento de video

El procesamiento de video implica:

  • Dividir y transcodificar el video en segmentos más pequeños.
  • Aplicar filtros de calidad para aislar datos relevantes de alta resolución.

Tokenización

La tokenización transforma los datos visuales brutos de alta dimensionalidad en unidades más pequeñas y manejables llamadas tokens, lo que simplifica los procesos de aprendizaje automático. Su objetivo es reducir las redundancias de los píxeles y convertirlos en tokens compactos y semánticamente significativos, lo que permite un entrenamiento y una inferencia del modelo más rápidos y eficientes.

Existen dos tipos de tokenización: discreta (que codifica los datos visuales como números enteros) y continua (que codifica los datos visuales como vectores continuos).

Redes neuronales y representación interna

En el núcleo de los modelos fundacionales del mundo se encuentran redes neuronales con miles de millones de parámetros. Estas redes analizan los datos para crear y actualizar un estado oculto o una representación interna del entorno.

Las capacidades clave incluyen:

  • Percepción: Extrae movimiento, profundidad y otros comportamientos dinámicos 3D de videos e imágenes.
  • Predicción: Anticipa objetos ocultos, patrones de movimiento y posibles eventos basándose en las representaciones aprendidas.
  • Adaptación: Refina continuamente el estado oculto mediante el aprendizaje profundo, garantizando la capacidad de respuesta a nuevos escenarios y entornos.

Arquitecturas de modelos

Los modelos fundacionales del mundo utilizan arquitecturas de redes neuronales especializadas para simular y predecir fenómenos físicos de manera eficaz:

Modelos de difusión

  • Funcionan refinando ruido aleatorio para generar videos de alta calidad.
  • Ideales para tareas como la generación de video y la transferencia de estilo.

Modelos autorregresivos

  • Generan video fotograma a fotograma, prediciendo cada fotograma posterior en función de los anteriores.
  • Adecuados para la compleción de video y la predicción de fotogramas futuros.

Fine-tuning y especialización

Inicialmente entrenados para tareas generales, los modelos fundacionales del mundo pueden someterse a fine-tuning para aplicaciones específicas.

Los frameworks de fine-tuning integran bibliotecas, SDKs y herramientas para simplificar la preparación de datos, el entrenamiento de modelos, la optimización del rendimiento y el despliegue de soluciones, al tiempo que permiten la adaptación a tareas especializadas en robótica, sistemas autónomos y otras aplicaciones.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

¿Qué son los Modelos Fundamentales del Mundo?

Los modelos fundacionales del mundo son sistemas de IA avanzados diseñados para simular y predecir los entornos del mundo real y su dinámica.

Estos modelos procesan diversos datos de entrada, como información textual, datos visuales como imágenes y videos, y datos relacionados con el movimiento, para crear simulaciones realistas e inmersivas de escenarios físicos y virtuales.

La capacidad central de los modelos fundacionales del mundo reside en su comprensión de los principios físicos fundamentales, como el movimiento, la fuerza, la causalidad y las relaciones espaciales.

Esto les permite simular cómo interactúan los objetos y las entidades dentro de un entorno determinado, ya sea el movimiento de un vehículo, la dinámica de un brazo robótico o la interacción de objetos en un mundo virtual.

Una aplicación clave de estos modelos es el desarrollo y perfeccionamiento de sistemas de IA física, como robots y vehículos autónomos. Al proporcionar un entorno seguro y controlado para el entrenamiento y las pruebas, estos modelos pueden reducir la necesidad de experimentación en el mundo real, que puede ser costosa, lenta y potencialmente peligrosa.

Además, los modelos fundacionales del mundo pueden generar contenido de video realista y de alta calidad, que puede utilizarse para diversos fines, como el entretenimiento, la educación y la investigación.

Su capacidad para simular entornos precisos y detallados los convierte en herramientas esenciales para los desarrolladores, ya que permiten mejoras del rendimiento de la IA más eficientes y precisas.

Sistemas de IA física: definición e importancia

Las aplicaciones de IA física se refieren a sistemas de inteligencia artificial equipados con sensores para percibir el mundo físico y actuadores para interactuar con él y modificarlo.

Permiten que máquinas autónomas, como robots, coches autónomos y otros dispositivos, realicen acciones complejas en entornos del mundo real.

A menudo descrita como “IA física generativa”, amplía los modelos de IA generativa con una comprensión de las relaciones espaciales y las reglas físicas que rigen el mundo 3D.

¿Cómo funciona la IA física?

La IA física generativa combina la IA generativa con datos del mundo físico para mejorar su funcionalidad.

Durante el entrenamiento, los sistemas de IA se exponen a simulaciones que imitan escenarios del mundo real. Estas simulaciones se basan en gemelos digitales, réplicas virtuales muy precisas de espacios físicos como fábricas, donde se introducen máquinas y sensores autónomos. El entorno virtual genera datos de entrenamiento 3D, capturando interacciones como el movimiento de objetos, las colisiones y la dinámica de la luz.

El aprendizaje por refuerzo es fundamental en este proceso. Permite que las máquinas aprendan habilidades mediante ensayo y error en estos entornos simulados. Se otorgan recompensas por completar las acciones deseadas, lo que permite a la IA adaptarse, mejorar y eventualmente dominar tareas con precisión. Este proceso dota a las máquinas de las sofisticadas habilidades motoras necesarias para aplicaciones en el mundo real.

¿Por qué son importantes los sistemas de IA física?

Anteriormente, las máquinas autónomas tenían dificultades para percibir e interactuar eficazmente con su entorno. La IA física supera esta limitación al permitir que los robots y otros dispositivos perciban, se adapten e interactúen con su entorno.

Los sistemas de IA física ayudan a mejorar la eficiencia, la seguridad y la accesibilidad en todas las industrias al crear máquinas capaces de realizar tareas complejas, desde procedimientos quirúrgicos hasta navegación en almacenes.

La IA física se basa en simulaciones avanzadas basadas en la física para entrenar máquinas en entornos seguros y controlados. Estas simulaciones aceleran el desarrollo, evitan daños durante las primeras etapas de aprendizaje y garantizan la preparación para el despliegue en el mundo real.

Estas son algunas de las aplicaciones de la IA física:

  • Robots móviles autónomos (AMR): Navegan por entornos de almacén complejos, evitan obstáculos y se adaptan a la retroalimentación de sensores en tiempo real.
  • Manipuladores: Realizan tareas delicadas como ajustar la fuerza de agarre y la posición en función de las poses de los objetos.
  • Robots humanoides: Requieren habilidades motoras finas y gruesas para percibir, navegar e interactuar en diversas tareas.
  • Espacios inteligentes: Los entornos interiores a gran escala, como almacenes y fábricas, se benefician de la IA física y la IA generativa en aplicaciones de cadena de suministro gracias a una mayor seguridad, una planificación dinámica de rutas y la eficiencia operativa. Modelos avanzados de visión por computadora monitorizan y optimizan las actividades priorizando la seguridad humana.
  • Robots quirúrgicos: Ejecutan operaciones de precisión, como suturas y enhebrado de agujas.

Ejemplo de la vida real:

ORBIT-Surgical, desarrollado por investigadores de la Universidad de Toronto, UC Berkeley, ETH Zurich, Georgia Tech y NVIDIA, es un framework de simulación de código abierto diseñado para entrenar robots quirúrgicos. Alivia la carga cognitiva de los cirujanos y mejora el rendimiento del equipo.

Construido sobre NVIDIA Isaac Sim, admite tareas inspiradas en la laparoscopia, como agarrar agujas, transferir objetos y realizar colocaciones precisas. Gracias a la aceleración de la GPU, puede entrenar robots rápidamente; tareas como la inserción de derivaciones se completan en menos de dos horas en una sola NVIDIA RTX GPU.

El framework también utiliza NVIDIA Omniverse para generar datos sintéticos de alta calidad para entrenar modelos de percepción de IA, mejorar el reconocimiento de herramientas y reducir la dependencia de datasets del mundo real.13

¿Por qué es importante el Modelo Fundamental del Mundo?

Construir modelos del mundo eficaces para la IA física a menudo requiere datasets enormes que son costosos y lentos de recopilar, especialmente cuando se trata de capturar la amplia gama de escenarios del mundo real necesarios para un entrenamiento integral.

Los Modelos Fundamentales del Mundo (WFM) pueden abordar este reto generando datos sintéticos. Estos datos son ricos, variados y escalables, y permiten a los desarrolladores entrenar sistemas de IA de manera más eficaz sin los problemas logísticos de recopilar información del mundo real.

Los datasets sintéticos creados por los WFM también ayudan a llenar las lagunas en escenarios que podrían ser raros o difíciles de replicar en el mundo real.

El entrenamiento y las pruebas de los sistemas de IA física en entornos del mundo real plantean retos importantes. Entre ellos se incluyen los altos costes, los riesgos potenciales para los equipos o el entorno, y la dificultad de mantener condiciones controladas para realizar pruebas coherentes.

Los Modelos Fundamentales del Mundo ofrecen una solución al proporcionar entornos 3D virtuales muy realistas donde los sistemas de IA pueden entrenarse y probarse de forma segura. Estos entornos permiten a los desarrolladores simular interacciones físicas complejas, probar nuevas capacidades y perfeccionar los comportamientos de la IA de forma controlada y repetible.

Video de NVIDIA que explica los sistemas de IA física.

Beneficios de los Modelos Fundamentales del Mundo

Al aprovechar los Modelos Fundamentales del Mundo, los investigadores e ingenieros pueden acelerar los ciclos de desarrollo, reducir costes y minimizar los riesgos mientras construyen sistemas de IA física más robustos y adaptables.

Este enfoque puede ayudar a crear aplicaciones de IA avanzadas y garantizar un despliegue más seguro y eficiente en escenarios del mundo real.

Mejora de la toma de decisiones y la planificación

Los Modelos Fundamentales del Mundo mejoran los sistemas de IA física al simular posibles escenarios futuros basados en diversas secuencias de acciones. Mediante el uso de módulos integrados de coste o recompensa, estos modelos evalúan los resultados para identificar estrategias óptimas.

Esta previsión permite a los creadores de IA física resolver desafíos complejos, garantizando eficiencia, adaptabilidad y seguridad en entornos dinámicos.

Simulaciones realistas y físicamente precisas

Los Modelos Fundamentales del Mundo, incluidos los modelos de difusión de NVIDIA, generan simulaciones 3D de alta fidelidad al comprender cómo se mueven e interactúan los objetos. Estas simulaciones son fundamentales para entrenar a la IA de percepción y probar vehículos autónomos o sistemas robóticos en entornos diversos.

Por ejemplo, los coches autónomos pueden evaluarse en diversas condiciones meteorológicas y de tráfico, mientras que los robots pueden probarse en la manipulación de objetos y el rendimiento de tareas antes de su despliegue en el mundo real.

Inteligencia predictiva

Los Modelos Fundamentales del Mundo proporcionan inteligencia predictiva, lo que permite a los sistemas de IA física anticipar escenarios y tomar decisiones informadas basadas en el entrenamiento con video y los datos históricos.

Aprovechando la generación de video a mundo y la generación de videos con conciencia física, estos modelos ayudan a optimizar estrategias, mejorar la seguridad y aumentar la adaptabilidad en las configuraciones de IA física.

Desarrollo mejorado de políticas con Modelos Fundamentales del Mundo

Evaluación de políticas: Los Modelos Fundamentales del Mundo, como los modelos Cosmos de NVIDIA, permiten a los desarrolladores de sistemas de IA física probar y perfeccionar modelos de políticas en entornos virtuales en lugar del mundo físico.

Este método utiliza gemelos digitales y es rentable y eficiente en tiempo. Permite realizar pruebas diversas en condiciones no vistas, y los desarrolladores pueden centrar las tareas y recursos de IA física en políticas prometedoras descartando rápidamente las ineficaces.

Inicialización de políticas: Los Modelos Fundamentales del Mundo proporcionan una base sólida para inicializar modelos de políticas al modelar la física y la dinámica del mundo real. Este enfoque aborda los desafíos de escasez de datos y acelera el desarrollo de modelos de IA física.

Entrenamiento de políticas: Combinados con modelos de recompensa, los Modelos Fundamentales del Mundo actúan como sustitutos del mundo físico en configuraciones de aprendizaje por refuerzo. Estos modelos proporcionan retroalimentación que ayuda a realizar fine-tuning de los modelos de políticas mediante interacciones simuladas, mejorando sus capacidades.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Futuro de las plataformas de Modelos Fundamentales del Mundo

Se espera que las aplicaciones de los modelos fundacionales del mundo se extiendan mucho más allá de los vehículos autónomos y la robótica. Algunas de las posibles aplicaciones futuras de los Modelos Fundamentales del Mundo incluyen:

Sanidad

Estos modelos pueden permitir el entrenamiento simulado de robots quirúrgicos y dispositivos médicos, garantizando precisión y seguridad durante procedimientos complejos y mejorando en última instancia los resultados de los pacientes.

Educación y formación

Los entornos virtuales pueden proporcionar simulaciones inmersivas para la educación y la formación, específicamente para operadores de maquinaria pesada, pilotos y personal de emergencias, replicando escenarios de alto riesgo sin los peligros del mundo real.

Juegos y entretenimiento

Al crear personajes de IA más interactivos y adaptativos, estos modelos pueden transformar las experiencias de realidad aumentada, haciéndolas más atractivas y realistas.

Planificación urbana

Los planificadores urbanos pueden aprovechar estos modelos para simular patrones de tráfico, dinámicas peatonales y cambios en la infraestructura, optimizando los diseños antes de su implementación física.

Seguridad y defensa

Se espera que los modelos del mundo sean esenciales en el entrenamiento de drones y agentes autónomos para vigilancia, misiones de búsqueda y rescate, y respuesta ante desastres, todo ello dentro de escenarios virtuales seguros y controlados.

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani and Sıla Ermut (2026) - "Modelos Fundamentales del Mundo: 10 casos de uso". Publicado en línea en AIMultiple.com. Recuperado el 10 de Agosto de 2026, de: https://aimultiple.com/world-foundation-model [Recurso en línea]

Dilmegani, C., & Ermut, S. (2026, 10 de Agosto). Modelos Fundamentales del Mundo: 10 casos de uso. AIMultiple. https://aimultiple.com/world-foundation-model

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Ermut, Sıla},
  title  = {{Modelos Fundamentales del Mundo: 10 casos de uso}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/world-foundation-model}},
  note   = {AIMultiple. Recuperado el 10 de Agosto de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 3 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene un archivo CSV.

Última actualización: 17 de Agosto de 2026
Descargar

Registro de cambios

7 actualizaciones
  1. 2026

    Se reemplazó la sección "Casos de uso de modelos de base mundial" por la sección "Los 9 principales modelos de base mundial".

  2. Se amplió la sección de Robótica con nueva información sobre vehículos autónomos, integración multimodal, Alpamayo de NVIDIA y GR00T N1.6 de NVIDIA Research.

  3. 2025

    Se añadió PAN y World Labs' Marble a la sección "Planificación de tareas complejas".

  4. Se añadió Genie 3 de Google DeepMind a la sección de ejemplo de la vida real.

  5. Se añadió Meta V-JEPA 2 a la sección de ejemplo de la vida real.

  6. Se amplió la introducción a los Modelos Fundacionales Mundiales con detalles sobre robótica, vehículos autónomos e integración multimodal.

  7. Se añadió la integración multimodal a la sección Modelos Fundacionales Mundiales.

Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017.

El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]

A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.

Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.

Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo
Investigado por
Sıla Ermut
Sıla Ermut
Analista de la industria
Sıla Ermut es analista de la industria en AIMultiple y cubre modelos de IA, infraestructura de IA, gobernanza de IA y aplicaciones empresariales de IA. Su investigación se centra principalmente en el uso de la IA en marketing, atención sanitaria, cadenas de suministro y sostenibilidad.
Anteriormente trabajó como reclutadora en empresas de gestión de proyectos y consultoría. Sıla tiene un máster en Psicología Social y una licenciatura en Relaciones Internacionales.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450