NVIDIA Physical AI: Cosmos 3, GR00T N2 y el stack para robótica en producción
Physical AI: qué es y por qué ahora
Physical AI define una clase de sistemas que no solo procesan información simbólica — perciben, razonan y actúan en el mundo físico. A diferencia de los modelos de lenguaje que operan en espacios discretos de tokens, los sistemas de Physical AI operan en espacios de estado-acción continuos: (s, a) ∈ S × A, donde S es el espacio de observaciones sensoriales (visión, propioceptores, tacto) y A es el espacio de acciones motoras. La complejidad fundamental es que el entorno no es estacionario, los objetos tienen propiedades físicas heterogéneas y las consecuencias de una acción incorrecta son físicamente irreversibles.
En GTC 2026, NVIDIA consolidó su posición como infraestructura de base para Physical AI con cuatro anuncios: Cosmos 3, GR00T N1.7 con licencia comercial, GR00T N2 Preview (DreamZero) e Isaac Lab 3.0 con el motor Newton. La tesis estratégica de Jensen Huang es directa: "toda empresa industrial se convertirá en empresa de robótica." El mercado inmediato son los 2 millones de robots industriales ya instalados de ABB, FANUC, KUKA y YASKAWA — no los humanoides futuros.
Cosmos 3: arquitectura del world foundation model
Cosmos 3 es el primer world foundation model que unifica tres capacidades en una sola arquitectura: generación sintética de mundos (video diffusion con física precisa), razonamiento visual (vision transformer sobre escenas 3D) y simulación de acciones (action-conditioned prediction). La novedad técnica respecto a modelos anteriores es la co-supervisión física: el modelo aprende simultáneamente de datos de video y de simulaciones con restricciones físicas explícitas (colisiones, fricción, deformación). Esto produce mundos sintéticos donde los objetos se comportan de forma físicamente consistente, cerrando parte del gap que hacía que los robots entrenados en simulación fallaran al contacto con materiales reales.
El gap simulación→realidad: formulación y solución
El problema de transferencia simulación→realidad puede formularse como un problema de cambio de distribución. Sea π* la política óptima aprendida en simulación y πreal su comportamiento en el mundo real. El gap se produce porque la distribución de observaciones en simulación Psim(o) difiere de la distribución real Preal(o): cuando el robot actúa según π*, encuentra observaciones fuera de la distribución de entrenamiento y la política degrada. Los enfoques previos mitigaban esto con domain randomization (DR): aleatorizar parámetros físicos de la simulación para cubrir el espacio de variabilidad real. El problema del DR es que aleatorizar sin restricciones físicas produce configuraciones imposibles en el mundo real.
Newton aborda esto desde la física del contacto: el problema más difícil en simulación de robots es modelar con precisión las fuerzas de contacto y fricción durante la manipulación dexterous. Newton, construido sobre NVIDIA Warp, implementa un solucionador de contacto diferenciable que permite gradientes a través de la dinámica de contacto — lo que hace posible el entrenamiento de políticas con retropropagación a través de la simulación física. Isaac Lab 3.0 escala este entrenamiento en infraestructura DGX mediante paralelización masiva: miles de entornos de simulación corriendo simultáneamente para convergencia rápida.
| Capacidad | Motores anteriores | Newton 1.0 |
|---|---|---|
| Dinámica de contacto | Rígida, no diferenciable | Diferenciable, gradientes a través del contacto |
| Deformación de materiales | No soportada | Multiphysics: sólidos, fluidos, deformables |
| Manipulación dexterous | Imprecisa en contacto rico | Alta fidelidad para manipulación de 5 dedos |
| Backpropagation | No soportado | Soportado vía NVIDIA Warp |
| Paralelización | Limitada (CPU-bound) | Masiva en GPU (DGX) |
Vision-Language-Action models: la arquitectura detrás de GR00T
GR00T N2 pertenece a la familia de modelos VLA (Vision-Language-Action). La arquitectura VLA extiende los transformers multimodales con una cabeza de predicción de acciones: el modelo recibe como entrada frames de visión (codificados por un vision encoder tipo ViT), instrucciones en lenguaje natural y el estado propioceptivo del robot (posiciones articulares, velocidades, fuerzas de contacto). La salida es una distribución de acciones sobre el espacio motor. DreamZero, la innovación de GR00T N2, introduce generación de trayectorias en espacio latente antes de proyectar a acciones motoras, lo que permite planificación a horizonte largo con coherencia temporal — el punto débil de los VLA anteriores que operaban en modo reactivo (acción a acción).
El ecosistema: 30+ partners estructurados por capa
La estrategia de NVIDIA no es vender chips a fabricantes de robots: es convertirse en el sistema operativo del Physical AI. El ecosistema se estructura en cuatro capas funcionales que juntas cubren el ciclo completo desde datos hasta acción. La cobertura de hardware (ABB, FANUC, KUKA, YASKAWA, Universal Robots — 2 millones de robots instalados) garantiza un mercado de retrofit inmediato. La capa quirúrgica (CMR Surgical, Johnson & Johnson MedTech, Medtronic) es la más exigente en términos de safety y trazabilidad — y también la de mayor valor por sistema desplegado. La integración con Hugging Face y LeRobot conecta el ecosistema open-source con los 13 millones de desarrolladores de IA a nivel global.
Arquitectura de despliegue: cloud para entrenamiento, edge para inferencia
El modelo de despliegue es híbrido por necesidad física: el entrenamiento requiere cómputo masivo paralelo (DGX, cloud providers) mientras que la inferencia requiere latencia de respuesta <50ms para control en tiempo real — incompatible con round-trips a la nube. Jetson Thor es el chip edge de NVIDIA diseñado para este caso: inferencia de GR00T con restricciones de potencia (~900 TOPS, 60W TDP) integrable en controladores de robots industriales existentes. La arquitectura resultante: entrenamiento y fine-tuning en cloud, modelo congelado desplegado en Jetson Thor, reentrenamiento periódico con datos recolectados en producción.
La capa que NVIDIA no resuelve: gobernanza de decisiones físicas
El stack de NVIDIA resuelve con elegancia la capa de inferencia y la capa de física. Lo que no resuelve — y es responsabilidad de quien opera el sistema — es la capa de gobernanza: ¿quién valida que el modelo toma las decisiones correctas antes del deploy? ¿Qué pasa cuando falla en un entorno quirúrgico? ¿Cómo se audita una decisión tomada a 30ms por un brazo robótico con 6 grados de libertad? Los VLA como GR00T son cajas negras: producen distribuciones de acción sin explicación del razonamiento intermedio. En entornos de alto riesgo, eso es un problema regulatorio y operacional.
La potencia computacional es necesaria. La accountability es lo que hace operable un sistema de Physical AI en entornos donde el error tiene consecuencias físicas irreversibles. Los estándares regulatorios emergentes — ISO 10218 para robótica industrial, IEC 62443 para sistemas de control, MDR para dispositivos médicos — requerirán evidencia de validación, trazabilidad de decisiones y capacidad de auditoría post-incidente. Quien opere estos sistemas necesitará esa capa antes de que el regulador la exija.
Conclusiones clave
- GR00T N2 con DreamZero introduce planificación de trayectorias en espacio latente, resolviendo el problema de coherencia temporal de los VLA reactivos anteriores.
- Newton physics engine implementa un solucionador de contacto diferenciable: por primera vez es posible retropropagar gradientes a través de la dinámica de contacto en simulación.
- Cosmos 3 cierra el gap sim→real mediante co-supervisión física: el modelo aprende simultáneamente de video real y simulaciones con restricciones físicas explícitas.
- El modelo de despliegue es híbrido obligatorio: entrenamiento masivo en cloud (DGX/Azure/CoreWeave), inferencia en edge con <50ms de latencia (Jetson Thor).
- Los 2M+ robots industriales instalados son el mercado inmediato de retrofit — no los humanoides. ABB, FANUC, KUKA y YASKAWA ya tienen integraciones activas.
- NVIDIA resuelve inferencia y física. La capa de gobernanza — trazabilidad por acción, guardrails físicos certificados, auditoría post-incidente — sigue siendo responsabilidad de quien opera el sistema.
