NVIDIA lanza Cosmos 3, modelo foundation para razonamiento y acción de robots y vehículos autónomos
Hecho Qué ha ocurrido
NVIDIA ha presentado Cosmos 3, un modelo foundation multimodal de código abierto diseñado para sistemas de IA física (robots, vehículos autónomos y espacios inteligentes). El modelo combina razonamiento visual, generación multimodal (texto, vídeo, imágenes, sonido ambiental) y predicción de acciones en una única arquitectura de mezcla de transformadores. Cosmos 3 es capaz de generar datos de acción nativos como ángulos articulares y trayectorias, permitiendo que desarrolladores creen datos sintéticos de entrenamiento a escala sin necesidad de capturar escenarios reales repetidamente.
Resumen generado mediante IA a partir de NVIDIA Blog (original en inglés). Naturaleza de la información: hecho documentado.
Análisis Por qué importa
Para empresas de robótica industrial, vehículos autónomos e infraestructuras inteligentes, Cosmos 3 reduce significativamente el coste y tiempo de desarrollo al permitir generar datos de entrenamiento sintéticos físicamente plausibles en lugar de capturar datos reales costosos. El modelo abre la posibilidad de que sistemas autónomos aprendan a razonar sobre situaciones impredecibles (atropellos, colisiones) sin exposición a riesgos reales.
- Quién se ve afectado
- Desarrolladores de robótica, fabricantes de vehículos autónomos, empresas de automatización industrial, operadores de infraestructuras críticas (ciudades inteligentes, fábricas, almacenes) y proveedores de soluciones de visión por computadora.
- Qué puede cambiar
- Los equipos de IA física podrán entrenar modelos de política robótica más rápidamente y a menor coste usando datos sintéticos generados por Cosmos 3, acelerando la comercialización de robots y sistemas autónomos. La capacidad de razonamiento predictivo mejora la seguridad de sistemas que operan en entornos dinámicos.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Adopción de Cosmos 3 entre fabricantes de robots (Agile Robots ya lo utiliza) y operadores de infraestructura inteligente; rendimiento en benchmarks de generación de vídeo y razonamiento de tráfico frente a competidores; disponibilidad de herramientas simplificadas en build.nvidia.com y GitHub; integración con microsservicios NVIDIA NIM en producción.
Recomendación Qué debería hacer una empresa
Empresas de robótica e industria 4.0 deben evaluar Cosmos 3 en los próximos 3-6 meses como base para acelerar ciclos de entrenamiento de políticas; acceso abierto (Hugging Face, licencia OpenMDW 1.1) lo hace viable para POCs inmediatos sin compromisos de largo plazo.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: NVIDIA Blog (fuente primaria). La referencia es siempre el artículo original.
Ver fuente original ↗mundo modelogeneración de vídeorazonamiento visualmultimodalrobótica NVIDIAAgile RobotsLinker Vision datos sintéticosIA físicaNVIDIA Cosmos 3robóticavehículos autónomos
Tu opinión
0 comentarios
Relacionadas
NVIDIA amplía IA para medios: detección de vídeo sintético y herramientas de producción en vivo
En la conferencia IBC 2026 en Ámsterdam, NVIDIA anunció una expansión de NVIDIA AI for Media, con SDKs y microservicios NIM para detección de vídeo sintético…
Por qué importaEstas herramientas permiten a broadcasters y plataformas de streaming automatizar verificación de autenticidad, localización y producción en vivo…
Google DeepMind recrea con IA un recuerdo no fotografiado en el documental 'Love, Rendered'
Google DeepMind colaboró con Primordial Soup, la productora de Darren Aronofsky, y la directora Liz Garbus para crear el documental 'Love, Rendered', que usa…
Por qué importaIlustra un uso creativo y emocional de modelos generativos de imagen y vídeo más allá de aplicaciones empresariales, mostrando capacidades de…
IBM lanza Granite Time Series PatchTST-FM-r2, modelo de pronóstico con licencia comercial abierta
IBM ha publicado PatchTST-FM-r2, un modelo de series temporales de 385M de parámetros con licencia dual Apache 2.0 y OpenMDW 1.0. Según el benchmark GIFT-Eval…
Por qué importaOfrece a empresas un modelo de forecasting de alto rendimiento sin restricciones de licencia, evitando entrenar modelos específicos por dataset y…
Amazon Prime Video usará IA para sincronizar labios con doblajes, empezando por Maxton Hall
Amazon Prime Video implementará una herramienta de IA que sincroniza los movimientos labiales de actores con las pistas de audio dobladas, según reportó…
Por qué importaEs un ejemplo concreto de cómo las grandes plataformas de streaming están normalizando el uso de IA generativa en producción audiovisual pese a la…