Ir al contenido
IA para hoy

Lo esencial del día

NVIDIA unifica visión, audio y vídeo en Nemotron 3 Nano Omni

28 de abril de 2026, 14:00

El día está marcado por el lanzamiento de Nemotron 3 Nano Omni, el modelo multimodal abierto de NVIDIA que llega simultáneamente a Hugging Face, AWS y más de 25 plataformas. En el plano empresarial, la española Freepik se reinventa como Magnific y OpenAI amplía su presencia en la nube de Amazon.

Nemotron 3 Nano Omni: un solo modelo para agentes multimodales

Fotografía de archivo que ilustra: NVIDIA lanza Nemotron 3 Nano Omni, modelo multimodal unificado para agentes más eficientes
Foto: Brett Sayles · Licencia Pexels · Pexels

NVIDIA presenta un modelo abierto de 30B con mezcla de expertos que integra visión, audio y lenguaje en una única arquitectura, con hasta 9 veces más rendimiento que alternativas abiertas. Empresas como Foxconn, Palantir o Eka Care ya lo adoptan, mientras Dell, Oracle e Infosys lo evalúan.

Freepik pasa a llamarse Magnific y se centra en IA creativa

Fotografía de archivo que ilustra: Freepik se rebautiza como Magnific y pivota hacia plataforma de IA creativa
Foto: Matheus Bertelli · Licencia Pexels · Pexels

La compañía malagueña unifica generación de imagen y vídeo, upscaling, audio y colaboración en una sola plataforma, con 200 millones de euros de ingresos recurrentes y un millón de suscriptores. Es un caso poco habitual de empresa europea compitiendo con los grandes de la IA generativa sin financiación masiva.

OpenAI lleva GPT, Codex y agentes gestionados a AWS

Ilustración generada con IA sobre: OpenAI lleva sus modelos GPT, Codex y Managed Agents a AWS
Ilustración generada con IA por IA para hoy

Las empresas podrán desplegar los modelos y agentes de OpenAI dentro de sus propios entornos en la nube de Amazon. Reduce la fricción técnica y de seguridad para organizaciones ya asentadas en AWS.

El modelo de NVIDIA llega a SageMaker JumpStart

Fotografía de archivo que ilustra: NVIDIA Nemotron 3 Nano Omni disponible en SageMaker JumpStart para agentes multimodales
Foto: Melih Can · Licencia Pexels · Pexels

AWS ofrece Nemotron 3 Nano Omni con contexto de 131K tokens, razonamiento encadenado y llamadas a herramientas, procesando vídeo, audio, imagen y texto en una sola inferencia. Consolida pipelines separados y recorta latencia y costes de orquestación.

AWS explica cómo pasar de agentes de texto a voz

Fotografía de archivo que ilustra: AWS publica guía para migrar agentes de texto a asistentes de voz con Nova 2 Sonic
Foto: cottonbro studio · Licencia Pexels · Pexels

Una guía técnica detalla la migración a asistentes de voz con Amazon Nova 2 Sonic: latencia ultrabaja, streaming bidireccional, detección de actividad de voz y gestión de interrupciones. Útil para planificar proyectos reales en finanzas, sanidad o comercio.

Talkie, un modelo entrenado solo con textos anteriores a 1931

Ilustración generada con IA sobre: Talkie: modelo de lenguaje de 13B entrenado solo con textos anteriores a 1931
Ilustración generada con IA por IA para hoy

Un modelo de 13B entrenado con 260.000 millones de tokens de dominio público, publicado bajo Apache 2.0. Explora una vía de entrenamiento sin riesgo de litigios por derechos de autor.

La tendencia del día es clara: menos modelos especializados y más arquitecturas únicas que simplifican los sistemas de agentes; conviene vigilar el coste real de estos despliegues en producción.

Días anteriores

Ver todo el archivo de resúmenes