Ir al contenido
IA para hoy
Herramientas y productos Lanzamiento

Alibaba lanza Qwen3.5-Omni, modelo multimodal que genera código desde instrucciones de voz y vídeo

Hecho Qué ha ocurrido

Alibaba ha lanzado Qwen3.5-Omni, un modelo de IA omnimmodal que procesa texto, imágenes, audio y vídeo. El modelo supera a Gemini 3.1 Pro en tareas de audio y desarrolló una capacidad emergente no entrenada explícitamente: escribir código desde instrucciones habladas y entrada de vídeo. El modelo maneja contextos de hasta 256.000 tokens, procesa más de 10 horas de audio y más de 400 segundos de vídeo en 720p, y está disponible como servicio API.

Resumen generado mediante IA a partir de The Decoder (original en inglés). Naturaleza de la información: hecho documentado.

Análisis Por qué importa

La capacidad emergente de generación de código multimodal (audio-visual) sin entrenamiento específico sugiere que los modelos omnimmodales pueden desarrollar habilidades impredecibles al escalar. Para empresas, esto abre nuevas formas de interacción con sistemas de IA y mejora significativamente la experiencia en interfaces conversacionales reales.

Quién se ve afectado
Desarrolladores, empresas de software, plataformas de IA conversacional, servicios de atención al cliente y sectores que requieren procesamiento multimodal en tiempo real.
Qué puede cambiar
Las interfaces de programación podrían evolucionar hacia sistemas capaces de entender descripciones verbales y visuales complejas sin código tradicional. Los asistentes de IA en tiempo real ganarán robustez en manejo de múltiples modalidades y contextos prolongados.

Análisis generado a partir de la información disponible; no procede de la fuente.

Predicción Qué observar a continuación

Adopción de Qwen3.5-Omni en aplicaciones empresariales y evaluaciones independientes de la calidad de código generado. Reacción de OpenAI y Google ante estas capacidades multimodales. Salida de talento clave en Alibaba (partida de Junyang Lin) y su impacto en futuras iteraciones.

Recomendación Qué debería hacer una empresa

Evaluar Qwen3.5-Omni como alternativa para aplicaciones que requieren procesamiento de audio y vídeo en tiempo real en los próximos 6-12 meses, especialmente en atención al cliente y automatización de flujos complejos.

Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.

Compartir WhatsApp LinkedIn X Bluesky Telegram
Enviar esta noticia por correo

Se envía esta noticia con su análisis. La dirección se usa solo para ese envío y no se guarda.

Fuente original: The Decoder. La referencia es siempre el artículo original.

Ver fuente original ↗

multimodalomnimodalLLMspeech synthesisaudio AlibabaGoogle DeepMindOpenAI Alibabacódigo desde vozIA conversacionalmodelos multimodalesQwen3.5-Omni

Tu opinión

0 comentarios

Sin registro. La primera vez te pediremos confirmar el correo y el comentario pasará por moderación; después se publican al momento si cumplen las normas. Se guarda un resumen de tu IP para evitar abusos.

Relacionadas

AWS publica guía para desplegar el modelo abierto Qwen3.8-2.4T-A95B en SageMaker HyperPod

Alibaba lanzó el 12 de agosto de 2026 Qwen3.8-2.4T-A95B, un modelo de pesos abiertos con 2,4 billones de parámetros totales (95.000 millones activados por…

Por qué importaEs la primera vez que un modelo de la clase Qwen-Max se libera en pesos abiertos, lo que da a las empresas una alternativa autoalojada frente a APIs…

Impacto medio Fiabilidad una fuente fiable AWS Machine Learning Blog
Herramientas y productos 2 fuentes

GPT-6 Astra de OpenAI llega a Amazon Bedrock para empresas

OpenAI puso a disposición GPT-6 Astra en Amazon Bedrock para uso general de organizaciones. El modelo permite escribir código, analizar datos y automatizar…

Por qué importaLa disponibilidad en Bedrock facilita que empresas que ya usan infraestructura AWS integren un modelo avanzado de OpenAI sin depender de su API…

Impacto medio Fiabilidad varias fuentes Infobae Tecno

Suno lanza v6, su primer modelo musical de IA con licencias de discográficas

Suno ha lanzado v6, la nueva versión de su modelo de generación musical con IA, entrenado con datos que incluyen contenido licenciado de Warner Music Group…

Por qué importaEs el primer modelo de Suno respaldado por acuerdos de licencia con la industria discográfica, tras años de disputas legales por uso no autorizado de…

Impacto bajo Fiabilidad una fuente fiable The Verge AI
Herramientas y productos 10 fuentes

Apple lanza el iPhone Duo plegable y el iPhone 18 Pro con Siri AI mejorada

Apple presentó el iPhone Duo, su primer smartphone plegable, junto con el iPhone 18 Pro con cámara de apertura variable y chip A20 Pro. El evento marcó el…

Por qué importaEl lanzamiento consolida la apuesta de Apple por la IA on-device y abre la categoría de plegables premium, con implicaciones para fabricantes de…

Impacto bajo Fiabilidad confirmado por varias fuentes El Español Omicrono