Alibaba lanza Qwen3.5-Omni, modelo multimodal que genera código desde instrucciones de voz y vídeo
Hecho Qué ha ocurrido
Alibaba ha lanzado Qwen3.5-Omni, un modelo de IA omnimmodal que procesa texto, imágenes, audio y vídeo. El modelo supera a Gemini 3.1 Pro en tareas de audio y desarrolló una capacidad emergente no entrenada explícitamente: escribir código desde instrucciones habladas y entrada de vídeo. El modelo maneja contextos de hasta 256.000 tokens, procesa más de 10 horas de audio y más de 400 segundos de vídeo en 720p, y está disponible como servicio API.
Resumen generado mediante IA a partir de The Decoder (original en inglés). Naturaleza de la información: hecho documentado.
Análisis Por qué importa
La capacidad emergente de generación de código multimodal (audio-visual) sin entrenamiento específico sugiere que los modelos omnimmodales pueden desarrollar habilidades impredecibles al escalar. Para empresas, esto abre nuevas formas de interacción con sistemas de IA y mejora significativamente la experiencia en interfaces conversacionales reales.
- Quién se ve afectado
- Desarrolladores, empresas de software, plataformas de IA conversacional, servicios de atención al cliente y sectores que requieren procesamiento multimodal en tiempo real.
- Qué puede cambiar
- Las interfaces de programación podrían evolucionar hacia sistemas capaces de entender descripciones verbales y visuales complejas sin código tradicional. Los asistentes de IA en tiempo real ganarán robustez en manejo de múltiples modalidades y contextos prolongados.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Adopción de Qwen3.5-Omni en aplicaciones empresariales y evaluaciones independientes de la calidad de código generado. Reacción de OpenAI y Google ante estas capacidades multimodales. Salida de talento clave en Alibaba (partida de Junyang Lin) y su impacto en futuras iteraciones.
Recomendación Qué debería hacer una empresa
Evaluar Qwen3.5-Omni como alternativa para aplicaciones que requieren procesamiento de audio y vídeo en tiempo real en los próximos 6-12 meses, especialmente en atención al cliente y automatización de flujos complejos.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: The Decoder. La referencia es siempre el artículo original.
Ver fuente original ↗multimodalomnimodalLLMspeech synthesisaudio AlibabaGoogle DeepMindOpenAI Alibabacódigo desde vozIA conversacionalmodelos multimodalesQwen3.5-Omni
Tu opinión
0 comentarios
Relacionadas
AWS publica guía para desplegar el modelo abierto Qwen3.8-2.4T-A95B en SageMaker HyperPod
Alibaba lanzó el 12 de agosto de 2026 Qwen3.8-2.4T-A95B, un modelo de pesos abiertos con 2,4 billones de parámetros totales (95.000 millones activados por…
Por qué importaEs la primera vez que un modelo de la clase Qwen-Max se libera en pesos abiertos, lo que da a las empresas una alternativa autoalojada frente a APIs…
GPT-6 Astra de OpenAI llega a Amazon Bedrock para empresas
OpenAI puso a disposición GPT-6 Astra en Amazon Bedrock para uso general de organizaciones. El modelo permite escribir código, analizar datos y automatizar…
Por qué importaLa disponibilidad en Bedrock facilita que empresas que ya usan infraestructura AWS integren un modelo avanzado de OpenAI sin depender de su API…
Suno lanza v6, su primer modelo musical de IA con licencias de discográficas
Suno ha lanzado v6, la nueva versión de su modelo de generación musical con IA, entrenado con datos que incluyen contenido licenciado de Warner Music Group…
Por qué importaEs el primer modelo de Suno respaldado por acuerdos de licencia con la industria discográfica, tras años de disputas legales por uso no autorizado de…
Apple lanza el iPhone Duo plegable y el iPhone 18 Pro con Siri AI mejorada
Apple presentó el iPhone Duo, su primer smartphone plegable, junto con el iPhone 18 Pro con cámara de apertura variable y chip A20 Pro. El evento marcó el…
Por qué importaEl lanzamiento consolida la apuesta de Apple por la IA on-device y abre la categoría de plegables premium, con implicaciones para fabricantes de…