Meta lanza Muse Voice Transcribe, modelo de transcripción en tiempo real de bajo coste

Hecho Qué ha ocurrido
Meta Superintelligence Labs lanzó Muse Voice Transcribe, un modelo de transcripción de voz en tiempo real que procesa audio en fragmentos de 80 milisegundos, distingue hasta más de 20 hablantes y detecta límites de oración. Según Artificial Analysis, alcanza 3.1% de tasa de error en inglés con 0.16 segundos de latencia, superando a competidores como ElevenLabs, AssemblyAI y Cartesia, con un precio de 0.18 dólares por hora, inferior al de sus rivales. El modelo ya alimenta el dictado por voz en Meta AI y Muse Code, y está disponible vía Meta Model API, aunque no se publican los pesos ni detalles de entrenamiento.
Resumen generado mediante IA a partir de The Decoder (original en inglés). Naturaleza de la información: declaración de parte interesada.
Análisis Por qué importa
Meta apuesta por competir en precio y latencia en transcripción en tiempo real, sentando las bases para asistentes de IA que 'escuchan' continuamente a través de dispositivos como sus gafas con cámara.
- Quién se ve afectado
- Empresas de atención al cliente, desarrolladores de asistentes de voz y fabricantes de dispositivos wearables con IA.
- Qué puede cambiar
- La transcripción en tiempo real de alta precisión y bajo coste puede acelerar la integración de agentes de voz persistentes en aplicaciones empresariales y dispositivos personales.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar la adopción del modelo en productos de terceros, la evolución de precios de la competencia (OpenAI, ElevenLabs) y el debate regulatorio sobre dispositivos que graban conversaciones continuamente.
Recomendación Qué debería hacer una empresa
Evaluar en los próximos 3-6 meses la integración de APIs de transcripción en tiempo real de bajo coste como Muse Voice Transcribe para casos de uso de atención al cliente y actas de reuniones.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Fuente original: The Decoder. La referencia es siempre el artículo original.
Ver fuente original ↗vozmodelos multimodaltiempo real asistentes de IAgafas inteligentesMetatranscripciónvoz
Relacionadas
WhatsApp probará chats dedicados para conectar agentes de IA de terceros
WhatsApp está probando en la beta de Android (v2.26.35.3) una función que permite conectar hasta cinco agentes de IA de terceros mediante API, cada uno con su…
Por qué importaConvertir WhatsApp en una plataforma de acceso a agentes de IA externos amplía su rol como canal de distribución para empresas de IA y…
Microsoft lanza Project Zenith: Windows preconfigurado para IA local sobre chips AMD Ryzen AI Halo
Microsoft presentó en IFA Berlín 2026 Project Zenith, una imagen de Windows 11 preconfigurada para desarrolladores en dispositivos certificados con 64 GB o más…
Por qué importaPermite a equipos de desarrollo ejecutar modelos grandes localmente sin depender de APIs cloud, reduciendo latencia, coste por token y exposición de…
Lenovo apuesta por IA híbrida local con su asistente Qira en IFA 2026
En IFA de Berlín, Lenovo presentó su visión de IA centrada en Qira, un asistente personal que funciona a través de PC, móviles, tablets y el Moto Watch Ultra…
Por qué importaLa estrategia de Lenovo refleja una tendencia hacia modelos de IA local que priorizan privacidad y reducción de dependencia de la nube, algo…
Magnific lanza conector MCP para generar imágenes y vídeo desde ChatGPT
Magnific ha lanzado un conector MCP que permite invocarlo con @magnific desde ChatGPT para generar imágenes, crear variantes de formato, transformar imágenes…
Por qué importaReduce la fricción entre ideación y producción de contenido visual, un problema habitual en equipos de marketing y contenido que hoy trabajan con…



