Google DeepMind lanza Gemini 3.5 Transcribe, modelo de voz a texto en tiempo real

Hecho Qué ha ocurrido
Google DeepMind presenta Gemini 3.5 Transcribe, un modelo de transcripción de voz disponible en la Gemini API, Google AI Studio y Gemini Enterprise Agent Platform. Según Artificial Analysis, mejora el tiempo hasta transcripción final en un 70% respecto a Chirp 3, y en el benchmark FLEURS logra un WER de 5,50% en streaming y 5,04% en no streaming. El modelo ofrece atribución de hablantes, marcas de tiempo por palabra, cambio de idioma en vivo y limpieza de disfluencias, y ya se integra en Gboard, Antigravity, Chrome, Gemini app y Android (Rambler).
Resumen generado mediante IA a partir de Google DeepMind (original en inglés). Naturaleza de la información: declaración de parte interesada.
Análisis Por qué importa
Una transcripción más precisa y rápida reduce fricción en agentes de voz, atención al cliente y análisis de llamadas, áreas donde el error de reconocimiento y la latencia son barreras críticas de adopción.
- Quién se ve afectado
- Desarrolladores de voz IA, empresas de atención al cliente, centros de contacto y proveedores de plataformas de streaming en tiempo real como LiveKit o LangChain.
- Qué puede cambiar
- Empresas que dependían de servicios de transcripción menos precisos podrán construir agentes de voz y pipelines de análisis post-llamada con menor coste de post-procesado y mayor precisión multilingüe.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar la adopción por integradores como Agora, LiveKit o Pipecat, la disponibilidad de precios públicos y comparativas independientes de WER frente a competidores como Whisper o AssemblyAI.
Recomendación Qué debería hacer una empresa
Los equipos que operan centros de contacto o agentes de voz deberían evaluar Gemini 3.5 Transcribe en pruebas piloto en los próximos 3-6 meses frente a su solución actual de STT.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Fuente original: Google DeepMind (fuente primaria). La referencia es siempre el artículo original.
Ver fuente original ↗vozLLMedge AI APIGeminiGoogle DeepMindtranscripciónvoz a texto
Relacionadas
Google y Cathay Pacific amplían pruebas de IA para evitar estelas de condensación
Google Research está ampliando con Cathay Pacific un programa piloto que usa IA, imágenes satelitales y datos meteorológicos para ajustar ligeramente la…
Por qué importaEs un ejemplo de aplicación de IA a un problema climático concreto en un sector con difícil descarbonización, usando infraestructura existente sin…
Gemini Spark de Google ya puede gestionar bibliotecas de Google Photos
Google anunció que su agente personal Gemini Spark puede ejecutar tareas en Google Photos, como editar imágenes, curar álbumes, crear álbumes compartidos…
Por qué importaEs un ejemplo más de cómo las grandes tecnológicas integran agentes de IA en servicios de consumo masivo, buscando justificar el valor de las…
Instagram etiqueta erróneamente fotos reales como contenido generado por IA
Usuarios de Instagram reportan que Meta está aplicando la etiqueta 'AI Content' a imágenes que no fueron creadas ni editadas con IA generativa, mientras…
Por qué importaEl fallo erosiona la confianza en los sistemas de etiquetado de IA de las grandes plataformas justo cuando la detección de contenido sintético se…
Microsoft lanza Project Zenith, Windows optimizado para desarrolladores de IA local
Microsoft ha bautizado como Project Zenith su experiencia de Windows optimizada para desarrolladores, orientada a nuevos dispositivos con 64GB o más de memoria…
Por qué importaPermite a desarrolladores experimentar con modelos grandes de IA sin depender de la nube, reduciendo costes y latencia en fases de prototipado…



