Google lanza Gemini 3.8 Live, modelos de voz en tiempo real vía WebSockets

Hecho Qué ha ocurrido
Google presentó Gemini 3.8 Live y 3.8 Live Extended Thinking, dos modelos speech-to-speech comparables a la familia GPT-Live de OpenAI. El desarrollador Simon Willison creó una interfaz web para probarlos, que se conecta al endpoint WebSocket BidiGenerateContent de Google usando la Web Audio API, permitiendo conversaciones de voz interrumpibles en el navegador.
Resumen generado mediante IA a partir de Simon Willison (original en inglés). Naturaleza de la información: hecho documentado.
Análisis Por qué importa
Los modelos de voz en tiempo real son clave para asistentes conversacionales y atención al cliente automatizada, y esta demo muestra lo accesible que resulta ya construir prototipos funcionales con APIs abiertas.
- Quién se ve afectado
- Desarrolladores de aplicaciones conversacionales, equipos de atención al cliente y empresas que evalúan asistentes de voz con IA.
- Qué puede cambiar
- Se reduce la barrera técnica para integrar voz en tiempo real en productos propios, ya que no requiere librerías complejas, solo WebSockets y Web Audio API.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar la adopción de estos modelos frente a GPT-Live de OpenAI, precios de la API y casos de uso reales en producción más allá de demos.
Recomendación Qué debería hacer una empresa
Equipos técnicos interesados en asistentes de voz pueden evaluar un prototipo con la API de Gemini Live en los próximos 3 meses para valorar latencia y calidad frente a alternativas.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: Simon Willison. La referencia es siempre el artículo original.
Ver fuente original ↗vozLLMWebSockets GoogleOpenAI Gemini LiveGooglevozWebSockets
Forma parte de la historia Google lanza modelos de voz Gemini 3.8 Live (3 noticias, estado: alto impacto).
Tu opinión
0 comentarios
Relacionadas
Google lanza Gemini 3.8 Live, modelo de voz que compite con GPT-Live-1 de OpenAI a menor precio
Google DeepMind lanzó Gemini 3.8 Live y su variante Extended Thinking, dos modelos de voz disponibles vía API y Google AI Studio. La variante Extended Thinking…
Por qué importaEl precio agresivo de Google puede acelerar la adopción de agentes de voz en aplicaciones empresariales, aunque OpenAI mantendría ventaja en…
Google DeepMind lanza Gemini 3.8 Live y Live Extended Thinking para voz en tiempo real
Google DeepMind presenta Gemini 3.8 Live y 3.8 Live Extended Thinking, sus modelos de diálogo en vivo más avanzados, disponibles vía API, Google Workspace y…
Por qué importaEstos modelos acercan la voz como interfaz principal para agentes empresariales capaces de ejecutar tareas complejas mientras mantienen conversación…
Apple lanzará Siri con IA en español a partir de octubre de 2026 tras el estreno de iOS 27
Apple confirmó que la nueva Siri con inteligencia artificial, incluida en iOS 27.0 lanzado el 14 de septiembre de 2026, llegará al español, francés, japonés…
Por qué importaEs una actualización de producto de consumo masivo que amplía el acceso de IA conversacional integrada al ecosistema Apple para millones de usuarios…
Salesforce y NVIDIA presentan Koa, modelo de razonamiento CRM basado en Nemotron 3 Super
En Dreamforce, Salesforce presentó Koa, su primer modelo de razonamiento para CRM, construido mediante post-entrenamiento de NVIDIA Nemotron 3 Super sobre…
Por qué importaIlustra la tendencia de grandes empresas de software a construir modelos propios sobre bases abiertas para controlar datos y costes, en lugar de…



