Google lanza modelos Gemini 3.8 Flash TTS con voces diseñadas desde texto y clonación de voz

Hecho Qué ha ocurrido
Google presenta Gemini 3.8 Flash TTS y Flash-Lite TTS, dos modelos de texto a voz que soportan más de 100 idiomas y permiten crear voces nuevas a partir de descripciones textuales. Incluyen clonación de voz desde muestras de 30 segundos con consentimiento verbal, más de 2.000 voces preestablecidas, modo de diálogo con dos voces y marca de agua SynthID inaudible. Están disponibles vía Gemini API, Google AI Studio, Gemini Notebook y Google Vids, con precios de 0,81 y 0,54 dólares por hora de audio hasta finales de 2026.
Resumen generado mediante IA a partir de The Decoder (original en inglés). Naturaleza de la información: declaración de parte interesada.
Análisis Por qué importa
Reduce drásticamente el coste y la complejidad de generar voces sintéticas personalizadas para doblaje, audiolibros, agentes de voz y contenido a escala, lo que puede acelerar su adopción empresarial.
- Quién se ve afectado
- Empresas de atención al cliente, estudios de doblaje, productoras de podcasts y videojuegos, y desarrolladores de agentes de voz.
- Qué puede cambiar
- Se abarata y democratiza la creación de voces personalizadas sin depender de actores de doblaje, y se facilita la localización multilingüe de contenido con control fino de estilo y emoción.
Análisis generado a partir de la información disponible; no procede de la fuente.
Predicción Qué observar a continuación
Vigilar la adopción por plataformas de desarrollo (Agora, LiveKit, Pipecat, Vercel), la disponibilidad de endpoints en la UE y posibles problemas de calidad como el 'speaker drift' detectado en pruebas iniciales.
Recomendación Qué debería hacer una empresa
Empresas con necesidades de doblaje, atención al cliente por voz o contenido multilingüe deberían evaluar Flash-Lite TTS en pruebas piloto durante los próximos 3-6 meses por su relación coste-escala.
Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.
Enviar esta noticia por correo
Fuente original: The Decoder. La referencia es siempre el artículo original.
Ver fuente original ↗voztexto a vozclonación de vozmultimodal GoogleGoogle DeepMind clonación de vozGeminiGoogleSynthIDtexto a voz
Forma parte de la historia Google DeepMind lanza Gemini 3.8 Flash TTS con clonación y diseño de voces (2 noticias, estado: en evolución).
Tu opinión
0 comentarios
Relacionadas
Google DeepMind lanza Gemini 3.8 Flash TTS y Flash-Lite TTS con voces personalizables
Google DeepMind presentó Gemini 3.8 Flash TTS y Flash-Lite TTS, sus nuevos modelos de texto a voz que permiten crear voces de personaje personalizadas y…
Por qué importaLa generación de voz sintética de alta calidad y personalizable abre nuevas posibilidades para doblaje global, agentes de voz conversacionales y…
NVIDIA detalla cómo usar Warp y MJWarp para acelerar simulación robótica en GPU
NVIDIA publica un tutorial técnico sobre cómo usar NVIDIA Warp y MJWarp, una implementación de la física de MuJoCo sobre GPU, para paralelizar hasta 2.048…
Por qué importaAcelerar la simulación física es clave para entrenar políticas de robótica mediante aprendizaje por refuerzo a gran escala, reduciendo tiempos y…
AWS detalla arquitectura agéntica para consultar vídeo con lenguaje natural
AWS presenta en su blog una arquitectura de inteligencia de vídeo conversacional basada en un agente único con Strands Agents SDK, que orquesta en tiempo de…
Por qué importaMuestra un patrón de arquitectura agéntica reutilizable donde el modelo decide qué servicios invocar en lugar de pipelines fijos, lo que reduce el…
AWS muestra cómo usar modelos abiertos como agente de codificación con Amazon Bedrock y OpenCode
AWS publicó una guía técnica para usar OpenCode, un agente de codificación de código abierto, junto a modelos de pesos abiertos como Kimi K3, GPT-OSS 120B y…
Por qué importaOfrece a las empresas una alternativa para reducir dependencia de proveedores cerrados de IA de codificación, con control sobre residencia de datos y…



