Ir al contenido
IA para hoy
Herramientas y productos Lanzamiento 4/5 · Varias fuentes

Google lanza modelos Gemini 3.8 Flash TTS con voces diseñadas desde texto y clonación de voz

Google lanza modelos Gemini 3.8 Flash TTS con voces diseñadas desde texto y clonación de voz
Foto: Nishant Ghosh · Licencia Pexels · Pexels

Hecho Qué ha ocurrido

Google presenta Gemini 3.8 Flash TTS y Flash-Lite TTS, dos modelos de texto a voz que soportan más de 100 idiomas y permiten crear voces nuevas a partir de descripciones textuales. Incluyen clonación de voz desde muestras de 30 segundos con consentimiento verbal, más de 2.000 voces preestablecidas, modo de diálogo con dos voces y marca de agua SynthID inaudible. Están disponibles vía Gemini API, Google AI Studio, Gemini Notebook y Google Vids, con precios de 0,81 y 0,54 dólares por hora de audio hasta finales de 2026.

Resumen generado mediante IA a partir de The Decoder (original en inglés). Naturaleza de la información: declaración de parte interesada.

Análisis Por qué importa

Reduce drásticamente el coste y la complejidad de generar voces sintéticas personalizadas para doblaje, audiolibros, agentes de voz y contenido a escala, lo que puede acelerar su adopción empresarial.

Quién se ve afectado
Empresas de atención al cliente, estudios de doblaje, productoras de podcasts y videojuegos, y desarrolladores de agentes de voz.
Qué puede cambiar
Se abarata y democratiza la creación de voces personalizadas sin depender de actores de doblaje, y se facilita la localización multilingüe de contenido con control fino de estilo y emoción.

Análisis generado a partir de la información disponible; no procede de la fuente.

Predicción Qué observar a continuación

Vigilar la adopción por plataformas de desarrollo (Agora, LiveKit, Pipecat, Vercel), la disponibilidad de endpoints en la UE y posibles problemas de calidad como el 'speaker drift' detectado en pruebas iniciales.

Recomendación Qué debería hacer una empresa

Empresas con necesidades de doblaje, atención al cliente por voz o contenido multilingüe deberían evaluar Flash-Lite TTS en pruebas piloto durante los próximos 3-6 meses por su relación coste-escala.

Recomendación generada por IA con la evidencia disponible; no es asesoramiento profesional.

Compartir WhatsApp LinkedIn X Bluesky Telegram
Enviar esta noticia por correo

Se envía esta noticia con su análisis. La dirección se usa solo para ese envío y no se guarda.

Fuente original: The Decoder. La referencia es siempre el artículo original.

Ver fuente original ↗

voztexto a vozclonación de vozmultimodal GoogleGoogle DeepMind clonación de vozGeminiGoogleSynthIDtexto a voz

Fuentes de esta historia

Esta noticia forma parte de una historia cubierta por 2 publicaciones. La fiabilidad sube cuando varias fuentes independientes la confirman.

  1. Google DeepMind
    · varias fuentes · artículo original ↗
  2. The Decoder estás leyendo esta
    · varias fuentes · artículo original ↗

Ver la historia completa con su línea temporal →

Tu opinión

0 comentarios

Sin registro. La primera vez te pediremos confirmar el correo y el comentario pasará por moderación; después se publican al momento si cumplen las normas. Se guarda un resumen de tu IP para evitar abusos.

Relacionadas

Herramientas y productos

Google DeepMind lanza Gemini 3.8 Flash TTS y Flash-Lite TTS con voces personalizables

Google DeepMind presentó Gemini 3.8 Flash TTS y Flash-Lite TTS, sus nuevos modelos de texto a voz que permiten crear voces de personaje personalizadas y…

Por qué importaLa generación de voz sintética de alta calidad y personalizable abre nuevas posibilidades para doblaje global, agentes de voz conversacionales y…

Impacto medio Fiabilidad varias fuentes Google DeepMind

NVIDIA detalla cómo usar Warp y MJWarp para acelerar simulación robótica en GPU

NVIDIA publica un tutorial técnico sobre cómo usar NVIDIA Warp y MJWarp, una implementación de la física de MuJoCo sobre GPU, para paralelizar hasta 2.048…

Por qué importaAcelerar la simulación física es clave para entrenar políticas de robótica mediante aprendizaje por refuerzo a gran escala, reduciendo tiempos y…

Impacto bajo Fiabilidad una fuente fiable Hugging Face

AWS detalla arquitectura agéntica para consultar vídeo con lenguaje natural

AWS presenta en su blog una arquitectura de inteligencia de vídeo conversacional basada en un agente único con Strands Agents SDK, que orquesta en tiempo de…

Por qué importaMuestra un patrón de arquitectura agéntica reutilizable donde el modelo decide qué servicios invocar en lugar de pipelines fijos, lo que reduce el…

Impacto medio Fiabilidad una fuente fiable AWS Machine Learning Blog

AWS muestra cómo usar modelos abiertos como agente de codificación con Amazon Bedrock y OpenCode

AWS publicó una guía técnica para usar OpenCode, un agente de codificación de código abierto, junto a modelos de pesos abiertos como Kimi K3, GPT-OSS 120B y…

Por qué importaOfrece a las empresas una alternativa para reducir dependencia de proveedores cerrados de IA de codificación, con control sobre residencia de datos y…

Impacto medio Fiabilidad una fuente fiable AWS Machine Learning Blog