Google lanzó el 23 de septiembre Gemini 3.8 Flash TTS y Flash-Lite TTS: diseñan una voz entera desde una descripción escrita, sin grabar antes ni un segundo. Ya están en la API, en AI Studio y en Google Vids.

La voz se dirige línea a línea: acento, ritmo, emoción y hasta silencios. La librería pasa de 30 voces propias a más de 2.000, en más de 100 idiomas y variantes como español mexicano o inglés escocés.

Para Pablo, esto es diseño de voz sin actor: define el personaje por texto y ajusta el tono por línea. Google marca cada muestra con SynthID, pero no dice cómo suena una voz diseñada frente a una real.

Qué probar: describe una voz para un spot o un personaje de marca y compárala con una voz clonada real de 30 segundos, con permiso del hablante.