Google puede copiar una voz con 30 segundos de audio. Antes, el dueño tiene que decir que sí en voz alta

Los nuevos modelos de voz de Google pueden copiar una voz a partir de una grabación de 30 segundos. Antes de hacerlo, la persona dueña de esa voz tiene que decir que sí, en voz alta y grabado. Ese paso de consentimiento es lo más interesante del lanzamiento de esta semana para quienes trabajan con la voz, y también lo es la breve lista de lugares donde Google directamente no activa la función.

Qué lanzó Google

El 23 de septiembre, Google presentó dos modelos de texto a voz, Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, en una publicación en su blog corporativo firmada por Leland Rechis, gerente de producto de grupo, y Alan Cowen, director de ciencia de investigación, en nombre del equipo de Gemini Audio.

Los dos modelos se reparten el trabajo. Flash TTS está “pensado para una dirección creativa profunda y el diseño de personajes”, y Google lo orienta a “videojuegos, audiolibros inmersivos, pódcasts y medios interactivos”. Flash-Lite está “optimizado para doblaje de alto volumen, creación de contenido de audio y agentes de voz expresivos”.

Si esa lista parece un mapa de dónde se ganan la vida los actores de voz, no es casualidad de redacción. Google dice que los usuarios pueden “dirigir cada interpretación línea por línea con control detallado sobre indicaciones actorales, ritmo, cambios de dialecto y muletillas de escucha activa”. Los guiones pueden incluir indicaciones como risas, suspiros y jadeos. La empresa asegura que los modelos mantienen la calidad de la voz “a lo largo de horas de audio continuo con una deriva mínima del hablante”, algo que califica de “ideal para pódcasts y audiolibros”. Hay más de 2,000 voces listas para usar en más de 100 idiomas y dialectos, con variantes regionales como el español de México, el francés de Quebec y el inglés de Escocia.

La prensa tecnológica lo leyó igual. El titular de Android Authority del 24 de septiembre fue directo: “Gemini ya puede clonar tu voz e interpretar guiones como un actor”.

El filtro del consentimiento

Lo que más importa a los intérpretes está en la función de réplica de voz. Google dice que puede “recrear perfiles vocales consistentes a partir de una muestra de audio de solo 30 segundos de tu voz o de una voz que tengas derecho a usar”.

Luego viene la salvaguarda. “Para la réplica de voz, nuestro sistema usa verificación de consentimiento: los usuarios deben aportar una grabación de consentimiento verbal del dueño de la voz que coincida con el hablante de referencia antes de que se pueda crear una voz”, dice la publicación. El sistema compara la grabación de consentimiento con la muestra. Si las voces no coinciden, no hay clon.

Además, “cada clip de audio generado por nuestros modelos de Gemini Audio lleva la marca de agua SynthID”, que Google describe como una “marca de agua imperceptible” que va “entretejida directamente en el audio”. Las voces copiadas también llevan credenciales de contenido C2PA, un estándar para indicar de dónde viene un archivo. Google dice que construyó todo esto “para ayudar a proteger al talento de voz, respetar la identidad y garantizar la transparencia del contenido”.

Infografía: cómo funciona la copia de voz de Google en cinco pasos: una muestra de 30 segundos, el consentimiento hablado del dueño de la voz, la verificación de coincidencia, las marcas SynthID y C2PA, y los lugares donde no se ofrece

Dónde no funciona

Una nota al pie de la publicación es breve y reveladora: “La réplica de voz a través de AI Studio no está disponible en Illinois, Texas, el EEE, el Reino Unido, Suiza y la India”.

VoiceEditSuiteStart with a free studio analysis.Then every session cleaned for $15 a month, launch price until Sep 30.Show me more

Google no explica la lista. Lo que comparten varios de esos lugares son leyes que tratan la voz como algo cercano a la propiedad personal. La Ley de Privacidad de la Información Biométrica de Illinois y la ley de identificadores biométricos de Texas mencionan expresamente la huella de voz. Las normas de protección de datos de Europa y del Reino Unido tratan los datos biométricos usados para identificar a una persona como una categoría con protección especial. Cuando una empresa crea una función y luego la bloquea justo donde están las reglas más estrictas sobre voz y biometría, eso dice algo sobre dónde cree que está el riesgo legal.

Qué significa para los actores de voz

La competencia principal no es el clon. Es la biblioteca. La mayor parte de lo que lanzó Google no copia a nadie. Son 2,000 voces de catálogo más una herramienta para diseñar voces nuevas a partir de una descripción escrita, “ya sea que quieras dar vida a un dragón dramático que escupe fuego o crear un narrador carismático con una cadencia regional particular”, en palabras de Google. Personajes de videojuegos y narradores son justo los trabajos de esa frase.

Tu consentimiento hablado ahora es papeleo. El sistema de Google convierte un “sí” en una grabación. Trata cualquier pedido de leer una declaración de consentimiento como tratarías un contrato. Si un cliente te pide grabar “una línea extra rapidita” al final de una sesión y suena a permiso, detente y pregunta para qué es, en qué plataforma, por cuánto tiempo y cuánto paga. Una grabación de consentimiento con tu propia voz es mucho más difícil de discutir después que una firma que no recuerdas.

“Derecho a usar” sigue remitiendo a tu contrato. La función se ofrece para tu propia voz “o una voz que tengas derecho a usar”. La verificación pide la voz del dueño, y esa es una barrera real. Pero la frase muestra dónde terminará la discusión cuando algo salga mal: en lo que firmaste y en si menciona la IA.

Las marcas de agua pueden jugar a tu favor. Si un clip que suena como tú aparece donde no debería, una marca de agua detectable es una forma más de demostrar que no salió de una sesión que grabaste.

El doblaje es el mercado objetivo. Google menciona socios como Figma, HeyGen, Linguana, Wondercraft, 99.co y Ollang, que según la empresa están integrando los modelos “para ayudar a acelerar el doblaje global, localizar contenidos con acentos regionales matizados e impulsar agentes de voz conversacionales a gran escala”. El español de México es uno de los idiomas en los que Google dice que sus modelos ocupan los primeros puestos en pruebas de escucha a ciegas.

También hay una línea directa entre este lanzamiento y el mercado publicitario. En California, un comercial narrado por una voz sintética pronto tendrá que avisar al público que no aparece ningún intérprete humano. Herramientas como esta son justo para lo que se escribió esa nueva ley.

Nada de esto responde la gran pregunta que se hace todo actor de voz: cuánto del trabajo pasará a las máquinas. Lo que sí muestra es que las grandes empresas de IA ya esperan que se les pida consentimiento, y que el permiso hablado se está volviendo parte del oficio. Ten claro a qué dices que sí antes de decirlo.

Fuentes: Google, “Gemini 3.8 text-to-speech says hello”, 23 de septiembre de 2026; Android Authority, 24 de septiembre de 2026. Las citas de fuentes en inglés fueron traducidas por Voice Over Herald.

Read this article in English: Google Can Copy a Voice From 30 Seconds of Audio. First, the Owner Has to Say Yes Out Loud

¿Sabe algo más sobre esta noticia, o ha visto un error? Escriba a la redacción.