Gemini 3.8 TTS cria vozes por prompt e replica voz com amostra de 30 segundos
O Google lançou Gemini 3.8 Flash TTS e Flash-Lite TTS com criação de vozes por texto, controle por trecho e replicação mediante consentimento.
A combinação de voice design, clonagem consentida e API reduz a necessidade de pipelines separados para seleção, direção e adaptação de voz em produtos.
Os novos modelos de text-to-speech permitem descrever em linguagem natural o tipo de voz desejado e ajustar estilo, emoção e entrega por linha. O Google informa suporte a mais de 100 idiomas e dialetos e oferece mais de 2.000 vozes prontas para produção.
A variante também pode replicar uma voz a partir de uma amostra de cerca de 30 segundos, desde que o usuário tenha direito sobre a voz e forneça uma gravação de consentimento correspondente ao falante. Todo áudio gerado recebe SynthID, e o Google também usa metadados C2PA. Gemini 3.8 TTS já está disponível no Google AI Studio e na Gemini API; a oferta empresarial foi anunciada para depois.
Observar preço e limites na API, chegada da oferta empresarial e como os controles de consentimento e proveniência funcionam em integrações de produção.
Outros posts sobre assuntos próximos ao que você acabou de ler.