O Google anunciou os novos modelos Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, voltados à geração de voz por inteligência artificial. As ferramentas trazem recursos para criar vozes personalizadas e mais expressivas, incluindo a reprodução de uma voz existente a partir de uma amostra de apenas 30 segundos. A tecnologia também consegue interpretar instruções de atuação e adicionar elementos, como risadas, sussurros e suspiros, às falas.
O Gemini 3.8 Flash TTS tem foco em criação de vozes expressivas e personalizadas, com aplicações em audiobooks, podcasts e vozes para personagens de jogos. O modelo também cria vozes do zero a partir de comandos em texto, com descrições de papel, sotaque e outras características da persona vocal. As falas podem receber instruções de atuação frase por frase, com elementos, como sussurros, risadas, suspiros e interjeições.
O Flash TTS também consegue encenar diálogos entre duas vozes diferentes a partir de um único roteiro, o que atende a produções narrativas e outros conteúdos com múltiplos personagens ou narradores. Nos conteúdos de longa duração, o modelo busca manter a qualidade, o timbre e o tom da voz ao longo de horas de áudio, reduzindo o chamado speaker drift. A característica é especialmente útil em audiobooks e podcasts, nos quais alterações na voz podem ficar mais perceptíveis.
