Modelos e LLMs

Google lança dois modelos Gemini com catálogo de mais de 2 mil vozes

Novas APIs criam vozes a partir de 30 segundos de áudio e dividem falas entre múltiplos personagens na mesma chamada.

Reprodução · blog.google

O Google lançou nesta quarta-feira, 23 de setembro de 2026, dois novos modelos de síntese de voz chamados gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts. A tecnologia traz uma biblioteca com mais de 2.000 vozes e permite criar timbres personalizados com apenas 30 segundos de áudio gravado. Esse pacote atende desenvolvedores de software que constroem assistentes virtuais, narrações interativas e diálogos dinâmicos para produtos digitais. O lançamento encurta a produção sonora.

Ajuste fino divide falas entre personagens

A nova interface de programação do Google estrutura conversas completas entre múltiplos personagens dentro de uma única chamada de sistema. O desenvolvedor define diferentes atores na mesma requisição, escolhe vozes distintas do catálogo e envia comandos específicos de tom e estilo para a interpretação de cada personagem. A API dispensa softwares de montagem. Além das duas mil opções prontas, a documentação exige que o desenvolvedor tenha autorização legal ao usar "just a 30-second audio sample of your voice or a voice you have the rights to use".

O programador Simon Willison testou os novos modelos imediatamente e lançou uma interface pública chamada Gemini 3.8 TTS Playground. A página permite compor narrações individuais, configurar trocas de falas entre personagens, ouvir a prévia do áudio gerado e inspecionar detalhes brutos de envio e resposta da API. Qualquer pessoa com uma chave própria do Gemini pode realizar experimentos de síntese de voz de alta qualidade e guardar as definições em links permanentes no navegador. O acesso exige apenas a chave.

Willison construiu a ferramenta web adotando a prática de vibe coding com o auxílio do modelo GPT-6 Astra. O aplicativo não requer servidores intermediários porque se apoia na política aberta de CORS configurada pelo Google na API subjacente do Gemini. Essa liberação de rede permite que páginas em domínios de terceiros enviem comandos e recebam os dados diretamente no navegador do visitante. O método reduz barreiras de infraestrutura.

Áudio de um minuto custou menos de três centavos

Para demonstrar o funcionamento na prática, Willison publicou um clipe curto de áudio com uma conversa entre dois pelicanos debatendo se deveriam se mudar para o Pacifica Pier. O autor pediu que o Claude 4.5 Opus escrevesse o roteiro do diálogo e gerasse a URL com os parâmetros exatos para renderizar o áudio no playground. O modelo gemini-3.8-flash-tts levou cerca de 20 segundos para sintetizar 1 minuto e 18 segundos de fala. A execução custou 2,74 centavos de dólar.

O teste prático recorreu à versão gemini-3.8-flash-tts, deixando a variante gemini-3.8-flash-lite-tts como opção voltada a quem busca menor custo por chamada. Embora a demonstração de Willison comprove a rapidez e o custo baixo na geração pontual, o Google ainda precisa provar a estabilidade e a qualidade do catálogo de duas mil vozes sob demanda contínua em escala global. A novidade chega no momento em que a indústria enfrenta uma nova guerra de preços, desencadeada um dia antes com o lançamento dos modelos Claude Opus 5.5, GPT-6 Sol e GPT-6 Luna. O mercado cobra respostas rápidas.

Fontes

Simon WillisonModelos e LLMs
Como apuramos: as fontes consultadas estão indicadas nesta matéria para que você possa conferir as informações. Os números de estrelas e a posição no ranking refletem o momento da coleta. Conheça os critérios editoriais.