Gemini 3.5 Transcribe leva streaming de voz a GA
Publicado 27 de ago. de 2026 · Leitura 1 min de leitura · Relevância 8.8
O Google lançou dois modelos de transcrição em GA para arquivos e áudio ao vivo, com mais de 85 idiomas, diarização, vocabulário customizado e WebSockets.
Transcrição em tempo real com API estável, detecção multilíngue e vocabulário controlado reduz trabalho de infraestrutura para agentes de voz, legendas, atendimento, reuniões e pipelines de análise de chamadas.
O Google colocou em disponibilidade geral dois endpoints dedicados de transcrição. gemini-3.5-transcribe processa arquivos com atribuição de falas e timestamps por palavra; gemini-3.5-transcribe-live entrega eventos provisórios e finais em streaming bidirecional por WebSockets.
Os modelos detectam mais de 85 idiomas, inclusive trocas de idioma durante a mesma sessão, e aceitam vocabulário customizado de até 1.000 termos. O modo para arquivos suporta até uma hora de áudio por requisição, reduzida a 30 minutos quando diarização ou timestamps por palavra estão ativos.
Segundo medições apresentadas pelo Google com base na Artificial Analysis, a taxa média de erro de palavras foi de 4,0% no streaming e 2,6% no modo não streaming. O tempo até a transcrição final teria melhorado 70% em relação ao Chirp 3. Esses resultados ainda precisam ser comparados em sotaques, ruído e vocabulários reais de cada aplicação.
Observar precisão independente em português brasileiro, custo total de entrada e saída, latência sob carga, qualidade com mais de três falantes, impacto dos timestamps na precisão e regras de uso de dados no nível gratuito.