GPT-Live-1 leva voz full-duplex à API por US$ 0,05 por minuto
Publicado 11 de set. de 2026 · Leitura 1 min de leitura · Relevância 9.2
O modelo de voz ouve e fala simultaneamente, aceita interrupções e delega raciocínio e ferramentas a um modelo de backend. A camada de voz é cobrada separadamente.
A execução full-duplex reduz a necessidade de encadear reconhecimento de fala, modelo de texto e síntese de voz, além de permitir que tarefas demoradas rodem em paralelo à conversa. O desenho de custo exige contabilizar a camada de voz e o backend separadamente.
A OpenAI disponibilizou o GPT-Live-1 na API para experiências de voz full-duplex. O modelo processa áudio de entrada e saída simultaneamente, o que permite interromper uma resposta, mudar de assunto ou continuar falando enquanto uma ação de backend é executada.
A arquitetura separa a conversa por voz do raciocínio mais profundo. O GPT-Live-1 pode delegar uma tarefa a um modelo de texto da OpenAI ou de outro fornecedor, receber o resultado e incorporá-lo à conversa sem interromper o fluxo de áudio. A documentação também cobre sessões, ferramentas, MCP, WebRTC, WebSockets e telefonia.
A camada frontal de voz custa US$ 0,05 por minuto. Uso do modelo de backend, do harness e de ferramentas é cobrado à parte, de modo que esse valor não representa o custo total de um agente de voz.
O lançamento amplia vozes, sotaques, dialetos e idiomas. Vozes personalizadas dependem de contato comercial e de elegibilidade, portanto não fazem parte do acesso padrão.
Acompanhar latência e interrupções em medições independentes, qualidade em português, custos completos com backend e ferramentas, limites de sessões longas e critérios para vozes personalizadas.