Padaria Villa Carmela

OpenAI lança novos modelos de voz para conversas ao vivo mais naturais

TecnologiaPor Redação Guarulhos Digital em 08/07/2026
A OpenAI diz que seu novo modo de voz pode falar e ouvir ao mesmo tempo, uma capacidade fundamental para tradução simultânea.
OpenAI lança novos modelos de voz para conversas ao vivo mais naturais

OpenAI lança novos modelos de voz para conversas ao vivo mais naturais

A OpenAI lançou hoje novos modelos conversacionais, chamados GPT-Live-1 e GPT-Live-1 mini, alegando que eles soam mais naturais e lidam melhor com a alternância de turnos na conversação. Esses são modelos full-duplex, o que significa que eles podem falar e ouvir ao mesmo tempo, permitindo que os usuários interrompam de forma natural e viabilizando recursos como tradução simultânea.

A empresa também está substituindo seu atual Modo de Voz Avançado no ChatGPT pelo GPT-Live-1 mini por padrão. Usuários de planos pagos poderão acessar o modelo GPT-Live-1, que é maior. O modelo anterior combinava um modelo de fala para texto para transcrever a fala, um grande modelo de linguagem para gerar respostas e um modelo de texto para fala para entregar a resposta final.

A empresa afirmou em uma entrevista coletiva que os novos modelos resolvem problemas como interromper os usuários enquanto eles estão falando e não terem inteligência suficiente para responder a perguntas. Os novos modelos da OpenAI enviarão a consulta para seus modelos de texto mais recentes, como o GPT-5.5, para busca, raciocínio ou capacidades agênticas, enquanto continuam a conversa.

A OpenAI também demonstrou que o modelo pode ficar em silêncio por um longo período e absorver o contexto da conversa até ser chamado. Além disso, como o novo modo de voz tem acesso a modelos GPT mais recentes, ele também pode apresentar algumas informações em formato visual. Outras startups, como a Monogram, que captou US$ 40 milhões em financiamento semente da DST e da Lux Capital, também estão apostando em respostas visuais para tornar os assistentes mais interativos.

A empresa afirmou que o novo modo de voz no ChatGPT foi projetado para conversas mais longas. Durante a apresentação, o líder de produto do ChatGPT Voice, Atty Eleti, disse que teve conversas de 30 a 40 minutos com o recurso de voz durante caminhadas.

A OpenAI acredita que a voz pode ser a principal interface para a computação em trabalhos complexos. Relatórios sugerem que ela poderá lançar um par de fones de ouvido com recursos de IA este ano. No entanto, a empresa não forneceu nenhuma informação sobre produtos de hardware.

“Com o tempo, achamos que isso também desbloqueará a capacidade de usar a voz como uma espécie de interface principal para a computação, e para gerenciar trabalhos agênticos de longa duração cada vez mais complexos. O tipo de caso de uso incrível que vemos as pessoas realizando com o Codex e o ChatGPT, achamos que a voz pode ser a interface futura para todos os tipos de trabalho”, disse Eleti.

A OpenAI tem trabalhado para fortalecer os recursos baseados em voz ao longo dos últimos anos para fazer com que o modo de voz do ChatGPT soe mais natural. A empresa afirmou que mais de 150 milhões de pessoas conversam com o ChatGPT usando recursos como Voz e Ditado.

Concorrentes também estão tentando tornar os assistentes mais expressivos.

Tanto a Apple quanto a Amazon atualizaram seus assistentes para serem mais conversacionais e com melhor tratamento de contexto. Startups como a Sesame, fundada pelo cofundador do Oculus, Brendan Iribe, e por Ankit Kumar, também lançaram assistentes de IA com conversação mais natural enquanto realizam tarefas em segundo plano.

A OpenAI está seguindo na mesma direção, com o objetivo de permitir que os usuários conversem com seu assistente sem as mãos por mais tempo. Apesar de afirmar que o novo modo de voz soa mais natural, a empresa enfatizou que não tem o objetivo de transformar isso em um companheiro de IA. Ela observou que os novos modelos possuem salvaguardas integradas para fornecer respostas adequadas à idade para adolescentes e fornecer recursos caso a conversa aborde tópicos como automutilação.

O novo modo de voz ainda precisa de melhorias. Durante a demonstração, quando a empresa exibiu seu recurso de tradução ao vivo em hindi, o assistente tinha um forte sotaque americano e falava um hindi que soava pouco natural e tinha um tom ligeiramente acadêmico. A empresa afirmou que o novo modo está otimizado para “a maioria das línguas faladas”, mas não especificou quais.

Compartilhe