
OpenAI lança novos modelos de voz para conversas ao vivo mais naturais
A OpenAI lançou hoje novos modelos conversacionais, chamados GPT-Live-1 e GPT-Live-1 mini, alegando que eles soam mais naturais e lidam melhor com a alternância de turnos na conversação. Esses são modelos full-duplex, o que significa que eles podem falar e ouvir ao mesmo tempo, permitindo que os usuários interrompam de forma natural e viabilizando recursos como tradução simultânea.
A empresa também está substituindo seu atual Modo de Voz Avançado no ChatGPT pelo GPT-Live-1 mini por padrão. Usuários de planos pagos poderão acessar o modelo GPT-Live-1, que é maior. O modelo anterior combinava um modelo de fala para texto para transcrever a fala, um grande modelo de linguagem para gerar respostas e um modelo de texto para fala para entregar a resposta final.
A empresa afirmou em uma entrevista coletiva que os novos modelos resolvem problemas como interromper os usuários enquanto eles estão falando e não terem inteligência suficiente para responder a perguntas. Os novos modelos da OpenAI enviarão a consulta para seus modelos de texto mais recentes, como o GPT-5.5, para busca, raciocínio ou capacidades agênticas, enquanto continuam a conversa.
A OpenAI também demonstrou que o modelo pode ficar em silêncio por um longo período e absorver o contexto da conversa até ser chamado. Além disso, como o novo modo de voz tem acesso a modelos GPT mais recentes, ele também pode apresentar algumas informações em formato visual. Outras startups, como a Monogram, que captou US$ 40 milhões em financiamento semente da DST e da Lux Capital, também estão apostando em respostas visuais para tornar os assistentes mais interativos.
A empresa afirmou que o novo modo de voz no ChatGPT foi projetado para conversas mais longas. Durante a apresentação, o líder de produto do ChatGPT Voice, Atty Eleti, disse que teve conversas de 30 a 40 minutos com o recurso de voz durante caminhadas.
A OpenAI acredita que a voz pode ser a principal interface para a computação em trabalhos complexos. Relatórios sugerem que ela poderá lançar um par de fones de ouvido com recursos de IA este ano. No entanto, a empresa não forneceu nenhuma informação sobre produtos de hardware.
“Com o tempo, achamos que isso também desbloqueará a capacidade de usar a voz como uma espécie de interface principal para a computação, e para gerenciar trabalhos agênticos de longa duração cada vez mais complexos. O tipo de caso de uso incrível que vemos as pessoas realizando com o Codex e o ChatGPT, achamos que a voz pode ser a interface futura para todos os tipos de trabalho”, disse Eleti.
A OpenAI tem trabalhado para fortalecer os recursos baseados em voz ao longo dos últimos anos para fazer com que o modo de voz do ChatGPT soe mais natural. A empresa afirmou que mais de 150 milhões de pessoas conversam com o ChatGPT usando recursos como Voz e Ditado.
Concorrentes também estão tentando tornar os assistentes mais expressivos.
Tanto a Apple quanto a Amazon atualizaram seus assistentes para serem mais conversacionais e com melhor tratamento de contexto. Startups como a Sesame, fundada pelo cofundador do Oculus, Brendan Iribe, e por Ankit Kumar, também lançaram assistentes de IA com conversação mais natural enquanto realizam tarefas em segundo plano.
A OpenAI está seguindo na mesma direção, com o objetivo de permitir que os usuários conversem com seu assistente sem as mãos por mais tempo. Apesar de afirmar que o novo modo de voz soa mais natural, a empresa enfatizou que não tem o objetivo de transformar isso em um companheiro de IA. Ela observou que os novos modelos possuem salvaguardas integradas para fornecer respostas adequadas à idade para adolescentes e fornecer recursos caso a conversa aborde tópicos como automutilação.
O novo modo de voz ainda precisa de melhorias. Durante a demonstração, quando a empresa exibiu seu recurso de tradução ao vivo em hindi, o assistente tinha um forte sotaque americano e falava um hindi que soava pouco natural e tinha um tom ligeiramente acadêmico. A empresa afirmou que o novo modo está otimizado para “a maioria das línguas faladas”, mas não especificou quais.