Padaria Villa Carmela

O novo modelo de fala v4 da ElevenLabs suporta mais controle de expressão e 90 idiomas

TecnologiaPor Redação Guarulhos Digital em 28/09/2026
O ElevenLabs v4 pode clonar vozes com um clipe de 10 segundos
O novo modelo de fala v4 da ElevenLabs suporta mais controle de expressão e 90 idiomas

O novo modelo de fala v4 da ElevenLabs suporta mais controle de expressão e 90 idiomas

A ElevenLabs lançou dois novos modelos de fala na segunda-feira, chamados ElevenLabs v4 e v4 Turbo, oferecendo mais controle de expressão, menor latência para agentes de voz e suporte a mais de 90 idiomas.

A empresa lançou seu modelo v3 no ano passado e apresentou uma prévia do modelo em um evento em Varsóvia no início deste ano. Para a geração v4 de modelos, a ElevenLabs está adotando uma nova arquitetura que permite melhor controle e clonagem mais rápida. A empresa afirmou que, com a v4, os usuários poderão clonar uma voz com apenas 10 segundos de áudio.

No aspecto criativo, o modelo lida melhor com a identidade da voz em trechos de texto mais longos. Ele também mantém o contexto do texto em mente ao lê-lo em voz alta para alterar as expressões. A ElevenLabs introduziu tags embutidas para definir a expressão com a v3 e está expandindo essas tags na v4, permitindo que os usuários empilhem várias tags e façam com que o modelo siga a sequência.

A versão anterior dava suporte a 70 idiomas, e a ElevenLabs trabalhou para elevar esse número para 90 idiomas com a nova versão. A startup afirmou que observou o maior salto de qualidade em japonês, português brasileiro, mandarim e cantonês.

A ElevenLabs expandiu rapidamente seus negócios de chamadas corporativas no último ano, com mais de 55% de seus negócios vindos de grandes empresas. A empresa disse que o novo modelo é adequado para agentes de voz, já que a nova versão possui menor latência para permitir conversas mais fluidas. Além disso, a v4 pode começar a gerar áudio assim que o LLM por trás dela começar a gerar respostas. Para completar, o modelo também pode lidar com confrontos, escalonamentos e esperas de maneira diferente para uma melhor resolução de problemas.

A competição em modelos de fala se intensificou à medida que startups como Cartesia, Deepgram, Fish Audio, Boson e WellSaid Labs criaram modelos de fala expressivos. Grandes empresas como Google e OpenAI também aprimoraram seus modelos de voz.

A ElevenLabs captou 500 milhões de dólares no início deste ano com a Sequoia, em uma rodada liderada pela Sequoia que avaliou a empresa em 11 bilhões de dólares. Já há rumores de uma nova rodada de captação de recursos que avaliaria a empresa em 22 bilhões de dólares. A taxa de receita anualizada recorrente da ElevenLabs subiu de aproximadamente 330 milhões de dólares no início do ano para mais de 600 milhões de dólares. A empresa contratou pessoal de forma agressiva em diferentes mercados, como Índia, Europa e Brasil, com seu quadro de funcionários ultrapassando 800 pessoas.

Em uma entrevista recente ao TechCrunch, o cofundador e CEO da empresa, Mati Staniszewski, disse que a empresa tem como objetivo uma oferta pública inicial (IPO) “nos próximos anos”, mas não se comprometeu com um prazo específico.

Compartilhe