Padaria Villa Carmela

20 minutos com o CEO da ElevenLabs, agora avaliada em supostamente US$ 22 bilhões

TecnologiaPor Redação Guarulhos Digital em 24/09/2026
A ElevenLabs alimenta a voz de IA do outro lado de muitas chamadas de atendimento ao cliente, e seu CEO me disse esta semana que as empresas provavelmente deveriam avisar você sobre isso — pelo menos até que falar com uma máquina seja o que todo mundo espera de qualquer maneira.
20 minutos com o CEO da ElevenLabs, agora avaliada em supostamente US$ 22 bilhões

20 minutos com o CEO da ElevenLabs, agora avaliada em supostamente US$ 22 bilhões

A ElevenLabs cria a camada de voz da IA, os modelos que transformam texto em fala com som humano. A maioria das pessoas a encontra quando está conversando com o atendimento ao cliente — muitas vezes sem perceber. A Klarna, por exemplo, gerencia o suporte telefônico de primeira linha para 35 milhões de clientes nos EUA usando essa tecnologia. O mesmo fazem a Deutsche Telekom, a Cisco, a Adobe e uma lista crescente de governos. A ElevenLabs também vende para criadores, que usam sua plataforma para audiolivros, dublagem e música.

Ela não está sozinha no que faz. Na verdade, ela está esbarrando cada vez mais em clientes, incluindo a Decagon, uma plataforma de IA conversacional que treinou seu produto de voz na ElevenLabs e agora concorre com ela. Mas seus investidores não parecem muito preocupados. A empresa, que afirma estar a caminho de alcançar US$ 600 milhões em receita recorrente anual, estaria agora avaliada em US$ 22 bilhões por seus apoiadores, apesar de ter apenas quatro anos de existência.

Para entender melhor, entrevistei o cofundador e CEO da ElevenLabs, Mati Staniszewski, na Nrth em Toronto, uma conferência local de empreendedorismo anteriormente conhecida como Elevate. Cobrimos vários tópicos em pouco tempo, incluindo se as empresas devem avisar os clientes quando estão conversando com uma IA (ele acha que sim) e se ele poderia falar sobre as margens brutas da empresa. Sem surpresa, Staniszewski disse que não podia discuti-las em detalhes, mas deixou claro que não se importa se elas forem ainda mais espremidas, desde que isso signifique expandir a fatia de mercado da empresa.

Nossa conversa segue abaixo, condensada e levemente editada. Você pode assistir à conversa completa aqui.

Você participou do TechCrunch Disrupt no ano passado, onde disse que os modelos de áudio seriam mercantilizados dentro de alguns anos. Como você avalia essa previsão agora?

Ainda há muito trabalho a ser feito, e o delta de qualidade que você consegue alcançar apenas no nível do modelo ainda é significativo. Se pensarmos a longo prazo, provavelmente daqui a três, cinco anos, essas diferenças serão menores. O que adoraríamos fazer, e ser os primeiros a conseguir, é passar no teste de Turing para IA conversacional. Você precisa combinar inteligência, mas também precisa de inteligência emocional. Você precisa entender as emoções do outro lado, para poder desacelerar ou falar mais alto. Isso ainda não foi feito.

Qual é a porcentagem do negócio que é voltada para empresas (enterprise) agora?

Estamos agora em US$ 600 milhões em ARR. Cinquenta e cinco por cento ou mais são empresas clássicas, e uma grande porcentagem dos 45% [restantes] são pequenas e médias empresas, desenvolvedores, construtores, criadores.

Como todo mundo em IA, vocês estão competindo cada vez mais com seus próprios clientes. A Decagon treinou seu produto de voz com vocês e agora executa consultas por meio de seus próprios modelos.

As linhas estão ficando mais difusas. Quando pensamos em empresas de modelos, empresas de plataformas, empresas de aplicativos, no passado havia divisões muito claras sobre onde cada uma começava e terminava. Hoje essa linha é muito mais difusa. No caso da Anthropic, o que era uma empresa de modelos é definitivamente uma plataforma e, cada vez mais, um conjunto amplo de aplicativos. Acho que isso vai continuar.

Seus clientes podem escolher a "camada de raciocínio" a partir de um menu de opções na ElevenLabs. O que você tem visto em termos de uso de modelos de laboratórios de fronteira em comparação com pesos abertos?

É menos uma escolha binária. Na experiência do cliente, se você está ligando e é apenas informativo, se você não está executando nenhuma ação — você pode usar muitos dos modelos de código aberto porque sua base de conhecimento define o que é uma boa experiência. Mas se forem serviços financeiros, você quer ser autenticado, quer informações sobre uma transação, talvez um reembolso. Não há margem para erros. Aqui, os modelos de fronteira ainda vão liderar.

Alguns desses modelos de pesos abertos são chineses. O governo dos EUA é cliente. Governos europeus são clientes. Como são essas conversas?

Diferentes. Em cada implantação, os modelos e as vozes que implantamos dependerão do caso. Se trabalhamos com o governo polonês ou com o governo brasileiro, eles têm seu próprio conjunto de requisitos. Pode ser um modelo de pesos abertos, um modelo de código fechado, o modelo ajustado (fine-tuned) deles próprios. [Na Polônia] é um caso de saúde. Você tem pacientes agendando consultas em todo o sistema público de saúde, e 18% nunca comparecem. A implantação são agentes que ligam e lembram você. Eles tinham um conjunto de modelos otimizados em seu conhecimento, e nós nos integramos mantendo a residência de dados.

As empresas devem informar quando alguém está conversando com um agente em vez de um humano?

Acho que deveria haver transparência neste momento. Atualmente, as pessoas não estão acostumadas com isso, e o padrão comum é que você não quer se sentir traído nessa ligação. Mas daqui a cinco anos, quando todo mundo tiver seu próprio agente trabalhando em seu nome, você vai ligar e esperar um agente. Aí acho que nós mudaremos como sociedade. Existem maneiras boas de fazer isso — se houver uma espera de 30 minutos por um humano, ofereça ao cliente uma escolha. Em quase todos os casos, eles escolhem o agente e depois ficam surpresos com a qualidade da experiência.

Quais são suas margens brutas, considerando o que vocês estão pagando por modelos e inferência?

Vou dar uma resposta vaga. Como temos esse elemento de pesquisa, conseguimos ajustar e restringir modelos de maneiras extremamente inteligentes. Mas se pudermos repassar qualquer economia para o cliente, nós o fazemos. A maior coisa ainda é provar o valor e estar lá com o cliente. Portanto, se pudermos investir e provar esse valor, não nos importamos que as margens fiquem mais baixas para realmente nos beneficiarmos juntos à medida que o valor for criado nos próximos cinco anos.

Vocês têm milhões de horas de chamadas de atendimento ao cliente. Vocês treinam usando elas? Quanta parte dos seus dados de treinamento é sintética?

Em certas empresas, criamos os modelos juntos. Elas queriam um modelo específico para o seu caso de uso. Caso contrário, a grande parte do treinamento não foi tanto o volume de dados, mas sim a anotação dos dados. Temos milhares de pessoas internamente sob regime de contrato nos ajudando a anotar não apenas o que foi dito, mas quando as pessoas estavam falando, como disseram as coisas, quais emoções foram usadas. Tivemos que trazer treinadores de voz para conseguir detectar sotaques com precisão.

Foi noticiado que vocês estão mirando em 2028 para uma IPO. Você pode confirmar isso?

Adoraríamos criar uma empresa que resista ao teste do tempo. Estamos preparando a base para poder fazer isso nos próximos anos. Mas se o faremos ou não, dependerá do momento e do lugar.

"Anos" é muito vago.

[Risos.]

Nos bastidores: Qual é a sua posição sobre os laboratórios de fronteira deverem desacelerar?

Todo mundo está alinhado para trabalhar junto na busca de uma forma de dosar o ritmo. Se eles devem ser públicos sobre isso, e quanta conversa da mídia ou regulamentação isso deve envolver, esse é outro tópico. Mas sim, todos devemos tomar as precauções certas à medida que implantamos a tecnologia. Nós não treinamos os modelos de texto e o lado da inteligência dos modelos, que é o núcleo principal do debate.

A ElevenLabs poderia ficar exposta da mesma forma que a Hugging Face ficou?

Estamos um passo adiante, porque não implantamos partes auto-replicantes ou recorrentes da inteligência dos agentes. nossa tecnologia não permite que você deixe os agentes criarem mais agentes. Cada cliente passa pelo KYC (Conheça seu Cliente). O risco de cibersegurança é definitivamente um risco para o mundo em geral, mas temos um bom conjunto de precauções em vigor.

Compartilhe