criia.
← Todos os artigos

Inteligência artificial e produto

A IA aprendeu a falar. Sua startup aprendeu a ouvir?

O lançamento do Eleven v4 amplia as possibilidades da IA de voz. No Brasil do acesso pelo celular, a oportunidade para startups pode estar menos na voz da máquina e mais no trabalho de quem a usa.

A inteligência artificial está ficando melhor em falar. Isso não resolve, por si só, a parte mais difícil de uma conversa comercial: entender o que a pessoa precisa e permitir que ela consiga fazer alguma coisa a respeito. Para startups que desenvolvem interfaces de voz, a oportunidade está nessa diferença entre produzir uma fala convincente e construir uma experiência útil.

Em 28 de setembro de 2026, a ElevenLabs apresentou o Eleven v4 e sua variante Turbo, modelos de geração de fala com suporte anunciado a mais de 90 idiomas. Segundo a empresa, o desenvolvimento busca melhorar expressividade, ritmo e consistência da voz. É uma novidade relevante para quem constrói produtos de áudio, mas não constitui, isoladamente, evidência de que um atendimento inteiro ficou melhor. Anúncio do Eleven v4.

A voz melhorou. O problema do cliente pode continuar igual.

O modelo transforma texto em fala. Escolher o que dizer, consultar a informação correta, compreender uma correção e executar uma solicitação são outras partes do produto. Uma voz agradável não conserta um cadastro errado nem autoriza uma operação que o sistema não sabe realizar.

A ElevenLabs informa uma mediana de aproximadamente 150 milissegundos até o início da fala para o Turbo, num teste em que a latência de rede foi medida e removida. Esse número não representa o tempo completo entre uma pergunta do usuário e a conclusão de uma tarefa. Trata-se de uma medida do fornecedor, nas condições descritas por ele, não de uma avaliação feita pela CRIIA. Anúncio do Eleven v4.

Essa diferença merece sair da documentação e entrar na reunião de produto. O cliente pode estar esperando por uma consulta de estoque, uma autorização ou uma informação que ninguém integrou. Economizar tempo na geração do áudio ajuda, mas não elimina as demais esperas.

O antigo “só um instante” ganhou uma voz melhor. A pergunta é se o instante também ficou menor.

No Brasil, falar com um sistema pode ser mais que uma conveniência

A TIC Domicílios 2025 registra que 65% dos usuários de internet acessavam a rede apenas pelo telefone celular, no recorte que compara celular e computador. Nas áreas rurais, o percentual era de 83%. São dados de usuários de internet, não de todos os brasileiros. Indicador de acesso por celular e computador do Cetic.br.

A pesquisa não demonstra que essas pessoas preferem falar em vez de digitar. Essa preferência precisa ser investigada. O que o dado oferece é um contexto: desenhar uma operação inteira supondo que o usuário estará diante de um computador pode deixar de representar uma parte importante da experiência real.

É aí que a observação vale mais do que uma apresentação sobre o futuro das interfaces. Um teste deveria incluir o aparelho que a pessoa usa, o lugar onde trabalha e as interrupções que acontecem ali. O silêncio do escritório de desenvolvimento é uma condição de teste, não uma descrição automática do mundo.

Voz pode ser uma alternativa útil para uma tarefa. Não deveria virar obrigação para todas.

A frase mais importante talvez seja “não, eu quis dizer outra coisa”

Imagine uma situação hipotética numa pequena operação de alimentação. Durante a preparação dos pedidos, alguém precisa ajustar o cadastro: “Acabou o suco de laranja. Tira do combo, mas deixa a versão com limão”.

A frase parece simples até começar a virar alteração. Qual combo? O item deve ser desativado ou substituído? A mudança vale em todos os canais? Quando o produto volta ao cardápio?

Uma interface de voz pode reduzir a necessidade de interromper o trabalho para digitar. Mas, antes de fazer alterações, precisa resolver essas ambiguidades. Neste exemplo, a conversa útil não é aquela em que o agente responde “perfeitamente!” mais rápido. É aquela em que a pessoa consegue conferir o que será feito, corrigir o entendimento e confirmar a ação.

Agora acrescente uma correção no meio da frase: “Não, pera, no almoço mantém”. Se a experiência desmorona quando o usuário muda de ideia, ela foi desenhada para um roteiro, não para uma conversa.

Não estamos descrevendo uma falha observada no produto da ElevenLabs. É um cenário de teste que propomos para qualquer startup que construa sobre uma tecnologia de voz, seja qual for o fornecedor.

Ouvir também significa descobrir quando o áudio atrapalha

Uma pessoa pode não querer dizer em voz alta uma informação pessoal. Pode estar num ambiente barulhento, não conseguir ouvir a resposta ou preferir ler para comparar opções. O produto deveria testar essas situações, não tratar a ausência de áudio como um erro do usuário.

Na nossa proposta de desenho, a pessoa consegue alternar para texto, revisar informações importantes e recuperar o controle da conversa. Quando houver consequências relevantes, uma confirmação legível pode ser mais útil do que mais uma frase simpática.

Também propomos identificar claramente que existe automação e explicar o que acontece com os áudios. Isso é uma escolha de transparência no produto; não exige transformar cada interação numa leitura interminável de termos. A voz pode ser acolhedora sem depender de o usuário acreditar que está conversando com uma pessoa.

Dar ao sistema um nome, uma personalidade e uma excelente pronúncia pode melhorar sua apresentação. Não deveria servir para esconder seus limites.

O que medir num piloto de IA de voz

Antes de substituir um fluxo existente, vale comparar a experiência com a alternativa atual. No exemplo do cardápio, o teste poderia observar quantas alterações foram concluídas corretamente, quantas precisaram de correção, quanto tempo o trabalho inteiro levou e quantas vezes alguém teve de abandonar o áudio.

A medição deve acompanhar a tarefa, não apenas o trecho mais impressionante da demonstração. Começar a falar depressa e resolver o pedido depressa são coisas diferentes.

Também é importante testar uma variedade de aparelhos, formas de falar e condições de ambiente. A pergunta é concreta: quem consegue completar a tarefa e quem encontra dificuldades? Se uma solução só funciona com a pessoa que a demonstrou, ainda não sabemos o suficiente para chamá-la de simples.

Um piloto pequeno pode responder a isso sem prometer substituir toda uma operação. Seu resultado mais valioso talvez seja descobrir em qual etapa a voz ajuda — e em qual ela deveria sair do caminho.

O cruzamento com a CRIIA acontece antes do microfone

A proposta da CRIIA aproxima imaginação, pesquisa e construção. Neste tema, o cruzamento começa com observar pessoas trabalhando, antes de escolher como a máquina vai soar.

Nossa hipótese editorial é que existem oportunidades para startups que conheçam bem um contexto e consigam simplificar uma tarefa sem exigir que o usuário aprenda a conversar como um manual de software. A vantagem pode estar numa sequência curta de perguntas, numa confirmação bem desenhada ou na capacidade de reconhecer que ainda não entendeu.

O lançamento desta semana amplia as ferramentas disponíveis. Descobrir onde elas fazem diferença continua exigindo proximidade com gente de verdade.

A melhor experiência de voz pode começar com uma pesquisa em que o fundador fala menos.

Fontes

  1. Introducing Eleven v4, our most emotive model
  2. C16A - USUÁRIOS DE INTERNET, POR ACESSO EXCLUSIVO OU SIMULTÂNEO POR TELEFONE CELULAR E COMPUTADOR
  3. CRIA — Toda ideia tem uma vida