A demonstração acabou. Agora começa o expediente.
O desafio de um agente de IA não termina quando ele responde corretamente a uma pergunta. Para ter valor operacional, precisa executar o trabalho esperado, respeitar limites e permitir que a empresa identifique e corrija suas falhas.
A pesquisa State of Agent Engineering, publicada pela LangChain em junho de 2026, ajuda a dimensionar essa transição. Entre mais de 1.300 profissionais consultados, 57,3% informaram ter agentes em produção. Ao mesmo tempo, a qualidade apareceu como principal barreira para aproximadamente um terço dos participantes. É uma amostra de profissionais próximos desse mercado, não um censo de todas as empresas. 2
O recado para quem está construindo uma startup nesse setor é direto: colocar o agente para funcionar e construir um negócio confiável são trabalhos relacionados, mas diferentes.
O problema precisa existir antes do agente
Considere uma distribuidora que recebe pedidos por e-mail e precisa conferir produtos, condições comerciais e disponibilidade. Um agente pode ajudar nessa operação. Mas o primeiro passo não deveria ser escolher o modelo de IA.
Deveria ser acompanhar quem faz o trabalho hoje.
Onde estão os erros? Quais pedidos exigem interpretação? Quem pode autorizar uma exceção? O que acontece quando o código do produto está incompleto? Qual informação parece disponível, mas só existe na cabeça de uma pessoa?
Esse tipo de investigação se conecta à origem da CRIA: observar o trabalho cotidiano antes de decidir o que construir. Uma operação aparentemente simples pode esconder o problema relevante. Também pode revelar que uma integração convencional resolveria tudo, sem precisar de um agente.
Descobrir isso cedo é economia, não falta de ambição.
A conta precisa incluir o trabalho que a IA devolve
Um agente que produz cem respostas em poucos minutos parece produtivo. Mas, se cada resposta exige revisão extensa, a empresa pode ter apenas mudado o lugar do trabalho.
Uma métrica útil é o custo por tarefa corretamente concluída. Ela considera o uso da tecnologia, a revisão humana, as correções e o tratamento das exceções. O tempo economizado precisa ser comparado com o processo anterior, utilizando critérios equivalentes de qualidade.
Na pesquisa da LangChain, aproximadamente 89% dos participantes relataram mecanismos para acompanhar o funcionamento dos agentes, enquanto 52,4% informaram avaliações em conjuntos de teste antes da operação. Observar o que aconteceu e testar se o resultado é aceitável são disciplinas complementares. 2
Para um piloto, vale definir antecipadamente uma tarefa limitada, exemplos representativos, erros inaceitáveis e situações que exigem aprovação humana. Autorizar o agente a sugerir uma resposta não significa autorizar automaticamente um pagamento.
Onde pode estar a oportunidade para startups
Nossa leitura é que existe espaço para empresas que conheçam profundamente uma operação e consigam assumir responsabilidade por uma parte bem definida dela. O diferencial pode estar menos na aparência da interface e mais na capacidade de lidar com os casos difíceis que uma demonstração evita.
Na CRIA, essa é uma pergunta de construção: qual trabalho importante fica efetivamente melhor depois que a tecnologia entra?
Um agente não precisa parecer uma pessoa para ser útil. Precisa evitar que uma pessoa tenha de refazer, escondida nos bastidores, tudo o que ele acabou de apresentar como concluído.