No chat, alguns segundos de espera passam despercebidos. Ao telefone, esses mesmos segundos bastam para o cliente perder a paciência, repetir a pergunta ou pedir para falar com um humano. Essa diferença orientou a estratégia do Inter ao levar a IA generativa para o canal de voz. Para o banco, o assistente virtual que apenas responde perguntas ficou no passado. A aposta agora é uma rede de agentes de IA que conversa com naturalidade, executa transações e encaminha o cliente para o lugar certo na primeira tentativa.
O projeto, desenvolvido com a ElevenLabs, foi apresentado no CONAREC 2026 por Guilherme Nunes, gerente executivo de Customer Experience do Inter, Ivan Preti, Director GTM Strategic Sales da ElevenLabs, e José Petry, Forward Deployed Director da empresa, no painel ‘Agentes de IA em Rede: É o fim da era dos assistentes?’.
Começar onde havia mais controle
O Inter organiza sua operação por avenidas de produtos, como cartão, saldo e investimentos. Para dar o primeiro passo com IA generativa por voz, o banco escolheu justamente a área que, à primeira vista, parecia a mais complexa.
A decisão foi baseada em ponto específico. Em investimentos, a equipe conseguia estabelecer os guardrails adequados e garantir que a base de perguntas frequentes fosse bem interpretada pela IA, gerando respostas resolutivas. “A gente queria provar a tese de que o cliente conseguiria se servir sozinho, mesmo entendendo conceitos às vezes complexos de investimento”, explica Guilherme Nunes, do Banco Inter.
A tese se confirmou. Clientes passaram a fazer resgates e aplicações no Meu Porquinho, um dos produtos de investimento do banco, com atendimento totalmente conduzido por IA generativa. “Um atendimento que levaria três, quatro, cinco minutos no call center, a gente evitou o transbordo e resolveu diretamente com a IA”, afirma o executivo.
A latência como critério decisivo
Na escolha do fornecedor, o Inter tinha uma exigência inegociável em oferecer uma experiência de alta performance no telefone. Durante as provas de conceito, porém, nenhuma das soluções avaliadas entregava a qualidade de voz e o tempo de resposta esperados.
“Em uma conversa de voz, o cliente não está disposto a esperar três, quatro, cinco segundos por uma resposta. Se a gente seguisse esse caminho, não ia resolver nenhum problema. Ia causar outros”, afirma Guilherme.
A resposta veio de forma prática. Graças à integração nativa com telefonia, Petry colocou o celular sobre a mesa, conectou uma linha e convidou o time do banco a conversar com o agente de IA ali mesmo. “No primeiro dia, a gente já conseguiu entregar métricas que batiam concorrentes que estavam havia meses fazendo a implementação”, conta Ivan.
Segundo Guilherme, a latência da solução, na casa dos milissegundos, torna quase imperceptível que o cliente está falando com uma máquina. Os indicadores também pesaram na decisão: taxa de solução de 80%, CSAT acima de 4,5 e retenção superior a 50%. “A gente falou: é isso que estávamos procurando”, resume. Outro fator foi a velocidade. Em uma semana, o piloto já rodava em produção e gerava resultados.
Por que voz exige outra arquitetura
A diferença entre texto e voz vai além da percepção do cliente. Ela está na base tecnológica. “Quando abro um chatbot ou o WhatsApp, a latência não é uma preocupação. Na voz, o cliente está no telefone e não quer esperar cinco segundos para o agente começar a responder. É uma conversa que precisa ser instantânea”, explica José Petry.
Segundo ele, o diferencial está no fato de a ElevenLabs ter nascido como um laboratório de pesquisa e desenvolver internamente todos os modelos envolvidos na conversa: o de transcrição da fala do usuário (STT), o que transforma texto em voz (TTS) e os que lidam com situações como interrupções. “O agente pode estar dando uma informação e o usuário quer interromper, dizer que não é aquilo. Tecnicamente, identificar isso e dar continuidade à conversa é difícil”, afirma.
Petry aponta que muitas empresas tentam montar a solução combinando APIs de diferentes fornecedores. “Na hora de acoplar, esses modelos não funcionam com a mesma performance. Como somos donos dessa base, os modelos foram feitos para conversar entre si, com foco em baixíssima latência e telefonia totalmente integrada.”
Ivan acrescenta que, enquanto parte do mercado investe em modelos speech-to-speech, a empresa mantém uma arquitetura em cascata avançada. “Esse pipeline conversacional traz guardrails, observabilidade, segurança da informação e auditoria, que é o que o Inter precisa.”
Um concierge para orquestrar agentes
Com a tese validada em investimentos, o Inter trabalha agora para ampliar o projeto. O plano é colocar no topo da URA um concierge, um grande orquestrador de agentes. O cliente diz o que deseja e esse agente aciona outro, especializado naquele problema. Quando a questão não puder ser resolvida pela IA, o cliente é direcionado à fila exata do atendimento humano.
Esse detalhe tem impacto direto na operação. “Quando a gente tem que transferir um cliente, acaba pagando duas vezes: para a posição de atendimento que recebeu e para a outra, para onde ele vai ser transferido. A nossa ideia é eliminar a transferência de atendimento”, diz Guilherme. O banco chama esse modelo de frictionless. “Ele vai desligar com o atendimento resolvido naquela ligação.”
Em vez de reconstruir sua estrutura, o Inter optou por um caminho híbrido. A Seven, Inteligência Artificial do banco criada sobre uma arquitetura de chat e mensageria, será integrada à plataforma agêntica da ElevenLabs. Os agentes já treinados no chat vão ganhar capacidade transacional também na voz.
A criação dessa voz envolve o departamento de produção de vozes da ElevenLabs, que trabalha com o time do Inter para traduzir os atributos da marca em uma voz sintética, a partir de uma referência real.
Para Ivan, isso resolve uma lacuna antiga das empresas. “Quem é de marketing ou comunicação sabe: todo mundo fala de atributos de marca. Mas e a voz? Quem conseguia construir uma voz sintética que transmitisse esses atributos?”, provoca. A voz da Seven poderá ser usada em todos os pontos de contato: na URA, em campanhas de marketing, no Instagram e dentro do aplicativo.
Engenharia lado a lado
A implementação conta com um modelo de trabalho em que a mesma equipe acompanha o cliente da pré-venda ao resultado final. “Participo desde a parte pré-venda, quando entendemos as dores. Após o fechamento do contrato, a mesma pessoa continua dentro do cliente para ajudar o projeto a ter sucesso”, explica Petry.
O trabalho envolve diferentes áreas do banco, que atuam de forma integrada em torno das metas do projeto. “Estamos falando de banco. Segurança é prioridade máxima”, ressalta. Com a área de TI, a equipe cuida das integrações com as APIs transacionais. Com o time de CX, define tom de voz, o que o agente deve falar, em que momento e com quais informações.
Os números do projeto
- Implementação do piloto em produção em uma semana.
- Taxa de solução de 80% como referência de desempenho.
- CSAT acima de 4,5.
- Retenção superior a 50% no topo da URA.
- Atendimentos de três a cinco minutos no call center resolvidos integralmente por IA generativa na avenida de investimentos.
Uma voz sem fronteiras
O próximo capítulo acompanha a expansão internacional do Inter, que já opera em Miami e na Argentina e prevê chegar a outros países. “Queremos trazer um case em que a voz não tem fronteira. Não importa o idioma nem onde o cliente esteja, ele vai conseguir falar com o Inter do jeito que preferir, por voz ou mensagem, e receber o mesmo atendimento, com a mesma qualidade agêntica”, projeta Guilherme.
Para Petry, a mudança também será cultural. Hoje, muitos clientes ainda pedem para falar com um humano assim que percebem estar diante de um assistente virtual. Esse comportamento, segundo ele, tende a se inverter. O executivo cita a previsão de Mati Staniszewski, fundador da ElevenLabs, de que a IA vai vencer o teste de Turing na voz nos próximos 12 meses.
“A minha provocação é: quando você ligar no Inter e o agente te transferir para o humano, peça para voltar. O agente vai conseguir te atender de forma mais efetiva, empática, treinada e rápida”, conclui.





