02 out 2026
Observabilidade: Quando a IA ajuda a fazer um Pix, como saber o que aconteceu?

À medida que agentes de inteligência artificial passam a interpretar solicitações e executar ações em outros sistemas, compreender o percurso entre o pedido e a resposta se torna essencial para avaliar seu comportamento.

A inteligência artificial vem assumindo novas funções nas jornadas digitais. Além de responder perguntas ou gerar conteúdo, agentes de IA podem consultar informações, acionar ferramentas e conduzir tarefas que dependem da interação com diferentes serviços.

Essa evolução amplia as possibilidades de aplicação da tecnologia, mas também traz um desafio: quando um agente apresenta uma resposta, como saber quais decisões foram tomadas e se a mensagem corresponde ao que realmente ocorreu?

Considerar apenas a conclusão exibida ao usuário pode não ser suficiente. Uma resposta aparentemente correta pode ter sido produzida após um caminho inadequado. Da mesma forma, o agente pode comunicar que uma tarefa foi concluída antes de receber a confirmação necessária ou apresentar de maneira imprecisa o retorno de outro serviço.

É nesse contexto que ganha relevância a observabilidade, prática que permite compreender o que aconteceu durante a atuação de um agente de inteligência artificial. Para isso, são reunidas evidências sobre o que foi interpretado, quais recursos foram acionados, que retornos foram recebidos e como essas informações se refletiram na resposta apresentada ao usuário.

Esses elementos ajudam a reconstruir o percurso seguido pelo agente. A avaliação, então, compara o que ocorreu com critérios previamente definidos para verificar se a tarefa foi conduzida da maneira esperada. Sem informações suficientes sobre a execução, essa análise perde contexto; sem referências claras, não é possível determinar a qualidade do atendimento.

No ICTi, essa abordagem integra estudos voltados à avaliação de agentes e modelos de linguagem em ambientes de produto. As iniciativas investigam formas de acompanhar interações, aplicar critérios de qualidade e comparar o desempenho de diferentes versões de sistemas inteligentes.

Para entender como essa análise funciona na prática, podemos recorrer a uma situação simples e familiar: um Pix solicitado por meio de uma conversa.

 

Do pedido à confirmação do Pix

Neste artigo, chamamos de agente de IA o assistente capaz de conversar com o cliente, consultar informações e realizar ações em outros sistemas.

Imagine que uma pessoa encaminhe uma cobrança e peça ao agente para fazer o Pix. O sistema identifica o valor e o destinatário e apresenta essas informações ao cliente. Depois da autorização, tenta realizar a transferência e, antes de responder “Pix realizado”, precisa conferir se o sistema de pagamentos confirmou a operação.

Essa sequência revela uma diferença importante: a autorização do cliente permite tentar o Pix, mas não comprova que o dinheiro foi enviado. Nesse caso, é a resposta do sistema de pagamentos que informa se a transferência realmente aconteceu.

Considere agora dois atendimentos que terminam com a mesma mensagem. No primeiro, o agente apresentou os dados, recebeu a autorização e obteve do sistema a confirmação da transferência. No segundo, anunciou a conclusão apesar de o sistema ter informado uma falha.

Apenas no primeiro caso a mensagem corresponde ao resultado da operação.

Também existiria um problema se o agente tentasse realizar o Pix antes da autorização, mesmo que a transferência fosse posteriormente concluída. Sendo assim, para avaliar se o pedido foi atendido corretamente, é necessário relacionar a solicitação do cliente, os dados apresentados, a autorização, as ações executadas pelo agente e a resposta do sistema de pagamentos.

 

Os registros ajudam a reconstruir o atendimento

É nesse ponto que entra a observabilidade: a possibilidade de reconstruir o que o assistente fez durante o atendimento a partir de registros relacionados ao mesmo pedido.

Esses registros são anotações com data e hora que ajudam a conferir quando o valor e o destinatário foram identificados, quando os dados foram apresentados ao cliente, se houve autorização, quando ocorreu a tentativa de transferência e qual resposta foi devolvida pelo sistema de pagamentos.

Os registros precisam mostrar que a autorização e a tentativa pertencem ao mesmo Pix e ocorreram na ordem esperada. A mensagem “Pix realizado” não substitui o retorno do sistema de pagamentos. Sem essa resposta, ainda não é possível saber se a transferência foi concluída ou se falhou.

No exemplo fictício apresentado neste artigo, o atendimento pode ser reconstruído em quatro momentos: interpretação do pedido; apresentação dos dados e autorização; tentativa de transferência e retorno do sistema; e resposta enviada ao cliente.

Figura 1. Etapas e registros utilizados para avaliar o Pix fictício. A avaliação compara as evidências disponíveis com o comportamento esperado. Se faltar o retorno do sistema, a conclusão sobre a transferência permanece pendente. O desenho não representa o funcionamento interno de um produto do Itaú.

A figura mostra que cada etapa produz uma evidência diferente. Na interpretação do pedido, os registros indicam o valor e o destinatário identificados. Na apresentação e autorização, mostram os dados exibidos e a confirmação do cliente. Na execução, registram a tentativa e o retorno do sistema. Por fim, documentam a resposta enviada ao cliente.

A avaliação relaciona essas evidências aos critérios definidos para a jornada. Uma resposta enviada ao cliente comprova que houve uma comunicação, mas não confirma, isoladamente, o resultado da operação. Para concluir que o Pix foi realizado, é necessário encontrar também o retorno correspondente do sistema de pagamentos.

A ausência de uma evidência esperada também precisa ser considerada. Se houver o registro da tentativa, mas não o retorno do sistema, não existe base suficiente para classificar a transferência como concluída ou malsucedida. Nesse caso, a conclusão permanece pendente.

É possível registrar essas etapas sem guardar a conversa inteira, desde que sejam definidos os dados necessários para investigar o atendimento e as pessoas autorizadas a consultá-los. A Lei Geral de Proteção de Dados Pessoais determina a adoção de medidas técnicas e administrativas para proteger dados pessoais contra acessos não autorizados e situações acidentais ou ilícitas.

 

Como avaliar o que a IA fez e disse

Com os registros em mãos, é possível comparar o que aconteceu com o comportamento esperado. Essa é a avaliação do atendimento.

No Pix fictício, a análise verifica se o agente apresentou corretamente o valor e o destinatário, esperou a autorização, registrou a tentativa de transferência e conferiu a resposta do sistema antes de comunicar o resultado.

Parte dessa conferência pode ser realizada automaticamente. É possível verificar, por exemplo, se a tentativa ocorreu depois da autorização ou se existe um retorno do sistema associado à operação.

Também é necessário conferir se a mensagem enviada ao cliente corresponde ao resultado registrado. Se o sistema informou uma falha, a resposta “Pix realizado” está incorreta. Se o retorno não foi registrado, a transferência ainda não pode ser considerada confirmada.

Uma avaliação baseada apenas na frase final deixaria passar esses problemas. O resultado precisa ser analisado em conjunto com as etapas e evidências da jornada.

 

Quando outro modelo de IA participa da avaliação

Um modelo de linguagem de grande porte, conhecido pela sigla LLM, também pode ajudar a avaliar o atendimento.

Esse uso é chamado de LLM as a judge, ou “modelo de linguagem como avaliador”. Nesse formato, o modelo compara os critérios definidos para a jornada com os registros do que o assistente fez e disse.

No exemplo do Pix, o avaliador pode analisar se o agente apresentou os dados, aguardou a confirmação, tentou realizar a transferência e comunicou uma resposta coerente com o retorno do sistema. A mensagem final, sozinha, não é suficiente para essa análise.

Um estudo sobre avaliações realizadas por modelos de linguagem identificou limitações como vieses relacionados à posição, à extensão das respostas e à preferência do modelo por conteúdos semelhantes aos produzidos por ele próprio. Essas limitações reforçam a importância de critérios claros, testes de consistência e revisão humana em situações duvidosas.

A conferência pode começar com exemplos de atendimento utilizados antes de uma mudança no agente. Durante o uso, os registros podem revelar problemas que esses exemplos não previram. Depois de investigado, um caso pode ser transformado em um novo teste para a versão seguinte.

Assim, testes, observação, investigação e melhoria passam a integrar um ciclo contínuo de avaliação.

 

Por que conferir ações e respostas da IA nas finanças

O Pix mostra por que o resultado de uma ação precisa ser verificado antes de ser comunicado ao cliente. Em uma orientação financeira, também é necessário saber de onde veio a informação apresentada.

No aplicativo do Itaú, o cliente pode perguntar à assistente ia.i quanto gastou em uma categoria ou como pode economizar. Para conferir uma resposta sobre gastos, é necessário saber quais dados e qual período foram considerados.

A linha de pesquisa em Inteligência Artificial do ICTi inclui assistentes conversacionais para serviços e transações, ambientes de experimentação em IA generativa, testes, métricas, controles de segurança e orquestração de múltiplos agentes.

Essas frentes mostram como avaliação, rastreabilidade e governança se tornam relevantes à medida que sistemas inteligentes participam de jornadas com diferentes etapas, ferramentas e decisões.

Os produtos apresentados publicamente pelo Itaú ajudam a compreender a importância dessas perguntas. Eles não revelam, porém, como cada atendimento é registrado nem permitem afirmar quais métodos de pesquisa foram aplicados a cada produto.

 

O que o ICTi pesquisa para conferir agentes de IA

Parte das pesquisas desenvolvidas pelo ICTi e pelo Itaú está descrita em pedidos de patente publicados pelo Instituto Nacional da Propriedade Industrial.

Um desses métodos compara versões de um agente em cenários de teste e gera relatórios com os resultados. No Pix fictício, um cenário poderia verificar se o agente mostrou o valor e o destinatário, aguardou a autorização e recebeu o retorno do sistema antes de comunicar uma conclusão.

A solução organiza a avaliação de agentes a partir de cenários configuráveis, métricas específicas e relatórios comparativos, permitindo acompanhar diferentes versões de forma estruturada e rastreável.

Quando o agente já está em uso, outro método reúne registros, aplica verificações automáticas e encaminha casos selecionados a modelos que avaliam o atendimento. Esse processo busca identificar falhas que não haviam aparecido nos testes anteriores.

O pedido de patente sobre avaliação integrada de agentes descreve uma abordagem que combina registros operacionais, detectores, modelos avaliadores e métricas de qualidade. O conteúdo do pedido pode ser utilizado em materiais públicos após sua publicação, mas deve ser apresentado como pedido de patente publicado, e não como patente concedida enquanto o exame do INPI não estiver concluído.

Uma patente já concedida descreve um método que recebe pedidos por texto, voz ou imagem, decide se deve utilizar regras, módulos especializados ou um modelo de IA e registra as decisões e os resultados da interação.

Quando uma resposta exige um cálculo, outro método identifica a operação, realiza a conta em um componente separado do modelo de IA e registra os dados usados para conferir a explicação apresentada ao cliente.

Há ainda um método voltado à conferência da própria avaliação, que compara julgamentos automáticos com revisões feitas por especialistas e examina uma amostra dos atendimentos que ficariam fora da análise detalhada. A proposta busca distinguir falhas na seleção dos casos de erros no julgamento realizado.

Outra pesquisa do ICTi combina análise automatizada e conhecimento especializado para avaliar conteúdos produzidos por modelos de linguagem. Quando os avaliadores divergem, o sistema registra os pontos de discordância e produz explicações que apoiam a investigação.

Embora tenham objetivos e estruturas diferentes, essas iniciativas compartilham uma preocupação: compreender não apenas a resposta apresentada por um agente, mas também as ações, os registros e as decisões que levaram ao resultado.

 

O que o cliente precisa saber

Voltemos à mensagem “Pix realizado”.

  • Se o valor e o destinatário estavam corretos, o cliente autorizou a tentativa e o sistema confirmou a transferência, o Pix pode ser tratado como concluído.
  • Se o sistema informou uma falha, o cliente precisa saber que a transferência não foi realizada.
  • Se o retorno do sistema não está disponível, a mensagem final não basta para afirmar que a operação aconteceu. O resultado ainda precisa ser verificado.

O cliente não deveria precisar adivinhar se o Pix saiu. Registros relacionados ao mesmo atendimento permitem investigar essa dúvida, enquanto critérios claros ajudam a conferir se o agente agiu e respondeu de maneira adequada.

Quando as informações disponíveis não permitem chegar a uma conclusão, reconhecer esse limite também faz parte de um atendimento confiável.

Ao pesquisar formas de observar, testar e avaliar agentes de inteligência artificial, o ICTi contribui para o desenvolvimento de sistemas mais transparentes, consistentes e preparados para atuar em cenários complexos. Essa agenda conecta pesquisa aplicada, rigor técnico e uso responsável da inteligência artificial, especialmente em jornadas nas quais a qualidade da resposta precisa estar apoiada pelas evidências do que realmente aconteceu.

 

Referências e contexto