21 set 2026
ICTi desenvolve método inédito para testar a confiabilidade de agentes de inteligência artificial

Nova invenção depositada no INPI pelo ICTi cria um método capaz de avaliar, de forma automatizada, riscos em agentes conversacionais e reforça a estratégia do Itaú de desenvolver Inteligência Artificial responsável, segura e centrada nas pessoas. 

 

A IA já faz parte da rotina de milhões de pessoas. Seja para esclarecer dúvidas, apoiar decisões ou simplificar jornadas, agentes conversacionais vêm assumindo um papel cada vez mais relevante na interação entre empresas e clientes. À medida que essas tecnologias evoluem, cresce também a necessidade de compreender, medir e mitigar riscos associados ao seu comportamento. 

Foi para contribuir com esse desafio que pesquisadores do Instituto de Ciência e Tecnologia Itaú (ICTi) desenvolveram o ‘Método automatizado para detecção e quantificação de risco de indução de psicose por agentes conversacionais de Inteligência Artificial’, uma nova invenção recentemente depositada no âmbito do Programa de Propriedade Intelectual do Itaú. A tecnologia propõe uma abordagem inédita para avaliar a segurança e a confiabilidade de agentes baseados em modelos de linguagem, ampliando a capacidade de governança sobre sistemas de IA generativa. 

O método foi criado para responder a um desafio que vem ganhando atenção da comunidade científica e da indústria: a possibilidade de agentes conversacionais reforçarem crenças infundadas durante interações prolongadas com usuários. Diferentemente de falhas tradicionais de software, esses efeitos tendem a emergir ao longo de múltiplos turnos de conversa, tornando sua identificação mais complexa e exigindo novas formas de avaliação. Desenvolvemos um box ao final do artigo com mais detalhes sobre o tema.  

A solução permite avaliar tanto sistemas desenvolvidos internamente quanto tecnologias fornecidas por terceiros, utilizando uma metodologia consistente e escalável.  

A técnica combina inferência automática do propósito do agente, geração dinâmica de cenários de avaliação e simulação de interações multiturn com representações sintéticas, que podem se basear em perfis agregados de usuários ou em jornadas individuais específicas, conforme a aplicação. Ao longo desse processo, um sistema analisa e avalia diferentes dimensões de risco, como reforço de crenças, fundamentação na realidade e evidência seletiva. O resultado é uma visão abrangente sobre o comportamento do sistema ao longo de toda a interação. 

Além de sua relevância científica, a invenção possui aplicações práticas para organizações que utilizam inteligência artificial em larga escala. No contexto do Itaú, a tecnologia pode contribuir para processos de validação, monitoramento e evolução de agentes conversacionais, apoiando a construção de soluções cada vez mais seguras para clientes e colaboradores. Os relatórios gerados pelo método também podem fortalecer práticas de governança, gestão de riscos e conformidade associadas ao uso de Inteligência Artificial. 

A iniciativa está alinhada à missão do ICTi de transformar pesquisa aplicada em inovação com impacto concreto para o negócio e para a sociedade. Ao desenvolver tecnologias voltadas para segurança, confiabilidade e uso responsável da inteligência artificial, o Instituto amplia a capacidade do Itaú de antecipar desafios tecnológicos e responder a eles com base em ciência, experimentação e conhecimento especializado. 

O objetivo é contribuir para que ela avance de forma responsável. Em um cenário em que a confiança será cada vez mais determinante para a adoção de novas tecnologias, iniciativas como essa ajudam a fortalecer a relação entre inovação e segurança, garantindo que o desenvolvimento de soluções inteligentes continue tendo as pessoas no centro de sua construção.

 

Entenda o desafio: quando a Inteligência Artificial passa a reforçar crenças 

Nos últimos anos, pesquisadores têm investigado um comportamento conhecido como sycophancy (bajulação), a tendência de modelos de linguagem adaptarem suas respostas às opiniões e expectativas dos usuários, mesmo quando elas não estão apoiadas em evidências. Entre os estudos sobre o tema, uma pesquisa conduzida pela Anthropic mostrou que modelos podem privilegiar a concordância em detrimento da precisão factual. 

A preocupação cresce quando esse comportamento é analisado ao longo de múltiplos turnos de conversa. Trabalhos de pesquisadores como Chandra et al. demonstram que ciclos sucessivos de validação podem amplificar crenças ao longo do tempo, criando uma dinâmica difícil de identificar por avaliações tradicionais, normalmente focadas em respostas isoladas.  

O tema também vem sendo explorado por iniciativas como o PsychosisBench, de Au Yeung et al., o DelusionScore, de Shimgekar et al., e o SIM-VAIL, de Weilnhammer et al., que investigam como agentes conversacionais se comportam diante de cenários envolvendo crenças infundadas, vulnerabilidade psicológica e reforço progressivo de narrativas.  

Foi a partir desse avanço da literatura científica que surgiu a invenção desenvolvida pelo ICTi. O método busca preencher uma lacuna apontada por esses estudos: criar uma forma automatizada de avaliar como agentes de Inteligência Artificial se comportam ao longo de conversas completas, gerando evidências que apoiem o desenvolvimento de sistemas mais seguros, confiáveis e alinhados aos princípios de IA Responsável.

Para saber mais: