Num teste comparativo direto, um LLM de uso geral líder cometeu erros evidentes em 35% das vezes no que diz respeito a datas regulamentares. O Archer Evolv™ não apresentou qualquer erro
Para as empresas que implementam IA na área da conformidade, uma data errada equivale a um prazo não cumprido. A falha mais perigosa é uma resposta errada que o modelo devolve com elevada confiança, uma resposta que é incorporada silenciosamente num calendário de conformidade e só é descoberta depois de o prazo ter expirado.A Archer® divulgou hoje resultados que demonstram que a IA concebida especificamente para este fim supera, e por uma margem considerável, um modelo de linguagem de grande escala (LLM) de uso geral no que diz respeito ao trabalho regulamentar. Este teste comparativo colocou frente a frente a IA da Archer, desenvolvida especificamente para este fim e orientada para um setor específico, juntamente com os seus conjuntos de dados proprietários, contra um LLM de uso geral líder de mercado, numa tarefa essencial de conformidade: determinar as datas de publicação, de entrada em vigor e de encerramento do período de comentários de documentos regulamentares em seis jurisdições.
Os modelos de uso geral representam um verdadeiro avanço, e isto não constitui, de forma alguma, um julgamento sobre a sua qualidade. A questão que Archer se propôs a responder é mais específica e mais prática: o que é necessário para tornar uma decisão específica e de alto risco fiável, rápida e acessível em grande escala. Um processo vertical e centrado num domínio específico, assente numa base de conhecimento verificada por especialistas, destaca-se em todos estes três aspetos ao mesmo tempo.
Precisão: 90 % menos respostas erradas
Nesses mesmos 55 documentos, o LLM de uso geral errou em 56% das vezes. O nível de confiança agravou a situação, em vez de a melhorar. Das respostas às quais atribuiu um nível de confiança elevado, 35% continuavam a estar erradas. Com o Archer Evolv, mais de 95% das determinações são verificadas de imediato e as restantes são encaminhadas para um especialista antes de serem utilizadas. Nenhuma data errada chegou à produção. Nada é enviado sem ter sido verificado.
Resultados relativos aos documentos de amostra
Certo
- Processo genérico de LLM: 44%
- Archer Evolv: 95% verificado, 5% revisto por especialistas
Errado, considerado válido
- Processo genérico de LLM: 25%
- Archer Evolv: 0%
Falha ou tempo limite esgotado
- Processo genérico de LLM: 31%
- Archer Evolv: 0%
A confiança de uma modelo não é um fator de controlo.
Das respostas que o LLM de uso geral classificou como de elevada confiança, 35% estavam erradas. Essa lacuna de precisão é a condição prévia para a implementação responsável da IA agênica, porque um operador autónomo só é tão fiável quanto as determinações subjacentes. Respostas verificadas, com origem rastreável e supervisionadas por especialistas tornam possível implementar com segurança agentes de IA em toda a empresa. Este é o cerne da governação da IA e a camada que a Archer foi concebida para fornecer.
«No âmbito da conformidade, uma resposta rápida e barata, mas errada, não tem qualquer valor, e uma resposta cuja origem não se consegue rastrear constitui um risco», afirmou Kayvan Alikhani, Diretor de Produto e Tecnologia da Archer. «A IA da Archer, concebida especificamente para este fim, verificou mais de 95% das determinações em tempo real. Essa é a base que permite às empresas expandir a utilização de agentes de IA sem perderem o controlo sobre o resultado.»
Rapidez: respostas verificadas em tempo real
Conforme solicitado, o processo de uso geral demorou, em média, cerca de quatro segundos por resposta, dentro de um limite de tempo de cinco segundos. O Archer Evolv forneceu uma data verificada em aproximadamente cinco centésimos de segundo, sendo cerca de 80 vezes mais rápido em consultas repetidas. Para os agentes de IA e analistas que trabalham ao ritmo de um calendário regulatório, essa é a diferença entre acompanhar o ritmo e tornar-se o gargalo.
Custo: uma base de conhecimento persistente e verificada, e não inferência a pedido
Um processo de uso geral recalcula a resposta a cada pedido, sem guardar qualquer registo do que encontrou anteriormente. O Archer Evolv efetua o cálculo uma única vez no momento da ingestão, verifica o resultado numa base de conhecimento escalável e gerida por especialistas e armazena-o para todas as consultas futuras, por uma fração do custo e da latência. Quando uma regulamentação é alterada, o Evolv deteta a alteração de forma proativa, volta a verificar e cria uma versão da resposta atualizada. Nenhuma resposta fornecida fica desatualizada. Para um corpus de 500 documentos com 12 consultas por mês cada, isso representa 6 000 determinações em comparação com apenas 500. O Archer Evolv evita cerca de 92% das chamadas de inferência, uma poupança estrutural que aumenta à medida que o volume cresce.
É o contexto que torna isto possível
A vantagem do Archer Evolv reside no contexto: antes de qualquer IA entrar em funcionamento, esta avalia as jurisdições, os produtos, as unidades de negócio, os riscos e os temas regulamentares da organização, para que cada decisão se baseie no que é relevante para essa empresa. Esta é a diferença entre uma resposta e uma resposta defensável. Quanto mais agentes uma empresa implementar, mais valiosa se torna essa base, porque cada agente herda a mesma base verificada e com origem rastreável, em vez de ter de reconstruir o mundo a partir do zero.
«As empresas que se destacarão na próxima década do SaaS irão combinar IA específica de cada domínio com contexto proprietário e específico de cada setor — algo que os modelos de base não conseguem replicar», afirmou Bill Diaz, diretor executivo da Archer. «Essa é a vantagem competitiva, e ela vai-se reforçando. Este teste é a prova disso.»
A metodologia completa, os dados de origem e o estudo de caso estão disponíveis no site de liderança de pensamento da Archer, compliance.ai/evolv_assets/case-01-evolv-vs-raw-llm.html. Para ver o Archer Evolv em ação, visite www.archerirm.com.
Sobre a Archer
A Archer impulsiona a forma como as principais empresas mundiais gerem o risco, a conformidade e as alterações regulamentares. Mais de 1 300 organizações utilizam a Archer, incluindo metade das empresas da Fortune 500 e 37 dos 50 maiores bancos mundiais. A cada seis minutos surge uma nova alteração regulamentar algures no mundo, e a IA autônoma está a ultrapassar a capacidade da maioria das equipas para a gerir. A IA da Archer, concebida especificamente para este fim, baseia-se nos dados regulamentares mais abrangentes e na especialização no domínio da GRC, pelo que cada resultado remete à sua fonte e cada decisão pode ser justificada. A Archer oferece soluções em toda a gama de GRC, incluindo gestão de alterações regulamentares, gestão de riscos com IA, inteligência regulamentar, riscos de terceiros e riscos de TI e de segurança. Saiba mais em www.archerirm.com.






