En una prueba comparativa directa, un modelo de lenguaje grande (LLM) líder para uso general se equivocó con total seguridad el 35 % de las veces en lo relativo a las fechas reglamentarias. Archer Evolv™ no presentó ningún error.
Para las empresas que implementan la IA en el ámbito del cumplimiento normativo, una fecha errónea supone incumplir un plazo. El fallo más peligroso es una respuesta errónea que el modelo devuelve con un alto nivel de confianza, una respuesta que se incorpora silenciosamente al calendario de cumplimiento y que solo se descubre una vez que ha vencido el plazo.Archer® ha publicado hoy unos resultados que demuestran que la IA diseñada específicamente para este fin supera con creces a un modelo de lenguaje grande (LLM) de uso general en tareas regulatorias. Esta prueba comparativa enfrentó la IA de Archer —diseñada específicamente para un sector concreto y con conjuntos de datos propios— a un LLM líder de uso general, en una tarea fundamental de cumplimiento normativo: determinar las fechas de publicación, entrada en vigor y cierre del plazo de comentarios de los documentos normativos en seis jurisdicciones.
Los modelos de uso general suponen un auténtico avance, y esto no pone en duda su calidad. La pregunta que Archer se propuso responder es más concreta y práctica: qué se necesita para que una decisión específica y de gran importancia sea fiable, rápida y asequible a gran escala. Un proceso vertical y centrado en un ámbito concreto, basado en una base de conocimientos verificada por expertos, cumple estos tres requisitos a la vez.
Precisión: un 90 % menos de respuestas incorrectas
En esos mismos 55 documentos, el modelo de lenguaje grande (LLM) de uso general se equivocó el 56 % de las veces. El nivel de confianza empeoró la situación, en lugar de mejorarla. De las respuestas a las que asignó un alto nivel de confianza, el 35 % seguía siendo errónea. Con Archer Evolv, más del 95 % de las determinaciones se verifican directamente, y el resto se remite a un experto antes de su uso. Ni una sola fecha errónea llegó a la fase de producción. No se envía nada sin verificar.
Resultados de los documentos de muestra
Correcto
- Proceso genérico de LLM: 44 %
- Archer Evolv: 95 % verificado, 5 % revisado por expertos
Incorrecto, se ha devuelto como válido
- Proceso genérico de LLM: 25 %
- Archer Evolv: 0 %
Error o tiempo de espera agotado
- Proceso genérico de LLM: 31 %
- Archer Evolv: 0 %
La confianza de una modelo no es un factor de control.
De las respuestas que el modelo de lenguaje grande (LLM) de uso general calificó como de alta confianza, el 35 % eran erróneas. Esa brecha de precisión es la condición previa para implementar la IA agentiva de forma responsable, ya que un operador autónomo solo es tan fiable como las decisiones en las que se basa. Las respuestas verificadas, con origen trazable y supervisadas por expertos permiten implementar con seguridad agentes de IA en toda la empresa. Este es el núcleo de la gobernanza de la IA, y la capa que Archer está diseñado para proporcionar.
«En materia de cumplimiento normativo, una respuesta rápida y barata, pero errónea, no tiene ningún valor, y una respuesta cuya procedencia no se pueda rastrear supone un riesgo», afirmó Kayvan Alikhani, director de Producto y Tecnología de Archer. «La IA de Archer, diseñada específicamente para este fin, verificó más del 95 % de las determinaciones en tiempo real. Esa es la base que permite a las empresas ampliar el uso de los agentes de IA sin perder el control sobre el resultado».
Rapidez: respuestas verificadas en tiempo real
Según las pruebas realizadas, el proceso de uso general tardó una media de unos cuatro segundos por respuesta dentro de un tiempo de espera de cinco segundos. Archer Evolv proporcionó una fecha verificada en aproximadamente cinco centésimas de segundo, lo que supone unas 80 veces más rápido en consultas repetidas. Para los agentes de IA y los analistas que trabajan al ritmo de un calendario normativo, esa es la diferencia entre mantenerse al día y convertirse en el cuello de botella.
Coste: una base de conocimientos persistente y verificada, no una inferencia bajo demanda
Un proceso de uso general vuelve a calcular la respuesta en cada solicitud, sin recordar lo que había encontrado anteriormente. Archer Evolv realiza el cálculo una sola vez en el momento de la ingesta, verifica el resultado en una base de conocimientos escalable y gestionada por expertos, y lo almacena de forma permanente para cada consulta futura a una fracción del coste y la latencia. Cuando se modifica una normativa, Evolv detecta el cambio de forma proactiva, vuelve a verificar y crea una versión de la respuesta actualizada. Nada de lo que se ofrece está nunca desactualizado. Para un corpus de 500 documentos con 12 consultas al mes cada uno, eso supone 6.000 determinaciones frente a solo 500. Archer Evolv evita aproximadamente el 92 % de las llamadas de inferencia, un ahorro estructural que aumenta a medida que crece el volumen.
El contexto es lo que lo hace posible
La ventaja de Archer Evolv radica en el contexto: antes de que se ejecute cualquier IA, esta evalúa las jurisdicciones, los productos, las unidades de negocio, los riesgos y los aspectos normativos de la organización, de modo que cada decisión se basa en lo que es relevante para esa empresa. Esa es la diferencia entre una respuesta y una respuesta defendible. Cuantos más agentes implemente una empresa, más valiosa se vuelve esa base, ya que cada agente hereda los mismos fundamentos verificados y de origen trazable, en lugar de tener que reconstruir el mundo desde cero.
«Las empresas que triunfen en la próxima década del SaaS combinarán la IA específica de cada ámbito con un contexto propio y específico de cada sector que los modelos base no pueden replicar», afirmó Bill Díaz, director ejecutivo de Archer. «Esa es su ventaja competitiva, y se va consolidando con el tiempo. Esta prueba es la demostración de ello».
La metodología completa, los datos de origen y el estudio de caso están disponibles en la página web de liderazgo intelectual de Archer, compliance.ai/evolv_assets/case-01-evolv-vs-raw-llm.html. Para ver Archer Evolv en acción, visita www.archerirm.com.
Acerca de Archer
Archer impulsa la forma en que las empresas líderes a nivel mundial gestionan el riesgo, el cumplimiento normativo y los cambios normativos. Más de 1.300 organizaciones utilizan Archer, entre ellas la mitad de las empresas de la lista Fortune 500 y 37 de los 50 principales bancos del mundo. Cada seis minutos se produce un nuevo cambio normativo en algún lugar del mundo, y la IA autónoma está superando la capacidad de la mayoría de los equipos para gestionarlo. La IA de Archer, diseñada específicamente para este fin, se basa en los datos normativos más exhaustivos y en una profunda experiencia en el ámbito de GRC, de modo que cada resultado se remonta a su fuente y cada decisión puede justificarse. Archer ofrece soluciones que abarcan todo el espectro de GRC, incluyendo la gestión de cambios normativos, la gestión de riesgos mediante IA, la inteligencia normativa, los riesgos de terceros y los riesgos de TI y seguridad. Más información en www.archerirm.com.






