直接比較のベンチマークにおいて、ある主要な汎用LLMは、規制上の日付に関する問題で35%の確率で明らかに誤った回答を出しました。一方、Archer Evolv™はエラーゼロという結果を出しました。
コンプライアンス分野でAIを導入している企業にとって、日付の誤りは期限の遅れを意味します。しかし、それ以上に危険なのは、モデルが「高い確信度」で誤った回答を返し、それがコンプライアンスカレンダーに何気なく反映され、期限が過ぎてから初めて発見されてしまうケースです。Archer®は本日、規制関連業務において、専用に開発されたAIが汎用大型言語モデル(LLM)を圧倒的な差で上回るという結果を発表しました。 この直接対決テストでは、Archerの専用に開発された業界特化型AIと独自データセットを、主要な汎用LLMと比較し、6つの法域にわたる規制文書の公表日、発効日、意見募集締切日を特定するという、コンプライアンスの中核となるタスクについて検証を行いました。
汎用モデルはまさに画期的な成果であり、その品質を問うものではない。アーチャーが解明しようとした問題は、より限定的かつ実用的なものである。すなわち、特定の高リスクな判断を、大規模なレベルで信頼性が高く、迅速かつ手頃なコストで下すには何が必要か、ということだ。専門家が検証した知識ベースに裏打ちされた、特定の分野に特化した垂直的なプロセスは、これら3つの要件をすべて同時に満たすことができる。
正確性:誤答が90%減少
同じ55件の文書について、汎用LLMの誤答率は56%でした。信頼度を設定しても、状況は改善されるどころか、さらに悪化したのです。高い信頼度と評価された回答のうち、35%は依然として誤りでした。Archer Evolvでは、判定結果の95%以上が即座に検証され、残りは使用前に専門家に回されます。誤った日付が本番環境に反映されたことは一度もありません。検証されていないものは一切出荷されません。
サンプル文書に関する結果
正しい
- 一般的なLLMの処理:44%
- Archer Evolv:95%が検証済み、5%が専門家による確認済み
間違いです。有効として返されました。
- 一般的なLLMプロセス:25%
- アーチャー・エボルブ:0%
失敗またはタイムアウト
- 一般的なLLMの処理:31%
- アーチャー・エボルブ:0%
モデル自身の自信は、制御要素ではない。
汎用LLMが「高い確信度」と評価した回答のうち、35%は誤りでした。この精度のギャップこそが、自律型AIを責任を持って導入するための前提条件となります。なぜなら、自律型オペレーターの信頼性は、その判断の根底にある決定の信頼性に左右されるからです。 検証済みで、情報源が追跡可能であり、専門家によって管理された回答があれば、企業全体でAIエージェントを安全に導入することが可能になります。これがAIガバナンスの中核であり、Archerが提供するために構築されたレイヤーです。
「コンプライアンスの観点から言えば、迅速かつ低コストであっても誤った回答は無価値であり、追跡不可能な回答はリスクとなります」と、アーチャーの最高製品・技術責任者(CPTO)であるケイヴァン・アリカニ氏は述べた。「アーチャーが専用に開発したAIは、判定の95%以上をリアルタイムで検証しました。これこそが、企業が結果に対する管理を失うことなくAIエージェントを拡張できる基盤なのです。」
スピード:リアルタイムで回答が確認可能
要望に応じて、汎用プロセスの応答時間は、5秒のタイムアウト枠内で1回あたり平均約4秒でした。一方、Archer Evolvは検証済みの日付を約0.05秒で提供し、繰り返し検索では約80倍の速度を実現しました。規制カレンダーのペースで業務を行うAIエージェントやアナリストにとって、これは「業務に追いつく」か「ボトルネックになる」かの分かれ目となります。
コスト:オンデマンドの推論ではなく、永続的で検証済みの知識ベース
汎用的な処理では、以前の検索結果を記憶することなく、リクエストがあるたびに答えを再計算します。一方、Archer Evolvはデータ取り込み時に一度だけ計算を行い、その結果をスケーラブルで専門家が管理するナレッジベースに検証して登録し、将来のすべての検索に対して、わずかなコストとレイテンシでその情報を保持します。規制が改正された場合、Evolvは変更を先回りして検知し、再検証を行い、更新された回答にバージョン管理を施します。 提供される情報は決して古くなることはありません。500件の文書からなるコーパスで、各文書につき月12回の検索が行われる場合、500件の文書に対して6,000回の判定が行われます。Archer Evolvは推論呼び出しの約92%を回避し、この構造的な節約効果はデータ量が増えるにつれてさらに拡大します。
こうしたことが可能になるのは、文脈があるからこそです
Archer Evolvの強みは、コンテキストにあります。AIが処理を実行する前に、組織の管轄範囲、製品、事業部門、リスク、規制上の課題を評価するため、あらゆる判断がその企業にとって関連性の高い事実に基づいています。これこそが、「単なる答え」と「正当化可能な答え」との違いです。 企業が展開するエージェントが増えれば増えるほど、その基盤の価値は高まります。なぜなら、各エージェントは、世界を一から再構築するのではなく、検証済みで情報源が追跡可能な同じ基盤を継承するからです。
「今後10年間でSaaS市場を制する企業は、ドメイン特化型AIと、基盤モデルでは再現できない独自の業界固有のコンテキストを組み合わせるだろう」と、アーチャー社の最高経営責任者(CEO)であるビル・ディアス氏は述べた。「それこそが競争上の堀であり、その効果は倍増していく。今回のテストがその証明だ。」
調査方法の詳細、出典データ、および事例研究は、Archerのソート・リーダーシップ・ウェブサイト(compliance.ai/evolv_assets/case-01-evolv-vs-raw-llm.html)でご覧いただけます。Archer Evolvの実際の動作をご覧になりたい場合は、www.archerirm.com をご覧ください。
アーチャーについて
Archerは、世界をリードする企業がリスク、コンプライアンス、規制変更を管理する仕組みを支えています。フォーチュン500企業の半数や、世界トップ50の銀行のうち37行を含む、1,300以上の組織がArcherを導入しています。世界では6分ごとに新たな規制変更が発生しており、自律型AIの進化のスピードは、それを管理するほとんどのチームの能力を上回っています。 Archerの専用AIは、GRC分野における最も詳細な規制データと専門知識に基づいており、すべての結果はその出所まで遡ることができ、あらゆる意思決定を正当化することができます。Archerは、規制変更管理、AIリスク管理、規制インテリジェンス、サードパーティリスク、ITおよびセキュリティリスクなど、GRCの全領域にわたるソリューションを提供しています。詳細については、www.archerirm.com をご覧ください。






