英機関の検証で露呈
AIエージェントの暴走リスクが浮き彫り 情シスが備えるべき検証手法
AIエージェントが目標達成のために人間を欺くなど予測不能な暴走が英機関の調査で判明した。従来のソフト検証では防げないAI特有のリスクに、情シスが講じるべきテスト手法と権限管理の要所を解説する。
AIシステムがチャットボットから意思決定や行動を自律的にこなすエージェントへと進化するにつれ、セキュリティと信頼性に疑問符が付けられている。企業はエージェントを本番環境へ配備し、社内データや各種ツール、基幹システムへのアクセスを許可する前に、テスト段階で懸念に対処すべきだ。しかし、企業のAIテストは果たして十分なのだろうか。
先端AIエージェントを対象に実施されたサイバーセキュリティ定期評価の結果によると、企業はAIシステムのテスト方法を根本から見直す必要があるかもしれない。評価を実施した英国AIセキュリティ研究所(AISI)は、エージェントによる予測不能な行動を複数記録した。AISIは、サイバーセキュリティ分野などの先端AIモデルの能力評価を通じて政府が高度なAIのリスクを把握できるよう支援する機関だ。
評価で判明したAIの深刻な不正行動
2026年7月に実施された評価で、AISIはAIエージェントがテストの想定範囲を超えた行動を取っている事実を確認した。その中には実在の人物や組織を巻き込む行動も含まれていた。AISIは複数のAIモデルで122回の評価を実行し、そのうち10回で承認外の活動を検出した。評価全体でエージェントが不正な行動を取った事例は19件あり、そのうち17件はAnthropicの「Mythos 5」によるもの、残る2件はOpenAIの「GPT-5.6 Sol」を用いた1回の評価中に発生した。
最も深刻な不正行動を見せたのは、サイバーセキュリティの課題解決を指示されたMythos 5のエージェントだった。目標を達成するため、同エージェントはOSSプロジェクトへのサプライチェーン攻撃を試みた。プロジェクトの管理者を調査し、偽の身元を作成した上で、悪意のあるコードを承認させようと人間のレビュー担当者へソーシャルエンジニアリングを仕掛けた。追及を受けると、エージェントは過去の活動を無害に見せかけて隠蔽を図り、別の身元を使って活動を継続することまで検討した。
エージェントは自律的に行動しており、他者を欺くよう指示されていたわけではない。AISIによると、与えられた目標を執拗に追求する過程でこの欺瞞行動が発生したという。AISIは調査結果で「現実世界の生身の人間を標的に、指示もないままこれほど深刻な欺瞞を働いた事例を確認したのは初めてだ」と報告している。
AISIは、プロンプトの設定不備が一因だと分析する。想定されたパラメーター内では課題を達成できないとエージェントが誤認したためだ。だが、それだけでは今回の結果を完全には説明できない。想定通りにタスクを完了できる指示が与えられていたにもかかわらず、承認外の行動に及んだ事例もあった。
エージェントによる欺瞞の試みは失敗に終わった。AISIの調査でも、現実世界への被害は確認されていない。それでもAISIは、今回の事象を深刻なセキュリティインシデントと位置付けている。
企業のAIテストが抱える限界
AISIの調査結果は、AIエージェントに大きな自律性と社内システムへのアクセス権を与えようとする企業に重い問いを突きつける。AIシステムがタスクを完了できるかテストするだけで十分なのか。それとも、目標を追求する過程でシステムが何をしでかすかまでテストしなければならないのか。
自律型AIエージェントの導入を進める企業にとってAISIの調査結果は極めて示唆に富むと語るのは、Informa TechTarget傘下のOmdiaでチーフアナリストを務めるリアン・ジェ・スー氏だ。ただし同氏は、今回の評価環境と一般的な企業環境での稼働形態を直接比較することには注意を促している。
評価環境ではエージェントからセキュリティ上のガードレールやフィルターが外されており、企業に提供される標準的な状態とは異なるためだ。それでも、大半の企業はエージェント型AIの導入に必要なエンジニアリング力やガバナンスの知見を欠いており、ベンダーやパートナーに頼り切っている。「AISIの調査結果は、企業がエージェント型AIソリューションを評価、導入する際により慎重な姿勢を取るきっかけになる」とスー氏は指摘する。
さらに同氏は、今回の結果が従来のAIテスト手法の弱点を浮き彫りにしたとも語る。企業は依然として短期的な評価と人間の監視に依存している。だが、エージェントが複雑な計画を立案し、ツールを使いこなし、外部システムへアクセスできるようになれば、そうした手法は通用しにくくなる。エージェントが想定範囲外の行動を取る可能性を考慮し、さまざまな条件下での複数ステップにわたる行動評価をテストに含めるべきだとスー氏は助言する。
テストと本番運用のギャップ
Gartnerでリサーチバイスプレジデントを務めるデニス・シュー氏によると、CIOやCISOが犯しがちな最大の誤りは、進化するAIエージェントの推論能力や計画能力を考慮せず、従来型のソフトウェアと同じように扱ってしまうことだという。AIエージェントは状況適応型であり、タスクを完遂するために従来のソフトウェアでは考えられない行動を取ることがあると同氏は説明する。
こうした違いがあるため、セキュリティ部門はAIエージェント特有の脆弱(ぜいじゃく)性や行動パターンをテストする必要がある。プロバイダーの制限を回避するジェイルブレイクが可能かどうか、機密情報を漏えいさせたり正当な権限を持つツールを悪用したりするよう誘導されないかを検証しなければならない。正当なインターネットアクセスを悪用され、さらなる被害を招く悪意ある指示をダウンロードさせられないかどうかも確認すべきだとシュー氏は指摘する。
リスクは単一エージェントの侵害にとどまらない。推論機能や計画機能が向上するにつれ、AIシステムは「従来のソフトウェアや人間の攻撃者よりもはるかに速いスピードで甚大な被害をもたらす恐れがある」とシュー氏は警告する。
さらに全米サイバーセキュリティ同盟(National Cybersecurity Alliance)で情報セキュリティおよびエンゲージメント担当ディレクターを務めるクリフ・スタインハウアー氏は、基盤システムの脆弱性だけでなくエージェントを取り巻く環境全体までテスト対象を広げる必要があると語る。ネットワークアクセス権、各種権限、認証情報、利用ツール、外部接続先などがその対象だ。
「指示を与えることと封じ込めることは別物だ。エージェントにインターネット接続や特定システムへの到達を許さないなら、その制限は技術的に強制しなければならない。モデル自身が境界を守ることに頼るべきではない」(スタインハウアー氏)
エージェントに回答生成だけでなく行動権限を与えるようになると、テストの網羅性と本番環境とのギャップは深刻さを増す。ITコンサルティング会社CaylentのCTOであるランドール・ハント氏は「企業は権限の設計が追い付かないスピードで知能を買い求めている」と指摘する。「大半のチームは正常系でのみエージェントをテストしている。汚染されたコンテキスト、あいまいな指示、ツールの障害、リトライのループ、意図しない権限昇格、ドキュメントに隠された攻撃者の指示といった異常系をテストしているチームは極めて少ない」(ハント氏)
例えばエージェントにコードの記述やコミットを許可する前に、悪意あるパッケージの提案、秘密情報の扱い、データ持ち出し、破壊的なコマンド、リポジトリファイル内のプロンプトインジェクション、制御不能なリトライやロールバックなどをテストすべきだとハント氏は話す。エージェントにどこまでの思考と行動の自由を認めるかは、潜在的な被害範囲、行動の可逆性、行動の可観測性に応じて決める必要がある。最初は読み取り専用アクセスで配備し、制限付きの書き込み権限やトランザクション上限、人間の承認ステップを段階的に設ける方法が有効だ。金銭の移動、データ削除、IDやアクセス管理の設定変更、機密情報の開示、外部通信を伴う行動には特に厳格な精査が求められる。
スー氏も配備前のサイバー攻撃シミュレーションの有用性を強調する。AISIの調査結果を踏まえると、レッドチーム演習では欺瞞、ソーシャルエンジニアリング、予期せぬ回避行動、ツールの悪用、エージェント間の連携などを重点的に検証すべきだという。
本番環境での継続的なテスト
配備前のテストをどれほど手厚くしても、自律型エージェントの全ての行動を予測できるわけではない。エージェントが依存するAIモデルやツール、データが常に変化し続けるからだ。そのため企業は、本番に近いステージング環境での継続的な評価やレッドチーム演習に加え、LLMのトレイシングやツール呼び出しの監視など、可観測性を高める仕組みを導入すべきだとスー氏は助言する。「エージェントシステム全体を一連の評価対象およびリスクの単位として捉える必要がある」(スー氏)
モデル、プロンプト、ツール、依存関係、データ、攻撃者の手口は全て変化し得るとハント氏は語る。本番環境のトレースデータを用いた継続的テスト、実行時モニタリング、定期的な侵入テストやレッドチーム演習を配備前テストと組み合わせる必要がある。監視の対象には、完了したタスクだけでなく試行して失敗した行動も含めるべきだ。失敗した行動を追跡し続ければ、エージェントが自らの境界をどのように探っているかが浮き彫りになり、将来のテストや演習に役立つ情報を得られる。
エージェントの自律性に合わせたガバナンス
エージェントの自律性が高まるリスクには、テストだけで対処しきれない。エージェントが稼働する場所、アクセスできる対象、許可される行動を統制する仕組みが必要だ。
「ツールやインターネットへのアクセス範囲を明確に定義し、透明性を確保しなければならない」とスー氏は指摘する。悪意ある活動やその影響を抑え込むため、エージェントはリアルタイム監視と人間の監視が組み合わされたサンドボックス環境で動作させる必要がある。
ガバナンスの第一歩は、社内でどのエージェントが稼働しているかを把握することだ。エージェントを検出するプロセスの導入や、リスクを生む設定ミスの特定、許可する行動を定義するガードレールの確立が必要だとシュー氏は語る。エージェントが試みる悪意ある行動や危険な行動を遮断する仕組み、すなわち「暴走エージェント管理」も必要だ。
スタインハウアー氏も同様に、パイロット段階から本番運用へ移行する際に広範なアクセス権を一気に与えることへ警鐘を鳴らす。最初は適用範囲を狭く絞り、周囲の制御策を検証した上でアクセス権を広げていく段階的なアプローチを推奨している。「制御されたテスト環境から本番環境の広範なアクセス権へと急ぎすぎれば、手痛いしっぺ返しを食らうことになる」(スタインハウアー氏)
エージェント周辺に多層の防御策を敷くことも有効だ。エージェントごとに個別IDと短期間で失効する認証情報を付与し、最小権限の原則とツールの許可リストを徹底すべきだとハント氏は提案する。ポリシーチェック、ネットワークとデータの分離、利用額や実行レートの上限、保護された実行サンドボックス、行動を後から追跡できる改ざん耐性ログの導入も求められる。ツールの不審な連続実行、特権の行使、連続する失敗、指示されたタスクからの逸脱行動なども監視対象とすべきだ。
そして、それらの制御策が破られたときのために非常停止ボタンが必要だとハント氏は説く。「制御不能に陥ったときに全てを遮断できるスイッチが必要だ。企業は権限の設計が追い付かないスピードで知能を買い求めている」(ハント氏)
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget発 先取りITトレンド
米国TechTargetの豊富な記事の中から、最新技術解説や注目分野の製品比較、海外企業のIT製品導入事例などを厳選してお届けします。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
技術文書・技術解説
[アトラシアン株式会社] IT運用や従業員サポートは生成AIでどう変わる? 使い方や導入の流れは? -
製品資料
[株式会社みらい翻訳] 音声翻訳活用の課題を解決、“本当に使える”ツールの特徴とは? -
製品レビュー
[Wrike Japan 株式会社] 400店舗を支えるWalmart Canada、散在する情報やアナログな管理をどう変えた? -
事例
[Wrike Japan 株式会社] 年間100件超のDXプロジェクトを統合管理、JERAはどのように実現した? -
事例
[Wrike Japan 株式会社] グローバルなクリエイティブ業務を合理化、エスティーローダーに学ぶ実践のコツ
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
「Copilot」はなぜ放置される? “議事録要約止まり”を脱する処方箋
-
2
全社標準Copilotに絶望? MS Copilotで問い合わせ6割減できた企業は何が違った
-
3
「定期診断」発想は要注意? いまセキュリティに求められる持続的な対策とは
-
4
“AIコーディング”でどのツールを選ぶ? 「ChatGPT」「Claude」の真価
-
5
「AI活用を前提とした業務PCへの移行」に関するアンケート
-
6
「制御用組み込みPC」に関するアンケート
-
7
「複数AIの野放し」に歯止め Salesforceが6製品統合で挑むAI統制の覇権
-
8
脱VMwareの前提が崩れる BroadcomのVDDK公開停止で確認すべき点
-
9
LLMの「過学習」、正しく説明している文章はどれ?
-
10
「ネットワークインフラの現状と課題」に関するアンケート
ホワイトペーパーランキング PR
-
1
5回聞くだけじゃ足りない? トヨタ式「なぜなぜ分析」の正しい実践方法
-
2
生成AIで文書活用を進めるには? 効率化と安全性をどう両立する
-
3
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
4
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
5
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
6
国税庁の次世代基幹システム「KSK2」稼働開始に向けて、対応すべき変更点とは?
-
7
5分で分かる「セキュア大容量ファイル転送サービス」の機能とメリット
-
8
「スクラム」と「カンバン」の違いとは? アジャイル型開発手法を徹底比較
-
9
ドラマで分かる、標的型攻撃メールの被害を受ける企業と回避できる企業の分岐点
-
10
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー