“期待外れ”のAI障害対処
精度はわずか14%? インシデント調査でAIが“迷子”になる理由と改善策
AIツールによる障害への対処に期待が高まる一方、検証では原因特定の精度は低いという結果が出た。この課題に対し、IBM Researchが開発したオープンソース評価ツールと、特定精度を95%に改善した手法を解説する。
インシデント処理時の原因調査として、ログやメトリクス(指標)を大規模言語モデル(LLM)に入力して分析させる手法が模索されている。市場には「根本原因分析を90%高速化する」とうたうAIツールも存在する。
しかし、その実態は期待を裏切るものだ。Meta Platformsが2024年に公開した実証データによれば、過去のインシデントデータを用いて独自にチューニングしたLLMであっても、初期段階での原因特定の成功率は42%にとどまる。IBMの研究部門IBM Researchが構築した検証用ツール「ITBench」でも、「Gemini 3 Pro」のような高性能モデルでさえ正しい根本原因を突き止められないことが判明した。
LLMが失敗する最大の理由は、提供されるコンテキストに潜むノイズにある。例えば、ネットワーク設定の変更と直後の取り消しといった、本来の障害とは無関係な情報が存在すると、LLMはそれに固執してしまい、真の原因である設定ミスを見逃してしまうのだ。IBM Researchが2025年に実施した検証によれば、「ReAct」などLLMに調査プロセスを自律的に実行させる手法を用いた場合、原因特定の成功率は約14%という結果に終わっている。
この実戦では使い物にならない精度を、IBM Researchは95%という実用レベルに引き上げた。その突破口は、LLMに全てを丸投げするのをやめ、システムの「トポロジー」(構成情報)を使ってAIを正しく導くというアプローチにあった。
精度を14%から95%に改善した「制約」
併せて読みたいお薦め記事
インシデント対処にAIツールを活用する
2026年3月に開催されたテクノロジーカンファレンス「SREcon26 Americas」のセッション「From Chaos to Confidence: How SREs Can Leverage 50 (and Counting) Failure...」には、このプロジェクトを担当したIBM Researchのローハン・アローラ氏らが登壇した。セッション内で彼らはAIモデルの能力を科学的かつ定量的に評価するためのオープンソースの検証システムであるITBenchを開発し、その成果を発表した。
ITBenchはコンテナオーケストレーションツール「Kubernetes」で稼働し、「Apache 2.0」ライセンスの下、ソースコードリポジトリ「GitHub」で公開されている。ITBench内には、マイクロサービスで構成されたテスト用アプリケーションや、標準的なオブザーバビリティツール群があらかじめ用意される。評価の仕組みとしては、自動化ツール「Ansible」を利用して、不具合のあるソフトウェアを配置するなどの障害を注入し、その障害をAIエージェントがいかに迅速かつ正確に診断、緩和できるかを測定する。
評価に当たっては、AIモデルの評価で一般的に用いられる「Pass at K」(K回の試行内に正解を含められたかどうか)や、IT運用の標準指標である「Mean Time to Resolution」(MTTR:平均復旧時間)を採用した。
独自の指標として、「Mean Time to WTF」という概念が導入された。これは、AIモデルが的外れな提案や行動を取り、人間のサイト信頼性エンジニアを困惑させるまでの時間を示すものだ。AIツールの導入によってかえって現場の作業負担が増加してしまっては本末転倒であるため、運用担当者にとっての真の有用性が厳しく問われているのだ。
初期の実験では、LLM自身にデータ収集から分析、解決策の立案までを全て任せるアーキテクチャが採用されたが、前述の通り原因特定の成功率は約14%、問題解決に至る割合は約11%にとどまった。分析の結果、LLMは巨大で複雑なKubernetesシステムで迷子になり、不要な情報収集を繰り返して幻覚(ハルシネーション)を引き起こしていることが分かった。
そこで研究チームは、アプリケーションのトポロジー情報を用いて、LLMが探索できる範囲を意図的に制限する手法を考案した。アラートが発生したサービスの周辺にのみ範囲を絞り、あらかじめ定義された固定の手順に基づいてLLMに状況を共有することで、LLMが各種ツールを操作して原因を探る負担や生データを解析する負荷を軽減したのだ。結果として、この制約を与えられたAIエージェントは、3回の試行で原因を特定する割合(Pass at 3)において約95%という劇的な精度向上を達成した。
AIエージェント育成に向けたコミュニティーの拡大
ITBenchは、過去のインシデントレポートを読み込ませることで、LLMを活用して自動的に障害シナリオを評価システム内に構築する機能も備えている。これによって、人間が手作業でコードを書かなくても評価用のテストケースを容易に拡充できる。
ITBenchが対象とするのはSRE(サイト信頼性エンジニアリング)領域だけではない。過去には、悪意のある攻撃者がGPU搭載の仮想マシンを不正に立ち上げて暗号資産のマイニングを行った事例が存在する。この異常にいち早く気付いたのはSREではなく、クラウド費用の急増を検知したFinOps(クラウド費用最適化)の担当者であったという。このように、ITBenchはセキュリティやFinOpsといった周辺領域のインシデント評価にも応用できる高い適応力を持っている。
発表時点でITBenchに実装されている障害パターンは、現実のシステム運用で想定されるトラブルの約15%をカバーしているに過ぎないという。「真に信頼できるAIアシスタント」を育てるため、開発チームはIT担当者に対し、日々の運用やCI/CDパイプラインで遭遇したインシデント事例をベンチマークに追加するよう呼び掛けている。
本稿は、USENIXが2026年4月24日に公開した動画「SREcon26 Americas - From Chaos to Confidence: How SREs Can Leverage 50 (and Counting) Failure...」を基に作成しました。
Copyright © ITmedia, Inc. All Rights Reserved.
本記事は制作段階でChatGPT等の生成系AIサービスを利用していますが、文責は編集部に帰属します。
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社MatrixFlow] 「物流リソース最適化」ガイド:人員・配車・傭車を出庫依頼の確定前に決めきる -
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
4
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
5
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
6
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
7
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
8
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
9
「結局使わなくなる」Microsoft 365 Copilotを半年で定着 キリンの3施策
-
10
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー