Kubernetesの障害も自己修復
インシデント処理を4時間から8分に短縮する「AIエージェント」の真価
システム障害に対処する担当者は、夜間や休日のアラートも処理しなければならず、多大な心理的ストレスを抱えることになる。こうした属人化や疲弊を招く運用を、「AIエージェント」は具体的にどう変えるのか。
システム障害が発生した際、システムの信頼性向上を担うSRE(Site Reliability Engineering)担当者は、夜間であってもアラートを処理しなければならない。古いドキュメントの確認や複数の監視ツールにまたがるログの調査など、状況の切り替えを伴う手作業は担当者に大きな心理的ないし肉体的ストレスを与えている。システム復旧の知識が特定の熟練技術者に偏っている場合、該当者が不在の状況下では迅速な復旧作業が困難になるという課題も存在する。
こうした従来の手法が抱える属人化や負荷の偏りを解決する仕組みとして、自律的に思考して外部システムと連携して目的を達成する「AI(人工知能)エージェント」を活用できる。コンテキストを理解するAIエージェントを既存のエンジニアリングのプロセスに組み込む「AI Reliability Engineering」という新しいアプローチによって、障害の検出、原因究明、修正の一連の作業を自動化する。その目的は、複数ソースからの情報群を関連付けて整理するナレッジグラフの構築や、ビジネスインパクトを学習した自律的な優先順位付け、過去の履歴を参照する並行調査など多岐にわたる。これによって、従来であれば4時間かかっていたトラブルシューティングを8分に短縮できる可能性が示されている。
静的な自動化スクリプトはシステム構成の変化に対して脆弱(ぜいじゃく)だが、AIエージェントは目的に向かって適応的に学習して行動するため、より自由度が高い処理を実現する。AIエージェントは具体的にどのようにして外部ツールと連携し、複雑なインシデントを自律的に解決しているのか。
AIエージェントがSREの属人化と疲弊を終わらせる
以下で解説するAIエージェントの仕組みや実証結果は、SREのカンファレンス「SREcon25 Europe/Middle East/Africa」におけるセッション「From 4 Hours to 8 Minutes with AI Agents that Transform SRE Incident Response」で示された知見に基づく。
AIエージェントは、単なるチャットbotとは異なり、外部のシステムと能動的にやりとりする機能を持つ。そのアーキテクチャは、大きく「システムプロンプト」「ツール」「大規模言語モデル(LLM)」の3要素で構成される。システムプロンプトはエージェントの役割と動作の境界を定義するものであり、LLMの推論を適切な方向へ導く役割を担う。
AIエージェントが自律的に問題を解決する仕組みは、「エージェントループ」と呼ばれる反復処理にある。エンドユーザーから要求を受け取ると、エージェントはシステムプロンプト、利用可能なツールの定義およびエンドユーザーのクエリをまとめてLLMに送信する仕組みだ。LLM自体は外部APIを直接実行できないものの、提供されたツールの仕様を読み取り、現在の課題解決に必要なツールとその実行引数を推論してAIエージェントに返す。AIエージェントは指示されたツールを実行し、その結果を再びLLMに提示する。このやりとりを必要な情報が全てそろうまで繰り返し、最終的な回答やアクションを導き出す。
AIエージェントが真価を発揮するためには、「Amazon Web Services」(AWS)や「GitHub」、各種監視システムなどの外部サービスと通信するための「ツール」の実装が不可欠だ。しかし、複数のAIエージェントを運用する場合、それぞれのAIエージェントに対して固有のAPI連携処理を実装することは、ソースコードの重複や保守性の低下を招いてしまう。
この課題を解決する技術が「Model Context Protocol」(MCP)だ。MCPは、AIモデルと外部のデータソースやツールを標準化された手順で接続するための通信規格として機能する。外部サービスへのアクセスロジックを「MCPサーバ」として切り出し、標準化されたインタフェースで提供する。MCPの通信規格に適合したAIエージェントは、各サービスの複雑な仕様の違いを意識することなく、統一された簡単な手順でさまざまな外部ツール群を利用可能だ。MCPサーバの普及は急速に進んでおり、APIを提供する多様なサービスが順次適合していくとみられる。複数のAIエージェント同士が情報を交換し、協調して動作するための「A2A」(Agent to Agent)プロトコルの整備も進んでいる。
開発者が一からプログラムを記述する手間を省き、AIエージェントの構築や展開に必要な共通機能群をあらかじめまとめた「フレームワーク」も登場している。その一つが、非営利団体CNCF(Cloud Native Computing Foundation)のオープンソースプロジェクトとして提供される「kagent」だ。これはコンテナオーケストレーションツール「Kubernetes」に特化したフレームワークで、Kubernetes向けのAIエージェントやMCPサーバを構築するツール群として機能する。開発者がソースコードを記述することなく、YAML形式の設定ファイルを用いた定義のみでAIエージェントを展開できる特徴を持つ。
kagentは、Kubernetesの各種コンピューティングリソースや監視ツール「Prometheus」のメトリクス(指標)を参照するためのツールを標準で備える。セッションでは、登壇者のピーター・ヤウソベック氏が、実際のインシデント対処を想定したデモンストレーションを実施した。このデモンストレーションでは、設定ファイルの記述ミスによって生じたサービスの障害に対し、AIエージェントがデータ抽出用の問い合わせ言語である「PromQL」のクエリを自律的に生成し、Prometheusからエラー率や遅延のデータを収集した。その後、エラーの原因を分析し、GitHubへの課題(イシュー)の自動起票や分析ツール「Grafana」のダッシュボードの自動作成を実行した。最終的には、Kubernetesの設定ファイルを自ら修正し、障害を自己修復する動作が示された。
今後のシステム運用において、AIエージェントは人間の業務を完全に代替するものではなく、IT担当者の効率を高める強力な補助手段として位置付けられる。監視から復旧までをシームレスにつなぐMCPやkagentのような技術、ツールが成熟することで、インシデント処理の自動化は新たな段階へと進むだろう。
本稿は、USENIXが2025年11月12日に公開した動画「SREcon25 Europe/Middle East/Africa - From 4 Hours to 8 Minutes with AI Agents That Transform SRE...」を基に作成しました。
Copyright © ITmedia, Inc. All Rights Reserved.
本記事は制作段階でChatGPT等の生成系AIサービスを利用していますが、文責は編集部に帰属します。
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー