クラウド障害で情シスはどう動くべきか【前編】
“クラウド安全神話”の崩壊 AWS、Azure障害で情シスが直面した「SLAの死角」
2025年に発生した主要クラウドベンダーの障害は、クラウドサービス依存体制のリスクを浮き彫りにした。しかし最大の恐怖は、システム復旧後も業務停止が続く「可用性と継続性のギャップ」にある。
「クラウドに移行すれば、インフラの運用負荷は下がり、安定性も向上する」。そう信じていたIT担当者にとって、2025年はその幻想を打ち砕かれる1年となった。「Amazon Web Services」(AWS)、「Microsoft Azure」といった大手クラウドサービスでシステム障害が相次ぎ、世界中の顧客の事業を停止させたからだ。
こうした障害の際に、経営層は「なぜ止まったのか」「いつ復旧するのか」「うちは大丈夫なのか」とIT部門を詰めてくる。しかし、本当の恐怖は障害そのものではない。「ベンダーのSLA(サービス品質保証)上は復旧しているのに、自社の業務は止まったまま」という現象こそが、現代のIT担当者が抱える大きなリスクだと言える。「システムの可用性」と「事業継続性」のギャップを理解し、システムダウンを見据えたインシデント対処計画と事業継続計画(BCP)の策定が不可欠だ。
SLAを盾にするベンダー、BCPを問われる情シス
併せて読みたいお薦め記事
ベンダーでシステム障害が発生したら
2025年の主要なクラウドサービス障害は、事業継続を外部ベンダーに依存するリスクと、準備不足の企業が被る広範な影響をまざまざと見せつけた。
2025年10月に発生し、数時間に及んだAWSの世界的な障害は、数千の顧客に影響を与えた。同月にはMicrosoft Azureでも障害が発生し、同様の混乱を引き起こした。Microsoft Azureの障害は、サブスクリプション型オフィススイート「Microsoft 365」やAI(人工知能)アシスタント「Microsoft Copilot」を含む複数のMicrosoftサービスで障害が発生した。
これらの障害は単なる「不便」ではない。ITインフラをクラウドサービスに依存している企業に実質的な損害をもたらすからだ。リスク分析企業CyberCubeによると、2025年10月に発生したAWS障害による暫定的な保険損失額の見積もりは、3800万ドルから5億8100万ドルの範囲に及ぶ。
クラウドサービス障害によって、顧客向けの製品やサービスが利用できなくなったり、アプリケーションやWebサイトの読み込みが遅延したりすれば、ユーザー体験は著しく損なわれる。企業の評判へのダメージや顧客の不満にもつながりかねない。
相次ぐ障害事例は、ベンダー起因のトラブルに伴うリスクを強調している。特に、単一のベンダーや特定のリージョン(地域)に過度に依存するシステム構成は、事業に損害を与える恐れがある。予期しない連鎖的な影響によって、障害が復旧した後も問題が尾を引くことがある。例えば、AWSの障害原因がDNS(ドメインネームシステム)の不具合だった場合、認証機能などのDNSを利用する他のサービスにも影響が波及するためだ。
システムが使えれば業務を継続できるわけではない
企業は「システム可用性」と「業務継続性」を混同しがちだが、両者の間には明確な違いがある。
システム可用性とは、システムやインフラがオンラインであり、全ての構成要素が期待通りに動作している状態を指す。しかし、システムが利用可能な状態に戻ったからといって、業務機能が完全に復旧したとは限らない。これに対して業務継続性とは、企業が中核となる業務機能を実行し、事業を継続させるために必要なプロセスやオペレーションを遂行できる能力を指す。
システム可用性はインフラの技術的な状態を評価する指標に過ぎない。必ずしも全ユーザーの業務、ワークフロー、システム間の連携機能が完全に復旧していることを意味しない。そのため、障害の発生中および発生後において、システム可用性と業務継続性のギャップを埋めるBCPを作成することが重要だ。
コンビニエンスストアチェーンWawaでシニア事業継続アドバイザーを務めるジャスティン・ケイツ氏は、事業継続に必要なこととして、システムがダウンした際に必要となる手動での回避策の計画や、そうした一時的なプロセスを支える人員と設備を確保することを挙げる。
コンサルティング企業McKinsey & Companyによると、優れたレジリエンス(回復力)を持つ企業は、新型コロナウイルス感染症(COVID-19)のパンデミック(世界的大流行)による混乱にもうまく対処できていた。起こり得るシステム障害に備えるために、企業は技術面と業務運用面の双方から、自社のレジリエンスを測定、追跡する指標を持つべきだ。
ネットワーク接続サービスを提供するMegaportのCTO(最高技術責任者)であるキャメロン・ダニエル氏は、企業のレジリエンスを測るための重要な指標として以下を挙げる。
- 目標復旧時間(RTO:Recovery Time Objective)
- 目標復旧時点(RPO:Recovery Point Objective)
- 平均復旧時間(MTTR:Mean Time to Recovery)
「ハイブリッドクラウドの採用が進む現代において、ワークロード(処理)がどれほど迅速に復旧し、どの時点のデータまで戻せるかを知るためには、これらの指標が欠かせない」とダニエル氏は指摘する。
次回は、回復力を確保するためのインシデント対処計画とアーキテクチャの設計手順を解説する。
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget グローバルインサイト
米国Informa TechTargetが発信する記事を翻訳し、国内向けに分かりやすく紹介します。最新の海外動向や先進事例を取り上げ、グローバルなITトレンドを把握できる連載です。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品レビュー
[ヴィーム・ソフトウェア株式会社] SCS評価制度を導入するだけで十分? 組織の防御力を高める活用方法とは -
技術文書・技術解説
[フォーティネットジャパン合同会社] AIランサムウェアに勝つ 自律型エンドポイント管理導入で確認すべき条件4つ -
技術文書・技術解説
[フォーティネットジャパン合同会社] LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント -
製品レビュー
[ネットアップ合同会社] 研究分野でAI活用が進まない? 真の成果につなげるデータ管理の在り方とは -
製品レビュー
[ヴィーム・ソフトウェア株式会社] SCS評価制度を導入するだけで十分? 組織の防御力を高める活用方法とは
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
「ITインフラとデータ保護・バックアップ対策」に関するアンケート
-
2
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
3
VMware離れの決め手は“機能”以外だった 情シス109人が選んだ新基準と死角は
-
4
なぜ情シスは評価されにくい? 読者調査で見えた「成果が見えない仕事」第1位は
-
5
年収700万超エンジニアに共通するスキルと「もっと勉強すべきだった分野」
-
6
脱VMwareか、継続か? 仮想化ソフト主要6製品の機能とスペックを徹底比較
-
7
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
8
二極化する生成AI活用 「一部の社員しか使いこなせない」をどう解消すべきか
-
9
「企業におけるAIの運用」に関するアンケート
-
10
IBM iのブラックボックス化を打破 資産継承と進化を実現する「IBM Bob」の実力
ホワイトペーパーランキング PR
-
1
登録セキスぺが語る「SCS評価制度」の舞台裏 星を取得すべき理由と対応のコツ
-
2
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
3
OSSでは困難 100超のサービスを持つマネーフォワードが実践した統合監視術
-
4
「改正物流効率化法対策」徹底解説 総物流費を抑制するサプライチェーン戦略
-
5
月1000枚の紙を削減 9年動けなかった組織が、業務改革のその先に得たもの
-
6
ネットワーク遅延の原因、「パケットロス」の基礎知識と効果的な解決策
-
7
ドラマで分かる、標的型攻撃メールの被害を受ける企業と回避できる企業の分岐点
-
8
Windows PCとMacの選択制で生産性向上 LINEヤフーが実践する運用管理方法とは
-
9
「Google Workspace」活用事例34選、先進の生成AIによる組織変革の全貌
-
10
ソフトウェア開発の属人化と手戻りをどう防ぐ? 速さと品質を両立させる方法
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー