AWSの障害対策における4つのポイント【後編】
AWS障害からの復旧計画時に意識したい「RPO」「RTO」とは?
「Amazon Web Services」(AWS)に障害が起きたときのために、どのように復旧計画を立てればよいのだろうか。「復旧対象のデータの評価」「復旧計画に使う指標」「復旧の訓練」の観点から説明する。
パブリッククラウドでは天変地異やハードウェアの障害、サイバー攻撃が原因のサービス停止がいつか必ず起こる。Amazon Web Services(AWS)の同名パブリッククラウドも例外ではない。AWSをはじめとするクラウドベンダーは、ITインフラ停止の被害を最小限に抑えるための機能やサービスを幾つか提供している。
本稿は前編「AWSの可用性を確保する方法とは?」に引き続き、AWSをはじめとするパブリッククラウドを利用するときの、障害対策の方法を説明する。
目次
- 1.可用性を確保する(前編で紹介)
- 2.データの種類と重要度を評価する
- 3.「RPO」「RTO」など復旧計画に適用する指標を確立させる(会員限定)
- 4.障害からの復旧の訓練をする(会員限定)
データの種類と重要度を評価する
パブリッククラウドの障害に備えるには、企業の業務に関する要件と技術に関する要件の足並みをそろえる必要がある。ITコンサルティング企業のUptime InstituteでIT戦略部門の最高責任者を務めるトッド・トラバー氏は、パブリッククラウドに配置されているデータの種類ごとに、データ保護と可用性確保の方法や保管期間について評価し、分類しなければならないと話す。この分類に基づいて、利用するデータセンターの種類や地域に加え、複数のハードウェア間でデータを同時に書き込むミラーリングの手法を決定する。
トラバー氏は、データを処理するための要件をルール化してドキュメントにすることも勧める。これはパブリッククラウド障害の影響を受ける恐れがある自社の事業部門のさまざまなエンドユーザーと協力して実施する。
AWSのユーザー企業であれば、メッセージキューイングサービス「Amazon Simple Queue Service」を利用することで、キュー(メッセージ待機列)の長さに基づいて仮想マシン(VM)を個別にスケーリングできる。万が一障害が発生しても、キューに入れられた要求はアプリケーションが復旧したときに新しいVMに引き継がれる。
「RPO」「RTO」など復旧計画に適用する指標を確立させる
パブリッククラウドで障害が発生する可能性のある全ての状況を特定することは不可能だ。だが大規模な障害は、アプリケーションで部分的な障害が発生した結果として起きることが少なくない。そのため「AWSで障害が起きたときに直ちに実行する項目と手順を明記したロードマップを作成する必要がある」と、クラウドコンサルティング会社Atlantic.NetでCEOを務めるマーティ・プラニク氏は話す。「全ての企業は、障害とそれに対処するための業務プロセスについて、事前に熟慮しておくべきだ」(プラニク氏)
クラウド管理者は、災害復旧のバックアップ計画や障害の発生時にすぐ使えるサービスを用意しておく必要があるとプラニク氏は言う。システムの復旧計画には、目標復旧時点(RPO)と目標復旧時間(RTO)などの指標を含めることが欠かせない。RPOはアプリケーションが許容するダウンタイム(停止時間)の長さを定義する。RPOが長くなるほど必要な更新が減り、保守もそれだけ簡単かつ低コストになる。ただしアプリケーションの広範囲に影響が及ぶ障害では、ダウンタイムが長くなることでより多くのデータが失われる恐れがある。RTOは、障害が発生したときにどれだけ迅速にバックアップを復旧できるかを示す。災害復旧計画ではRPOとRTOの目標を満たす必要がある。これはホストしているアプリケーションによって変わる。
障害からの復旧の訓練をする
障害に対して脆弱なデータは、データベース管理システム(DBMS)に格納しているデータだけではない。アプリケーションの状態や各種クラウドサービスの設定、アプリケーションログも障害で失う恐れがある。企業にとってはこれらの種類のデータを復旧可能にしておくことも重要だ。
「パブリッククラウドで稼働するアプリケーションは、何も手を加えなくてもバックアップされていると誤解しているユーザー企業は少なくないが、それは間違いだ」。そう語るのは、ITコンサルティング会社Sparkhoundでインフラエンジニアコンサルタントを務めるブライアン・ブロック氏だ。
IT部門は高可用性を確保する計画を立てる必要はある。ただしそれだけでランサムウェア(身代金要求型マルウェア)をはじめとするサイバー攻撃によるデータの削除からデータを完全に保護できるわけではない。ブロック氏によると、企業はパブリッククラウド障害やランサムウェア攻撃、自然災害など、複数の障害シナリオからの復旧を訓練しておく必要がある。
障害に備えてパブリッククラウドとプライベートクラウド、オンプレミスを組み合わせるハイブリッドクラウドの手法を導入する企業は少なくない。ハイブリッドクラウドを構築していないなら、複数のリージョンやパブリッククラウドを利用するマルチリージョン戦略やマルチクラウド戦略を選ぶとよい。オンプレミスのハードウェアを扱う際には、スケーリングや柔軟性が問題になることがあるためだ。
Copyright © ITmedia, Inc. All Rights Reserved.
AWSの障害対策における4つのポイント
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー