クラウドは管理不能という現実
痛い思いをしてAmazon S3障害から得た教訓、「クラウド利用時のDRは大丈夫?」
Amazon Web Services(AWS)のようなクラウドサービスを利用している企業は、障害発生に備えて災害対策(DR)計画を策定しておく必要がある。
あなたの会社の災害対策(DR:ディザスタリカバリー)計画には、サービスプロバイダー側で障害が発生した場合の緊急時対策は含まれているだろうか。われわれは頭では、全てのコンピュータシステムで障害が発生することを理解している。だが時には、障害を経験して初めてこの問題を痛感し、適切な計画の策定に動くこともある。
2017年2月に「Amazon Simple Storage Service」(Amazon S3)で大規模な障害が発生した際、あなたの会社はDRを実行できただろうか。あなたの会社がDR計画で別のクラウドサービスを使用していても、この「Amazon Web Services」(AWS)の障害事例には学ぶべき教訓がある。特に、DR計画の各要素のサービスレベル契約(SLA)、中でもあなたの会社の管理が及ばない要素のSLAを認識する必要がある。
何が問題だったのか
AWSの障害の原因は、ごく単純なものだった。AWSのエンジニアが通常のメンテナンス時にコマンドを誤入力してしまったことだ。その結果、S3の管理と監視を行うAWSのインフラが正常に稼働しなくなった。S3を使用する米国東部(バージニア北部、US-EAST-1)リージョン内のアプリケーションは、新しいオブジェクトを作成できなくなったもようだ。
そのせいでDRアプリケーションは、新しいバックアップを保存できなくなった。S3をDRに使用する顧客は、RPO(目標復旧時点)を満たすことができなくなっていたかもしれない。またDRアプリケーションは、既存バックアップからリストアを行うこともできなくなり、RTO(目標復旧時間)の達成にも影響が及んだ。
AWSが完全にサービスを復旧するまでには約6時間かかった。AWSによると、S3は99.9%の月間稼働率を目標としている。これを1カ月当たりのダウンタイムに換算すると、44分弱となる。AWSが2月については、料金の一部を返金しなければならないのは明らかだ。AWSの障害の影響を受けた顧客にとっては、稼働率は90%にとどまったとみられるからだ。
だが、返金を受けても、障害時にDRイベントが発生した顧客には、ほとんど慰めにならないだろう。障害が解消されるまで、最後に完成したバックアップを使ってリカバリーを開始することができなかったからだ。
クラウド障害にどう備えるか
AWSの障害の第一の教訓は、クラウドサービスは管理不能であるということだ。特定のクラウドサービスがDRニーズを満たしているかどうかをビジネスの観点から判断するには、提供されるサービスレベルを認識する必要がある。
クラウドプロバイダーのシステムと自社のプライマリーデータセンターで同時に障害が発生する可能性は低い。Google検索でざっと調べたところ、S3は2006年のサービス開始以来、大規模な障害が3回程度発生しているようだ。自社のデータセンターとAWSを結ぶネットワーク回線の方が、RPOやRTOの大きなリスクとなりそうだ。「これらのリスクがDR計画に文書化されているかどうか」「こうしたリスクを踏まえても、『サービスとしてのDR』(DRaaS)を利用することはビジネス上、理にかなっているかどうか」をチェックする必要がある。
AWSの障害をきっかけに、クラウドを使ったDRに経営陣が不安を感じるようになった場合は、使用するサイトを増やすといった手がある。例えば、US-EAST-1リージョンにおける冬の嵐は、欧州西部(アイルランド、EU-West-1)リージョンに影響しない。バックアップを含むS3バケットをUS-East-1からEU-West-1にレプリケーションしたり、バックアップアプリケーションが両方のリージョンにバックアップを直接送信したりするようにすれば、AWSの特定リージョンにおける障害の影響を受けずに済む。
また、S3と互換性のあるストレージシステムをリモートオフィスに用意し、バックアップソフトウェアにそこにも書き込ませるという選択肢もある。
極めて懐疑的なユーザー向けには、全く別のインフラを持つ2つの異なるクラウドプロバイダーにバックアップを送信するという方法も取れる。ただし、この方法は、バックアップを2カ所に送ることから、ストレージとネットワーク転送の料金が跳ね上がるというデメリットがある。さらに、データをレプリケーションする場所ごとに、それぞれのDR計画を管理する必要もある。少し計算すれば、コストの増加に見合うほど可用性が向上しないことが分かるだろう。
どのようなコンピュータシステムでも、ダウンタイムは発生し得るし、実際に発生する。クラウドベースのDRaaSも例外ではない。あなたの会社は、クラウドでAWSのケースのような障害が発生し、DRが影響を受けた場合、事業継続にどのような影響があり得るかを理解しているだろうか。
大部分の企業は、出費を増やしてまでDR自体の信頼性を高めようとはしないだろう。だが、少数ながら、いくらコストがかかっても、最高のDR体制を構築する必要がある企業もあるだろう。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
事例
[株式会社マクニカ] アイカ工業に学ぶ脆弱性対策 情シスが把握できずにいたアセットも正確に把握 -
製品資料
[株式会社マクニカ] 「脆弱性総まとめ」解説 被害事例から考える必須の対策ポイント -
製品資料
[Splunk Services Japan合同会社] サイバー脅威「トップ50」完全解説ガイド、新たな攻撃手法に対抗するには -
製品資料
[株式会社うるる] 「入札市場」完全ガイドブック:メリットから資格取得のポイントまで -
市場調査・トレンド
[株式会社うるる] はじめての「自治体/官公庁入札」 必要な知識がすぐに学べる入門ガイド
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
2
Oracle巨大ITプロジェクトはなぜつまずいたのか 8年で導入1割、追加で170億ドル
-
3
Microsoft製品でここまで自動化できる 情シスがやめられる手作業10選
-
4
ISMSの“コンサル丸投げ”が招く数千万円の無駄 NTTドコモビジネスの脱出劇
-
5
「VMware離れ」は本当か 3000社がVCF 9にかじを切った現実的な理由
-
6
「Microsoft 365」が乗っ取られる 跡形もなくMFAを破る手口
-
7
「AI活用を前提とした業務PCへの移行」に関するアンケート
-
8
AI全部入り「Microsoft 365 E7」に企業が二の足を踏む訳 移行意向はわずか4%
-
9
「技術屋」で終わらないために 情シスが今取るべき認定資格5選
-
10
Netflixのバックエンドは「ほぼJava」 3000超のアプリを支える開発基盤の裏側
ホワイトペーパーランキング PR
-
1
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
2
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
-
3
5回聞くだけじゃ足りない? トヨタ式「なぜなぜ分析」の正しい実践方法
-
4
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
5
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
6
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
7
PostgreSQLの「機能」「性能」「運用」「拡張性」に関する悩みの解消法
-
8
5分で分かる「セキュア大容量ファイル転送サービス」の機能とメリット
-
9
Macの安全神話は崩壊? 最新の脅威動向から見えた攻撃のトレンドと有効な対策
-
10
情報セキュリティ対策早分かりガイド:25の自社診断で弱点と解決策を理解
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー