4時間にわたってアクセスできない状態に
AWS大規模障害はなぜ起きた? クラウド不安を払拭するためにやるべき対策(1/2 ページ)
Amazon Web Services(AWS)で2月28日に障害が発生した。障害が発生したら、どうすればいいのか、事前にできることはないのか。行うべき対策を紹介する。
Webサイトの反応が鈍くなり、Webページが読み込めなくなった2月28日。ソーシャルネットワーキングサービス(SNS)の「Twitter」に投稿された最初の反応は「これって自分だけ」だった。
続いてAmazon Web Services(AWS)のクラウドストレージサービスがダウンしたという発表がニュースで報じられた。何万というサイトに障害が及び、AWSの障害はあまりに大きかったため不安が広がった。
クラウド ナビ
今回の事態を受けて、クラウドコンピューティングがうたうアジリティや柔軟性といったメリットを当てにしていたCIO(最高情報責任者)は、クラウドの代替策を考える必要に迫られている。アプリケーションを別々のクラウドプロバイダーの間で分散させ、バブリッククラウドと社内プライベートクラウドを併用するハイブリッドクラウドへ投資を増やすべきなのか。それとも、クラウドプロバイダーが機能しなくなったときでもアプリケーションを機能する方法を見つけるべきなのか。
今回のAWSで起きた障害のような事態を受けて真っ先にすべきことは、平静を保って自社のITアーキテクチャを見直すことだと業界の専門家は指摘する。
調査会社Gartnerのアナリスト、リディア・レオン氏は、「自分が何に満足していて、何に不満を持っているかを判断すること」と指摘する。
依存関係
「多くのIT部門がまず検証すべきは、インシデント対応、すなわち助けを求められた際にどう対応すべきか」だとレオン氏は言う。
「今回の障害で皮肉だったのは、多くの組織のIT部門が何らかの障害があったときのインシデント対応の取りまとめに『Slack』を使っていたことだ」とレオン氏は言う。Slackは人気の高いメッセージングアプリケーションだ。「今回の場合、SlackもAWSの障害の影響を受けていた。このためSlackを使って対応しようとした場合、問題が生じた」(レオン氏)
障害はまず、何兆本ものファイルや写真、ビデオが保存されているAWSの「Amazon Simple Storage Service」(S3)の減速で始まった。AWSがそのいきさつについて3月2日に公表した報告書によると、S3の課金システムが不安定になり、修理のために数台のサーバを停止させる必要が生じた。だが誤ったコマンドを入力したために、必要以上のサーバが多数ダウン。その復旧のためにリブートが必要になり、このためほぼ4時間にわたって多くのWebサイトが、サーバに保存された情報にアクセスできなくなった。
障害は米バージニア州にあるAmazonの大規模リージョン「米東部1」のデータセンターで発生した。米国の4リージョンのうち、他のリージョンに保存されているデータはほとんど影響を受けなかった。
Forrester Researchのアナリスト、デイブ・バートレッティ氏は、「特定のS3リージョンに対する自分たちの依存状況について誰もが検証する必要がある」と話す。その上で、最も重要なWebアプリケーションについては「特定リージョンのS3が使えなくなった場合にどう対応するかを見極めるために障害テストを実施すべき」だと提言する。
同氏は実例として、AWSに完全依存しているオンラインビデオネットワークNetflixの例を挙げる。Netflixは、サーバ周辺で障害を発生させるための「Chaos Monkey」というコードを開発した。これは重要なアプリケーションが障害に対処できるかどうかを見極める助けになっている。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
事例
[株式会社マクニカ] アイカ工業に学ぶ脆弱性対策 情シスが把握できずにいたアセットも正確に把握 -
製品資料
[株式会社マクニカ] 「脆弱性総まとめ」解説 被害事例から考える必須の対策ポイント -
製品資料
[Splunk Services Japan合同会社] サイバー脅威「トップ50」完全解説ガイド、新たな攻撃手法に対抗するには -
製品資料
[株式会社うるる] 「入札市場」完全ガイドブック:メリットから資格取得のポイントまで -
市場調査・トレンド
[株式会社うるる] はじめての「自治体/官公庁入札」 必要な知識がすぐに学べる入門ガイド
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
2
Oracle巨大ITプロジェクトはなぜつまずいたのか 8年で導入1割、追加で170億ドル
-
3
Microsoft製品でここまで自動化できる 情シスがやめられる手作業10選
-
4
ISMSの“コンサル丸投げ”が招く数千万円の無駄 NTTドコモビジネスの脱出劇
-
5
「VMware離れ」は本当か 3000社がVCF 9にかじを切った現実的な理由
-
6
「Microsoft 365」が乗っ取られる 跡形もなくMFAを破る手口
-
7
「AI活用を前提とした業務PCへの移行」に関するアンケート
-
8
AI全部入り「Microsoft 365 E7」に企業が二の足を踏む訳 移行意向はわずか4%
-
9
「技術屋」で終わらないために 情シスが今取るべき認定資格5選
-
10
Netflixのバックエンドは「ほぼJava」 3000超のアプリを支える開発基盤の裏側
ホワイトペーパーランキング PR
-
1
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
2
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
-
3
5回聞くだけじゃ足りない? トヨタ式「なぜなぜ分析」の正しい実践方法
-
4
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
5
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
6
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
7
PostgreSQLの「機能」「性能」「運用」「拡張性」に関する悩みの解消法
-
8
5分で分かる「セキュア大容量ファイル転送サービス」の機能とメリット
-
9
Macの安全神話は崩壊? 最新の脅威動向から見えた攻撃のトレンドと有効な対策
-
10
情報セキュリティ対策早分かりガイド:25の自社診断で弱点と解決策を理解
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー