4時間にわたってアクセスできない状態に
AWS大規模障害はなぜ起きた? クラウド不安を払拭するためにやるべき対策(1/2 ページ)
Amazon Web Services(AWS)で2月28日に障害が発生した。障害が発生したら、どうすればいいのか、事前にできることはないのか。行うべき対策を紹介する。
Webサイトの反応が鈍くなり、Webページが読み込めなくなった2月28日。ソーシャルネットワーキングサービス(SNS)の「Twitter」に投稿された最初の反応は「これって自分だけ」だった。
続いてAmazon Web Services(AWS)のクラウドストレージサービスがダウンしたという発表がニュースで報じられた。何万というサイトに障害が及び、AWSの障害はあまりに大きかったため不安が広がった。
クラウド ナビ
今回の事態を受けて、クラウドコンピューティングがうたうアジリティや柔軟性といったメリットを当てにしていたCIO(最高情報責任者)は、クラウドの代替策を考える必要に迫られている。アプリケーションを別々のクラウドプロバイダーの間で分散させ、バブリッククラウドと社内プライベートクラウドを併用するハイブリッドクラウドへ投資を増やすべきなのか。それとも、クラウドプロバイダーが機能しなくなったときでもアプリケーションを機能する方法を見つけるべきなのか。
今回のAWSで起きた障害のような事態を受けて真っ先にすべきことは、平静を保って自社のITアーキテクチャを見直すことだと業界の専門家は指摘する。
調査会社Gartnerのアナリスト、リディア・レオン氏は、「自分が何に満足していて、何に不満を持っているかを判断すること」と指摘する。
依存関係
「多くのIT部門がまず検証すべきは、インシデント対応、すなわち助けを求められた際にどう対応すべきか」だとレオン氏は言う。
「今回の障害で皮肉だったのは、多くの組織のIT部門が何らかの障害があったときのインシデント対応の取りまとめに『Slack』を使っていたことだ」とレオン氏は言う。Slackは人気の高いメッセージングアプリケーションだ。「今回の場合、SlackもAWSの障害の影響を受けていた。このためSlackを使って対応しようとした場合、問題が生じた」(レオン氏)
障害はまず、何兆本ものファイルや写真、ビデオが保存されているAWSの「Amazon Simple Storage Service」(S3)の減速で始まった。AWSがそのいきさつについて3月2日に公表した報告書によると、S3の課金システムが不安定になり、修理のために数台のサーバを停止させる必要が生じた。だが誤ったコマンドを入力したために、必要以上のサーバが多数ダウン。その復旧のためにリブートが必要になり、このためほぼ4時間にわたって多くのWebサイトが、サーバに保存された情報にアクセスできなくなった。
障害は米バージニア州にあるAmazonの大規模リージョン「米東部1」のデータセンターで発生した。米国の4リージョンのうち、他のリージョンに保存されているデータはほとんど影響を受けなかった。
Forrester Researchのアナリスト、デイブ・バートレッティ氏は、「特定のS3リージョンに対する自分たちの依存状況について誰もが検証する必要がある」と話す。その上で、最も重要なWebアプリケーションについては「特定リージョンのS3が使えなくなった場合にどう対応するかを見極めるために障害テストを実施すべき」だと提言する。
同氏は実例として、AWSに完全依存しているオンラインビデオネットワークNetflixの例を挙げる。Netflixは、サーバ周辺で障害を発生させるための「Chaos Monkey」というコードを開発した。これは重要なアプリケーションが障害に対処できるかどうかを見極める助けになっている。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー