NYSE、WSJのシステム停止はなぜ起きた?
今日もまたコンピュータが動かない――その理由と対策(1/2 ページ)
仮想化と自動化のソフトウェアのおかげでシステム障害への対応は迅速に行われるようになったものの、有名企業はいまだにシステム停止の憂き目に遭っている。
このところ、米紙The Wall Street Journal、米ニューヨーク証券取引所(以下、NYSE)、米航空会社United Airlinesなど、有名企業がデータセンターのシステム障害トラブルに見舞われる事態が相次いでいる。システム障害を完全に防ぐことは不可能だが、こうしたトラブルが大々的に報じられれば金銭的損失も大きく、顧客が企業に抱くイメージにも響く。そこで米TechTargetの顧問委員に話を聞いた。企業が高いレベルのアップタイムを維持するにはどうすればいいのか? ダウンタイムを招く過ちにはどのようなものがあるのか? 平均的なデータセンターの堅牢性や耐障害性は顧客が期待するレベルなのか、それでも時折システム停止が発生するのは仕方ないことなのか?
ブライアン・キルシュ氏(米ミルウォーキー地域技術カレッジ)
可用性とその他の要件のバランスはITの重要課題の1つだ。システムは必要な限り常に稼働しているべきだと誰もが考えており、企業の管理職や経営陣もそれは同じだろう。問題は、可用性とそれを確保するために必要な代償のバランスをどう取るかにある。それは単なるコストだけの話ではなく、総合的な運用性を実現する複雑さとテストがカギになる。1つのハードウェア製品やソフトウェア製品だけで可用性を確保できるという考えはもう通用しない。バックアップとディザスタリカバリ(DR)の製品はますます幅広く効果的になっているものの、アプリケーションの方はどんどん複雑化している。アプリケーションと可用性は常にせめぎ合っており、現行のDR製品がアプリケーションのニーズとデザインについていけなくなったとき、大規模なシステム障害を招くことになる。
だが、ハードウェアとソフトウェアはシステム障害というパズルの1つのピースにすぎない。システム障害の原因の多くは、システムエラーと変更だ。システムエラーを防ぐ設計、不正な変更を封じる安全対策は実施されているだろう。しかし、いくらフロントエンドでこうした対策を講じても、システム障害を完全に防ぐことはできない。そろそろディザスタリカバリとシステム障害に関する考え方を改めるときが来ている。これからは、単にシステム障害を防ごうとするのではなく、システム障害が発生するという前提でシステムを設計すべきだ。システム障害の発生を想定し、表面的なものにとどまらない対策を用意すれば、アプリケーションは真の耐障害性を確保できる。そのためには、システム障害を正しく処理できることをテストして確認することだ。
これをどこよりも如実に実践したのが、米Netflixと同社の「Chaos Monkey」エンジニアリンググループだ。同社は「Amazon EC2」クラウドでサービスを運用しており、EC2クラウドの大規模リブートが実施されたとき、サービスを維持する必要があった。多くの企業がEC2クラウドのリブートは自分たちに影響しないと考え、そのほとんどはシステム停止対策を講じなかった。だが、NetflixとChaos Monkeyエンジニアリンググループは違った。Chaos Monkeyは日常的にシステム障害を繰り返し発生させるツールだ。Netflixは可用性を確保するために、大規模なシステム停止が発生する前に日ごろから継続的にテストして問題を修正し、システム障害を念頭に置いたサービスを作成した。
デイヴ・ソーベル氏(英LogicNow)
NYSE、The Wall Street Journal、United Airlinesのような企業でシステム停止が発生するのは不面目といえる事態だ。システム停止は高くつく。比較的安価なコンピューティングリソースで対策を講じておけば、ダウンタイムを最小限に抑えることができる。クリティカルニーズのある企業は、クラウドでバックアップシステムを簡単に構築でき、それを緊急時にのみ使用することが可能だ。例えば、「Microsoft Azure」はアクティブコンピューティングロードについてのみ課金されるので、問題が発生するまでは、バックアップネットワーク全体をコールドスタンバイ状態で待機させることができる。ホットスタンバイも最小限の利用レベルに設定でき、いつでもフェイルオーバー可能にしておける。既に利用しているであろうモニタリングと管理のソフトウェアも進化を続けており、予測分析でダウンタイムに備えることができる。
だが、システム停止の影響を緩和するには、コミュニケーションが最も重要だ。United Airlinesのシステム障害で実際に足止めされた乗客の話のように、情報の欠如は最も不満を招く。企業は一刻も早く状況の把握に努め、慎重な見通しを示し、期待以上の結果を出すべきだ。ソーシャルメディアへの発信もなく、従業員にも情報が伝えられていないようでは、顧客サービスは最悪になる。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
技術文書・技術解説
[Jamf Japan 合同会社] MDMだけでモバイルセキュリティは十分? 不足する対策を16項目でチェック -
事例
[Wrike Japan 株式会社] 世界的な家電メーカーが実践する「クリエイティブプロセス効率化」の方法とは? -
事例
[Wrike Japan 株式会社] 世界的テクノロジー企業に学ぶ、プロセス標準化とプロジェクト納品自動化の秘訣 -
事例
[Wrike Japan 株式会社] ソニー・ピクチャーズ テレビジョンに学ぶ、次世代サービスデリバリーのヒント -
事例
[Wrike Japan 株式会社] ソミック石川に学ぶ、ICT浸透後に直面した「工数管理」の課題と解決策
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
「Copilot」はなぜ放置される? “議事録要約止まり”を脱する処方箋
-
2
脱VMwareの前提が崩れる BroadcomのVDDK公開停止で確認すべき点
-
3
「有線LAN環境」に関するアンケート
-
4
Oracle巨大ITプロジェクトはなぜつまずいたのか 8年で導入1割、追加で170億ドル
-
5
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
6
「データストレージの活用方法」に関するアンケート
-
7
「自動化」で「DX」は強制的に進む? そのシンプルな理由
-
8
AWS障害でも補償ゼロの衝撃 サイバー保険で情シスが見落とす「細則の壁」
-
9
AI全部入り「Microsoft 365 E7」に企業が二の足を踏む訳 移行意向はわずか4%
-
10
「データを国内に置く」だけでは不十分 情シスが知るべきAI時代の「デジタル主権」
ホワイトペーパーランキング PR
-
1
マンガで解説:「ゼロトラスト」「SASE」の必要性とメリット
-
2
5回聞くだけじゃ足りない? トヨタ式「なぜなぜ分析」の正しい実践方法
-
3
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
4
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
5
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
6
国税庁の次世代基幹システム「KSK2」稼働開始に向けて、対応すべき変更点とは?
-
7
5分で分かる「セキュア大容量ファイル転送サービス」の機能とメリット
-
8
ドラマで分かる、標的型攻撃メールの被害を受ける企業と回避できる企業の分岐点
-
9
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
10
少額減価償却資産が40万円未満へ拡大、令和8年度税制改正で押さえるべき変更点
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー