Azureに学ぶ単一障害点による障害の回避方法
IaaSはなぜダウンしないのか、ダウンしたらどうなるのか(1/2 ページ)
クラウドサービスで物理障害が発生した場合、初期設定のままでは稼働中のサービスにダウンタイムが発生してしまう。高可用性を維持するために必要な設定についてAzureを例として解説する。
Microsoftの「Microsoft Azure」などのパブリッククラウドインフラで管理者が仮想マシンを作成すると、デフォルトの状態では、単一障害点によるダウンタイムに対する保護はないに等しい。クラウドの物理ノードで障害が発生すると、仮想マシンは別の物理ノードで再起動する。この動作をユーザーが制御することはできない。そのため、アプリケーションを導入する上で仮想マシンのワークロード(システム稼働状態)を保護することは欠かせない。
企業がアプリケーションをクラウドに導入する前に、クラウドコンピューティングの高可用性について把握すべき問題がある。
本稿では、MicrosoftのIaaS(Infrastructure as a Service)であるAzureを例として使用している。本稿は一般的な指針となることを目標としているが、インフラの詳細については各パブリッククラウドプロバイダーに確認してほしい。
併せて読みたいお薦め記事
「Microsoft Azure」についてもっと詳しく
可用性についてもう一度考えてみよう
高可用性を実現するためのゾーン
Azureのデザインを支えているのは、クラウドの概念だ。Azureで1つの場所と見なされている可用性ゾーンの実態は、地理的に比較的近場にある多数の物理データセンターである。そのため、クラウドへのアプリケーションの導入に取り組んでいる管理者は、大規模なサービス停止が発生したときに、同じゾーンの別のデータセンターにシステムをフェイルオーバーさせるように構成できる。
各データセンターで運用されているクラスタは、ネットワークで接続された何千もの物理ノードを関連付けている。いずれかの物理ノードで障害が発生すると、そのノードでホストされている仮想マシンは同じクラスタ内の別の物理ノードで再起動する。パブリッククラウドコンピューティングでは、サイトごとに何百または何千ものクラスタが存在している。
プライベートデータセンターのハイパーバイザーにパッチを適用する必要があるのと同様に、パブリッククラウドの物理ブレードサーバで実行しているハイパーバイザーにもパッチを適用しなければならない。これは、クラウドアプリケーションをホストする仮想マシンにとっては残念なことだろう。仮想マシンは年に数回ベースとなるハイパーバイザーのアップグレード中に移動しなければならない。管理者は、「Azure DNS」(DNSドメインのホスティングサービス)や「Azure Active Directory」(ディレクトリとIDの管理サービス)などのAzureサービス群にメンテナンスの作業が影響することを心配しなくてよい。だが、顧客のワークロードについては管理者が責任を負わなければならない。
Azureは、「可用性セット」によって顧客が利用する仮想マシンのサービス停止に関する問題に対処している。可用性セットを使用すると、管理者は、異なるゾーンに配置されているフロントエンドWebサーバなど複数の仮想マシンを割り当てることができる。この分散型の性質がクラウドコンピューティングアーキテクチャで高可用性を実現している。というのも、フロントエンドサービスは、単一障害とサーバアップデートのどちらが発生した場合でも、要求を処理できるからだ。Microsoftは可用性セットを仮想マシンの論理グループと位置付けている。また可用性セットは、クラウドアプリケーションがどのように構成されているかという情報をMicrosoftに提供する役割も担っている。
AzureでSLA(サービス品質保証)に記載の99.95%の稼働率を実現したいと考える管理者は、可用性を確保するためにこれらの可用性セットを使用しなければならない。クラウドコンピューティングの高可用性について管理者が理解すべき最大の教訓の1つは、ホスティングインフラに振り回されることなく、使いこなすことだ。管理者は、導入したクラウドアプリケーションの機能への影響が最小限で済むように単一ノードのフェイルオーバーを設計しなければならない。
Azureでは、オンプレミスで管理されているITインフラとは異なる形でディスクが用意されている。ストレージノードでもアップグレードが必要になる。そのため、管理者が単一ノードと見なしているディスクは、実際のところ、Azureデータセンターのローカルで少なくとも3回複製されている。それから、冗長性のレベルを上げるには、膨大なコストがかかる。つまり、クラウドコンピューティングの可用性はタダでは手に入らないということだ。
可用性セットでは、導入したクラウドアプリケーションについて「障害ドメイン」と「更新ドメイン」が考慮されている。障害ドメインは、局所的な停電など、単一の問題の影響を受ける可能性があるインフラアイテムのグループだ。一方の更新ドメインは、制御された状態でパッチを適用する、グループ化された仮想マシンで構成している。
可用性セットは、クラウドでホストしているサービスが、要請を受けたときに、その役割を果たせるようにしている。
特定の可用性セットに含まれる仮想マシンは、ネットワークの制御(どのサーバにトラフィックを流すか)についてロードバランサーに頼ることになる。Azureの負荷分散機能は、アクティブなサーバにトラフィックをルーティングする。障害が発生しているサーバやアップグレード中のサーバにトラフィックがルーティングすることはない。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社MatrixFlow] 「物流リソース最適化」ガイド:人員・配車・傭車を出庫依頼の確定前に決めきる -
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
2
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
3
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
4
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
5
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
6
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
7
「結局使わなくなる」Microsoft 365 Copilotを半年で定着 キリンの3施策
-
8
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
9
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
10
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー