Azureに学ぶ単一障害点による障害の回避方法
IaaSはなぜダウンしないのか、ダウンしたらどうなるのか(1/2 ページ)
クラウドサービスで物理障害が発生した場合、初期設定のままでは稼働中のサービスにダウンタイムが発生してしまう。高可用性を維持するために必要な設定についてAzureを例として解説する。
Microsoftの「Microsoft Azure」などのパブリッククラウドインフラで管理者が仮想マシンを作成すると、デフォルトの状態では、単一障害点によるダウンタイムに対する保護はないに等しい。クラウドの物理ノードで障害が発生すると、仮想マシンは別の物理ノードで再起動する。この動作をユーザーが制御することはできない。そのため、アプリケーションを導入する上で仮想マシンのワークロード(システム稼働状態)を保護することは欠かせない。
企業がアプリケーションをクラウドに導入する前に、クラウドコンピューティングの高可用性について把握すべき問題がある。
本稿では、MicrosoftのIaaS(Infrastructure as a Service)であるAzureを例として使用している。本稿は一般的な指針となることを目標としているが、インフラの詳細については各パブリッククラウドプロバイダーに確認してほしい。
併せて読みたいお薦め記事
「Microsoft Azure」についてもっと詳しく
可用性についてもう一度考えてみよう
高可用性を実現するためのゾーン
Azureのデザインを支えているのは、クラウドの概念だ。Azureで1つの場所と見なされている可用性ゾーンの実態は、地理的に比較的近場にある多数の物理データセンターである。そのため、クラウドへのアプリケーションの導入に取り組んでいる管理者は、大規模なサービス停止が発生したときに、同じゾーンの別のデータセンターにシステムをフェイルオーバーさせるように構成できる。
各データセンターで運用されているクラスタは、ネットワークで接続された何千もの物理ノードを関連付けている。いずれかの物理ノードで障害が発生すると、そのノードでホストされている仮想マシンは同じクラスタ内の別の物理ノードで再起動する。パブリッククラウドコンピューティングでは、サイトごとに何百または何千ものクラスタが存在している。
プライベートデータセンターのハイパーバイザーにパッチを適用する必要があるのと同様に、パブリッククラウドの物理ブレードサーバで実行しているハイパーバイザーにもパッチを適用しなければならない。これは、クラウドアプリケーションをホストする仮想マシンにとっては残念なことだろう。仮想マシンは年に数回ベースとなるハイパーバイザーのアップグレード中に移動しなければならない。管理者は、「Azure DNS」(DNSドメインのホスティングサービス)や「Azure Active Directory」(ディレクトリとIDの管理サービス)などのAzureサービス群にメンテナンスの作業が影響することを心配しなくてよい。だが、顧客のワークロードについては管理者が責任を負わなければならない。
Azureは、「可用性セット」によって顧客が利用する仮想マシンのサービス停止に関する問題に対処している。可用性セットを使用すると、管理者は、異なるゾーンに配置されているフロントエンドWebサーバなど複数の仮想マシンを割り当てることができる。この分散型の性質がクラウドコンピューティングアーキテクチャで高可用性を実現している。というのも、フロントエンドサービスは、単一障害とサーバアップデートのどちらが発生した場合でも、要求を処理できるからだ。Microsoftは可用性セットを仮想マシンの論理グループと位置付けている。また可用性セットは、クラウドアプリケーションがどのように構成されているかという情報をMicrosoftに提供する役割も担っている。
AzureでSLA(サービス品質保証)に記載の99.95%の稼働率を実現したいと考える管理者は、可用性を確保するためにこれらの可用性セットを使用しなければならない。クラウドコンピューティングの高可用性について管理者が理解すべき最大の教訓の1つは、ホスティングインフラに振り回されることなく、使いこなすことだ。管理者は、導入したクラウドアプリケーションの機能への影響が最小限で済むように単一ノードのフェイルオーバーを設計しなければならない。
Azureでは、オンプレミスで管理されているITインフラとは異なる形でディスクが用意されている。ストレージノードでもアップグレードが必要になる。そのため、管理者が単一ノードと見なしているディスクは、実際のところ、Azureデータセンターのローカルで少なくとも3回複製されている。それから、冗長性のレベルを上げるには、膨大なコストがかかる。つまり、クラウドコンピューティングの可用性はタダでは手に入らないということだ。
可用性セットでは、導入したクラウドアプリケーションについて「障害ドメイン」と「更新ドメイン」が考慮されている。障害ドメインは、局所的な停電など、単一の問題の影響を受ける可能性があるインフラアイテムのグループだ。一方の更新ドメインは、制御された状態でパッチを適用する、グループ化された仮想マシンで構成している。
可用性セットは、クラウドでホストしているサービスが、要請を受けたときに、その役割を果たせるようにしている。
特定の可用性セットに含まれる仮想マシンは、ネットワークの制御(どのサーバにトラフィックを流すか)についてロードバランサーに頼ることになる。Azureの負荷分散機能は、アクティブなサーバにトラフィックをルーティングする。障害が発生しているサーバやアップグレード中のサーバにトラフィックがルーティングすることはない。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
急増する「AIはこう言ってる」マン 判断を狂わせる「AI忖度」を防ぐには?
-
2
取手市がVDIと決別した理由 更改費用「4倍超」を約1.7倍に圧縮
-
3
「データストレージの活用方法」に関するアンケート
-
4
自宅のWi-Fiが「遅い」「途切れる」本当の原因は? Dellが推奨する鉄則
-
5
本当に安いPCで十分か? “すぐ重くなる”を防ぐノートPC選びの絶対条件
-
6
Claudeの不可視透かしに批判殺到 著作権消失や誤判定に潜む企業リスク
-
7
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
8
221人調査で分かった「情シス最大のストレス」は?
-
9
LLMの「過学習」、正しく説明している文章はどれ?
-
10
レガシー基幹システムをSAPに統合 山善が突き止めた「標準化と個別最適」の境界線
ホワイトペーパーランキング PR
-
1
年収2000万「クラウドセキュリティのプロ」になれる資格とは
-
2
セキュリティソフトをすり抜ける標的型攻撃メール、不審メールの見破り方とは?
-
3
Windows Updateの通信集中で回線が逼迫、ネットワーク刷新事例に学ぶ解決策
-
4
財務を戦略的組織へ進化させるAI活用術、4つの主要な障壁と解消方法
-
5
「NAS」「SAN」「DAS」は何が違う? いまさら聞けないストレージの基礎
-
6
“あのファイル転送”で暗躍するノーウェアランサム
-
7
標的型攻撃メールを見破るには? サンプル文面を例に傾向を解説
-
8
商用利用の安全性を確保し大量のコンテンツを高速で生成する、AI活用の秘訣
-
9
マンガで解説、1日で生成AI環境を構築できるワークショップの中身とは?
-
10
Dark AIが台頭する時代の新発想、「より高度なAIで対抗する」具体的方法とは?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー