対処の迅速さに評価の声も
「Google Cloud Platform」(GCP)の障害を引き起こしたエンジニアの行動とは?
「Google Cloud Platform」(GCP)の複数のサービスが2019年3月、障害に見舞われた。アナリストは、Googleの素早い対処と透明性を評価する。
Googleのクラウドサービス群「Google Cloud Platform」(GCP)で2019年3月11日(日付は米国時間)に発生した障害は迅速に解決され、ユーザー企業への影響は限定的だった。だがユーザー企業にとっては、クラウドサービスの信頼性を向上させるよう、クラウドベンダーに圧力をかけ続けなければならない必要性を再認識させる出来事だった。
障害が発生したGCPのサービスは、以下の2つだ。
- Cloud Console
- ユーザー企業が自分のアカウントおよびプロジェクト管理に使うサービス
- Cloud Dataflow
- ユーザー企業がバッチとストリームデータの処理に使うサービス
併せて読みたいお薦め記事
Google Cloud Platformの導入事例
企業向けに転換するGoogle Cloud Platform
パブリッククラウドの障害に備える
GCPの障害はなぜ発生したのか
Googleの事後検証によると、Cloud Consoleは約4時間にわたって使用不能になった。これはGCPでユーザーリクエストにレート(単位時間当たりのリクエスト数)制限をかけるシステムで実施した、コードの変更が原因だった。この不具合のために、システムがレート制限の低い状態に陥り、結果としてリクエストが拒否された。
Cloud Dataflowの問題では、システムの速度が低下する問題が19時間以上も続いたが、2019年3月12日に完全に障害はなくなった。Googleは、原因の究明を続けると説明している。
オブジェクトストレージの「Google Cloud Storage」は2019年3月12日に全リージョンで、エラーが増える現象が4時間にわたって発生した。Googleの事後検証によると、この問題はWebサイトやサービスの信頼性向上に向けたGoogleの取り組み「サイトリライアビリティーエンジニアリング」(SRE)を担当するエンジニアが取った行動に起因していた。
このエンジニアは2019年3月11日、Google社内のBLOB(バイナリデータを格納する場合のデータ型)ストレージに接続する、メタデータ用ストレージの利用が急増していることに気付いた。この利用を減らすため、このエンジニアが設定を変更した結果、BLOBデータの位置情報を参照するシステムの一部に過剰な負荷がかかり、その負荷が連鎖的な障害を引き起こしたという。
Webアプリケーションの開発・実行環境サービス「Google App Engine」でも関連した障害が発生し、4時間ほど続いた。
Googleの報告によると、今後はストレージサービス内でリージョンを切り離す手段を改善し、GCPで障害が起きても世界に広がらないようにするなどの対策を計画しているという。
クラウドの信頼性は依然として野心的な目標
ほぼ全てのクラウドベンダーがダウンタイム(障害のためにユーザー企業が利用できない時間)を経験している。GCPの場合、市場シェアで「Amazon Web Services」(AWS)と「Microsoft Azure」に大きく引き離されていることから、障害への迅速な対処は非常に重要だ。パブリックラウドは買い手が有利な市場で、ユーザー企業は最も安定性の高いサービスを選ぶ。一方で、今回のGoogleの問題解決に向けた迅速な対処と透明性は「ユーザー企業にとっては貴重な要素だ」と、調査会社Constellation Researchのアナリスト、ホルガー・モラー氏は指摘する。
それでもGoogle Cloud Storageの障害に関する報告の中で、Googleがリージョン間の分離を強化すると言及している点には不安を感じるユーザー企業もあるだろう。リージョン分離はクラウドにおけるアップタイム(コンピュータやシステムが稼働している時間)と耐久性の確保において鍵を握る。もしクラウドベンダーがリージョン分離に失敗すれば、それは「ユーザー企業にとって懸念材料になる」とモラー氏は指摘。Googleがリージョン分離にうまく対処できたかどうかは「次にGCPがダウンしてみるまで分からない」と語る。
調査会社IDCのアナリスト、スティーブン・エリオット氏によると、想定外のクラウドサービスの障害は、管理の高度化、オーケストレーションの導入、負荷分散技術の採用を通じ、いずれは発生頻度が低くなる見通しだ。「これはユーザー企業が一般的にクラウドサービスに期待する基準だ」とエリオット氏は語る。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
技術文書・技術解説
[セコムトラストシステムズ株式会社] SCS評価制度で重要性が増す「SASE」 制度の要求事項と機能はどう関係する? -
製品資料
[株式会社オプティム] SaaS管理やID管理などの「資産管理」をまるごとカバーする方法とは? -
製品資料
[株式会社kickflow] 3分でわかる「kickflow」 どのようなワークフローを実装できる? -
事例
[株式会社kickflow] 出前館も実践 ワークフロー刷新で得られる効果とは? -
事例
[株式会社kickflow] ワークフロー活用事例:社内システムとのAPI連携で業務効率化&統制強化を実現
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
-
2
1200万円のSaaS導入を回避 スギ薬局「運用費10万円」のAIエージェント構築術
-
3
年収700万超エンジニアに共通するスキルと「もっと勉強すべきだった分野」
-
4
「企業におけるAIの運用」に関するアンケート
-
5
「完璧な設計」なのに3000万円溶けた AWSの失敗事例から学ぶ3つの教訓
-
6
「企業内サーバ環境の利用実態」に関するアンケート
-
7
本当にそのIBM iに問題はない? ブラックボックス化と属人化を防ぐ第一歩
-
8
脱VMwareか、継続か? 仮想化ソフト主要6製品の機能とスペックを徹底比較
-
9
なぜ情シスは評価されにくい? 読者調査で見えた「成果が見えない仕事」第1位は
-
10
「シェルコード」とは? 凶悪なマルウェア感染を可能にする手口
ホワイトペーパーランキング PR
-
1
「Google Workspace」活用事例34選、先進の生成AIによる組織変革の全貌
-
2
DX/AI投資の壁を突破、現代の最高財務責任者が直面する課題と克服のヒント
-
3
Linuxのスキルを証明する“激推し”の認定資格はこれだ
-
4
バックアップは“取っているから大丈夫”なのか? ランサムウェア時代の備え方
-
5
ネットワーク遅延の原因、「パケットロス」の基礎知識と効果的な解決策
-
6
月1000枚の紙を削減 9年動けなかった組織が、業務改革のその先に得たもの
-
7
「改正物流効率化法対策」徹底解説 総物流費を抑制するサプライチェーン戦略
-
8
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
9
5分で分かる Microsoft 365のデータ損失に備えるためのバックアップの仕組み
-
10
Windows PCとMacの選択制で生産性向上 LINEヤフーが実践する運用管理方法とは
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー