対処の迅速さに評価の声も
「Google Cloud Platform」(GCP)の障害を引き起こしたエンジニアの行動とは?
「Google Cloud Platform」(GCP)の複数のサービスが2019年3月、障害に見舞われた。アナリストは、Googleの素早い対処と透明性を評価する。
Googleのクラウドサービス群「Google Cloud Platform」(GCP)で2019年3月11日(日付は米国時間)に発生した障害は迅速に解決され、ユーザー企業への影響は限定的だった。だがユーザー企業にとっては、クラウドサービスの信頼性を向上させるよう、クラウドベンダーに圧力をかけ続けなければならない必要性を再認識させる出来事だった。
障害が発生したGCPのサービスは、以下の2つだ。
- Cloud Console
- ユーザー企業が自分のアカウントおよびプロジェクト管理に使うサービス
- Cloud Dataflow
- ユーザー企業がバッチとストリームデータの処理に使うサービス
併せて読みたいお薦め記事
Google Cloud Platformの導入事例
企業向けに転換するGoogle Cloud Platform
パブリッククラウドの障害に備える
GCPの障害はなぜ発生したのか
Googleの事後検証によると、Cloud Consoleは約4時間にわたって使用不能になった。これはGCPでユーザーリクエストにレート(単位時間当たりのリクエスト数)制限をかけるシステムで実施した、コードの変更が原因だった。この不具合のために、システムがレート制限の低い状態に陥り、結果としてリクエストが拒否された。
Cloud Dataflowの問題では、システムの速度が低下する問題が19時間以上も続いたが、2019年3月12日に完全に障害はなくなった。Googleは、原因の究明を続けると説明している。
オブジェクトストレージの「Google Cloud Storage」は2019年3月12日に全リージョンで、エラーが増える現象が4時間にわたって発生した。Googleの事後検証によると、この問題はWebサイトやサービスの信頼性向上に向けたGoogleの取り組み「サイトリライアビリティーエンジニアリング」(SRE)を担当するエンジニアが取った行動に起因していた。
このエンジニアは2019年3月11日、Google社内のBLOB(バイナリデータを格納する場合のデータ型)ストレージに接続する、メタデータ用ストレージの利用が急増していることに気付いた。この利用を減らすため、このエンジニアが設定を変更した結果、BLOBデータの位置情報を参照するシステムの一部に過剰な負荷がかかり、その負荷が連鎖的な障害を引き起こしたという。
Webアプリケーションの開発・実行環境サービス「Google App Engine」でも関連した障害が発生し、4時間ほど続いた。
Googleの報告によると、今後はストレージサービス内でリージョンを切り離す手段を改善し、GCPで障害が起きても世界に広がらないようにするなどの対策を計画しているという。
クラウドの信頼性は依然として野心的な目標
ほぼ全てのクラウドベンダーがダウンタイム(障害のためにユーザー企業が利用できない時間)を経験している。GCPの場合、市場シェアで「Amazon Web Services」(AWS)と「Microsoft Azure」に大きく引き離されていることから、障害への迅速な対処は非常に重要だ。パブリックラウドは買い手が有利な市場で、ユーザー企業は最も安定性の高いサービスを選ぶ。一方で、今回のGoogleの問題解決に向けた迅速な対処と透明性は「ユーザー企業にとっては貴重な要素だ」と、調査会社Constellation Researchのアナリスト、ホルガー・モラー氏は指摘する。
それでもGoogle Cloud Storageの障害に関する報告の中で、Googleがリージョン間の分離を強化すると言及している点には不安を感じるユーザー企業もあるだろう。リージョン分離はクラウドにおけるアップタイム(コンピュータやシステムが稼働している時間)と耐久性の確保において鍵を握る。もしクラウドベンダーがリージョン分離に失敗すれば、それは「ユーザー企業にとって懸念材料になる」とモラー氏は指摘。Googleがリージョン分離にうまく対処できたかどうかは「次にGCPがダウンしてみるまで分からない」と語る。
調査会社IDCのアナリスト、スティーブン・エリオット氏によると、想定外のクラウドサービスの障害は、管理の高度化、オーケストレーションの導入、負荷分散技術の採用を通じ、いずれは発生頻度が低くなる見通しだ。「これはユーザー企業が一般的にクラウドサービスに期待する基準だ」とエリオット氏は語る。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社MatrixFlow] 「物流リソース最適化」ガイド:人員・配車・傭車を出庫依頼の確定前に決めきる -
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
4
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
5
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
6
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
7
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
8
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
9
「結局使わなくなる」Microsoft 365 Copilotを半年で定着 キリンの3施策
-
10
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー