障害対応を阻む「組織の壁」
東京ガスが“原因不明のエラー”特定時間を10分の1に短縮した方法
クラウドインフラは便利である半面、システムが複雑化して障害時の原因究明を困難にするという負の側面を持つ。手作業での膨大なログ収集に疲弊していた東京ガスの運用現場は、この難局をどう乗り越えたのか。
社会インフラであるガスや電力の安定供給において、顧客との接点になる手続き用Webサイトの可用性は不可欠だ。東京ガスは首都圏を中心に膨大な数の顧客を抱え、人々の生活を支えている。同社ではサービス利用者の増加に伴い、大規模な受付システムをオンプレミスシステムからクラウドサービス群「Microsoft Azure」に移行した。ところがシステム構成が複雑になり、多様な外部APIとの連携が必要になる中で、障害発生時に原因究明の労力が多大になるという運用上の課題に直面していた。
この課題を克服する手段として、東京ガスはシステム全体の稼働状況を一元的に可視化する統合監視ツールを採用し、エラー調査の時間を10分の1にまで短縮した。サービスが複雑に絡み合うシステムの裏側で、いかにして迅速なトラブル解決とコスト最適化を実現したのか。
原因特定を10分の1に縮めた“共通言語”
東京ガスが導入したのは、インフラからアプリケーション、ユーザー体験を単一のシステムで網羅的に観測可能にするオブザーバビリティ(可観測性)ツール「New Relic」だ。同社が運用する受付システム「TG-WISP」(WISP:Web Interface Service Platform)は、ガスや電気の使用開始/停止手続きなどを担う重要なライフラインの入り口だ。引っ越しが集中する繁忙期には、1日平均10万件、月間で最大300万件のリクエストを処理しており、システムの停止は社会活動への影響に直結する。
システムを高度化する中で直面した課題と、それを克服した独自の仕組みは以下の通りだ。
1.フルスタック監視とトレースIDによる迅速な原因特定
従来の仕組みでは、エラーのアラートが発報された場合、連携する多数の外部システムから膨大なログを手作業で収集して分析をかけなければならなかった。しかし新たな統合監視基盤の導入により、1つの画面で全てのシステムのログを横断的に確認することが可能になった。
特筆すべきは、1件のリクエストに対する一連の処理の流れを一意に識別する「トレースID」の活用だ。この仕組みによって、インフラ担当者はアプリケーションのソースコードを読み解くことなく、処理の前後関係や通信の実態を正確に把握できるようになった。結果として問題の切り分けが迅速化し、エラー1件当たりの調査時間は従来の10分の1にまで短縮されている。機能ごとの課金体系ではないため、料金の増加を懸念することなく、必要に応じて監視機能を自由に追加して有効性を検証できる点も、優位性として評価された。
2.共通言語としてのデータが実現する運用体制
技術的な恩恵は、組織の連携プロセスにも大きな変革をもたらした。
東京ガスは、システムのプロダクトオーナーである自社に加え、運用を担うIT子会社の東京ガスiネット、開発を担当する協力会社のサーバーフリーの3社体制で業務を進めている。以前は問題が発生した際、各社が個別に観測結果を確認し、必要に応じて連絡を取り合うという分断された手順を踏んでいた。New Relic導入後は、監視システムが収集した客観的なデータを「共通言語」として活用している。アラートを契機に3社の関係者が直ちにWeb会議に集まり、同じ画面でデータを確認しながら、原因の特定から対処方針の決定までをその場で実施するスタイルに移行した。これによって、従来は問題発生から対処方針を決めるまでに3時間程度を要していた意思決定の時間が約30分へと短縮され、対処スピードが6倍に上がっている。
3.クラウド料金適正化と将来への展望
詳細な稼働状況の可視化はインフラの最適化にも寄与している。どの部分の処理が、CPUやメモリなどのリソースをどれだけ消費しているかが正確に見えるようになったため、過剰なリソース確保による無駄を排除し、データに基づいたクラウド料金の適正化が可能になった。インフラ構築を自動化する仕組みと組み合わせることで、作成した監視用の画面を他のシステムに横展開できる拡張性も備えている。
東京ガスの小川靖史氏(エネルギー事業革新部 オペレーション改革グループ チームリーダー)は、2025年1月にメインの受付システムとしてTG-WISPをリリースした直後の繁忙期にトラブルが発生した際も、New Relicによる可視化と各社のノウハウが助けになり、難局を切り抜けることができたと説明する。同社は今後、TG-WISPでの成功モデルをベースにNew Relicの適用範囲を他のシステムにも拡大し、収集したデータからトラブルの予兆を捉えるプロアクティブな対処の実現を目指している。
Copyright © ITmedia, Inc. All Rights Reserved.
本記事は制作段階でChatGPT等の生成系AIサービスを利用していますが、文責は編集部に帰属します。
関連記事
新着ホワイトペーパー PR
-
製品資料
[日本シーゲイト株式会社] 実験のやり直しを防止 研究データ基盤に求められる高可用性ストレージとは -
製品資料
[株式会社Leaner Technologies] もっと安く買えるのに…… 間接材購買で“コスト削減機会”を逃さないためには -
製品資料
[株式会社セールスフォース・ジャパン] フィールドサービスの熟練技術者が「AIエージェント」を求めている理由 -
製品資料
[株式会社グリーンフィールド・オーバーシーズ・アシスタンス] 基礎から分かる「就労ビザ」 アメリカ進出を目指すなら知っておきたい取得戦略 -
製品資料
[ネットアップ合同会社] データを安全に管理しながら製造DXとAI活用を推進、その具体策とは?
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
ITエンジニア1265人調査 生成AIを使い込むほど「人の確認」が重い理由
-
2
高額GPUを買っても成果ゼロ? 「プライベートAI」の落とし穴
-
3
年収700万超エンジニアに共通するスキルと「もっと勉強すべきだった分野」
-
4
9割が頓挫する「AI内製化」 差がついたのはツールより設計力
-
5
JSONをやめてPythonで送る トークン消費を約7割抑えるAIの設計
-
6
【基本情報技術者試験】データを複数ディスクに分散する「RAID」の仕組みと特徴
-
7
情シス管理職は何を「やらない」のか ラクス情シス課長が語る評価される仕事の選び方
-
8
脱VMwareか、継続か? 仮想化ソフト主要6製品の機能とスペックを徹底比較
-
9
ハルシネーションに関して正しく説明している記述はどれ?
-
10
AIエージェントを暴走させない設定、済んでますか? 対策5選を専門家が紹介
ホワイトペーパーランキング PR
-
1
登録セキスぺが語る「SCS評価制度」の舞台裏 星を取得すべき理由と対応のコツ
-
2
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
3
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
4
「人員を増やす」という選択肢はない 情シスが負の連鎖から抜け出すには?
-
5
「問題が深刻化しやすいプロジェクト管理」から脱却する方法とは?
-
6
AI時代の組織設計:「判断と責任」を人に残すための2つの原則とは?
-
7
防御側の「3つの前提」が崩壊 AI時代のセキュリティに必要な3つの転換とは?
-
8
AI活用を停滞させる「2:6:2の壁」を乗り越えるためのポイントとは?
-
9
生成AIで文書活用を進めるには? 効率化と安全性をどう両立する
-
10
OSSでは困難 100超のサービスを持つマネーフォワードが実践した統合監視術
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー