既存ツールを捨てないインフラ刷新
サイロ化が招く大規模障害 巨大企業のインフラを「わずか4人」で救った方法
システム規模の拡大に伴い、監視ツールにかかる費用や運用負荷の肥大化が顕在化する。金融大手のMSCIはわずか4人で、乱立した監視ツールを即座に捨てることなく、高額な維持費とベンダーロックインから抜け出した。
複数ベンダーのクラウドサービスやオンプレミスシステムが混在し、数千人規模の従業員を抱える企業にとって、監視の複雑化は避けて通れない課題だ。金融サービス大手のMSCIも例外ではなく、過去の企業買収などを経てサイロ(分断)化された旧来の監視ツール群が乱立し、運用が不透明な状態に陥っていた。
MSCIはある日、顧客に提供している自社サービスで大規模な障害に見舞われた。稼働ログが複数のツールに分散しており、事象の相関関係を特定するのに時間を要した。結果として、顧客の業務時間帯に影響を及ぼし、収益や企業ブランドを脅かす事態となった。
このインシデントを機に、MSCIは監視体制の根本的な見直しに着手する。高額なライセンス費用やデータ量に応じた従量課金、特定の製品に依存した「ベンダーロックイン」状態からの脱却を目指し、標準技術の採用を決断した。これによって、障害の平均検出時間を30%短縮することに成功している。
巨大なインフラを抱えながら、わずか4人のチームでいかにしてこの大規模な移行を成し遂げたのか。その裏には、既存のツールを即座に捨てるのではなく、データの中継役となる「抽象化レイヤー」を挟み込むという戦略的な手法があった。
4人でサイロ化した大規模インフラを刷新
併せて読みたいお薦め記事
インフラ刷新術を事例から学ぶ
本プロジェクトの全容は、ITカンファレンス「KubeCon + CloudNativeCon Europe 2025」のセッション「From Legacy Vendor Tooling To OTEL: Scaling Observability at MSCI With a Four-Person Team」で解説された。登壇したのは、MSCIのバイスプレジデントであるアフタブ・カーン氏と、エグゼクティブディレクターのザック・アーノルド氏だ。
MSCIの変革をけん引したのは、わずか4人のエンジニアで構成されたチームだ。彼らが指針としたのは「サービスの規模に比例して人的リソースを増やさなければならないシステムは失敗する」という、Googleが提唱するSRE(サイト信頼性エンジニアリング)の原則だった。人員を増やさずに全社規模の監視システムを構築するために彼らが着目したのが、オープンソースアプリケーション観測ツール「OpenTelemetry」だ。
導入の契機は、利用していたクラウドサービス群の監視ツールの中に、OpenTelemetryのライブラリが組み込まれているのを発見したことだった。これを機に、特定の製品仕様に適合させる方法ではなく、データを収集するための標準的な枠組みとして扱う戦略へとかじを切った。
移行における最大のポイントは、既存のサイロ化されたツール群をいきなり撤廃しなかった点にある。社内の各開発チームが使い慣れたツールの使用を認めつつ、データの収集と転送の間にOpenTelemetryを利用した中継地点(コレクター)を配置した。これによって、ログ、メトリクス(指標)、トレース(処理の追跡)といった稼働データを統一された形式で受け取り、任意の保存先に転送できるデータパイプラインを構築した。
コレクターの稼働インフラには、アプリケーションの配備や運用を自動化する「Kubernetes」を採用し、設定変更や処理工程の更新を迅速に実行できるようにした。アプリケーションの設定を変更することなく、新しい保存先や監視ツールを容易に試すことが可能になった。
構築された新しいアーキテクチャでは、ピーク時に毎秒約1GBのデータをオンプレミスシステムで稼働する検索・分析エンジン「Elasticsearch」に投入し、1日当たり2TB超のデータも扱っている。分散処理を追跡する仕組みには「Jaeger」、数値データの収集には「Prometheus」を利用し、それらをデータ可視化ツール「Grafana」で一元的に可視化する構成を採用した。
これらのオープンソースツールの組み合わせによって、MSCIは特定のベンダーによる制約から解放され、大幅な費用の最適化を実現している。自動化された仕組みを整備したことで、新しいアプリケーションの監視設定にかかる手間は、数日から数分へと劇的に短縮された。開発者は設定の負荷を負わずに、パフォーマンスの可視化という本来の目的に集中できるようになった。
技術的な刷新だけではなく、企業全体の意識を変えるための地道な活動も実施した。当初は未知のオープンソースツールを運用することへの懸念や、使い慣れた画面を作り直す手間に対する反発もあったという。
推進チームは、開発者向けの導入用資料を作成し、移行による具体的な恩恵を明示した。ペアプログラミングを通じた技術移転や社内での実演、啓発活動を繰り返し実施して、チームごとの自律的な運用を支援した。その結果、監視対象アプリケーションの80%でデータ収集の仕組みが組み込まれ、新たな標準として社内に定着した。
MSCIは現状の安定したインフラに満足することなく、さらなる高度化を見据えている。そのためにカーネル(OSの中核)で動作し、システム内部を詳細に監視する技術「eBPF」(extended Berkeley Packet Filter)の習得を進めており、アプリケーションのソースコードに手を加えることなく、システムレベルでの詳細な通信や依存関係を把握することを目指している。
エンドユーザーの操作に基づいた監視から洞察を抽出し、データを製品の機能改善や意思決定に直接生かす仕組みづくりも視野に入れている。限られた人員であっても、適切な技術選定と抽象化のアプローチを用いれば、大規模で複雑なシステム構成を大きく改善できることを、MSCIの事例は示している。
本稿は、Cloud Native Computing Foundation(CNCF)が2025年4月18日に公開した動画「From Legacy Vendor Tooling To OTEL: Scaling Observability at MSCI With a... Aftab Khan & Zach Arnold」を基に作成しました。
Copyright © ITmedia, Inc. All Rights Reserved.
本記事は制作段階でChatGPT等の生成系AIサービスを利用していますが、文責は編集部に帰属します。
関連記事
新着ホワイトペーパー PR
-
製品資料
“攻撃者優位”なサイバーセキュリティ、全ての「穴」をふさぐ方法とは? -
製品資料
実際に悪用される脆弱性は4%前後 優先的に対処すべき脆弱性を把握するには? -
製品資料
HubSpotの機能を拡張する法人データ活用法 -
製品資料
面倒で非生産的な「名寄せ」作業 高精度&高効率に実施するには? -
製品資料
名刺管理には「その先」がある 成果のでない営業活動から脱却する秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
Netflixのバックエンドは「ほぼJava」 3000超のアプリを支える開発基盤の裏側
-
2
ISMSの“コンサル丸投げ”が招く数千万円の無駄 NTTドコモビジネスの脱出劇
-
3
「Microsoft 365」が乗っ取られる 跡形もなくMFAを破る手口
-
4
「WSUS」終了の時限爆弾 “本命”移行先ツールとMicrosoft提唱の新管理手法
-
5
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
6
「結局使わなくなる」Microsoft 365 Copilotを半年で定着 キリンの3施策
-
7
IT製品の導入に関するアンケート「サーバ&ストレージ」編
-
8
ベッドでの使用が「PC騒音」を悪化させる? Dellが推奨する冷却ファンの鎮め方
-
9
アラート47%削減 オープンハウスが捨てた「全部メール通知」の監視体制
-
10
継続利用は4割どまり M365 Copilotが「効く業務」と期待外れの境界
ホワイトペーパーランキング PR
-
1
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
2
財務・会計はAI活用でどう変わる? 調査で見えた変革の道筋
-
3
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
-
4
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
5
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
6
「結局、一部の人しか使わない」 AI活用が業務に定着しない根本的な理由
-
7
コスト分析で見る「デバイス復旧」の代償 損失額から導きだされた投資戦略とは
-
8
Macの安全神話は崩壊? 最新の脅威動向から見えた攻撃のトレンドと有効な対策
-
9
ゼロトラストにおける「IDaaSの課題」と補完すべき重要機能とは?
-
10
「NAS」「SAN」「DAS」は何が違う? いまさら聞けないストレージの基礎
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー