真のシステム効率とは
だからネトフリは落ちない BTSのカムバも支えたNetflixの裏側
2026年3月、Netflixを通じてBTSのライブが全世界に配信された。滞りなく配信が終了したその裏では、同社のどのようなロジックや技術が活用されたのか。
Netflixは2026年3月21日、韓国のアーティストBTSのライブ「BTS THE COMEBACK LIVE | ARIRANG」を全世界同時配信した。3100万PVを記録したとの報道もある本配信は、途中で”落ちる”ことなく終了した。
なぜNetflixは”落ちなかった”のか。2025年12月、Netflixのエンジニアがこのヒントとなる同社の取り組みを講演で語っている。
BTSの全世界配信も”落とさなかった” Netflixの秘策は
併せて読みたいお薦め記事
クラウド障害で情シスはどう動くべきか
講演に登壇したのは、AWSのプリンシパルソリューションアーキテクトであるプラティーク・シャルマ氏とNetflixのシニアソフトウェアエンジニア、アルガ・C氏だ。同氏は、Netflixのライブオペレーションにおいて、スケーラビリティと可用性を確保する責任も担っている。
NetflixはAWSが展開する4リージョンを同時に本番稼働させる体制を取っている。そのため、あるリージョンに障害が発生した場合もサービスを継続できる。その背景には「年商1000億ドル規模の企業では、1分間の停止が約20万ドルの損失になる」というアルガ氏の試算がある。サービスが10分止まれば200万ドル相当の損失だ。事業規模が大きくなるほど、障害のテールリスク(発生率は極めて低いが甚大な被害をもたらすリスク)は指数関数的に増大する。従って、効率性だけを追求するのは誤りであり、障害コストを考慮した「リスク調整後の正味価値」で評価すべきだと同氏は指摘する。
一方、ユーザーはスマートフォン、PC、タブレット、テレビなど多様なデバイスからNetflixのサービスを利用する。アルガ氏はこの状況を前提に「単一の安定したネットワークを前提にできない」と指摘する。さらに、デバイスの計算処理能力や画面の解像度も多様だ。
そこでアルガ氏が紹介するのが、Netflixが自社で運用するコンテンツ配信ネットワーク(CDN)の「Open Connect」(以下、OC)だ。OCは、世界中の配信品質向上とコスト削減を目的に設計されている。
CPUの使用率は効率を表さない
アルガ氏によると、Netflixはシステムの性能や効率をCPUの稼働率のみで計測しないという。同社は、キングマンの近似式(注)を用いてシステム性能を評価している。負荷を高めると応答時間は加速度的に悪化し、ある地点を越えると処理の待ち時間が急増する。「稼働率だけを見るのは誤りだ」というのがアルガ氏の指摘だ。同じCPU使用率30%でも、サービスAは安定し、Bは突発的に使用率が跳ね上がり、Cはその中間的な挙動を示す、というようにサービスによって状況は異なる。従って、単なるCPU使用率を効率の指標として見るのでは不十分だと同氏は述べる。
※注1:キングマンの近似式は、待ち行列理論において「稼働率と待ち時間の関係」を算出する計算式。稼働率が100%に近づくと待ち時間が急激に増大する現象を説明するために用いられる場合がある(近似式は、複雑な厳密解を簡略化する式)。待ち行列理論は、サービスを受けるために顧客やジョブが待つ「待ち行列」を数学的に解析する理論。
ワークロードを階層化する
Netflixはワークロードを重要度別に4つのグループに分類している。
- Tier 0
- 停止するとNetflixのサービスは即時停止となる
- 劣化許容
- 停止してもユーザーはそれほど困ることがないNetflixの一部の機能
- ベストエフォート
- 停止してもユーザーは気付かない機能。空いているサーバがあれば実行できるようにする
- バッチ処理
- リアルタイムに実施せず、後回しにしても問題がない処理
アルガ氏によると、従来はこれら全てを約50%の稼働で運用していたが、Tier 0を約30%、バッチを60~70%で運用し、総コストを変えずに全体効率を改善している
成功バッファと失敗バッファの概念を導入
Netflixは「成功バッファ」と「失敗バッファ」という概念を導入した。前者は、サーバの負荷を増やしても遅延もエラーも出さずに耐えられる負荷の範囲、後者は、表面上は動いているが、わずかでも負荷が増えると一気にシステムが破綻する直前の範囲を示す。
このバッファ量は、インスタンスの世代、サイズ、データベースの特性ごとに異なるため、一律のCPU指標は用いないとアルガ氏は説明する。例えば「Apache Cassandra」(オープンソース型のデータベース管理システム<DBMS>)はデータを内部に持ち、内部処理が性能を左右する状態保持型のサービスだ。同サービスは、バックグラウンドで定期的にコンパクション(ファイル統合処理)を実施するが、その際にCPUやメモリに負荷を掛ける。Netflixはその負荷を考慮して別のバッファを設定している。アルガ氏は「効率だけを追うと信頼性を失う。両者は補完関係にある」と述べる。
講演をまとめると
Netflixは効率を単独で考えず、信頼性とリスクを補完関係として捉えている。需要を先読みする容量設計、変化に即応するオートスケール、秒単位で動作するロードシェディング(負荷遮断機能)までを組み合わせることで、巨大規模でも停止しないクラウド運用を実現している。
※本稿は、公開済みの記事を修正の上、再公開したものです。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
新着ホワイトペーパー PR
-
製品資料
[o9ソリューションズ・ジャパン株式会社] 「改正物流効率化法対策」徹底解説 総物流費を抑制するサプライチェーン戦略 -
製品資料
[o9ソリューションズ・ジャパン株式会社] 「サプライチェーン最適化」実践ガイド:効果的な意思決定を実現する秘訣とは? -
製品資料
[株式会社リンプレス] 非デジタル/IT人材を「自走するDX推進者」に変えるための育成ロードマップ -
市場調査・トレンド
[ワンアイルコンサルティング株式会社] AI時代の組織設計:「判断と責任」を人に残すための2つの原則とは? -
技術文書・技術解説
[ワンアイルコンサルティング株式会社] システムの保守がモダン化を阻む? 「変えない判断」から脱却する方法とは
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
1200万円のSaaS導入を回避 スギ薬局「運用費10万円」のAIエージェント構築術
-
2
「完璧な設計」なのに3000万円溶けた AWSの失敗事例から学ぶ3つの教訓
-
3
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
4
高額な「AI PC」を一般従業員も使えたら? 費用のハードルを一気に下げる方法
-
5
LLMの「過学習」、正しく説明している文章はどれ?
-
6
「AIバブル」は崩壊するのか? 熱狂の後に来る“尻拭い”と4つの防衛策
-
7
「コピペ運用の限界」に直面するAI活用 7割超が“別画面”のまま使う理由は?
-
8
2035年までに1億4500万台、急拡大する「フィジカルAI」市場の勝者は誰か
-
9
IT調達担当者が知るべき「IT機器 大インフレ時代の前向きな選択肢」
-
10
【基本情報技術者試験】「デュプレックスシステム」と「デュアルシステム」の違いは?
ホワイトペーパーランキング PR
-
1
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
2
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
3
Windows PCとMacの選択制で生産性向上 LINEヤフーが実践する運用管理方法とは
-
4
DX/AI投資の壁を突破、現代の最高財務責任者が直面する課題と克服のヒント
-
5
「Google Workspace」活用事例34選、先進の生成AIによる組織変革の全貌
-
6
生成AIで文書活用を進めるには? 効率化と安全性をどう両立する
-
7
「人員を増やす」という選択肢はない 情シスが負の連鎖から抜け出すには?
-
8
「問題が深刻化しやすいプロジェクト管理」から脱却する方法とは?
-
9
Linuxのスキルを証明する“激推し”の認定資格はこれだ
-
10
NTTドコモが実践したクラウド統合監視 業務量2倍でも残業削減を実現できた理由
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー