3万CPUコアを食いつぶした「意外な原因」
OpenAIの“限界インフラ”を救ったのはわずか1行の設定変更だった
OpenAIのシステムにおいて、CPUの処理能力が限界に達し、深刻なログ欠落の危機が発生した。原因はログ収集ツールが引き起こした大量のシステムコールだ。何によって引き起こされ、どう解消できたのか。
AI(人工知能)技術の進化が加速する中、大規模言語モデル(LLM)を支えるコンピューティングリソースの確保は企業の喫緊の課題となっている。「ChatGPT」を開発するOpenAIは、1日当たり9P(ペタ)Bを超える膨大なログを処理しており、AI技術の開発や本番稼働の推論において、限られたCPUの効率的な活用が求められていた。
OpenAIのインフラは、コンテナオーケストレーションツール「Kubernetes」で稼働しており、各サーバではさまざまなシステムからデータを集約して転送するツール「Fluent Bit」などのアプリケーションが動作している。事業の急成長に伴ってログ量が爆発的に増加した結果、一部のワークロードでログを1行ずつ頻繁に書き込む動作がトリガーとなり、ホストマシンのCPU処理能力が限界に達した。その結果としてログの欠落が発生した。
AI技術の開発においてログの欠落は許容されない。しかし、インフラはすでに容量の限界を迎えており、CPUの追加割り当ても困難な状況だった。この課題に対し、OpenAIはFluent BitのCPU使用率を50%削減し、3万のCPUコアを推論などの用途に振り向けることに成功した。
膨大なコンピューティングリソース消費の真の原因は、意外な動作に潜んでいた。
システムコールの嵐を引き起こした原因
この最適化に関する詳細な分析プロセスは、クラウド技術の推進団体であるCloud Native Computing Foundation(CNCF)が主催する技術カンファレンス「KubeCon + CloudNativeCon NA 2025」の基調講演にて、OpenAIの技術スタッフであるファビアン・ポンス氏によって明かされた。
課題解決に当たり、OpenAIの担当者はOSの性能を細かく分析できるツール「perf」を用いてFluent Bitの動作を調査した。事前の仮説では、メタデータの付与や不要なログのフィルタリングなど、複雑な文字列処理でCPUの処理能力を大量に消費していると推測していた。しかし、分析レポートは全く異なる結果を示した。特定のスレッドにおいて、CPU処理時間の約35%を占めていたのは、ファイルの状態やサイズを取得する「fstat64」というシステムコール(OSの機能を呼び出す仕組み)だったのだ。
真の原因は、Fluent Bitがデフォルトで利用している、ファイル変更をリアルタイムで検出する「Linux」の標準機能「inotify」の仕様にあった。inotifyはイベントを検出する機能を持つが、どれだけのデータ量が書き込まれたかまでは通知しない。そのためFluent Bitは、イベントを受け取るたびにfstat64を実行し、ファイルサイズを確認して読み取りの再開位置を記録する。
OpenAIのシステム構成では、個々のプログラム実行環境(Pod)が常時ログを書き込んでいる。そのため、inotifyのイベント通知とそれに伴うfstat64の実行が無限ループのように繰り返され、スレッドがプロセッサの最高速度で回転し続ける「システムコールの嵐」を引き起こしていたのだ。
1行の設定変更が生んだ劇的な効果
解決手段は極めて簡潔であり、Fluent Bitの設定ファイルに「inotify: false」という1行を追加し、inotifyを完全に無効化することだった。これによって、従来はファイル変更のたびに実行されていたfstat64の処理を、指定した間隔での定期的な確認に切り替えた。最もログ出力が激しいPodに対しても1秒に1回という高頻度で確認する設定に変更したが、それでもinotifyを使用していたときと比較して、実行回数は桁違いに減少した。
この設定をテスト用のシステムに適用した直後からFluent BitのCPU使用率は半減し、全サーバへの適用後は約3万CPUコアを確保できるようになった。Kubernetesにおいて全サーバに特定のプログラムを常駐させる仕組み「DaemonSet」は、全てのノード(サーバ)に配置される性質上、少しの処理増大がインフラ全体における巨大なコンピューティングリソースの消費に直結する。今回の最適化によって解放された3万コアは、ChatGPTの推論リクエスト処理や新たなAIモデルの実験へと振り向けられ、結果的に同居する他のワークロードのパフォーマンス向上をもたらした。
最適化の知見をエコシステム全体へ
OpenAIが構築した社内のログシステム「OLogs」は、1日9PBものデータを処理している。このインフラは、全体を管理するKubernetesを中心に、ログ集約のFluent Bit、通信の交通整理を担うプロキシソフトウェア「Envoy」、システムの稼働データを統一形式で収集・分析可能にする「OpenTelemetry」といったオープンソースソフトウェア群で構成されている。同社はこれらの技術を活用して監視機能を内製化し、運用費用の削減を進めている。
OpenAIは自社システム最適化にとどまらず、得られた知見をオープンソースコミュニティーに還元する方針を固めている。inotifyの即応性を維持しつつ、イベント検出から一定時間経過後に1度だけstatを実行する機能を、Fluent Bitの開発チームに提案している。
クラウド時代において分散システムによる自由度の高い拡張が一般的になる中でも、根幹となるハードウェアの最適化が果たす役割は依然として大きい。極端な負荷条件下で顕在化した事象の解消は、結果としてコミュニティーが提供するツールの品質を高め、あらゆる利用者の恩恵につながる。
本稿は、CNCFが2025年11月13日に公開した動画「Keynote: How One Line of Code Freed 30,000 CPU Cores: Deep-Diving Fluent Bit at Petabyte... F. Ponce」を基に作成しました。
Copyright © ITmedia, Inc. All Rights Reserved.
本記事は制作段階でChatGPT等の生成系AIサービスを利用していますが、文責は編集部に帰属します。
関連記事
新着ホワイトペーパー PR
-
製品資料
[LRM株式会社] 「標的型攻撃メール」事例・サンプル集 -
製品資料
[LRM株式会社] セキュリティ教育はなぜ「年間計画」を立てる必要があるのか? -
製品資料
[LRM株式会社] セキュリティの重要性が伝わらない…… 効果がない社員教育から脱却する方法 -
製品資料
[LRM株式会社] 「標的型攻撃メール訓練」導入ガイド 社員の意識を確実に高める仕組みの作り方 -
事例
[株式会社マクニカ] アイカ工業に学ぶ脆弱性対策 情シスが把握できずにいたアセットも正確に把握
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
「VMware離れ」は本当か 3000社がVCF 9にかじを切った現実的な理由
-
2
「Microsoft 365」が乗っ取られる 跡形もなくMFAを破る手口
-
3
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
4
Oracle巨大ITプロジェクトはなぜつまずいたのか 8年で導入1割、追加で170億ドル
-
5
AI全部入り「Microsoft 365 E7」に企業が二の足を踏む訳 移行意向はわずか4%
-
6
Microsoft製品でここまで自動化できる 情シスがやめられる手作業10選
-
7
なぜOpenAIやAnthropicのAIは「脱走」したのか 情シスが迫られるエージェント統制
-
8
Netflixのバックエンドは「ほぼJava」 3000超のアプリを支える開発基盤の裏側
-
9
「技術屋」で終わらないために 情シスが今取るべき認定資格5選
-
10
「Windows派」「Linux派」を分ける決定的な違い
ホワイトペーパーランキング PR
-
1
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
2
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
-
3
5回聞くだけじゃ足りない? トヨタ式「なぜなぜ分析」の正しい実践方法
-
4
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
5
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
6
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
7
PostgreSQLの「機能」「性能」「運用」「拡張性」に関する悩みの解消法
-
8
5分で分かる「セキュア大容量ファイル転送サービス」の機能とメリット
-
9
Macの安全神話は崩壊? 最新の脅威動向から見えた攻撃のトレンドと有効な対策
-
10
情報セキュリティ対策早分かりガイド:25の自社診断で弱点と解決策を理解
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー