今の機械学習開発スタイルは時代遅れ
MLOpsで近代化する機械学習の開発ライフサイクル
機械学習の分野は自動化されておらずパイプラインは不安な、旧態依然とした体勢で運用されている。MLOpsを導入することで、機械学習の世界に産業革命をもたらすことができるという。
「MLOps」は、DevOpsと機械学習の必然的な融合だ。というのも、機械学習分野は1990年代のサイロ化したソフトウェア開発パターンをほうふつとさせる方法で運用され続けている。つまりほとんど自動化されておらず、協力体制はなく、パイプラインは不安定なスクリプトで巧妙に操られ、事実上可視性は存在せず、CI/CDの概念とは全く無縁だ。
MLOpsはこのエントロピーを克服するスキーマを提示し、機械学習開発者に新しい変革の波をもたらす。
本稿では、MLOpsが関心を集める理由、MLOpsが重視される理由、MLOpsの流行を受けた企業における今後の機械学習の展望について解説する。
ソフトウェアツールスタックのツール
まず認識すべきは、ソフトウェアツールスタックがたくさんのツールで構成されていることだ。
ソフトウェアエンジニアリングチームが各リリースで使うツールは数十種類に及ぶ。ソースコード管理システム、自動テストスイート、パフォーマンス監視ツール、イベントベースの警告システムなどがその例だ。こうしたツールスタックの構成要素が、ソフトウェア開発サイクルにおいて不可欠であることは誰もが認めるところだ。だが以前はそうではなかった。今では、「GitHub」「CircleCI」「Jenkins」「Docker」「NewRelic」をはじめとする無数のツールが世界中で広く使われている。
ソフトウェア開発のこうした概念は、機械学習にも当てはまる。機械学習でもコードのソース管理が必要だ。データパイプラインの監視、アプリケーションのコンテナ化、マシンのプロビジョニング、導入エンドポイントのテストを行う必要もある。機械学習では、より大規模で複雑な(特にデータの)操作が必要になる可能性があるが基本は同じで、パイプライン自動化が有益なことも変わらない。
MLOpsを成功に導く4つの要素
MLOpsには、独自のモデル形態がある。
MLOpsとは、決定論、スケーラビリティ、アジリティー、ガバナンスをモデル開発とデプロイパイプラインに提供する一連の手法だ。この新しい(と同時に非常に現代的な)パラダイムは、モデルのトレーニング、チューニング、導入のサイクルにおける4つの重要な領域に注目している。それは、機械学習開発の再現性、協調性、スケーラビリティ、継続性だ。
それでは、それぞれ順に見ていこう。
再現性
再現性とは、モデルの改善や内外の関係者や規制関係者に対する手法の説明のために、以前の機械学習モデルを数%以内の誤差で再構築できることをいう。これには入力のトレーサビリティーが必要になる。その入力には、データセット、コードのコミット、依存関係とパッケージ、ドライバのバージョン、低レベルのライブラリ、コンテナ、ランタイム、モデルのトレーニングに使用したパラメーター、トレーニング用ハードウェアの仕様、機械学習への具体的な入力(レイヤーの重み付けの初期化)などがある。
これは簡単な作業ではない。
協調性
開発者が1人でモデルを開発するのであれば、開発サイクルのこの領域は無関係だ。だが、チームメンバーを増やしながら運用モデルの拡張にチームで取り組むのであれば、適切な協調プロセスがなければシステムは瞬く間に失敗するだろう。
機械学習チームがうまく協調するには、全てのアクティビティー、リネージ、モデルパフォーマンスを追跡する統合ハブが必要だ。ハブは、フルスタック(概念から研究開発、運用まで)をカバーし、ノートブック、トレーニング実行、ハイパーパラメーターの探索、可視化、メトリック、データセット、コード参照、モデル成果物を可視にする必要がある。
これには、多くの対象領域の共有が必要になる。
スケーラビリティ
各機械学習エンジニアにインフラのデプロイを習得するよう求めることは、可能ではあるが賢明ではない。
というのも、機械学習では大量のデータセットとコストの高いコンピューティング要件を扱う。その上インフラも管理するとなれば、ブラックホールのようにチームの生産性が浪費される恐れがある。データサイエンスチームの各メンバーが需要に応じてコンピューティングインフラを利用できるよう、事前構成する方が妥当だ。
事前構成済みのリソースを各メンバーが自身でプロビジョニングできれば、スケーリング関係のプロビジョニングのボトルネックはほぼ解消されるだろう。
CI/CD
優れたMLOpsの最も重要な特徴は、モデル開発のCI/CDパイプラインだ。
コードをGitHubにプッシュすると、自動コンパイル、テスト、デプロイが実行される。このプロセスは、完全な決定論を求める全メンバーにとって同一である必要がある。機械学習のライフサイクルを標準化すれば、モデルの出力速度を何倍も向上できる。
MLOpsの将来
機械学習ライフサイクルを標準化する働き掛けは非常に大きい。
今後わずか数年で、手作業でモデルをトレーニングして導入するという考えは産業革命前の珍しいもののようになるだろう。何年も前にDevOpsを推し進めたソフトウェア開発業界の教訓と遺産によって、この機械学習の過渡期は誰も(機械学習モデルも)予想できないほど進みが速い。
産業革命前の珍しい見せ物にはならないようにしたい。
ダニエル・コブランはPaperspaceの共同創設者。
Copyright © ITmedia, Inc. All Rights Reserved.
Computer Weekly日本語版
この記事の著者
関連記事
新着ホワイトペーパー PR
-
事例
[サイボウズ株式会社] DXに必要な「Dスキル」「Xスキル」を持った人材を育成するには? -
市場調査・トレンド
[サイボウズ株式会社] データで見る、DXが「順調に進む企業」と「つまずく企業」の違い -
製品資料
[サイボウズ株式会社] 賛否が割れがちな「Notesからの移行」 新環境への移行を納得してもらうには? -
事例
[ServiceNow Japan合同会社] 農林中金に学ぶ内製開発 処理効率を約2倍に高めAI活用も加速させた方法とは? -
事例
[ServiceNow Japan合同会社] NTTグループのデジタル変革術、17万人が利用する決裁プロセス刷新の全貌
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
【基本情報技術者試験】「デュプレックスシステム」と「デュアルシステム」の違いは?
-
2
kintoneで実践 製造業のための「見積もり管理」改善のヒント
-
3
「Microsoft一択」で本当にいいのか 知らぬ間にライセンス費用が膨らむ真相
-
4
「VMware離れ」は本当か 3000社がVCF 9にかじを切った現実的な理由
-
5
サーバ約70台をAWSへ ヤナセが移行前にやった「通信要件の可視化」
-
6
脱VMwareの真実:データセンター大手がNutanixを選んだ「コスト以上の理由」
-
7
MS月例パッチが1000件突破 人手不足の情シスを襲う「月1回メンテ」の崩壊
-
8
製造業と金融業で「AI導入」が進まない理由 それぞれが抱える“恐怖”とは
-
9
「AI活用」を掲げた年金刷新が炎上 英政府が大手ITアウトソースを切り捨て「内製回帰」した理由
-
10
急増する「AIはこう言ってる」マン 判断を狂わせる「AI忖度」を防ぐには?
ホワイトペーパーランキング PR
-
1
生成AIのハルシネーションを防止 回答精度を高めるセマンティックレイヤーとは
-
2
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
3
5回聞くだけじゃ足りない? トヨタ式「なぜなぜ分析」の正しい実践方法
-
4
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
-
5
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
6
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
7
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
8
マンガで解説:「ゼロトラスト」「SASE」の必要性とメリット
-
9
5分で分かる「セキュア大容量ファイル転送サービス」の機能とメリット
-
10
情報セキュリティ対策早分かりガイド:25の自社診断で弱点と解決策を理解
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー