「AI」の学習用データ収集 その課題と解決策は【後編】
Facebook、IBMは「AI」の学習用データをどう作成しているのか
機械学習ベースのAIシステムが有益な判断を下せるようにするには、学習に利用するデータの質が重要だ。FacebookとIBMのAIシステム担当者の話から、データの質を高める方法を探る。
人工知能(AI)システムの誤った判断につながるバイアス。その軽減に必要なことは、機械学習の学習用データ(教師データとも)のクリーニングと、データ収集方法の見直しだ。
前編「AIの学習用データをクリーンにするには“ゴミデータ”を排除すべし」に引き続き、O'Reilly が2019年4月に開催したAIカンファレンス「Artificial Intelligence Conference」の講演を基に、企業が学習用データを作成するときの課題と、その解決方法について説明する。
FacebookでAIインフラ研究のシニアエンジニアリングマネジャーを務めるキム・ヘーゼルウッド氏は講演で、AIシステムの出力をプログラムの意図に合わせるために微調整するとき、同社が直面した問題について語った。
「機械学習をあらゆるユーザーに拡大しようとする際の大きな課題の一つは、大規模なデータ活用だった」とヘーゼルウッド氏は話す。
ヘーゼルウッド氏によると、Facebookは、
- 非構造化データを収集
- AIモデルがそれらのデータを使って学習
- 学習済みのAIモデルを運用環境に導入
という3つの手順でAIシステムの導入に取り組んでいるという。
最初の手順ではデータエンジニアが、機械学習用にデータをクリーニングして、自動テキスト翻訳や顔認識などの用途に合わせて最適化する必要がある。ヘーゼルウッド氏が率いるチームは、データセットの要件を絶えず変更している。なぜなら機械学習ベースのAIシステムの中核要素であるAIモデルは、継続的なトレーニングが必要な上、出力にさまざまな要件があるためだ。
Facebookの技術者には巨大なデータのラベリング、クリーニング、最適化のための時間とリソースがある。そうではない企業が独自の機械学習ベースのAIシステムを構築しようとする場合、大きな障害に直面する。
学習を自動化するツールの登場
データサイエンティストは育成が困難である上に人件費も高いと話すのは、IBMの調査組織IBM Researchでチーフサイエンティストを務めるラッチャー・プリ氏だ。プリ氏はデータサイエンティストの力に頼るのではなく、同氏が「Auto ML」と呼ぶ自動化されたプロセスで学習用データを作成している。
膨大なデータを蓄積するとなると、データ内のあらゆる特徴の分析、ラベリング、最適化をしなければならない。これには従来データサイエンティストが必要だった。「少量のデータの作成とラベリングをプログラムで自動化すれば、AIプロジェクトの持続可能性が高まり、AIモデルを人力で学習させる必要はなくなる。そのためリソースの少ない中小企業にとっての障壁が取り除かれる」とプリ氏は語る。
スタンフォード大学の准教授クリストファー・レ氏は、機械学習ベースのAIシステムを民主化して、より多くの企業に導入を促すには、まずクリーンな学習用データの収集から開始するのがよいと考えている。潜在的なバイアス、望ましい出力、用途を考慮して、トレーニング中の特定のアルゴリズム向けに微調整された小さなデータセットを作成することで、企業の時間とコスト節約が可能になる。
「人々はデータの収集に何年もかけている。そしてどの時点のデータにも、最新のデータと同じくらい高い収集コストがかかっている」(レ氏)
AIシステムの導入を検討している企業にとって、ハードウェア、モデル、プログラム、インタフェースの選択肢は豊富だが、学習用データは別だとレ氏は語る。さまざまな企業に、既に収集済みで、ラベリングされていないデータが大量にあるとしても、AIモデルの学習には役立たない。
Copyright © ITmedia, Inc. All Rights Reserved.
「AI」の学習用データ収集 その課題と解決策は
AIの学習用データを用意するときに重要なのは、量より質だ。本稿では実際の企業の事例から、質の高い学習データを集めるための方法について説明する。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社MatrixFlow] 「物流リソース最適化」ガイド:人員・配車・傭車を出庫依頼の確定前に決めきる -
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
2
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
3
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
4
「IBM iはDXのボトルネック」は誤解 意外と知らない今風モダナイズの効果
-
5
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
6
「朝8時にバッチが終わらない」データ爆発の危機をJPX総研はどう乗り越えたか
-
7
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
8
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
9
IT製品の導入に関するアンケート「PC&デバイス」編
-
10
AI導入後に発覚する「社内文書を読めない」問題 情シスは何を直せばいい?
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
プログラミング不要で誰でも実現できる、ネットワーク運用管理の自動化とは
-
5
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
6
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
-
9
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
10
“あのファイル転送”で暗躍するノーウェアランサム
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー