「AI」の学習用データ収集 その課題と解決策は【後編】

Facebook、IBMは「AI」の学習用データをどう作成しているのか

機械学習ベースのAIシステムが有益な判断を下せるようにするには、学習に利用するデータの質が重要だ。FacebookとIBMのAIシステム担当者の話から、データの質を高める方法を探る。

 人工知能(AI)システムの誤った判断につながるバイアス。その軽減に必要なことは、機械学習の学習用データ(教師データとも)のクリーニングと、データ収集方法の見直しだ。

 前編「AIの学習用データをクリーンにするには“ゴミデータ”を排除すべし」に引き続き、O'Reilly が2019年4月に開催したAIカンファレンス「Artificial Intelligence Conference」の講演を基に、企業が学習用データを作成するときの課題と、その解決方法について説明する。

 FacebookでAIインフラ研究のシニアエンジニアリングマネジャーを務めるキム・ヘーゼルウッド氏は講演で、AIシステムの出力をプログラムの意図に合わせるために微調整するとき、同社が直面した問題について語った。

 「機械学習をあらゆるユーザーに拡大しようとする際の大きな課題の一つは、大規模なデータ活用だった」とヘーゼルウッド氏は話す。

 ヘーゼルウッド氏によると、Facebookは、

  1. 非構造化データを収集
  2. AIモデルがそれらのデータを使って学習
  3. 学習済みのAIモデルを運用環境に導入

という3つの手順でAIシステムの導入に取り組んでいるという。

 最初の手順ではデータエンジニアが、機械学習用にデータをクリーニングして、自動テキスト翻訳や顔認識などの用途に合わせて最適化する必要がある。ヘーゼルウッド氏が率いるチームは、データセットの要件を絶えず変更している。なぜなら機械学習ベースのAIシステムの中核要素であるAIモデルは、継続的なトレーニングが必要な上、出力にさまざまな要件があるためだ。

 Facebookの技術者には巨大なデータのラベリング、クリーニング、最適化のための時間とリソースがある。そうではない企業が独自の機械学習ベースのAIシステムを構築しようとする場合、大きな障害に直面する。

学習を自動化するツールの登場

印刷する
SNSでシェア

「AI」の学習用データ収集 その課題と解決策は

AIの学習用データを用意するときに重要なのは、量より質だ。本稿では実際の企業の事例から、質の高い学習データを集めるための方法について説明する。

この連載の記事をもっと見る

この記事の著者

関連記事

こんなメディアも見られています

TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。

無料会員登録
最新情報をいち早くチェック!

製品カタログや技術資料、導入事例など、IT導入の課題解決に役立つ資料を簡単に入手できます(メディアごとに文章は変更)

いますぐ無料会員登録

ベンダーコンテンツ PR

From Informa TechTarget

アクセスランキング

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10

ホワイトペーパーランキング PR

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10

TechTargetジャパン SNS

X @techtarget_itmをフォロー

インフォメーション

TechTargetジャパンをフォロー