「AI」の学習用データ収集 その課題と解決策は【前編】
AIの学習用データをクリーンにするには“ゴミデータ”を排除すべし
機械学習導入の最初のステップは、質が高くクリーンな学習用データを用意することだ。研究機関と企業の事例から、学習用データの質を高める方法について解説する。
人工知能(AI)技術、特に機械学習によって業務プロセスを自動化するには、膨大な量の学習用データ(教師データとも)が必要だと考えられてきた。この見方が変わりつつある。機械学習では、誤った判断につながる不適切なバイアスが問題になっている。そのため学習用データの質が重視されるようになっている。機械学習をベースにしたAIシステムから有益な結果を得るためには、データのクリーニングによって質の高い学習用データを用意する必要がある。
2019年4月にO'Reillyが開催したAIカンファレンス「Artificial Intelligence Conference」の各登壇者は、企業が大規模データセットを管理する際に直面した問題について詳しく語った。データのクリーニングで成功を収める方法についても説明した。
併せて読みたいお薦め記事
AIの「バイアス」について考える
- 人工知能(AI)と機械学習データの課題、予測不能な世界を予測するには?
- Amazon、Facebookも批判の的に 「公平・公正なAI」はなぜ難しいのか
- “偏り”がプラスに作用することも 「AI」のバイアスとどう向き合うか
AIの学習データについて事例をもっと見る
米ニュージャージー州のスティーブンス工科大学(Stevens Institute of Technology)で視覚芸術およびテクノロジー学科の准教授兼主任を務めるジェフ・トンプソン氏は、自身のプロジェクト「Empty Apartments」について語った。このプロジェクトでは、賃貸物件のリストから空き家の画像を収集し、照明や間取り、写真の形などの類似性に基づいて分類する。分類に使用するのが機械学習モデルだ。
機械学習の学習プロセスには、ターゲットを絞り、更にクリーニングした学習用データを使った。そして写真を相互に関連付けて、特徴に基づいて分類し、大きなテーマで表すことを可能にした。Empty Apartmentsの場合は、オンライン広告サイト「craigslist」に掲載された画像のうち、空き家に絞った写真を利用した。
不要なデータを減らして学習用データをクリーンに
米ニューヨークを拠点とする新興企業CTRL-labsは、人間と機械をつなぐ神経インタフェースを開発している。同社の最高科学責任者を務めるパトリック・カイフォシュ氏は、複数の環境に機械学習ベースのAIシステムを導入している。例えば臨床環境では、皮膚に取り付けたセンサーを使って神経のデータを抽出して、コンピュータに転送し、データのラベリングと分析をする。
人間の身体からビッグデータを集める工程には課題がある。第一に、臨床用の神経インタフェースは個人の脳や神経回路の入出力に合わせて微調整する必要があるため、データ収集システムの設定の使い回しができない。個人に特化したデータからクリーンな学習用データを作成するのは非常に難しいため、機械学習モデルは複雑になる。
カイフォシュ氏によると、センサーを使い筋肉から神経活動に関するデータを抽出してコンピュータに送信するといった、複雑なフローでデータ収集するとき、センサーは不必要なデータを多く収集する傾向にある。同氏は、センサーやシステム間のつながりを減らして少量のデータを収集することで、クリーンなデータの取得を目指している。
CTRL-labsの将来の展望についてカイフォシュ氏は「神経活動を直接抽出してコンピュータに送信し、ノイズを除去することだ」と語る。
Copyright © ITmedia, Inc. All Rights Reserved.
「AI」の学習用データ収集 その課題と解決策は
AIの学習用データを用意するときに重要なのは、量より質だ。本稿では実際の企業の事例から、質の高い学習データを集めるための方法について説明する。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社MatrixFlow] 「物流リソース最適化」ガイド:人員・配車・傭車を出庫依頼の確定前に決めきる -
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
2
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
3
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
4
「IBM iはDXのボトルネック」は誤解 意外と知らない今風モダナイズの効果
-
5
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
6
「朝8時にバッチが終わらない」データ爆発の危機をJPX総研はどう乗り越えたか
-
7
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
8
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
9
IT製品の導入に関するアンケート「PC&デバイス」編
-
10
AI導入後に発覚する「社内文書を読めない」問題 情シスは何を直せばいい?
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
プログラミング不要で誰でも実現できる、ネットワーク運用管理の自動化とは
-
5
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
6
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
-
9
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
10
“あのファイル転送”で暗躍するノーウェアランサム
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー