機械学習ベースのAIシステムが有益な判断を下せるようにするには、学習に利用するデータの質が重要だ。FacebookとIBMのAIシステム担当者の話から、データの質を高める方法を探る。
人工知能(AI)システムの誤った判断につながるバイアス。その軽減に必要なことは、機械学習の学習用データ(教師データとも)のクリーニングと、データ収集方法の見直しだ。
前編「AIの学習用データをクリーンにするには“ゴミデータ”を排除すべし」に引き続き、O'Reilly が2019年4月に開催したAIカンファレンス「Artificial Intelligence Conference」の講演を基に、企業が学習用データを作成するときの課題と、その解決方法について説明する。
FacebookでAIインフラ研究のシニアエンジニアリングマネジャーを務めるキム・ヘーゼルウッド氏は講演で、AIシステムの出力をプログラムの意図に合わせるために微調整するとき、同社が直面した問題について語った。
「機械学習をあらゆるユーザーに拡大しようとする際の大きな課題の一つは、大規模なデータ活用だった」とヘーゼルウッド氏は話す。
ヘーゼルウッド氏によると、Facebookは、
という3つの手順でAIシステムの導入に取り組んでいるという。
最初の手順ではデータエンジニアが、機械学習用にデータをクリーニングして、自動テキスト翻訳や顔認識などの用途に合わせて最適化する必要がある。ヘーゼルウッド氏が率いるチームは、データセットの要件を絶えず変更している。なぜなら機械学習ベースのAIシステムの中核要素であるAIモデルは、継続的なトレーニングが必要な上、出力にさまざまな要件があるためだ。
Facebookの技術者には巨大なデータのラベリング、クリーニング、最適化のための時間とリソースがある。そうではない企業が独自の機械学習ベースのAIシステムを構築しようとする場合、大きな障害に直面する。
Copyright © ITmedia, Inc. All Rights Reserved.
生成AIのビジネス活用には、既存サービスを利用する方法と、生成AIツールを自社開発する方法がある。その後者の好例として、自社ビジネスに適したAIチャットツールを、あるクラウドサービスを活用して開発したSB C&Sの事例を紹介する。
インストラクションチューニングは、生成AIの応答精度を向上させるために重要なステップだが、その学習データを作成する際は、設計面/実務面/運用面で課題が発生しやすい。本資料では、現場でよくある課題と解決策について解説する。
労働人口減少や技能継承問題などを背景に「企業知」の活用ニーズが高まる一方、既存AI技術の限界から十分な成果を得られずにいるケースは多い。リコー他6社による生成AI開発事例より、データの課題を解決するサービスについて紹介する。
生成AIの開発には、高性能なGPUが不可欠だ。しかし、GPUサーバをオンプレミスで運用するには、高額な初期費用や設置場所の確保などの課題がネックになる。そこで注目したいのが、サブスクリプション形式で利用できるGPUクラウドサービスだ。
製造業の設計現場では、設計プロセスの複雑化などの課題が山積している。こうした中、注目を集めているのが生成AIの活用だ。本資料では、生成AIがもたらす設計業務の未来について、詳しく解説する。
「テレワークでネットが遅い」の帯域幅じゃない“真犯人”はこれだ
ネットワークの問題は「帯域幅を増やせば解決する」と考えてはいないだろうか。こうした誤解をしているIT担当者は珍しくない。ネットワークを快適に利用するために、持つべき視点とは。
「サイト内検索」&「ライブチャット」売れ筋TOP5(2025年5月)
今週は、サイト内検索ツールとライブチャットの国内売れ筋TOP5をそれぞれ紹介します。
「ECプラットフォーム」売れ筋TOP10(2025年5月)
今週は、ECプラットフォーム製品(ECサイト構築ツール)の国内売れ筋TOP10を紹介します。
「パーソナライゼーション」&「A/Bテスト」ツール売れ筋TOP5(2025年5月)
今週は、パーソナライゼーション製品と「A/Bテスト」ツールの国内売れ筋各TOP5を紹介し...