医療機関やDellの事例から学ぶ
「予測分析にはビッグデータが不可欠」という“常識”を疑え
データ量が多いからといって、必ずしも予測分析の精度が上げるわけではない。データを予測モデルに適用する前に、データを吟味して理解することが肝要だ。
ビジネスの意思決定に予測分析を活用する場合、分析の精度が利用データの質を上回ることはない。
当たり前のことに聞こえるだろう。だがそうとは限らない。ビッグデータ時代の今、企業は分析に利用できるデータを大量に蓄積し、社内にはセルフサービス型の分析ツールが急増している。つい手近なデータで予測モデルを構築してしまいがちだ。データセットの内容と出どころをよく理解し、高いデータ品質を確保する必要性は、かつてないほど高まっている。
「とにかく途方もない量のデータが生成されている。人手で処理できる量ではない」。小児科病院Children's Hospital Los Angeles(ロサンゼルス小児病院)のデータサイエンティスト、デビッド・レッドベター氏は語る。問題は、そうした大量のデータから、どのようにして必要なデータをえり分け、担当医師を割り当て、適切な治療を指示するかだ。
2017年12月中旬、ボストンで人工知能(AI)イベント「AI World Conference and Expo 2017」が開催され、レッドベター氏がパネルディスカッションに登壇した。同氏によれば、ロサンゼルス小児病院の小児集中治療室では、患者データを秒単位で収集するセンサーが一度に約500台作動していることがあるという。そうした“データの海”から、予測的価値を持つであろう核となる情報を特定するのは、ときに至難の業だ。
データの生成元を知る
レッドベター氏率いるチームはこの難題への対処方法の1つとして、データの発生元である現場で仕事をしている臨床スタッフらと、緊密に連携するようにしている。データ分析チームは、全てのデータを高速処理してデータの特徴を識別する深層学習アルゴリズムを開発し、それに基づいたスコアリング(データ集合への予測モデルの適用)を実行することも可能だ。ただし、そのためには時間と処理能力が必要となる。それよりも医療スタッフの臨床知見を頼りに、データの中から重要な兆候を発見してもらう方が簡単だ。
「臨床スタッフと話をするたびに、新たに興味深いことを学ぶ」とレッドベター氏は語る。データセットの数値には、臨床チームと話すまでは、その意味するところについて見当すら付かないものもあるという。
これは医療分野に限った話ではない。ビジネス上の意思決定に予測分析を活用するつもりなら、適切なタイミングで適切なデータを入手することが常に重要となる。
併せて読みたいお薦め記事
ビッグデータ活用について詳しく
医療や教育でも進むデータ活用
プロジェクトによってデータの適量はまちまち
AI World Conference & Expo 2017では、Dellの主任ソフトウェアアーキテクトを務めるマーク・ハモンズ氏が討論会に登壇し、自社が販売するハードウェアの不具合を予測分析モデルによって事前に検知し、予測保守を可能にする取り組みについて語った。ハモンズ氏のチームは多数のソースからデータを収集しているが、とりわけハードウェアの状態と利用状況を詳述したログを活用しているという。
データ分析プロジェクトには大量のデータが役立つ場合が少なくない。ただしハモンズ氏によれば、Dellのとあるプロジェクトの場合、それほど多量のデータは必要ではなく、小規模なデータセットに従来の統計手法を適用するだけで十分だったという。
「当社の場合、課題の多くをほんの数GBのデータで解決できることが分かってきた」とハモンズ氏は語る。データ量を増やしたからといって予測モデルに悪影響が及ぶわけではない。だがデータ特徴を幾つか把握するだけで、必要十分な予測精度を得ることができるのだという。少ない量のデータで満足な分析結果が得られるのなら、それ以上のデータを分析する必要はない。
近年はあらゆる業界でデータソースが急増し、データ分析チームに大量のデータが流入するようになってきた。誰もが、自社の予測モデルにどのようなデータをどの程度適用すべきかの判断を迫られている。この課題に対する調査会社Nielsen Companyの施策は、Dellのそれとは少し異なる。Nielsen Companyの事業にとっては、データ量の多い方が、より良い結果につながることが多いのだという。
データを基にマーケティングを実施する「データドリブンマーケティング」に役立つ消費者データやソフトウェアを、えりすぐって顧客企業に販売するというのが、Nielsen Companyのビジネスだ。同社は独自のデータセットにサードパーティーのデータを組み合わせることで、広範なデータセットを作成している。同社のグローバルエンジニアリング担当上級ディレクター、ジャンピエール・アベロ氏は、AI World 2017 Conference & Expoにおいて、こうしたデータ収集方針は「データに存在する潜在的な偏りの是正に役立つ」と説明した。データに偏りがあると、分析にゆがみが生じ、予測モデルの作成結果に大きなずれが発生することになりかねない。
Nielsen Companyはソーシャルネットワーキングサービス(SNS)のFacebookや信用情報機関Experianなどのデータ提供業者と提携している。個々のデータソースは人口統計的に特定のセグメントに偏りがちだが、Nielsen Companyは自社独自のデータを多様なソースと組み合わせることによって、こうした偏りを軽減することができているという。このように企業顧客に特化した予測分析においては、データ量を増やしデータセットの多様化を図ることがプラスに作用する場合がある。
世界はますますインターネットでつながるようになってきた。コンシューマー向け市場でもIoT(モノのインターネット)化の動きが進んでいる。今後はコンシューマー向けデバイス全般でデータを収集できるということだ。「これからはコンシューマーが求めているものを、より正確に予測できるようになる」とアベロ氏は語る。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社MatrixFlow] 「物流リソース最適化」ガイド:人員・配車・傭車を出庫依頼の確定前に決めきる -
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
2
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
3
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
4
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
5
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
6
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
7
「結局使わなくなる」Microsoft 365 Copilotを半年で定着 キリンの3施策
-
8
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
9
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
10
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー