Computer Weekly製品導入ガイド
課題はビッグデータ管理のためのプラットフォーム選定
無数のソースから得た多様な形態のデータ分析を目指すビッグデータでは、思考と技術の両方の切り替えが要求される。
少なくとも主要ソフトウェアとハードウェアの供給に関する限り、2012年はビッグデータの年だった。この市場のほぼあらゆるサプライヤーが、ビッグデータ用ソリューションとして取りあえず売り込める製品を投入した。そうした的外れのテクノロジーが多数出回ったことで、データから価値を引き出すために真に必要なものは何かという点について、誤解が生まれた。
だが、2013年はビッグデータが合理性を持つ年となるだろう。多くのサプライヤーが提供するシステムは、他社に遅れまいと既存の製品を手っ取り早く組み合わせて市場に投入したゴタ混ぜではなく、ビッグデータの問題の多くに対応すべく構築されるようになったからだ。
ビッグデータの課題
では、ビッグデータにはどんな問題があるのか。まず多くが思い浮かべるのは「量」だ。では大量のデータが存在すれば、それはビッグデータ問題と呼べるのか。そう呼べる場合もあれば、呼べない場合もある。単なる「大量データ」の問題であれば、OracleやIBM、Microsoftなどが提供する拡張性の高いデータベースに、これら各社やSAS Instituteなどの独立系サプライヤーが提供する優れたビジネス分析ソリューションを組み合わせれば済む。
問題なのは量だけではない。ビッグデータにはもっと多くの可変要素がある。まずは情報源の多様性を考慮しなければならない。全てのデータが平等だという考えに基づき、情報の流れを単なる1と0の流れと見なすことはもはやできなくなった。今後はデータベースの中に何もかも保存することはできなくなる。
各種のファイル形式、Webを巡回する検索エンジンから集めた情報、そしてその他の情報源も全て含めて、基本素材として利用できるようにしなければならない。IBM、Oracle、Teradata、EMCなどの各社も、各種の技術を集約して混在データに対応できるシステムを構築したり、個々の種類のデータを最適かつ一貫した方法で管理・分析するのに適したシステムを提供できるようになった。
画像、音声、動画、さらにはリアルタイムの製造ラインデータやスマートビルディング、環境システムのような標準化されていないデータソースの利用増加に伴い、データはコンテキストに添って扱わなければならなくなった。そのためには、優先順位を付けたデータストリームに対応でき、そうしたストリームをラインスピードで、あるいは十分なストリームを複製し、必要に応じてライブストリームの外で対応することによって分析できる機能を持ったネットワーク機器を使う必要がある。Cisco、Juniper、Dell、HPといった各社が提供するネットワーク機器の大半は、802.1p/Qプライオリティとサービス品質設定に対応でき、外部的にはMPLS(Multiprotocol Labelling Service)のタグを使ったパケットに対応できる。
次に来るのは速度だ。小売業務であれば、翌日の供給業務のために日ごとの取引を分析する必要はあっても、リアルタイムのデータ分析は必要としない。一方、投資銀行は、商品価格など変化の速い生のデータを参照しながら投資を決定しており、できる限りリアルタムに近い分析が必要になる。同様に、政府の安全保障システムや、オンライン詐欺検知、マルウェア対策システムなどの効果を出すためには、大量のデータをリアルタイムに近い速度で分析する必要がある。そうした分野でIBMの「PureData」やOracleの「Exadata」、Teradataなどの最新システムは、大量のデータをリアルタイムで処理できるよう設計したソリューションを提供している。
データの正確性
データの正確性も考慮しなければならない。これには2つの要素がある。1つはその組織の管理下にあるデータの品質。氏名、住所、電話番号など個人に固有の情報は、UKC hangesやPCA、Equifaxといった企業のデータクレンジングを通じて扱うことができる。一方、例えばマッピングデータなどの情報は、GoogleやBing Mapsなどのクラウドサービスを通じて扱うことが可能だ。従って、データが正確で最新状態にあることを保証するという問題は、その分野のエキスパートとされる組織に委託できる。
データの正確性のもう1つの側面は、その組織の直接的な管理下にないデータにまつわるものだ。社外の情報源から引き出した情報は、その情報源がどの程度信頼できるかを見極めるための判定を行う必要がある。例えば前述したような名のある情報源であれば、信頼できることは明らかだ。そうでない情報源の場合、その情報源が他にどれだけ引用されているか、その情報にかかわる個人や組織の知名度や他者に信頼されているかどうかといった点を調べるために、クロスリファレンスが必要になるかもしれない。この分野では、Wolfram Alpha、LexisNexis、Reutersなどの各社が、単なる直接的なインターネットトラフィックよりも信頼に足ると見なせる、裏付けのある情報を提供している。
次は価値だ。ここではアップストリームの価値とダウンストリームの価値という2つの側面を考慮する必要がある。
大部分の組織はこれまで社内のデータに焦点を絞っていたが、今では他のデータソースを求めて組織外に手を伸ばす(アップストリーム)必要が生じている。例えば、新しい化学物質や化合物を研究している医薬品会社は、Webのモニタリングを通じて競合企業の動向にも目を配る必要がある。同時に、その動向とはほとんど無関係な要素は全てふるいにかけて除外しなければならない。
ダウンストリームの価値は明白だ。それが相手にとってほとんど役に立たないデータであれば、分析結果をその相手に提供する意味はほとんどない。
リレーショナルデータベースとNoSQLの管理
全般的に、ビッグデータに必要なのは単なる思考の切り替えにとどまらない。違う種類のデータを扱うために使う技術や、それを分析・報告する手段の切り替えも必要だ。
Oracle、IBM、Microsoftといった各社の典型的なリレーショナルデータベースは現在のところ、表に収められ構造化されたデータを扱う上では役に立っている。だが、バイナリラージオブジェクト(BLOB)として保存される、あまり構造化されていないデータの扱いでは苦戦している。
NoSQLやMongoDB、Couchbase、Apache Cassandraなどに代表されるスキーマレスデータベース市場の台頭は、構造化されていないデータを分析・報告しやすい形で保持できる方法があることを示している。こうした技術を組み合わせた分野で、IBM、Teradata、EMCなどの各社は真のビッグデータエンジンといえるシステムを構築し始めている。
だが、構造化されたデータベースと構造化されていないシステムを組み合わせ、各種のデータを全て確実に適切な場所に落ち着かせるニーズは依然として存在する。そうした分野に適しているのがHadoopのような存在だ。HadoopはMapReduceを利用して、入ってくるデータストリームのフィルタとして機能する。出力された情報は、構造化データストア、あるいは非構造化データストアのいずれかに格納される。SAPを導入しているなら、HANAも同様の形で利用できる。
データインフラの上には分析・リポート機能がなければならない。ハードウェアとデータベースを扱っているメーカーは、自前のシステムを投入する傾向にある。例えばOracleにはHyperionが、IBMにはCognosとSPSSが、SAPにはBusiness Objectsがある。だがそうしたサプライヤー以外の選択肢も豊富に存在する。独立系ではSAS Instituteが依然とし圧倒的な存在感を放っているが、QlikTech、Birst、Panopticon、Pentaho、Splunkといった新規参入組も、混在型データソースの横断的な分析機能を提供できているという点で非常に有望だ。
2012年はビッグデータの誇大宣伝も飛び交ったが、だからといってビッグデータが重要でないというわけではない。幅広い多様なデータを効果的に分析して真のナレッジを引き出すことができれば、将来的なビジネスの成功に向けた大きな原動力となる。そのためには、模様眺めをしていてライバルに負かされるよりも、今から効果的なプラットフォームの立案に着手した方がいい。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー