ビッグデータ分析基盤の構築事例(前編)
ビッグデータ分析に必要な性能を満たすインフラの条件とは?
多くの企業が、ビッグデータの膨大な量と多様さに対応できるインフラの整備に知恵を絞っている。データセンターのインフラを見直し、システムを刷新した企業の事例を紹介する。
ビッグデータはもはや大企業の専売特許ではない。Web 2.0分野の巨人たちよりもはるかに少ないデータしか保有していない企業にも高度なデータ分析技術が進出しつつある(関連記事:企業のデータ活用動向、まずは基幹システムと顧客情報から)。
「ビッグデータ」という表現は、米Facebookの「Inboxサーチエンジン」や米Googleの「MapReduce」から生まれたものだが、さまざまな業界の企業が事業拡大の戦略としてビッグデータ分析技術を利用するようになった。最近、ビッグデータ分析戦略をめぐって、米小売大手のTargetの取り組みが物議を醸した。これは、消費者の購入動向を予測して新規顧客を獲得するために、同社がビッグデータ分析技術を利用しているとされる問題だ。
ITプロフェッショナルにとって、ビッグデータ分析は比較的小型で消費電力が少ない機器を大規模に水平展開した拡張型ファームを導入することを意味する場合が多い。これは、この仮想化時代に主流となってきた「融合と統合」というテーマとは正反対の志向だ。
ビッグデータ分析基盤の構築事例:CareCore National
米医療費給付管理企業のCareCore Nationalでは、サウスカロライナ州とコロラド州にデータセンターを保有しており、現在の患者と同症例の過去患者との詳細な比較データを作成する際にデータ分析を利用している。正確な医療判断を下せるようにするのが目的だという(関連記事:医療分野のビッグデータ事例 「Hadoop」を採用した徳島大学病院)。
これをサポートするために、同社では「Virtual Computing Environment」(VCE)連合の「Vblock」をベースとした統合インフラを構築した。Vblockは米VMware、米Cisco Systems、米EMCの製品を組み合わせたシステムだ。
CareCoreのビッグデータ分析では、Vblockに含まれる容量86Tバイトのディスクアレイ「Symmetrix V-Max」からデータを取り出す。その他にも48Tバイトの「EMC GreenPlum Distributed Computation Appliance(DCA)」を2台(合計容量96Tバイト)利用しており、これらは別個に管理しなければならないという。
「DCAは現在、分析用インフラの外側で運用している。この状態は少々厄介だ」とCareCoreのビル・ムーアCTO(最高技術責任者)は話す。「これらのDCAを10ギガビットイーサネットインフラに接続するのも大変だった」
CareCoreでは、これらのリポジトリからデータを取り出すのに「Apache Hadoop」に加えてVMwareのインメモリデータ管理システム「vFabric GemFire」を利用している。これらのデータは「Alpine Miner」や米Tableau Softwareのツールなどの分析/仮想化インタフェースを通じて処理しているという。
ムーア氏によると、今日の医療技術では「ある患者が12カ月以内に心臓発作を起こす確率は87%である」といった予測を立てるのは難しいことではないという。CareCoreが目指しているのは、特定の患者の症状と病歴および「アドホックコホート」(CareCoreのカルテの中でその患者の症状と一致する患者のグループ)に基づいて医師が治療計画を選べるようにすることだ。
そのためには、インフラの仮想レイヤーで発行される複雑なクエリをコンピューティングシャーシ「Cisco Unified Computing System」(UCS)から抽出し、それをコアスイッチ「Cisco Nexus」からエッジスイッチ「Nexus 5000」、ラックスイッチ「Nexus 2000」、そしてNexus 2000に接続された「GreenPlum DCA」ラック内のDCAサーバに送り、さらにそこから逆のコースをたどって返される必要がある。
ムーア氏は、将来的にこの機能をVblockファブリック内で完結できるようにしたいと考えているという。
また、Vblock内のインメモリデータ管理システム「GemFire」は、それぞれ96Gバイトを利用可能なメモリを搭載した複数の専用UCSブレードサーバを必要とする。GemFireのワークロード1件だけでも、そのメモリの半分を消費する可能性がある。このためCareCoreでは、多数のワークロードが同じブレードを奪い合うことがないように、「VMware Distributed Resource Scheduler」(DRS)のルールを厳密に設定する必要がある。
CareCoreでのビッグデータ処理プロセスは、大規模メモリとVblockインフラに加え、全社に配備された10ギガビットイーサネット(GbE)ネットワークが必要条件となる(関連記事:医療研究機関が100GbEネットワークの導入を決断した理由)。
「GbEトラフィック、あるいは10 GbEトラフィックの一部を処理する物理サーバを使って巨大なクエリセットをデータセンターとやりとりするには、両者の間に大規模なインフラが必要となる」とムーア氏は話す。
次回は、Wikipediaなどオンライン企業におけるビッグデータ分析基盤の構築事例を紹介する。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
新着ホワイトペーパー PR
-
製品資料
[o9ソリューションズ・ジャパン株式会社] 「改正物流効率化法対策」徹底解説 総物流費を抑制するサプライチェーン戦略 -
製品資料
[o9ソリューションズ・ジャパン株式会社] 「サプライチェーン最適化」実践ガイド:効果的な意思決定を実現する秘訣とは? -
製品資料
[株式会社リンプレス] 非デジタル/IT人材を「自走するDX推進者」に変えるための育成ロードマップ -
市場調査・トレンド
[ワンアイルコンサルティング株式会社] AI時代の組織設計:「判断と責任」を人に残すための2つの原則とは? -
技術文書・技術解説
[ワンアイルコンサルティング株式会社] システムの保守がモダン化を阻む? 「変えない判断」から脱却する方法とは
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
「AIバブル」は崩壊するのか? 熱狂の後に来る“尻拭い”と4つの防衛策
-
2
パナソニックが国内製造26拠点のERPを「SAP S/4HANA」に統一 アドオン7割削減
-
3
守るべきは「開発者のフロー状態」 AIによる生産性改善の6施策
-
4
脱VMwareの前提が崩れる BroadcomのVDDK公開停止で確認すべき点
-
5
データを無断で暗号化し使用者に身代金を要求する詐欺に用いられるマルウェアとは?
-
6
「コピペ運用の限界」に直面するAI活用 7割超が“別画面”のまま使う理由は?
-
7
「HDD終了」は本当か 巨大クラウド2社が下した大容量フラッシュへの決断
-
8
【お知らせ】「クラウドインフラに関するアンケート調査」結果リポート
-
9
【お知らせ】「サーバ仮想化導入に関するアンケート調査」結果リポート
-
10
Microsoft製品でここまで自動化できる 情シスがやめられる手作業10選
ホワイトペーパーランキング PR
-
1
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
2
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
3
生成AIで文書活用を進めるには? 効率化と安全性をどう両立する
-
4
Windows PCとMacの選択制で生産性向上 LINEヤフーが実践する運用管理方法とは
-
5
DX/AI投資の壁を突破、現代の最高財務責任者が直面する課題と克服のヒント
-
6
「Google Workspace」活用事例34選、先進の生成AIによる組織変革の全貌
-
7
「人員を増やす」という選択肢はない 情シスが負の連鎖から抜け出すには?
-
8
Linuxのスキルを証明する“激推し”の認定資格はこれだ
-
9
「問題が深刻化しやすいプロジェクト管理」から脱却する方法とは?
-
10
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー