ビッグデータ分析基盤の構築事例(前編)
ビッグデータ分析に必要な性能を満たすインフラの条件とは?
多くの企業が、ビッグデータの膨大な量と多様さに対応できるインフラの整備に知恵を絞っている。データセンターのインフラを見直し、システムを刷新した企業の事例を紹介する。
ビッグデータはもはや大企業の専売特許ではない。Web 2.0分野の巨人たちよりもはるかに少ないデータしか保有していない企業にも高度なデータ分析技術が進出しつつある(関連記事:企業のデータ活用動向、まずは基幹システムと顧客情報から)。
「ビッグデータ」という表現は、米Facebookの「Inboxサーチエンジン」や米Googleの「MapReduce」から生まれたものだが、さまざまな業界の企業が事業拡大の戦略としてビッグデータ分析技術を利用するようになった。最近、ビッグデータ分析戦略をめぐって、米小売大手のTargetの取り組みが物議を醸した。これは、消費者の購入動向を予測して新規顧客を獲得するために、同社がビッグデータ分析技術を利用しているとされる問題だ。
ITプロフェッショナルにとって、ビッグデータ分析は比較的小型で消費電力が少ない機器を大規模に水平展開した拡張型ファームを導入することを意味する場合が多い。これは、この仮想化時代に主流となってきた「融合と統合」というテーマとは正反対の志向だ。
ビッグデータ分析基盤の構築事例:CareCore National
米医療費給付管理企業のCareCore Nationalでは、サウスカロライナ州とコロラド州にデータセンターを保有しており、現在の患者と同症例の過去患者との詳細な比較データを作成する際にデータ分析を利用している。正確な医療判断を下せるようにするのが目的だという(関連記事:医療分野のビッグデータ事例 「Hadoop」を採用した徳島大学病院)。
これをサポートするために、同社では「Virtual Computing Environment」(VCE)連合の「Vblock」をベースとした統合インフラを構築した。Vblockは米VMware、米Cisco Systems、米EMCの製品を組み合わせたシステムだ。
CareCoreのビッグデータ分析では、Vblockに含まれる容量86Tバイトのディスクアレイ「Symmetrix V-Max」からデータを取り出す。その他にも48Tバイトの「EMC GreenPlum Distributed Computation Appliance(DCA)」を2台(合計容量96Tバイト)利用しており、これらは別個に管理しなければならないという。
「DCAは現在、分析用インフラの外側で運用している。この状態は少々厄介だ」とCareCoreのビル・ムーアCTO(最高技術責任者)は話す。「これらのDCAを10ギガビットイーサネットインフラに接続するのも大変だった」
CareCoreでは、これらのリポジトリからデータを取り出すのに「Apache Hadoop」に加えてVMwareのインメモリデータ管理システム「vFabric GemFire」を利用している。これらのデータは「Alpine Miner」や米Tableau Softwareのツールなどの分析/仮想化インタフェースを通じて処理しているという。
ムーア氏によると、今日の医療技術では「ある患者が12カ月以内に心臓発作を起こす確率は87%である」といった予測を立てるのは難しいことではないという。CareCoreが目指しているのは、特定の患者の症状と病歴および「アドホックコホート」(CareCoreのカルテの中でその患者の症状と一致する患者のグループ)に基づいて医師が治療計画を選べるようにすることだ。
そのためには、インフラの仮想レイヤーで発行される複雑なクエリをコンピューティングシャーシ「Cisco Unified Computing System」(UCS)から抽出し、それをコアスイッチ「Cisco Nexus」からエッジスイッチ「Nexus 5000」、ラックスイッチ「Nexus 2000」、そしてNexus 2000に接続された「GreenPlum DCA」ラック内のDCAサーバに送り、さらにそこから逆のコースをたどって返される必要がある。
ムーア氏は、将来的にこの機能をVblockファブリック内で完結できるようにしたいと考えているという。
また、Vblock内のインメモリデータ管理システム「GemFire」は、それぞれ96Gバイトを利用可能なメモリを搭載した複数の専用UCSブレードサーバを必要とする。GemFireのワークロード1件だけでも、そのメモリの半分を消費する可能性がある。このためCareCoreでは、多数のワークロードが同じブレードを奪い合うことがないように、「VMware Distributed Resource Scheduler」(DRS)のルールを厳密に設定する必要がある。
CareCoreでのビッグデータ処理プロセスは、大規模メモリとVblockインフラに加え、全社に配備された10ギガビットイーサネット(GbE)ネットワークが必要条件となる(関連記事:医療研究機関が100GbEネットワークの導入を決断した理由)。
「GbEトラフィック、あるいは10 GbEトラフィックの一部を処理する物理サーバを使って巨大なクエリセットをデータセンターとやりとりするには、両者の間に大規模なインフラが必要となる」とムーア氏は話す。
次回は、Wikipediaなどオンライン企業におけるビッグデータ分析基盤の構築事例を紹介する。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
新着ホワイトペーパー PR
-
製品資料
[株式会社MatrixFlow] 「物流リソース最適化」ガイド:人員・配車・傭車を出庫依頼の確定前に決めきる -
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
4
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
5
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
6
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
7
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
8
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
9
「結局使わなくなる」Microsoft 365 Copilotを半年で定着 キリンの3施策
-
10
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー