大量データ時代の分析インフラ構築法【前編】
ビッグデータ分析、Hadoop活用の意外な落とし穴
ビッグデータプロジェクトに取り組むIT担当者は、分析基盤の構築・運用では、仮想環境の一般的な運用管理アプローチが全く通用しないことを思い知らされることになるだろう。
ビッグデータがIT部門に付きつける課題
ビッグデータに備えよう。自社のデータセンターがその大波にまだ襲われていなくても、襲われるのは時間の問題だ。そうなれば、ITインフラとオペレーションの新たな要件に対応しなければならなくなる。
ビッグデータアナリティクスは、「eHarmony」のような結婚仲介サービスのWebサイトや、小売業者による顧客の購買行動予測、さらには医療機関による個人の寿命や疾病罹患の予測など、多種多様な用途で利用されている。こうしたデータ利用は、ジョージ・オーウェルの小説『1984年』で描かれた、ビッグブラザーが支配する監視社会を少し連想させるが、ビッグデータアナリティクスは、コンピューティングを利用して人間行動に解釈を加え、影響を与える方法に革命をもたらしている。
ビッグデータとは単に「増大の一途をたどるデータ」を指すものではない。「大規模なデータセットを高速に処理し、複雑な、そして多くはリアルタイムの意思決定を支援する一連のプロセスと技術」を指すのである。米ベス・イスラエル・ディーコネス・メディカルセンター(BIDMC)のストレージアーキテクト、マイケル・パース氏は、「予測分析を利用して治療を向上させることは、今後の医療が目指すべき方向だ。何らかの予測をしたい場合、ビッグデータはいつでも大いに役立ちそうだ」と語る。
明るい展望だ。しかし、ビッグデータ活用に携わる多くのIT担当者は、思わぬ壁に突き当たることになるだろう。
ビッグデータを分析するための方法が、「データセンターでこの10年間行われてきた仮想化やコンソリデーションの手法とは相入れない」と気付くことになるはずだ。
仮想化時代にありながら専用ハードウェアを求めるApache Hadoop
一般に、ビッグデータアナリティクスでは、ストレージとコンピューティングパワーを多数のノードに展開するインフラが必要になる。複雑なクエリに対してほぼ瞬時に答えを返すためだ。
ビッグデータアナリティクスで最もよく使われるプラットフォームは、オープンソースのApache Hadoopだ。このプラットフォームはHDFS(Hadoop Distributed File System)を使ってストレージを管理する。NoSQLやCassandraなどの分散データベースも、ビッグデータプロジェクトでよく採用されている。
だが、これらは比較的新しい技術であり、そのために成熟度に問題がある。米Evaluator Groupのシニアパートナー、ジョン・ウェブスター氏は、「例えばHDFSは、アーカイブ、バックアップ、スナップショット、高可用性といったストレージ管理者にとって当たり前の機能をネイティブにサポートしていない」と指摘する。
「経験豊富なHadoopユーザーは、ソーシャルメディア企業で働いていることが多い。彼らはHadoopの運用において、『ストレージは単純な機能しか提供しないダムディスクである』という考え方に立ってノードを作成し、そこで大量のI/Oを高速に処理している。過去20年間に開発されたストレージのインテリジェント機能など、全く存在していないかのように考えている」
さらにウェブスター氏は、「彼らは規制コンプライアンスについても『忘れよう』というスタンスだ。例えば、ファイルをロックダウンする方法もないと考えている」と付け加える。
また、Hadoopは通常、物理サーバのクラスタ上で運用され、そこではストレージネットワークとコンピュータネットワークが同一になっている。このため、企業のストレージやインフラの担当者は、Hadoop用の物理インフラを別個に管理しなければならないことが多い。
自動車メーカー、マツダの米開発拠点、Mazda North Americaでは、サーバの90%が仮想化されており、インフラアーキテクトのバリー・ブレークリー氏は、この比率の向上に取り組んでいる。しかしその一方で、Mazdaのビジネス部門の少なくとも1つが、BI(ビジネスインテリジェンス)ソフトウェアプロバイダー、米QlikTechの「QlikView」か、独SAPの「BusinessObjects」、あるいはその両方を使ったビッグデータプロジェクトを検討中だ。こうしたプロジェクトの多くでは、物理サーバとそれらに直結したローカルストレージが必要になる。
「私は仮想化を進めているが、このプロジェクトでは物理サーバを用意することになり、これは管理上の問題になる。異なる環境とデータのサイロがあると、ダッシュボードが多くなる。われわれ担当者の人数は非常に少ないため、異なる機器上の全てを管理するのは難しい」(バリー・ブレークリー氏)
HDFSの可用性の問題をどう解決するか
こうした問題の解決を目指すプロジェクトが進められている。その代表格が、米VMwareの後押しを受ける「Project Serengeti」だ。これはHadoopと同じく、Apache Software Foundationのオープンソースプロジェクトだ。最新版の「Serengeti 0.8」が2013年4月にリリースされている。
Project Serengetiの目的は、「ハードウェアやソフトウェアを追加購入することなく、空いているマシンサイクルを使って、標準化されたApache Hadoopクラスタを既存の仮想プラットフォーム上で迅速に展開することを可能にする」「自由にダウンロードできる製品を開発する」ことだと、VMwareのブログ投稿には記されている。
この「仮想Hadoopクラスタ」は、連続稼働の実現を目的としたVMwareのネイティブな高可用性機能とフォールトトレランス機能を利用でき、HDFSネームノードなどの基幹コンポーネントを保護するものだという。HDFSネームノードは、HDFS内の全てのファイルを追跡するノードであり、単一障害点となっている。ネームノードの高可用性はHadoopではまだネイティブに提供されていないためだ。このことは、企業のインフラ管理者、特に耐障害性を重視するストレージ担当者にとって大きな頭痛の種となっている。
これを受けて、米Symantecや米Red Hatは、HDFSに代わるスケールアウト型ファイルシステムとして、それぞれ「Clustered File System」「Gluster File System」を提唱している。より成熟度の高いこれらのファイルシステムは、スナップショットや高可用性のような機能を提供する。
自社製品とHDFSのネイティブな統合により、HDFSの可用性の問題を解決したと主張しているストレージベンダーもある。米EMCの「EMC IsilonスケールアウトNAS」だ。EMCのIsilonはHDFSが統合されているため、HDFSの単一障害点を解消するだけでなく、DAS(Direct Attached Storage)上に構築された物理クラスタと比べて、ビルトインデータ保護、高いストレージ効率、優れたパフォーマンスをHadoopユーザーに提供すると強調している。
前出のメディカルセンターBIDMCでは、Isilonストレージを使った臨床診療へのビッグデータアナリティクスの活用を模索している。別の目的でIsilonハードウェアを購入済みだったからだ。
「私がIsilonのインフラを使いたいのは、こうした取り組みのためのお試しキットではなく、専用の製品であり、非常に有用だからだ」とBIDMCのパース氏は語る。「既にIsilon製品を運用していたら、独自のディスクを搭載し、故障率が高い汎用的な製品を欲しがる理由があるだろうか」
少なくとも、Isilonストレージの利用はBIDMCの計画に沿っている。しかし現在、BIDMCは臨床診療で、米MicrosoftのSQL ServerとHadoopを統合した「HDInsight」も試用中だ。このソフトウェアは別の物理クラスタ上で動作している。このため、ビッグデータをBIDMCのITプラクティスに統合する上では、ストレージの集中化が課題となっているが、「課題はそれだけではない」とパース氏は説明する。Microsoftは、まだActive DirectoryとHDInsightを完全に統合しておらず、 BIDMCはこの統合を待ってから、ビッグデータの取り組みを発展させる計画だからだ。
「われわれはビッグデータの使い方と、われわれにとってのビッグデータの意味を理解し始めたばかりだ。次はインフラの観点から、ビッグデータをどのような形でサポートするのが最適かを見極めようとしている」(パース氏)
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
新着ホワイトペーパー PR
-
製品資料
[株式会社kickflow] 2社の事例に学ぶワークフロー改革:属人化解消や年数万件の申請書類削減のコツ -
製品資料
[NTTPCコミュニケーションズ株式会社] 「回線速度不足」だけが原因ではない? Web会議の遅延を解決する方法とは -
製品資料
[東京エレクトロン デバイス株式会社] 工場の可用性向上に重要な「7つの領域」と対策 OTセキュリティ強化の基礎知識 -
製品資料
[リコージャパン株式会社] 問い合わせ対応で本来の業務が進まない、総務や情シスの負担をどう減らす? -
製品資料
[リコージャパン株式会社] 自社データから高精度な回答を生成、簡単に生成AIチャットボットを構築する方法
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
ITエンジニア1265人調査 生成AIを使い込むほど「人の確認」が重い理由
-
2
全社標準Copilotに絶望? MS Copilotで問い合わせ6割減できた企業は何が違った
-
3
Microsoft製品でここまで自動化できる 情シスがやめられる手作業10選
-
4
脱VMwareの前提が崩れる BroadcomのVDDK公開停止で確認すべき点
-
5
「Copilot」はなぜ放置される? “議事録要約止まり”を脱する処方箋
-
6
「Microsoft一択」で本当にいいのか 知らぬ間にライセンス費用が膨らむ真相
-
7
IT予算が10%増えたら何に使う? 著名企業のCIOが明かす「最優先の投資先」
-
8
AI活用か新たな脅威か OpenAI自律エージェントがRubyGemsを急襲
-
9
音声もFAXもメールで確認――ユニファイドメッセージの業務効果
-
10
機械学習について、正しく説明している文章はどれ?
ホワイトペーパーランキング PR
-
1
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
2
生成AIで文書活用を進めるには? 効率化と安全性をどう両立する
-
3
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
4
Windows PCとMacの選択制で生産性向上 LINEヤフーが実践する運用管理方法とは
-
5
少額減価償却資産が40万円未満へ拡大、令和8年度税制改正で押さえるべき変更点
-
6
「Google Workspace」活用事例34選、先進の生成AIによる組織変革の全貌
-
7
国税庁の次世代基幹システム「KSK2」稼働開始に向けて、対応すべき変更点とは?
-
8
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
9
Linuxのスキルを証明する“激推し”の認定資格はこれだ
-
10
AI時代に成功するための「ナレッジマネジメント」ベストプラクティス
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー