Hadoopとストレージシステムの良い関係【前編】
Hadoopトラブルの“真犯人”、「HDFS」を使わずに済む代替手段とは
「Apache Hadoop」の要ともいえる分散ファイルシステム「HDFS」。その課題を回避するために、共有ストレージシステムを使用するユーザー企業が増えている。その理由を紹介する。
大量データを複数のマシンに分散して処理できるオープンソースのプラットフォーム「Apache Hadoop」のユーザー企業は通常、複数の汎用(はんよう)サーバで並列処理するクラスタを独自に構築する。各サーバの内蔵ストレージを使用し、6~12台のディスクを「JBOD構成」(複数のディスクを論理的にまとめて1つのディスクに見せる構成)にするのが一般的だ。
Hadoopクラスタは、1つのデータを分割して複数のサーバに分散する「シェアードナッシング」アーキテクチャとして知られている。それは各サーバが独立して処理をすることによって、クラスタ内の全処理が並列に動くことに起因する。データのやりとりは、共通のネットワークを経由する。だがそれを除けば、コンピューティングやメモリ、ストレージといったリソースをクラスタ内で共有することはない。
併せて読みたいお勧め記事
Hadoopのメリット/デメリット
Hadoopディストリビューション比較
ストレージエリアネットワーク(SAN)やネットワーク接続ストレージ(NAS)といったストレージシステムは拡張性を備えるが、大規模構成にするとコストが高くなり過ぎることが往々にしてある。また高いパフォーマンスを実現するために必要な「参照の局所性」(特定のリソースにアクセスが集中すること。該当リソースを高速化するだけで全体のアクセス速度が高まる)に欠け、さらにシェアードナッシングの「何も共有しない」というルールにも反する。そのため、各クラスタノードに組み込んだ直接接続ストレージ(DAS)をHadoop用のストレージシステムとして使用することが多い。
Hadoopの分野では、いまだに激しく議論されていることがある。それは、データを複数のサーバに分散配置するファイルシステム「Hadoop Distributed File System」(HDFS)で作られるHadoopクラスタ内のストレージプールを使うか、クラスタ外部に構築した大規模環境向けストレージシステムを使うか、ということだ。最近では後者を採用するユーザー企業が増えている。データセンタークラスのストレージシステムは、オンラインの長期保管ストレージ(アクティブアーカイブ)として補助的に追加されている。本稿では、HDFSで作られるストレージプールの代替手段として採用されている共有ストレージシステムに注目する。
HDFSストレージプールの代替手段とHadoopの利用に関係する特定の機能にスポットを当てる前に、HDFSストレージプールの代替を検討する理由について幾つか確認しておく。
データ保護機能と災害復旧機能の不足
HDFSは通常、データ取得時に3つの複製データを作成することで、ディスク障害やデータ損失、ネットワークの切断などの障害から復旧できるようにしている。複製データの作成により、クラスタはディスク障害に耐えられるようになり、障害を起こさずに機器を交換できるようになる。だがデータの取得処理は遅くなり、情報へのアクセス速度に悪影響が及ぶ。その上、データの破損といった全てのデータ消失シナリオに対処できるわけでもない。
クラスタ外部に構築する共有ストレージシステムを使用すれば、固有の管理機能を適用することで、パフォーマンスを維持しながら長期的にデータを保持できる。共有ストレージシステムの管理機能には、データ保護や災害復旧用レプリケーション、ストレージ階層化などがある。
ストレージリソースとコンピューティングリソースが分離不可能
HDFSストレージプールは、サーバとストレージを結び付けることで、処理とデータの距離を最短にし、桁違いなパフォーマンスを実現する。ただしストレージプールの容量を増設するには、コンピューティングリソースとネットワークリソースを追加しなければならない。それも、実際に必要であるかどうかには関係なくだ。
共有ストレージシステムをクラスタ外部に構築すれば、管理者はサーバリソースとストレージリソースを個別に拡張できるようになる
データの入出力プロセスで生じる運用の問題
HDFSストレージプールでは、アクティブなデータストアからデータをコピーする際に多くの時間を必要としたり、ネットワークリソースに負荷が掛かったりする場合がある。批判的に見ると、このプロセスによりデータの不整合が生じる可能性がある。その結果、「本当に単一のデータソースに対してクエリを実行できているのか」という疑いをアプリケーションのユーザーが抱くようになる。
スケールアウトNASなど、Hadoopをサポートする大容量の共有ストレージシステムを使えば、アプリケーションを含め関連するシステムのデータを一元的に集約でき、データの不整合を生じる可能性を抑えることができる。
またストレージシステムベンダーは、次のような理由から分析は共有ストレージシステムで実行する必要があると主張する。
- ストレージ容量の確保に必要なインフラが減ることで、総所有コスト(TCO)が半分以下になる。またデータ取得時に完全な複製データを3つ作成する必要がなくなることで、ストレージ効率が上がる
- 各ノードでHDFSをインストール、再インストール、更新する必要がなくなることで管理効率が向上する
- Hadoopクラスタから共有ストレージシステムへストレージ機能と管理機能をオフロードできる。これにより、データ保護や階層化ストレージ、スナップショット、セキュリティ対策など複数のメリットが得られる
後編では、HDFSストレージプールの代替手段として使える4つのストレージシステムを紹介する。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[o9ソリューションズ・ジャパン株式会社] 「改正物流効率化法対策」徹底解説 総物流費を抑制するサプライチェーン戦略 -
製品資料
[o9ソリューションズ・ジャパン株式会社] 「サプライチェーン最適化」実践ガイド:効果的な意思決定を実現する秘訣とは? -
製品資料
[株式会社リンプレス] 非デジタル/IT人材を「自走するDX推進者」に変えるための育成ロードマップ -
市場調査・トレンド
[ワンアイルコンサルティング株式会社] AI時代の組織設計:「判断と責任」を人に残すための2つの原則とは? -
技術文書・技術解説
[ワンアイルコンサルティング株式会社] システムの保守がモダン化を阻む? 「変えない判断」から脱却する方法とは
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
1200万円のSaaS導入を回避 スギ薬局「運用費10万円」のAIエージェント構築術
-
2
「完璧な設計」なのに3000万円溶けた AWSの失敗事例から学ぶ3つの教訓
-
3
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
4
パナソニックが国内製造26拠点のERPを「SAP S/4HANA」に統一 アドオン7割削減
-
5
LLMの「過学習」、正しく説明している文章はどれ?
-
6
「AIバブル」は崩壊するのか? 熱狂の後に来る“尻拭い”と4つの防衛策
-
7
脱VMwareの前提が崩れる BroadcomのVDDK公開停止で確認すべき点
-
8
高額な「AI PC」を一般従業員も使えたら? 費用のハードルを一気に下げる方法
-
9
守るべきは「開発者のフロー状態」 AIによる生産性改善の6施策
-
10
「企業内サーバ環境の利用実態」に関するアンケート
ホワイトペーパーランキング PR
-
1
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
2
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
3
生成AIで文書活用を進めるには? 効率化と安全性をどう両立する
-
4
Windows PCとMacの選択制で生産性向上 LINEヤフーが実践する運用管理方法とは
-
5
DX/AI投資の壁を突破、現代の最高財務責任者が直面する課題と克服のヒント
-
6
「Google Workspace」活用事例34選、先進の生成AIによる組織変革の全貌
-
7
「人員を増やす」という選択肢はない 情シスが負の連鎖から抜け出すには?
-
8
Linuxのスキルを証明する“激推し”の認定資格はこれだ
-
9
「問題が深刻化しやすいプロジェクト管理」から脱却する方法とは?
-
10
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー