Hadoopトラブルの“真犯人”、「HDFS」を使わずに済む代替手段とはHadoopとストレージシステムの良い関係【前編】

「Apache Hadoop」の要ともいえる分散ファイルシステム「HDFS」。その課題を回避するために、共有ストレージシステムを使用するユーザー企業が増えている。その理由を紹介する。

2016年08月29日 15時00分 公開
[John WebsterTechTarget]
Apache Hadoopの公式Wepページ《クリックで拡大》

 大量データを複数のマシンに分散して処理できるオープンソースのプラットフォーム「Apache Hadoop」のユーザー企業は通常、複数の汎用(はんよう)サーバで並列処理するクラスタを独自に構築する。各サーバの内蔵ストレージを使用し、6〜12台のディスクを「JBOD構成」(複数のディスクを論理的にまとめて1つのディスクに見せる構成)にするのが一般的だ。

 Hadoopクラスタは、1つのデータを分割して複数のサーバに分散する「シェアードナッシング」アーキテクチャとして知られている。それは各サーバが独立して処理をすることによって、クラスタ内の全処理が並列に動くことに起因する。データのやりとりは、共通のネットワークを経由する。だがそれを除けば、コンピューティングやメモリ、ストレージといったリソースをクラスタ内で共有することはない。

ITmedia マーケティング新着記事

news190.jpg

シンフォニーマーケティングが日立グループに「ABM研修特別編」を提供
シンフォニーマーケティングが日立アカデミーと教育プログラムを共同で設計・開発。世界...

news045.jpg

「現金で買い物」は少数派? 意外なポイントの使い道は? 調査で見えたお金への意識の変化
メットライフ生命保険が「全国47都道府県大調査 2024〜社会情勢の変化と将来への備え〜...

news100.png

どこどこJPに「匿名ネットワークアクセスレポート」が追加
Geolocation Technologyは、「どこどこJP」に新機能「匿名ネットワークアクセスレポート...