Hadoopとの使い分けは?
ビッグデータを高速分散処理するSparkをAWSで動かすと何がすごいのか(1/2 ページ)
「Amazon Web Services」(AWS)のHadoopサービスとして特に魅力的なのが「Apache Spark」である。「Amazon Elastic MapReduce」と連係して高速処理や多用途性を実現する。
「Amazon Web Services」(AWS)のユーザーが利用できるアプリケーションサービスのラインアップは続々と増えている。特に多いのがデータ分析に関連するサービスだ。多くの企業がデータの海におぼれ、処理に困っている。そんな中AWSは、複雑なシステムをシンプルかつコスト効率よく構築できるようにするビッグデータツールとして重要な地位を確立した。例えば、AWSでは「Apache Spark」(Spark)が実行可能だ。
AWSは多種多様なニーズに合わせて多くのデータベースを用意している。例えば「Amazon DynamoDB」でNoSQLデータベース、「Amazon RDS」と「Amazon Aurora」でリレーショナルデータベース(RDB)、「Amazon ElastiCache」でインメモリキャッシュ機能を提供したり、「Amazon Redshift」などのデータウェアハウスサービスを提供したりしている。またHadoopは、新種のデータ分析問題に対処する。これらの問題で使用されている極めて大きなデータセットを多くのシステム間で分散し、Hadoopクラスタを形成する。それでも、複数のソフトウェアコンポーネントが必要なスタックによって多数のシステムを導入するのはコストがかさむ上に複雑である。そのため、ほとんどの企業にとってHadoopの使用は現実的ではない。
併せて読みたいお勧めの記事
Hadoop事例
クラウドサービスのHadoopを比較
Hadoopディストリビューション選定
IT部門のためのアナリティクス入門
「Amazon Elastic MapReduce」(EMR)は、分散データを処理するHadoopフレームワークだ。AWSのコアインフラ上に構築され、データの収集と取得に「Amazon Simple Storage Service」(S3)を、処理に「Amazon Elastic Compute Cloud」(EC2)クラスタを使用する。EMRはシステム構成、導入、撤去、ジョブ管理、ログ記録など、Hadoopソフトウェアをセットアップする際のこまごまとした厄介な作業に対処する。
特に12台以上のサーバを伴うワークロードでは、Hadoopツールの導入と構成は複雑で、時間や費用がかかる。ビッグデータの開発者はこれらのHadoopツールへのアクセスにEMRを使用する。
EMRは「Hadoop Distributed File System」(HDFS)、MapReduce処理エンジン、API、YARNリソースマネジャーを提供するが、以下のHadoopサービスのプラットフォームでもある。
- HBase - HDFSを使用した分散データストア
- Hive - SQLクエリ言語を使用するデータウェアハウス
- Pig - SQLのようなコマンドをMapReduceジョブに変換するHadoopプログラミングフレームワーク
- Presto - HDFSおよびS3と互換性のあるSQLクエリエンジン
- Spark - EMRの構成可能なオプション
EMRのスピードと多用途性、複数言語で簡単にプログラミングできることを踏まえると、最も魅力的なHadoopサービスはSparkだろう。「Spark SQL」は、待機時間の少ない対話型のSQLクエリを分散したHadoop/HDFSデータセットの構造化データに対して実行する。またEMRのSparkには、Hadoopクラスタ内のデータのスケーラブルな分散機械学習アルゴリズムに対応するMLlibライブラリが含まれている。そして「Spark Streaming」は、同一の構文と言語(具体的にはJava、ScalaおよびPython)を使用するストリーム処理用のAPIを提供する。このAPIは、回復力の高いHadoopクラスタ上アプリケーションのストリーム処理に最適化されている。さらにSparkのAPI「GraphX」は、ETL(抽出、変換、読み込み)を統合するグラフ処理、予備解析、反復的なグラフ演算をHadoopクラスタ内で実行する。
AWSユーザーがEMRクラスタにシステムモニタリングツール「Ganglia」をインストールすると、AWSのSparkでより高度なクラスタの監視ができるようになる。EMRが管理するHadoopクラスタでAWSのSparkを実行すると、マスターノードがYARNリソースコントローラー、SparkやSpark SQLなどのオプションのモジュールを実行する。それから、データを読み取ってS3バケットに結果を書き込み、処理容量を増やすために1つ以上のスレーブノードを生み出す。
ビッグデータを処理するための拡張性
HadoopとEMRの初期リリースは、巨大で事実上無制限のデータセットを処理するように設計されていた。だが、圧倒的なスケーラビリティのマイナス面はその遅さだ。HadoopはHDFSを使用して、ディスクからあらゆるものを読み取って書き込み、一度に1つのタスクを実行する。各MapReduceジョブはバッチ処理だ。そのため、複数の連続した処理ステップやETLのような変換を伴う複雑なデータ変換を実行しなければならない場合は、別個のジョブが必要になる。つまり処理を完了するまでに時間がかかるということだ。また、個々のジョブが失敗して、データ処理ステップ全体を再実行しなければならない可能性があるため、フォールトトレラントなワークフローが必要になる。
対照的にSparkは、基本的なMapReduceアルゴリズムではなく、有向非巡回グラフ(DAG)として定義されているため、スピード、双方向性、より複雑なデータ変換を考慮して設計されている。DAGは構造体で、各アクションがノードまたは頂点になっている。各アクションが別のアクションを引き起こすことは可能だが自身にループバックすることはない。DAGが連続的なバッチジョブよりも柔軟性が高いのは、この特性のおかげだ。複数のタスクを並列に実行し、結果に基づいて1つのタスクが、1つ以上の後続のアクションをトリガーできる。
Sparkは、データセットがHadoopクラスタのノードのシステムメモリに完全に収まるくらい小さければ、完全にインメモリで実行することが多い。SparkのRAMベースの設計は、ディスクベースのMapReduceの約100倍も高速だ。インメモリキャッシュは、中間の結果をディスクに書き込む必要が全くないため、複雑なDAGを高速化する。
Sparkの多用途性は、ビッグデータ開発者からSparkが人気を博した主な理由の1つだ。Sparkは、規範的なプログラミング言語ではなくアプリケーションプラットフォームと見なすのが最適といえる。開発者は、なじみのある高度な言語で、80個以上の高度な演算子を使用してSparkアプリケーションを記述できる。さらにSparkは、SQLとDataFrame API、ストリーム処理、機械学習、グラフ分析、並列演算を含む複数のライブラリをサポートしている。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー