クラウドビッグデータ元年のPaaS動向【前編】
パブリッククラウドのHadoop対応状況を比較する──Amazon、Google、Herokuの場合
パブリッククラウドのビッグデータ対応を最も進めているベンダーはどこか? 前編ではAmazon.com、Google、Heroku(Salesforce.com)のHadoop対応状況を紹介する。
2012年はクラウドの「ビッグデータ」元年といわれており、米Amazon.com、米Google、米Heroku(米Salesforce.com)、米IBM、米Microsoftなどの大手PaaS(Platform as a Service)プレーヤーに注目が集まっている。では、パブリッククラウドでApache Hadoopのインプリメンテーションを最も包括的な形で提供しているのはどのベンダーだろうか。
Apache HadoopはHDFS、MapReduce、Hive、Pigなどのサブコンポーネントとともにビッグデータ分析の主流技術になりつつある。その背景には、エンタープライズデータウェアハウジングにPaaS型クラウドモデルを採用する企業が増えていることがある。Apache Software Foundationは、Hadoopが成熟し、業務用分析クラウド環境として活用できるようになったことを示すために「Hadoop v1.0」にアップグレードした。
拡張性の高い従量課金型のHadoopクラスタをPaaS業者のデータセンターの中に作成し、ホスティング型MapReduceを利用してバッチ処理が行えるので、企業のIT部門はたまにしか利用しないオンプレミス(社内運用)サーバへの設備投資を抑制することができる。その結果、HadoopはAmazon.com、Google、IBM、Microsoftなどの大手PaaS業者が相次いで採用し、各社はHadoop、MapReduceあるいはその両方を構成済みのサービスとして製品化した。
AWSのElastic MapReduce
米Amazon Web Services(AWS)は他社に先駆け、2009年4月にElastic MapReduce(EMR)を投入した。EMRはHadoopクラスタのプロビジョニング、ジョブの実行/終了、Amazon EC2(Elastic Compute Cloud)とAmazon S3(Simple Storage Service)間のデータ転送といった機能を備える。またEMRは、Hadoopをベースとするデータウェアハウジングサービス用ツールのApache Hiveも提供する。
EMRはスレーブの障害に対するフォールトトレランス機能を備えている。AWSでは、コストを抑えつつ可用性を維持するにはスポットインスタンス上でTask Instance Groupだけを実行することが望ましいとしている。しかし同社は2011年8月までスポットインスタンスをサポートしなかった。
AWSは、「Small」から「Cluster Compute Eight Extra Large」までのEC2インスタンスの料金に加え、EMRの使用に対して1時間当たり0.015~0.50ドルの追加料金を設定している。同社によると、ジョブフローが開始すると、Amazon Elastic MapReduceはAmazon EC2インスタンスのプロビジョニング、セキュリティの設定、Hadoopの構成とセットアップ、ログの収集、機器状態の監視やその他のハードウェア関連の複雑な機能(実行中のジョブから障害のあるインスタンスを自動的に除去するなど)の処理を実行するという。AWSは最近、EMRインスタンス用に無償の指標ツール「CloudWatch」(図1)を発表した。
GoogleのAppEngine-MapReduce
Google開発者のマイク・アイザッツキー氏によると、Googleの開発チームは全て、同社が2004年に発表したMapReduceを使っているという。同社はGoogle App Engine上でのHadoop 0.20プログラムの実行をサポートする「MapReduce APIの初期実験的リリース」として「AppEngine-MapReduce」APIをリリースした。その後、同APIの開発チームは2011年3月に、中間結果をBLOb(バイナリラージオブジェクト)として保存するためのファイル型システムを提供するために低レベルのファイルAPI v1.4.3をリリースするとともに、オープンソースの「User-Space Shuffler」機能を改良した(図2)。
GoogleのAppEngine-MapReduce APIは、Google Pipeline APIを通じてMap、ShuffleおよびReduceの動作を連係する。同社は「Google I/O 2012」カンファレンス用のビデオプレゼンテーションでAppEngine-MapReduceの現状を説明している。しかしGoogleは2012年春の時点で、「初期実験的リリース」という呼び方を変えていない。AppEngine-MapReduceは、ビッグデータサイエンティストや分析専門家ではなく、JavaおよびPythonの開発者をターゲットとしている。Shufflerは約100Mバイトのデータセットに制限されているが、これはビッグデータと呼べる容量ではない。大容量のデータセットの場合は、GoogleのBigShufflerへのアクセスをリクエストすることもできる。
HerokuのTreasure Data Hadoop
Herokuの「Treasure Data Hadoop」アドオンでは、DevOps(開発者と運用者のコミュニケーションとコラボレーションを改善する手法)のチームがHadoopとHiveを利用してホスティング型アプリケーションのログとイベントを分析することを可能にする。これは、同技術の主要機能の1つだ。Herokuのその他のビッグデータ用アドオンとしては、米CloudantによるApache CouchBaseのインプリメンテーション、MongoDB(米MongoLabが開発)、MongoHQ、Redis To Go、Neo4j(Java用グラフデータベースのパブリックβ)、RESTful Metricsなどがある。AppHarbor(「Heroku for .NET」とも呼ばれる)は、Cloudant、MongoLab、MongoHQ、Redis To Goといった同様のアドオンに加え、RavenHQ(NoSQLデータベースアドオン)を提供する。HerokuとAppHarborはいずれも、汎用的なHadoopインプリメンテーションをホスティングしない。
後編ではIBM、MicrosoftのパブリッククラウドのHadoop対応状況をまとめる。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー