ビッグデータ分析にクラウドを活用するポイント【前編】
OSSやクラウド(AWS、GCP)を使ったビッグデータ分析、基本的な流れをつかもう
クラウドベンダー各社は、データ分析に特化したクラウドサービス提供に注力している。こうしたクラウドサービスやOSSツールを活用したビッグデータ分析の基本的な流れを紹介する。
2017年10月に都内で開催されたデータ活用関連イベント「Data Platform Conference 2017」において、ホートンワークスジャパンを始めとした3社が、クラウドを活用したビッグデータ分析について語った。「エキスパートに聞く! クラウドで実現するビッグデータ活用」と題したこのセッションでは、データの収集から分析、活用までの考え方に始まり、各社のサービスを使った具体的な手法について聞くことができた。前編では、ビッグデータ分析にオープンソースソフトウェア(OSS)を使う場合や、「Amazon Web Services」(AWS)、「Google Cloud Platform」(GCP)といったクラウドサービスを使う場合にフォーカスし、ツールやビッグデータ分析の基本的な流れを紹介する。
OSS、クラウドを使ったビッグデータ分析の方法
当然ながら、ビッグデータ分析に使うアプリケーションはクラウドベンダーにより異なる。講演ではそれらを簡単に比較するため、ホートンワークスジャパンの北瀬公彦氏はまず、ビッグデータ分析の一般的な流れを整理した。
ビッグデータ分析ではまず、センサー系のIoTデバイスからストリームデータ(連続的に発生し続けるデータ)を取得し、リアルタイム処理して分散ファイルシステムに渡す。それをビッグデータ分析に適したデータベースであるNoSQLデータベースに格納して、「Apache Hadoop」などの分散処理フレームワーク(ミドルウェア)で分散処理するか、アプリケーションからNoSQLデータベースへ直接アクセスする。または、取得したデータをデータウェアハウス(DWH)に格納してビジネスインテリジェンス(BI)ツールからアクセスすることも考えられる。
その後、北瀬氏はビッグデータ分析にOSSを使う場合、AWS、GCPなどのクラウドサービスを使う場合について、具体的にどのようなアプリケーションやサービスを組み合わせるべきかを紹介した。
例えばOSSを使う場合は、「Apache Sqoop」などのETL(データ抽出、変換、登録)ツールでデータをバルク(一括)転送し、分散ファイルシステム「HDFS」などに落とし込んでからHadoopや「Apache Spark」のようなフレームワークで分散処理をする。その後、リアルタイム分析ツール「Druid」やHadoop向けDWH構築ソフトウェア「Apache Hive」に格納して、「Apache Superset」などのBIツールからアクセスすることになる。
AWSの場合には、ストリーミングデータ蓄積サービス「Amazon Kinesis」でデータを受け取り、ストリーミング処理サービス「Amazon Kinesis Analytics」などで分析した上で、NoSQL型のマネージドデータベース「Amazon DynamoDB」に格納することになる。分析にはSQLクエリ実行サービス「Amazon Athena」やBIサービス「Amazon QuickSight」が利用できる。
GCPの場合は、メッセージングサービス「Google Cloud Pub/Sub」がデータを受け取る。「Google Cloud Storage」に蓄積したデータをバッチおよびストリーミング処理サービス「Cloud Dataflow」やHadoopのマネージドサービス「Cloud DataProc」で分散処理をし、DWHサービスの「Google BigQuery」に格納した上でBIツールなどのアプリケーションからアクセスするのが一般的ではないかと北瀬氏は説明する。
北瀬氏は続けて「IBM Bluemix」(Bluemix)や「Microsoft Azure」(Azure)といった他のクラウドサービスを使った場合の例も示した。後編では、BluemixおよびAzureのデータ分析サービスについて紹介する。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
技術文書・技術解説
[セコムトラストシステムズ株式会社] SCS評価制度で重要性が増す「SASE」 制度の要求事項と機能はどう関係する? -
製品資料
[株式会社オプティム] SaaS管理やID管理などの「資産管理」をまるごとカバーする方法とは? -
製品資料
[株式会社kickflow] 3分でわかる「kickflow」 どのようなワークフローを実装できる? -
事例
[株式会社kickflow] 出前館も実践 ワークフロー刷新で得られる効果とは? -
事例
[株式会社kickflow] ワークフロー活用事例:社内システムとのAPI連携で業務効率化&統制強化を実現
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
-
2
1200万円のSaaS導入を回避 スギ薬局「運用費10万円」のAIエージェント構築術
-
3
年収700万超エンジニアに共通するスキルと「もっと勉強すべきだった分野」
-
4
「企業におけるAIの運用」に関するアンケート
-
5
「完璧な設計」なのに3000万円溶けた AWSの失敗事例から学ぶ3つの教訓
-
6
「企業内サーバ環境の利用実態」に関するアンケート
-
7
本当にそのIBM iに問題はない? ブラックボックス化と属人化を防ぐ第一歩
-
8
「シェルコード」とは? 凶悪なマルウェア感染を可能にする手口
-
9
脱VMwareか、継続か? 仮想化ソフト主要6製品の機能とスペックを徹底比較
-
10
なぜ情シスは評価されにくい? 読者調査で見えた「成果が見えない仕事」第1位は
ホワイトペーパーランキング PR
-
1
DX/AI投資の壁を突破、現代の最高財務責任者が直面する課題と克服のヒント
-
2
バックアップは“取っているから大丈夫”なのか? ランサムウェア時代の備え方
-
3
ネットワーク遅延の原因、「パケットロス」の基礎知識と効果的な解決策
-
4
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
5
5分で分かる Microsoft 365のデータ損失に備えるためのバックアップの仕組み
-
6
AI活用を停滞させる「2:6:2の壁」を乗り越えるためのポイントとは?
-
7
ソフトウェア開発の属人化と手戻りをどう防ぐ? 速さと品質を両立させる方法
-
8
「NAS」「SAN」「DAS」は何が違う? いまさら聞けないストレージの基礎
-
9
複雑な組織構造で一度は頓挫した電子化、東京女子医科大はどう全学展開したか
-
10
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー