ビッグデータ分析にクラウドを活用するポイント【前編】
OSSやクラウド(AWS、GCP)を使ったビッグデータ分析、基本的な流れをつかもう
クラウドベンダー各社は、データ分析に特化したクラウドサービス提供に注力している。こうしたクラウドサービスやOSSツールを活用したビッグデータ分析の基本的な流れを紹介する。
2017年10月に都内で開催されたデータ活用関連イベント「Data Platform Conference 2017」において、ホートンワークスジャパンを始めとした3社が、クラウドを活用したビッグデータ分析について語った。「エキスパートに聞く! クラウドで実現するビッグデータ活用」と題したこのセッションでは、データの収集から分析、活用までの考え方に始まり、各社のサービスを使った具体的な手法について聞くことができた。前編では、ビッグデータ分析にオープンソースソフトウェア(OSS)を使う場合や、「Amazon Web Services」(AWS)、「Google Cloud Platform」(GCP)といったクラウドサービスを使う場合にフォーカスし、ツールやビッグデータ分析の基本的な流れを紹介する。
OSS、クラウドを使ったビッグデータ分析の方法
当然ながら、ビッグデータ分析に使うアプリケーションはクラウドベンダーにより異なる。講演ではそれらを簡単に比較するため、ホートンワークスジャパンの北瀬公彦氏はまず、ビッグデータ分析の一般的な流れを整理した。
ビッグデータ分析ではまず、センサー系のIoTデバイスからストリームデータ(連続的に発生し続けるデータ)を取得し、リアルタイム処理して分散ファイルシステムに渡す。それをビッグデータ分析に適したデータベースであるNoSQLデータベースに格納して、「Apache Hadoop」などの分散処理フレームワーク(ミドルウェア)で分散処理するか、アプリケーションからNoSQLデータベースへ直接アクセスする。または、取得したデータをデータウェアハウス(DWH)に格納してビジネスインテリジェンス(BI)ツールからアクセスすることも考えられる。
その後、北瀬氏はビッグデータ分析にOSSを使う場合、AWS、GCPなどのクラウドサービスを使う場合について、具体的にどのようなアプリケーションやサービスを組み合わせるべきかを紹介した。
例えばOSSを使う場合は、「Apache Sqoop」などのETL(データ抽出、変換、登録)ツールでデータをバルク(一括)転送し、分散ファイルシステム「HDFS」などに落とし込んでからHadoopや「Apache Spark」のようなフレームワークで分散処理をする。その後、リアルタイム分析ツール「Druid」やHadoop向けDWH構築ソフトウェア「Apache Hive」に格納して、「Apache Superset」などのBIツールからアクセスすることになる。
AWSの場合には、ストリーミングデータ蓄積サービス「Amazon Kinesis」でデータを受け取り、ストリーミング処理サービス「Amazon Kinesis Analytics」などで分析した上で、NoSQL型のマネージドデータベース「Amazon DynamoDB」に格納することになる。分析にはSQLクエリ実行サービス「Amazon Athena」やBIサービス「Amazon QuickSight」が利用できる。
GCPの場合は、メッセージングサービス「Google Cloud Pub/Sub」がデータを受け取る。「Google Cloud Storage」に蓄積したデータをバッチおよびストリーミング処理サービス「Cloud Dataflow」やHadoopのマネージドサービス「Cloud DataProc」で分散処理をし、DWHサービスの「Google BigQuery」に格納した上でBIツールなどのアプリケーションからアクセスするのが一般的ではないかと北瀬氏は説明する。
北瀬氏は続けて「IBM Bluemix」(Bluemix)や「Microsoft Azure」(Azure)といった他のクラウドサービスを使った場合の例も示した。後編では、BluemixおよびAzureのデータ分析サービスについて紹介する。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー