DB管理も兼務する羽目に
クラウドによるビッグデータ活用でワリを食う管理者のため息
クラウドのおかげで、ビッグデータの管理や大規模化するデータウェアハウスの運用を行う選択肢が増えている。これらの選択肢は、クラウド管理者の役割に直接影響を与えている。
IaaS(Infrastructure as a Service)を主にコンピュートおよびストレージインフラとして使おうとする企業では、データベース管理者は、データウェアハウスコンポーネントのインストール、構成、監視の管理を続けることになる。一方、オーバーヘッドを最小限に抑えようとする企業や、既存のクラウド管理者を有効に活用しようとする企業にとっては、米Amazon Web Servicesの「Amazon Redshift」のようなホステッド型データウェアハウスサービスが適切な選択肢かもしれない。しかし、こうしたホステッド型データウェアハウスを利用する場合、クラウド管理者の役割と責任に一般的なデータベース管理者の仕事が加わってくる。
クラウド管理者が担うさまざまな責任を理解するため、クラウドで使用する大規模データウェアハウスの3つの選択肢を考えてみよう。すなわち、(1)Redshiftで提供されるホステッドデータウェアハウスサービス、(2)「Amazon Elastic MapReduce」(EMR)とともに使う「Hive」、(3)AmazonのIaaSで自前で管理するクラスタ上で使う「Apache Spark」――だ。データストアと運用モデルの組み合わせはこれら以外にも可能だが、この3つの選択肢には、代表的な幾つかの重要な考慮点が含まれている。
Amazon Redshift:ホステッドデータウェアハウスサービス
Redshiftでは、完全なデータウェアハウスサービスが提供され、オーバーヘッドが軽減されている。このサービスは「PostgreSQL」をベースにモニタリングや基本的な管理機能(バックアップなど)が用意されている。このデータウェアハウスサービスでは、スケールアップ(より大規模なサーバを使う)やスケールアウト(サーバを追加する)によって規模を拡大できる分散データベースが実装されている。
Redshiftを利用する場合、クラウド管理者の役割はデータベース管理者に似たものになる。一部の設計作業(物理モデルの選択など)は免れるが、他の多くの作業がクラウド管理者に降り掛かる。例えば、クラウド管理者はデータベース上のロードに応じて、データウェアハウスのノードの数やタイプを変更しなければならない。また、データベースサービスがマネージド型でも、クラウド管理者は一般的なクラウド管理作業、例えば、ID管理やアクセス制御情報のメンテナンスや、コンプライアンス上の報告要件への対応などを行う必要がある。
Redshiftには他にも難点がある。データウェアハウスのソースのサイズ、スコープ、数が大きくなると、ETL(データの抽出、変換、ロード)が厄介になることだ。AmazonはRedshiftで、「Amazon Simple Storage Service」(S3)、「Amazon DynamoDB」および外部ホストとの統合をサポートしている。
ETLアプリケーションの開発には多額の投資が必要になることがある。多くのソースやターゲットの間でデータを移動する必要がある場合や、使用するデータストアのタイプを変更する可能性がある場合は、米TalendなどのビッグデータETLツールの利用を検討するとよい。このツールを使えば、ターゲットデータベースを変更または追加する場合にコードの書き換えを最小限に抑えられる。
Amazon EMR上のHive:Hadoopを使ったデータウェアハウジング
EMRでHiveを実行することで、マネージドサービスのメリットの一部が得られるが、管理者には多くの作業が要求される。クラウド管理者はHiveの論理データモデルを設計するだけでなく、データロードの管理、クラスタ構成の設計、ワークロードのモニタリングを行わなければならない。これらの作業は通常、データベース管理者が担当している。
Hiveは、Hadoop上に構築されたデータウェアハウスシステムであり、EMRでサポートされている。Hadoopは「Hadoop Distributed File System」(HDFS)を使うように設計されているため、管理者は、データウェアハウスがどのようにHDFSとS3を使ってデータを保存するかを決める必要がある。「DistCp」ツールを使ってHadoop内外のデータをコピーでき、データがS3にある場合は「S3DistCp」ツールを使ってコピーできる。HDFSデータは、クラスタがシャットダウンされた後は存在しないため、管理者は、クラスタを終了する前にデータをS3などの永続データストアにコピーするワークフローを計画する必要がある。
また、EMRを使用するクラウド管理者は、Hadoopクラスタの構成を指定する必要がある。指定する内容には、使用するインスタンスタイプに加え、ソースプログラム、ログファイル、データソース、SSH(Secure Shell)キーの場所が含まれる。さらに重要なことは、管理者は、データロードや長時間のバッチ処理といったワークフローのモニタリングとデバッグも行う必要があることだ。
同じデータセットに対して複数のワークフローが実行されるときは、管理者はワークフローのスケジューリングを最適化して、ETLのオーバーヘッドを最小限に抑え、Hadoopクラスタの不要な起動とシャットダウンをなくすとよい。
Apache Spark:DIYモデル
クラウドを主にコンピュートおよびストレージリソースとして使う場合、クラウド管理者に要求されるデータベース管理スキルのレベルが最も高くなる。だが、Apache Sparkのような新しいプラットフォームを最も柔軟に利用できる。
対話型クエリをサポートしなければならないデータウェアハウスは、Hadoopの書き込み集約型処理モデルのMapReduceの先を行かなければならない。Apache Sparkは、ビッグデータアナリティクスのためのインメモリアナリティクスエンジン。機械学習、グラフ処理、ストリーミング、対話型クエリをサポートしている。Apacheのトップレベルプロジェクトに昇格したことが2014年2月末に発表されている。
Sparkの開発者は、「Amazon Elastic Compute Cloud」(EC2)上のクラスタでSparkを実行するためのスクリプトを提供している。Amazonは、EMR上でのSparkと「Shark」(Spark上のHive)の実行に関するチュートリアルを公開している。クラウド管理者は管理作業全体に責任を持ち、その中にはクラスタの構成、Sparkのパラメータ設定、データロードの管理、アクセス制御の設定、ジョブのモニタリング、トラブルシューティングなどが含まれる。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー