データレイク構築のススメ【前編】
データレイクとは何か――メリット、ストレージ、オンプレ/クラウドの是非
データレイクを構築するメリットは何か。データレイクに適したストレージとは何か。クラウド化すべきかオンプレミスで運用すべきか。基礎から解説する。
DX(デジタルトランスフォーメーション)にとって大量データの処理は前提条件だ。その鍵となるのがデータレイクという概念だ。組織がデータから可能な限り価値を引き出そうと試みる際、データレイクがそのコアとなる。データレイクはデータ管理と分析の分野に属し、ストレージに依存する。クラウドへの移行の機が熟したアクティビティーだが、オンプレミスのままでも可能だ。
本稿では、データレイクに必要なストレージ(多くの場合オブジェクトストレージ)と、オンプレミスとクラウドそれぞれの長所と短所を見ていく。
データレイクとデータウェアハウスの違い
データレイクは、企業のデータが最初に流れ込む場所であると考えて構わない。集められた全データのリポジトリであり、大体のデータは未加工のまま存在する。
データの検索を容易にするため、メタデータでタグ付けする場合もある。だがデータレイクのデータは、データサイエンティストやデータレイクの下流でタッチポイントを開発するスペシャリストがアクセスすることを目的とする。
データレイクは、実際の湖(レイク)のようにあらゆるデータソースからそこにデータが流れ込む。そのデータの多くは多様かつ未処理のため、その下流工程が重要になる。
データレイクから下流に流れるデータが行きつく先がデータウェアハウスだ。データはデータウェアハウスでさらに処理され、パッケージ化され、利用の準備が整っている状態だと想定される。
データレイクには複数のデータストアが含まれている。大半の従業員にとっては簡単にアクセスや読み取りができない形式(非構造化、半構造化、構造化)になっている。これに対してデータウェアハウスは、アプリケーションや従業員がアクセスできるデータベース内に構造化データとして構成される。データマートやデータハブでは、部門ごとにさらに利用しやすいデータに加工される可能性がある。
つまりデータレイクは大量のデータをそのデータ本来の形式で保持する。データウェアハウスやデータマートへのクエリとは異なり、データレイクへの問い合わせにはスキーマ・オン・リード(Schema on Read)のアプローチが必要だ。
データレイク:データ型とアクセス方式
データレイク内のデータのソースには、組織あるいはその各部門の全データが含まれる。リレーショナルデータベースの構造化データ、CSVファイルやログファイル、XML形式やJSON形式などの半構造化データ、メール、ドキュメントやPDFのような非構造化データ、画像、音声、動画のようなバイナリデータが含まれる可能性がある。
ストレージプロトコルに関しては、ファイル、ブロック、オブジェクトの各ストレージのデータを収容する必要があることになる。だが、データレイク自体のプロトコルとして一般的に選択されるのはオブジェクトストレージだ。覚えておきたいのは、ここでアクセスされるのはデータ自体ではなく、そのデータを説明するメタデータヘッダだ。メタデータヘッダは、データベースから写真まであらゆるものに添付できる。多くの場合、データへの詳細なクエリはデータレイクではなく他の場所で行われる。
オブジェクトストレージは、大量のデータを非構造化データとして格納するのに非常に適している。ブロックストレージのデータベースのようにクエリを実行することはできないが、複数の種類のオブジェクトを大きなフラット構造に格納でき、そこに何があるかを調べることが可能だ。
オブジェクトストレージは通常、高速性を目的とした設計にはなっていない。そのためオブジェクトストレージは、データウェアハウスのリレーショナルデータベースよりもクエリの構築や処理が複雑なデータレイクのユースケースに適している。データレイクレベルでのクエリ処理の多くでは、より容易にクエリできるデータストアを下流のデータウェアハウス用に用意することになる。
オンプレミスとクラウドのデータレイク
オンプレミスとクラウドの比較で行われる全ての議論がデータレイクの運用にも当てはまる。
オンプレミスのデータレイクは、設置スペースと電力、設計、ハードウェアとソフトウェアの調達、管理、それを運用するスキル、それら全ての領域に対応するコストを考慮しなければならない。
データレイクをクラウドに外部委託することは、設備投資(CAPEX)費用をクラウドプロバイダーへの支払いという運用支出(OPEX)費用にオフロードするというメリットがある。ただし、データの増加やクラウドとオンプレミス間のデータ移動は課金対象となることもあるため、予期しないコストが発生する可能性がある。
ストレージやデータレイクのアーキテクチャだけでなく、コンプライアンスや接続性などについても考慮する必要がある。
もちろん、クラウドとオンプレミスの両方で運用し、必要に応じてクラウドにバーストすることも可能だ。
後編では、オンプレミスのデータレイク製品と3大クラウドベンダーのデータレイクサービスを紹介する。
Copyright © ITmedia, Inc. All Rights Reserved.
Computer Weekly日本語版
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー