データレイクハウスとは
データレイクハウス=データレイク+データウェアハウス
「データレイクハウス」という新たな考え方が登場した。名前から概要は想像が付くが、具体的にどのような特徴があるのだろうか。
データレイクハウスとは、データウェアハウスとデータレイクのギャップを埋めるという考え方だ。言い換えると、データレイクの比較的低コストの柔軟性とデータウェアハウスのアクセス性を結び付けることがデータレイクハウスの目的だ。
データレイクとデータウェアハウス
まずデータレイクとデータウェアハウスの主な機能をまとめ、データレイクハウスという考え方がそのどこに落ち着くかを考えてみよう。
データレイクはデータ管理の最も上流に位置する。データレイクには企業の全てのデータが流れ込む。XMLやJSONなどを介して非構造化データ、構造化データ、画像ファイル、PDF、データベースなどさまざまな形式のデータがそのままの形式で存在する。データレイクにはメタデータを使った検索機能があり、データサイエンティストがアドホックな分析を実行できる。
データウェアハウスはこの対極にある。データウェアハウスでは、データレイクでの作業を終えたデータセットが定期的かつ日常的な分析作業に利用できるようになる。
データウェアハウスでは、データがパッケージ化された処理済みの形式に変換される。つまり、データは常に調査、評価、ラングリング(訳注:クレンジングや整形などの加工)などを終え、迅速かつ定期的にアクセスされる構造化データになる。
データウェアハウスのコンピューティングとストレージは、必要なアクセスの種類と処理のタイプに合わせて最適化される。
データレイクからデータレイクハウスへ
データレイクハウスは、日常的な利用を考慮していない大規模で無定型の塊であるデータレイクと、厳密かつ高度に構造化され、比較的高価なデータウェアハウスの間に位置する。
基本的には、データレイクハウスはACID(原子性、一環性、独立性、永続性)サポートの導入を考える。つまり複数のユーザーが同時にデータの読み取りと書き込みができるトランザクション処理を視野に入れている。これにはスキーマを適用する方法とデータの整合性を推定する方法によるガバナンスを確保することも必要になる。
データレイクハウスは非構造化(半構造化)データへの対応の一環でもある。こうしたデータはテキスト、画像、動画、音声などさまざまな形式になり、AIツールによって分析される可能性がある。
これは、さまざまな種類のワークロードをサポートすることも意味する。データウェアハウスが常にデータベースの使用を意味するとしたら、データレイクはデータサイエンス、AI、SQLなどの形式の分析対象になる可能性がある。
主なメリットは、Python、R、機械学習といった言語やツールを使ってさまざまなデータに迅速かつ容易にアクセスでき、アプリケーションに統合される点にある。
既に使えるデータレイクハウス
データレイクハウスのパイオニア的存在がDatabricksだ。Databricksはオープンソースのクラウドデータレイクハウス「Delta Lake」に貢献している。
Databricksは「Amazon Web Services」(AWS)で利用できる。AWSはデータウェアハウスサービスの「Amazon Redshift」もデータレイクハウスとして位置付けており、構造化データ(リレーショナルデータベース)と非構造化データ(「Amazon S3」、Amazon Redshift)にまたがってクエリを実行する機能を備えている。ここで重要なのは、データウェアハウスに必要な準備をすることなく任意のデータソースにクエリできることだ。
「Microsoft Azure」にも「Azure Databricks」がある。Azure DatabricksはSQL、Python、R、ScalaをサポートするAPIを備えたDelta Lakeエンジンと「Apache Spark」、最適化されたAzureコンピューティングライブラリおよび機械学習ライブラリを使用している。
DatabricksとGoogleは「Google Cloud Platform」での利用と、「BigQuery」と「Google Cloud AI Platform」の統合を発表している。
Snowflakeもデータレイクハウスサプライヤーだ。同社は「データレイクハウス」という用語の発案者だと主張し、データウェアハウスとデータの構造化が進んでいないシナリオでデータと分析のプラットフォームを売り込んでいる。
Copyright © ITmedia, Inc. All Rights Reserved.
Computer Weekly日本語版
この記事の著者
関連記事
新着ホワイトペーパー PR
-
技術文書・技術解説
[Jamf Japan 合同会社] MDMだけでモバイルセキュリティは十分? 不足する対策を16項目でチェック -
製品資料
[株式会社ウェーブスプリッタ・ジャパン] 100Gbps対応の光トランシーバーはどう選ぶ? 10分で分かる選定のポイント -
製品資料
[株式会社フィックスターズ] 組み込み開発の生産性と機密性を両立、自社環境で構築する「セキュアAI」活用術 -
製品レビュー
[ServiceNow Japan合同会社] 問い合わせの約9割を自動で解決、AI主導の自律型CRMがもたらす業務変革の全貌 -
市場調査・トレンド
[ServiceNow Japan合同会社] AI活用が業務自動化で止まる理由は何か? 調査で判明した課題と変革への道筋
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
AI全部入り「Microsoft 365 E7」に企業が二の足を踏む訳 移行意向はわずか4%
-
2
「Microsoft 365」が乗っ取られる 跡形もなくMFAを破る手口
-
3
脱VMwareの前提が崩れる BroadcomのVDDK公開停止で確認すべき点
-
4
「VMware離れ」は本当か 3000社がVCF 9にかじを切った現実的な理由
-
5
エンジニアが選考を辞退する本当の理由 7割が隠す“面接の違和感”とは
-
6
【基本情報技術者試験】「デュプレックスシステム」と「デュアルシステム」の違いは?
-
7
マンガで解説:採択率は3割台? デジタル化・AI導入補助金申請の落とし穴
-
8
AWS障害でも補償ゼロの衝撃 サイバー保険で情シスが見落とす「細則の壁」
-
9
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
10
「Microsoft一択」で本当にいいのか 知らぬ間にライセンス費用が膨らむ真相
ホワイトペーパーランキング PR
-
1
生成AIのハルシネーションを防止 回答精度を高めるセマンティックレイヤーとは
-
2
5回聞くだけじゃ足りない? トヨタ式「なぜなぜ分析」の正しい実践方法
-
3
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
4
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
5
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
6
マンガで解説:「ゼロトラスト」「SASE」の必要性とメリット
-
7
5分で分かる「セキュア大容量ファイル転送サービス」の機能とメリット
-
8
情報セキュリティ対策早分かりガイド:25の自社診断で弱点と解決策を理解
-
9
国税庁の次世代基幹システム「KSK2」稼働開始に向けて、対応すべき変更点とは?
-
10
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー