データレイクとDWHのいいとこ取り
GoogleやAWSなど大手ITベンダーがこぞって採用 「Apache Iceberg」とは何者か
大手IT企業が、自社サービスで「Apache Iceberg」形式のデータテーブルを扱えるようにする動きが進んでいる。データレイクとDWH双方の特徴を持つ「データレイクハウス」の土台になる、Apache Icebergの仕組みとは。
「Apache Iceberg」は、大規模なテーブル形式のオープンソースデータフォーマットだ。その役割は、いまや現代の「データレイクハウス」を支える中核技術へと進化した。データレイクハウスは、大量の未加工データを蓄積する「データレイク」と、特定の目的のために整理、加工されたデータを格納する「データウェアハウス」(DWH)を融合させた技術を指す。
Google、Amazon Web Services(AWS)、Snowflake、Apple、Netflix、Databricks、Qlik Technologies、Clouderaといった主要IT企業がこぞってApache Icebergを採用している事実は、Apache Icebergが単なる一時的な流行ではないことを物語っている。この動きは、オンプレミスシステムとクラウドサービスが共存する「ハイブリッドクラウド」において、オープンで特定のベンダーに縛られないアーキテクチャへの移行が進んでいることを示唆している。Apache Icebergの台頭を支えている、その特徴とは。
IT業界で急速に浸透している理由
Apache Icebergは、2017年にNetflixが開発し、2018年にオープンソース化された。主な採用例を以下に示す。
- Google
- データレイクハウスサービス「BigLake」およびデータベースサービス「BigQuery」でApache Iceberg形式のテーブルを扱えるようにしており、オープンフォーマットの活用を推進している。
- AWS
- 「Amazon Athena」「Amazon Redshift」「AWS Glue」といった主要な分析関連サービスでApache Iceberg形式のテーブルを利用可能にしている。
- Snowflake
- 2023年に、Apache Iceberg形式のデータを同社のクラウドDWHで使える機能「Unified Iceberg Tables」を発表した。2025年にはAI(人工知能)技術を活用した分析機能やデータレプリケーション機能などを追加した。
- Apple
- 数百の社内データチームでApache Icebergを採用した。その知見を基にした「Copy-on-Write」「Merge-on-Read」といった機能がApache Icebergに実装された。
- Databricks
- Apache Icebergの開発者が設立したTabularを買収した後、データ管理ツール「Unity Catalog」とデータベースサービス「Lakebase」で、Apache Iceberg形式のテーブルを利用可能にしている。
- Cloudera
- 早期からApache Icebergに着目し、自社が提供するデータ管理・分析ツールでApache Iceberg形式のテーブルを利用可能にしている。
- Qlik Technologies
- クラウド型データ変換・集約ツール「Qlik Talend Cloud」で、Apache Iceberg形式のテーブルを使ったデータパイプラインの構築を支援する機能「Open Lakehouse」を提供開始した。
- Dremio
- 自社のデータレイクハウスの中核にApache Icebergを据えており、その中でApache Iceberg形式のテーブルに対する操作機能を提供している。
- Oracle
- データベース「Oracle Autonomous Database」とクエリ(問い合わせ)高速化エンジン「MySQL Heatwave Lakehouse」で、Apache Iceberg形式のテーブルを扱えるようにした。
2025年6月に策定されたApache Icebergバージョン3の仕様では、異なるデータ関連製品間での連携性、特定ベンダーに依存しない中立性が強化された。
いま、Apache Icebergが重要視される理由
Apache Icebergが支持を集めている背景には、幾つかの要因がある。
1.データレイクハウスの真価を発揮する機能群
Apache Icebergは、これまでのデータレイクでは搭載することが難しかった以下の機能をもたらす。
- ACID特性を保証したトランザクションの実行
- 「ACID」は原子性(Atomicity)、一貫性(Consistency)、独立性(Isolation)、永続性(Durability)の略。
- データの整合性を保証したトランザクション(一連の処理)を実行できる。
- これによって、複数エンドユーザーによるデータ読み書きの同時実行を可能にする。
- スキーマやパーティションの動的な変更
- テーブルのスキーマ(列定義)、パーティション(データのグルーピング)を、テーブルの運用開始後でも変更できる。
- タイムトラベル
- 過去の任意の時点にテーブルの状態を戻したり、その時点のデータを参照したりできる。
この他、Apache Icebergはメタデータを実データと切り離して管理する構造になっているため、クラウドサービスのオブジェクトストレージでも効率的に処理できるという特徴もある。これは、テーブルを構成するファイル一覧をメタデータとして管理することで、オブジェクトストレージが苦手とするファイル一覧の取得処理を回避できるためだ。
2.ベンダーに依存しないオープンなデータフォーマット
特定のベンダーが管理するプロプライエタリ(ソースコード非公開)なデータフォーマットとは異なり、Apache Icebergはオープンなデータ仕様だ。「Apache Spark」「Apache Flink」「Trino」「Presto」「Apache Hive」「Amazon Athena」など、さまざまなデータ処理エンジンでApache Iceberg形式のテーブルを利用可能だ。このオープンな設計によって、企業はベンダーロックインを回避し、自由に技術や製品を選択できるようになる。
3.コミュニティー主導の活発な技術革新
Netflix、Apple、AWS、Snowflake、Dremio、Tabularなどが主要なコントリビューターとして参加する活発なオープンソースコミュニティーが、Apache Icebergの機能開発を後押ししている。
4.AI技術、データ分析技術との親和性
画像やテキストを自動生成するAI技術「生成AI」や、大規模データの分析システムが急速に発展したことで、Apache Icebergのようなオープンなデータ形式の採用が広がっている。これによって企業は、データ形式を一元化でき、データを変換、移動する手間なく、ペタバイト規模のデータを用いたAIモデルの学習を効率的に進められるようになる。タイムトラベル機能によってデータのロールバックや再現性を確保できるため、監査においても重要な役割を果たす。
5.多様なインフラ形態への適応力
Apache Icebergはデータを保管するストレージ層と、データを処理するコンピュート層を分離するという設計思想を持つ。これによって、機密性の高いデータはオンプレミスサーバに置き、データ処理は複数のクラウドサービスに分散させるといったハイブリッドなレイクハウスアーキテクチャが構築可能になる。Apache Icebergは、こうした複雑な構成においてもメタデータ管理とデータ一貫性の課題を解決するのに役立つ。
Apache Icebergは統一性、オープン性、自由度を兼ね備えたデータアーキテクチャを実現するための重要な技術だ。豊富な機能群、特定のベンダーに依存しない設計、活発なオープンソースのエコシステム、AI技術との親和性といった点を、主要IT企業が評価して採用している。データレイクの自由度とDWHの信頼性を両立させた、次世代のデータレイクハウスの実現を支える技術だと言える。
TechTarget.AIとは
TechTarget.AIは、TechTargetジャパンの記事の一部で生成AIを補助的に活用し、米国Informa TechTargetの記事を翻訳・編集して国内向けにお届けします。編集部による内容の確認を徹底しています。
Copyright © ITmedia, Inc. All Rights Reserved.
本記事は制作段階でChatGPT等の生成系AIサービスを利用していますが、文責は編集部に帰属します。
TechTarget.AI
TechTarget.AI編集部は生成AIなどのサービスを利用し、米国TechTargetの記事を翻訳して国内向けにお届けします。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー