クラウドETL「AWS Glue」「Azure Data Factory」でデータパイプラインを構築する方法「AWS Glue」と「Azure Data Factory」を徹底比較【中編】

AWSの「AWS Glue」やMicrosoftの「Azure Data Factory」といったクラウドETLは、データパイプラインの構築を支援する。両者の基本的な利用方法を説明する。

2022年11月14日 05時00分 公開
[Chris TozziTechTarget]

 Amazon Web ServicesとMicrosoftは、ETL(データの抽出、変換、読み込み)のクラウドサービス(以下、クラウドETL)として、それぞれ「AWS Glue」と「Azure Data Factory」を提供している。ユーザー企業はこれらのクラウドETLを利用することで、容易にデータパイプライン(さまざまなデータソースからデータを取り込むシステム)を構築可能だ。AWS GlueやAzure Data Factoryを使い、データパイプラインを構築する方法を説明する。

AWS GlueとAzure Data Factoryでデータパイプラインを構築する

 クラウドETLであるAWS GlueとAzure Data Factoryは、共通する前提条件がある。データパイプラインを構築する際に必要な要素は以下になる。

  • データソース
    • データを生成する場所を指す。具体的にはデータベース管理システム(DBMS)やAWSの「Amazon Simple Storage Service」(Amazon S3)、Microsoftの「Azure Blob Storage」などのオブジェクトストレージサービスといったシステムが当てはまる。AWS Glueの場合はAWSサービスが、Azure Data Factoryの場合はMicrosoftのクラウドサービス群「Microsoft Azure」のサービスが最も簡単に連携できる。両者共に、外部のデータソースも連携可能だ。
  • データターゲット
    • データターゲットは、データパイプラインで処理された後のデータを配置する場所を指す。オブジェクトストレージサービスまたはDBMSが当てはまる。

 AWS GlueとAzure Data FactoryのどちらのクラウドETLでデータパイプラインを構築するとしても、クラウドETLがデータソースからデータを収集する方法を定義する必要がある。収集したデータの処理が必要な場合は、その処理方法も定義する。

 データパイプラインは、外部システムからデータを取得してデータソースに足りない情報を補うことができる。データ処理の過程で、データソースから収集した重複データを削除することも可能だ。処理完了後にデータを転送するデータターゲットも指定する必要がある。

 AWS GlueとAzure Data Factoryは、各クラウドサービスの管理画面またはコマンドラインインタフェース(CLI)ツールで管理できる。

TechTarget発 先取りITトレンド

米国TechTargetの豊富な記事の中から、最新技術解説や注目分野の製品比較、海外企業のIT製品導入事例などを厳選してお届けします。

Copyright © ITmedia, Inc. All Rights Reserved.

アイティメディアからのお知らせ

From Informa TechTarget

「テレワークでネットが遅い」の帯域幅じゃない“真犯人”はこれだ

「テレワークでネットが遅い」の帯域幅じゃない“真犯人”はこれだ
ネットワークの問題は「帯域幅を増やせば解決する」と考えてはいないだろうか。こうした誤解をしているIT担当者は珍しくない。ネットワークを快適に利用するために、持つべき視点とは。

ITmedia マーケティング新着記事

news017.png

「サイト内検索」&「ライブチャット」売れ筋TOP5(2025年5月)
今週は、サイト内検索ツールとライブチャットの国内売れ筋TOP5をそれぞれ紹介します。

news027.png

「ECプラットフォーム」売れ筋TOP10(2025年5月)
今週は、ECプラットフォーム製品(ECサイト構築ツール)の国内売れ筋TOP10を紹介します。

news023.png

「パーソナライゼーション」&「A/Bテスト」ツール売れ筋TOP5(2025年5月)
今週は、パーソナライゼーション製品と「A/Bテスト」ツールの国内売れ筋各TOP5を紹介し...