【連載】IT部門のためのアナリティクス入門 第3回
データ分析で成功するためのデータマネジメントとIT部門の新たな役割(2/3 ページ)
専門知識がなくてもHadoopは使える
セルフサービス? ああ! だから、今日はガソリンスタンドの給油ホースを持ってたんですね。ちなみになんで、ガソリンじゃなくて、スパークリングワインが出てきたんですか? まあ、いいですよ、そんなことは。それよりも、セルフサービスデータマネジメントなんて、できるんですか? Hadoopデータの抽出や加工って、ガソリンのセルフスタンドみたいに、ボタン1つで誰もがお手軽にできるような作業じゃないですよ。
プログラムを書けないユーザーも多いし、正直あんまり現実的じゃないと思うんですけど……。
ちっちっちっ。心配は無用じゃ。
確かに一昔前は、ビッグデータを扱うためには特別なスキルや知識が必要だったの。それに世の中にある多くのアナリティクスツールは、PCやシングルサーバで利用することを前提としているため、ビッグデータに対応させて分散環境で動かすためには工夫が必要だったんじゃ。つまりスキル獲得や時間といった壁が大きく立ちはだかっていたといえるの。
じゃが、今は、SASのように、Hadoopのスキルがなくても、GUI(グラフィカルユーザーインタフェース)操作や分析者になじみのある言語でHadoopで扱うデータを自由自在に加工できる便利なツールがあるんじゃぞ。プログラミングなんてしなくとも、マウスによるポイント&クリック操作だけでデータ加工処理を作成し、実行エンジンとして「Apache Spark」や「Cloudera Impala」などを切り替えて実行することも可能じゃ。
つまり大半の分析者は、「Spark入門」なんて入門書を読む必要もないんじゃ。
お、出ましたね、Spark。さっき読んでいた本にも、SparkやらImpalaやら出てきたんですが、これって、Hadoopとどういう関係にあるんですか? 「Hadoopエコシステム」とか解説にあったんですが、何かチンプンカンプンで。
はあ。全く世話が焼けるの。確かに昨今は、どの部分を「Hadoop」と呼べばいいのかよく分からなくなってきておるからの。じゃが、おおむねは、以下のようにイメージすればよいじゃろう。
分散ファイルシステムの「HDFS」とクラスタ/スケジュール管理の「YARN」の組み合わせを昨今のHadoopフレームワークのコアと捉えれば、「Apache Hive」、 Spark、 ImpalaやSASも全てHadoopエコシステムの一員となる。SQLを使いたいのか、とんがったことをするためにプログラミングをしたいのか、はたまたビジネスのスピードを優先してポイント&クリックで使いたいのか。企業、組織の体制や成熟度、スキルや目的に応じてさまざまな選択肢が広がっておる。今やITに詳しくなくてもこれらビッグデータテクノロジーの恩恵に預かることができるのじゃ。
なるほど。で、セルフサービスデータマネジメントのツールを使えば、プログラムなしにSparkやImpalaまで活用できちゃうんだ。あ……、まさか「Spark」つながりで、スパークリングワインだったんですか?
遅い、気付くのが遅過ぎる。キレが悪すぎる。
まあ、よいわい。こうしたツールを活用すれば、データをHadoopに格納しておくだけで、データ分析者自身が生データに自らアクセスし、データのプロファイリング(品質や構造の明確化)や転置、変換、クレンジグに結合、集計まで行うことができるんじゃ。HadoopではRDBMS(リレーショナルデータベース管理システム)と異なり、データの整合性を保つ参照整合性制約などの機能がなく、データ品質が悪化しやすいので、プロファイリングクレンジング機能も普段以上に大事じゃぞ。
すごい。それならユーザー部門もストレスなく分析用のデータ準備作業ができちゃいますね。というか、業務に詳しくない私に依頼内容の詳細を説明してもらって、やりとりを繰り返すよりも、ずっとスムーズに分析用のデータを準備できると思います。アナリティクスにとっては、これ、重要ですよね。
そう、そこじゃ。アナリティクスにより具体的なビジネス価値を創出しようとするとき、スピードは何よりも重要じゃ。データの抽出と加工だけで2~3週間もかかっているようでは、意思決定のタイミングを逃してしまうからの。おぬしもだいぶ、アナリティクスに必要なデータマネジメントのポイントが分かってきたではないか……。
ん、おぬし、何でまたため息をついておるんじゃ?
Copyright © ITmedia, Inc. All Rights Reserved.
IT部門のためのアナリティクス入門
ビッグデータアナリティクスのビジネス活用において、IT部門が果たす役割とは何か。アナリティクスの本質と必要なツールについて、分かりやすく解説します。
この記事の著者
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー