事業部門と開発部門が持つデータ活用視点の違い
リクルートのビッグデータ分析基盤ができるまで、事業部門と開発部門が共に奮闘(1/2 ページ)
リクルートのサービスで共通に使われる「リクルートID」。ここに集まる膨大なデータを同社はどのように収集、分析し、活用基盤を構築しているのか。機械学習の結果を現場で生かす上での苦労と併せて紹介する。
「ホットペッパー」や「じゃらん」「ゼクシィ」「リクナビ」など数多くの人気サービスを手掛けるリクルートグループ。これらのサービスを支えるデータ基盤と機械学習について、2017年10月に都内で開催されたデータ活用関連イベント「Data Platform Conference 2017」のセッションで当事者が語った。同セッションでは、リクルートグループがどのようにユーザーデータを活用してきたかについて、同グループのシステム開発を手掛けるリクルートテクノロジーズが紹介。事業部門と開発部門とのすり合わせの歴史であり、現場でデータを活用する際に必要な示唆に富んだものだった。
併せて読みたいお薦めの記事
「Data Platform Conference 2017」レポート
主要クラウドのデータ分析サービス
- ビッグデータでも負けられない戦い AWS、Azure、Googleの関連サービスを比較する
- GoogleやAWSが提供する機械学習サービス、ビジネスにどう活用する?
- ビッグデータを高速分散処理するSparkをAWSで動かすと何がすごいのか
クラウドを活用したデータ処理の事例
ライフイベント、ライフスタイルに関わるサービスを横断分析可能
同セッションには、リクルートテクノロジーズのITソリューション統括部から2人の話者が登壇した。リクルートのビジネスモデルと横断データ基盤を紹介する前半を担当したのは、渡部 徹太郎氏だ。
リクルートグループの事業領域は主に2つに分けられる。進学や結婚など人生のあらゆるシーンをサポートするライフイベント事業、もう1つは旅行や美容などのライフスタイル事業だ。いずれにおいても共通するのは「エンドユーザーとクライアントがいて、それをいかにうまくマッチングさせるかということに注力している点です」と渡部氏は説明する。
より良いマッチングのために「集客力の向上」「ポイント制度の採用」「マッチング率向上施策の実施」「顧客セグメントレポートを活用したデータ主導の意思決定支援」の4プロセスを最適化しつつ運用する。それが渡部氏らに課された任務だ。そもそもリクルートテクノロジーズは、リクルートグループを横断する組織として生まれた。リクルートグループが提供するサービスに共通で使われる「リクルートID」をベースに、Webサイトを横断的に分析、共通ポイントの付与やサービス間のクロス送客をする組織だ。「そのためにグループ横断で使えるビッグデータの収集、分析、活用基盤を構築し、運用しています」(渡部氏)
リクルートグループはそのデータ分析基盤を使い、じゃらんなどリクルートグループが提供する各サービスのWebアプリケーションからマスターデータとユーザーの行動データを収集、蓄積している。収集したデータは、プログラミング言語「Python」で開発したプログラムなどを使って加工し、データ活用のためのアプリケーション(以下、データアプリケーション)に出力する。データアプリケーションでそのデータを可視化できるようにした他、それぞれの事業部門がビジネスインテリジェンス(BI)ツールからデータ分析基盤へアクセスしたりレポートを作成したりできるようにすることで、データドリブンな意思決定を支援する。
現在、データ分析基盤では50種類以上のサービスから2PB程度のデータを集めているという。データベースの数は160件、テーブルは8000件、サーバが200台という規模だ。そこで実行するジョブは1万件を超え、毎月1億クエリを処理している。約400人が利用し、データアプリケーション開発には87人が携わっている。
データ分析基盤の中心となっているのは、Oracleのデータベースサーバ専用機「Oracle Exadata Database Machine」(以下、Exadata)だ。Webブラウザから収集したデータをExadataに取り込み、個人情報のマスキングや名寄せをする。Adobe SystemsのWeb分析サービス「Adobe Analytics」を使って行動分析した結果をさらに機械学習で分析(属性推定)し、年齢や性別などの属性を推定し、それに応じてWebサイトのUI(ユーザーインタフェース)/UX(ユーザー体験)を改善する。これがパーソナライズやレコメンドの基本的なパターンだ。
複数のWebサイトを横断したデータ基盤なので「AというWebサイトに始めてアクセスする人であっても、BというWebサイトの利用歴から属性を推定し、ユーザーの意向に沿った情報提供が可能になります」と渡部氏は説明する。
データ分析基盤は十分に完成したシステムに思えるが、まだ課題は多いという。例えば「Amazon S3」の行動データ取得に時間がかかり過ぎていたり、スマートデバイスにインストールして使うネイティブアプリから情報を集め、処理する方法が定まっていなかったりする。ユーザー増加やビッグデータ活用の広まりによる計算量の増大も課題だ。個人情報を扱うデータウェアハウスと機械学習は現在オンプレミスで運用しており、拡張性に限界を感じているという。
データガバナンスのポイントを3点に絞って実例を紹介
続いて渡部氏は、リクルートグループのデータガバナンスへと話題を移した。ポイントはメタデータ管理、データフロー管理、そしてデータ品質管理の3点にあるという。
データの可視化については、該当する機能をWebアプリケーションとして提供し、約4年運用している。主要機能は「データを探す機能」「データの意味を知る機能」「データの変化を知る機能」の3つだ。
データを探す機能としては、データベースやテーブルの一覧を提供するのはもちろんのこと、自然言語検索で必要なデータを含むテーブルを見つけ出せるようにしている。データの意味を知る機能とは、テーブルの定義を事業者側にも分かりやすく提示する機能だ。ユーザーがコメントを残せるようにしており、どのような人がどのようなことに利用したテーブルかを知ることができる。データの変化を知る機能とは、テーブル定義の変化を知るためのもので、変更されるたびにメールで通知を受け取れる。
テーブルへのコメントの応用として、テーブルを頻繁に使う人が見えるようになった。「『このデータについて誰に聞けばいいのか』を可視化できたのです」(渡部氏)
さらに利便性を高めるために「データ収集のハードルを下げたい」と渡部氏は言う。具体的には、利用者自身がデータを追加できる仕組みや、開発者がもっと手軽にデータを追加できる仕組みづくりを目指すという。ビジネス用語とデータのひも付けも進め、データ管理者を置くなど、データ活用の視点も忘れてはいない。
2つ目のポイントは、データフロー管理だ。こちらは入力データとその処理の関係性を管理し可視化するWebアプリケーションを作り、提供している。Exadataと「Oracle Database」をまとめて管理できる仕組みで、取り扱いデータ数は約7000件、ジョブは800件程度だという。データの管理方法には、データ交換形式のYAMLで定義して、バージョン管理システムの「Git」を利用することで、Oracle Databaseのテーブル変更を管理している。主な用途は、障害影響調査など万が一の際のデータ分析だ。
「データの種類や処理目的によって、ソースデータに求められる鮮度が変わります。そのためデータ鮮度を考慮したデータ処理の流れを整備しないと、例えばデータの更新が遅れたときに、どのデータフローに影響があるのかといった障害影響調査が難しくなります」(渡部氏)
最後のポイントは、データ品質管理だ。これはまだ課題として残っており、リクルートテクノロジーズでも徹底できてはいないという。各チームが個別に品質チェックをしているのが現状だ。「データごとの品質要件をユーザーが登録し、チェックできる仕組みを作りたいと考えています。分析者がデータの状態を把握できるように、データ品質を標準化する必要があるからです」(渡部氏)
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
4
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
5
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
8
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
9
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
10
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー