課題だった個人情報を含むデータの扱い
NTTドコモが「テレワークでも安全なデータ分析」を実現した方法
近年のビジネスでは迅速なデータ分析が求められる。データを分析する際に課題になるのは「個人情報の取り扱い」だ。NTTドコモはこの問題をどう解決したのか。
変化が激しい現代のビジネス環境では、データに基づく迅速な意思決定が欠かせない。企業が扱うデータの中には、個人情報など機密性の高い情報が含まれる。その取り扱いには慎重さが求められるが、そのせいでデータ分析のスピードや精度が落ちてしまうことがある。
同様の課題に直面していたのが、NTTドコモだ。BtoBからBtoCまで幅広くサービスを提供する同社は、個人情報を含むデータの分析をより効率的かつ安全に進めたいと考えていた。同社が導入した「データ分析を効率化するツール」とは何か。導入成果と併せて紹介する。
NTTドコモは「個人情報を含むデータ」の分析方法をどう変えた?
NTTドコモはNTTグループ各社と共に、「dカード」「d払い」といった決済事業から「dtv」「Disney+(ディズニープラス)」などのエンタメ事業まで、多岐にわたるサービスを提供している。
これらのサービスに共通する重要なシステムとして、顧客との対話を支援するナレッジシステムがある。このシステムには、顧客向けFAQ(よくある質問とその答え)やチャットbotなどが含まれる。
このナレッジシステムの開発と運用を担うのが、NTTドコモの情報システム部だ。情報システム部は各ナレッジシステムからデータを取得し、顧客のナレッジシステムに対する満足度や、問題を解決できた割合について、可視化と分析を実施する部署に共有する役割を担っている。
「日々新しいサービスが登場する中で、なるべく最新のデータを分析し、ナレッジシステムの改善策を早めに検討することが重要です」。こう話すのは、分析業務効率化プロジェクトのリーダーを務めた西本竹靖氏だ。
ただ、2021年8月以前はナレッジシステムの改善に向けたPDCAサイクルは回っていない状態だったという。原因は、分析用データの準備に掛かる負荷だ。特に、個人情報を含む機密データの取り扱いが大きな課題だった。
例えば、チャットbotの質問欄やFAQの自由入力欄には、まれに氏名や住所などの個人情報が記載されることがある。NTTドコモは社内規定で、静脈認証が必要なセキュリティエリア外で機密データを扱うことを禁止している。在宅勤務制度はあるものの、分析業務などで機密データを扱う担当者の場合、その業務がたとえ1時間程度であっても出社しなければならない。テレワークで分析をしたい場合は、事前にデータを手作業でマスキングする必要があり、やはり出社が必要になる状況だった。
新型コロナウイルス感染症(COVID-19)のパンデミック(世界的大流行)で在宅勤務の需要も高まっていたこともあり、NTTドコモは2021年8月頃、自動マスキングツールの選定を開始した。
NTTドコモが選んだツール、その決め手は?
マスキングツールの選定に当たり、NTTドコモは以下3つの要件を定めた。
- フリーテキスト(自由形式で記述されたテキストデータ)をマスキングできる
- 個人情報を含む機密データを識別できる
- データベース格納前にマスキングし、マスキング前のデータはどこにも残さない
同社によると、選定当時、上記の要件を満たす製品は市場で2つしか見つからなかったという。NTTドコモが選んだのは、インサイトテクノロジーのデータ匿名化ツール「Insight Masking」だった。Insight Maskingは、上記3つの要件を満たす他、オンメモリ(注1)でのマスキング処理が可能という特徴がある。
※注1:データ全体をメモリで保持する仕組み。データがストレージに書き込まれることがないため、データ漏えいのリスクを軽減できる。
決め手となったのはコストとサポートだ。自社開発や他製品と比較してコストを低く抑えられる点と、インサイトテクノロジーのサポートが社内で好評だった点を、NTTドコモは重視した。プロジェクトの実務者である大塚彩乃氏は、「マスキングツールについて、Insight Maskingだけでなく、市場に関する全体的な動向なども親身に教えていただきました」とコメントする。
Insight Maskingの構成と仕組み
Insight Maskingは、ナレッジシステムに入力されたデータを「マスキングサーバ」に渡す。マスキングサーバは、「ルール処理エンジン」と人工知能(AI)技術を用いて、マスキング箇所を検出する。
クレジットカード番号など、型が判別しやすい部分はルール処理エンジンで検出し、氏名や住所など、文脈を理解しないと判別できない箇所は、AI技術で検出する。マスキングしたくない項目はホワイトリストを設定し、管理サーバで保持する。管理サーバの設定は即時反映が可能だ。
マスキング箇所を特定した後は、事前に設定した項目やルールに沿って「マスキング処理エンジン」でマスキングする。細かい指定にも対処可能で、例えば住所の項目について「市区町村は残して、番地以降は削除」することも可能だ。マスキングした部分は見た目で識別できるようになっている。
マスキング後のデータは一度ナレッジシステム側に返した後、データベースに保存する。NTTドコモの場合、リレーショナルデータベース管理システム(RDBMS)である「MySQL」に格納しているが、「Oracle Database」「Microsoft SQL Server」などにも格納可能だ。データベースに格納したデータは分析ツールに引き渡し、ナレッジシステムの改善に役立てる。
当初は諦めかけた――検証で見えた2つの課題
リアルタイムマスキングに向けたNTTドコモの検証では、主に2つの課題が見つかったという。
1つ目が、求められるマスキング精度の高さだ。完全に在宅勤務で分析業務を回すには、マスキング漏れを100%防ぐ必要がある。プロジェクトの調整役である石山省吾氏は「当初はマスキング精度が100%を下回ることを容認する、つまりフルリモート(出社せずにテレワークのみで働く勤務形態)を諦めることも視野に入れていました」と話す。
2つ目が、需要に見合ったサーバのスペックと台数の見極めだ。リクエスト数(秒間アクセス数)や入力文字数とサーバの性能が合わない場合、システムに遅延が発生してしまう可能性がある。
1つ目の精度の課題については、インサイトテクノロジーと製品のチューニングを実施した。まず実施したのは社内ルールに基づいた精度の評価軸の策定だ。マスキング項目やルールの優先順位付けをすることで、クリアすべき精度条件を明確化した。
次はモデルのチューニングだ。作業自体はインサイトテクノロジーが実施し、NTTドコモはナレッジシステムに入力され得る全パターンを洗い出した。NGパターンについては再学習を実施し、1日単位で評価と改善を繰り返してモデルの精度を上げていった。1つの項目の精度を上げると、別の項目が劣化するなどの課題もあったが、半年ほどの調整期間を経て、NTTドコモが定める基準内でのマスキング漏れを0%にした。
2つ目のサーバ台数の課題については、秒間リクエスト数と入力文字数を基に、求められるマスキング性能を計測し、適切なサーバ台数を算出、追加した。
ナレッジシステム側にも調整を入れた。ナレッジシステム全体の処理性能に影響を与えないように、ナレッジシステムの自由入力欄への入力可能文字数を制限した他、タイムアウト値を設定して、一定時間内にマスキング済みのデータを返せない場合はエラーを返すようにした。
本番稼働で「驚きの成果」と気になる課題
2022年10月、NTTドコモはInsight Maskingを本番稼働させた。一部のサービスについては1、2カ月ほど人間によるダブルチェック期間を設けたが、その期間中もそれ以降も、マスキング漏れは発生していないという。
Insight Maskingの導入によって、分析業務担当者もフルリモートで働けるようになった。それに伴い、分析業務にかかる負担は大幅に軽減。「PDCAサイクルを回せるようになった結果、FAQサイトの解決率の大幅な向上にもつながりました」と大塚氏は話す。
一方で課題も見えた。NTTドコモは、Insight Maskingのチューニングに当たり、マスキング漏れを最優先で回避することを重視した。その結果、マスキングしなくてよい項目までマスキングしてしまう「オーバーマスキング」が発生した。オーバーマスキングの対象になった項目はホワイトリストに追加して改善しているという。
「現時点でチューニングはインサイトテクノロジーに一任しているが、自社に知見を蓄えるという意味では、ユーザー企業側もチューニングに参加できる仕組みがほしいと考えています」。西本氏は今後の要望についてそう語る。
将来的には「音声データのマスキング」も
NTTドコモは今後、コールセンターで収集する音声の分析にInsight Maskingを活用することを検討している。NTTドコモのコールセンターは年間約4000万件の電話問い合わせを受けており、そこで収集した音声データを分析することで、サービスの改善や業務の支援に役立てる計画だ。
現時点での課題が、音声データのマスキングだ。テキストと違い、会話では流れで言葉の前後関係が頻繁に入れ替わる。音声をそのままテキスト変換したデータをマスキングツールにわたしても、文脈を適切に理解できず、精度の高いマスキングは難しいという。「前後の文脈が曖昧になってしまってもマスキングできるのかどうか、注目しているポイントです」と西本氏はコメントする。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
新着ホワイトペーパー PR
-
事例
[株式会社マクニカ] アイカ工業に学ぶ脆弱性対策 情シスが把握できずにいたアセットも正確に把握 -
製品資料
[株式会社マクニカ] 「脆弱性総まとめ」解説 被害事例から考える必須の対策ポイント -
製品資料
[Splunk Services Japan合同会社] サイバー脅威「トップ50」完全解説ガイド、新たな攻撃手法に対抗するには -
製品資料
[株式会社うるる] 「入札市場」完全ガイドブック:メリットから資格取得のポイントまで -
市場調査・トレンド
[株式会社うるる] はじめての「自治体/官公庁入札」 必要な知識がすぐに学べる入門ガイド
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
2
Oracle巨大ITプロジェクトはなぜつまずいたのか 8年で導入1割、追加で170億ドル
-
3
Microsoft製品でここまで自動化できる 情シスがやめられる手作業10選
-
4
「VMware離れ」は本当か 3000社がVCF 9にかじを切った現実的な理由
-
5
「Microsoft 365」が乗っ取られる 跡形もなくMFAを破る手口
-
6
AI全部入り「Microsoft 365 E7」に企業が二の足を踏む訳 移行意向はわずか4%
-
7
ISMSの“コンサル丸投げ”が招く数千万円の無駄 NTTドコモビジネスの脱出劇
-
8
Netflixのバックエンドは「ほぼJava」 3000超のアプリを支える開発基盤の裏側
-
9
「IoT通信環境の構築・運用」に関するアンケート
-
10
「技術屋」で終わらないために 情シスが今取るべき認定資格5選
ホワイトペーパーランキング PR
-
1
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
2
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
-
3
5回聞くだけじゃ足りない? トヨタ式「なぜなぜ分析」の正しい実践方法
-
4
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
5
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
6
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
7
PostgreSQLの「機能」「性能」「運用」「拡張性」に関する悩みの解消法
-
8
5分で分かる「セキュア大容量ファイル転送サービス」の機能とメリット
-
9
Macの安全神話は崩壊? 最新の脅威動向から見えた攻撃のトレンドと有効な対策
-
10
情報セキュリティ対策早分かりガイド:25の自社診断で弱点と解決策を理解
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー