AI-readyなデータ基盤の現実解
生データをAIに渡すな デジタル庁が明かすMCP×意味定義の実践知
AIに生データを渡すだけでは誤集計は防げない。デジタル庁が約7.5万件のデータで検証した、MCPと意味定義層でLLMの誤読を抑え込む「AI-ready」な設計思想と実装手法を解剖する。
社内データを生成AIに渡して分析させようとしたものの、計算ミスや項目の取り違えが多発し、結局人間がExcelで検算し直す羽目になった経験はないだろうか。デジタル庁は2026年8月13日、国の行政手続などについての調査データ約7万5000件を対象に、対話形式の自然言語で分析できる検証用実装をGitHubで公開した。
AIに生データを直接渡さず、LLMには検索条件の指定のみを担わせて計算を外部サーバ側で処理する構成を採った。以下では、データの誤読や不適切な集計を抑え込むための意味定義層と品質管理の仕組みを解剖する。
生データを渡さずサーバ側で集計を実行
今回の検証で対象としたのは、デジタル庁が公表する国の法令などに基づく行政手続などのオンライン化状況などをまとめた調査データ(38列、約7万5000件)だ。事業者が直面する手続の電子化状況や、引越し・結婚・法人設立といったライフイベント横断の手続件数を自然言語で検索・集計できる。
最大の特徴は、生データをLLMに直接読み込ませるのではなく、外部連携の標準規格である「MCP(Model Context Protocol)」を採用した点にある。LLMの役割を検索や集計の条件指定にとどめ、算術処理はMCPサーバ側で完結させるアーキテクチャを採用した。これにより、LLM特有の計算ミスやコード値の誤用を防いでいる。
データの格納形式にはCSVではなく列指向の圧縮バイナリ形式である「Apache Parquet」を採用。約7万5000行、39列の調査データが約3MBに圧縮される。Parquetファイルの末尾に含まれるメタデータのみをサーバ起動時に読み込み、実データはクエリ実行時に初めてメモリへロードする遅延ロードによって省メモリ化を図っている。
国際標準SDMXを参考にした意味定義と品質把握
生データをMCP経由でAIに提供するだけでは、欠損値の扱いや指標の解釈ミスを防ぎきれない。そこで同実装では、統計データの国際標準規格「SDMX」のデータ構造定義(DSD)の考え方を参考に、独自形式の設定ファイル「dataset.yaml」を用意した。
この設定ファイルでは、分析の軸となる分類項目(dim)、数値項目(measure)、サーバ側で算出する指標(computed_measures)を定義している。例えば「オンライン手続件数」の欠損値(null)は「0件」ではなく「件数不明」を意味するといった解釈上の注意(notes)を付与し、AIが誤った推測で数値を引用しないよう制御している。
データの探索から分析までは、役割を分けた4つのMCPツールで実行する。データセットの存在を確認する「list_datasets」と構造を把握する「inspect_dataset」の探索層ツールを経て、実データの取得を行う「query_records」および「summarize_records」を呼び出す。inspect_datasetは設定ファイルの定義に加え、実データから充填率や数値統計を動的に算出してAIに返す仕様とした。
ユーザーインタフェースには、チャットUI内にグラフや表を直接表示できる拡張仕様「MCP Apps」を試作した。集計軸の数に応じて、円グラフ、棒グラフ、ヒートマップ、ツリーマップなどを自動で切り替えて描画できる。
型揺れや漢字の誤読を吸収する対話向け設計
LLMがツールを呼び出す際に発生する入力の揺れでも、サーバ側で多層的な保護策を講じた。
LLMがツール引数を辞書形式で送るかJSON文字列で送るかが一定しない問題では、複数の入力形式を正規化して受け入れる処理を実装した。また、LLMが似た漢字を混同して出力する現象では、完全一致、Unicode NFKC正規化、ライブラリによる近似一致の3段階で項目名を照合する。近似一致はフィールド名という閉じた語彙(ごい)に限定し、誤補正を防ぐガードを設けた。
さらに、ツール応答を辞書の配列形式から列指向形式へ変換することで、キー名の繰り返しを排除し、消費トークン数の削減も図っている。
同実装はGitHubのリポジトリ「administrative-procedures-mcp」で公開されており、Python 3.10以上の環境で検証できる。また、ブラウザの内蔵AIを利用し、APIキーなしでローカル環境のみで動作を確認できるプレビュー機能も備えている。
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget ニュースプラス
国内のIT業界ニュースを迅速に報道します。企業動向から導入事例、市場トレンドまで幅広く取り上げ、実務に直結する情報をタイムリーに提供する連載です。
関連記事
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
急増する「AIはこう言ってる」マン 判断を狂わせる「AI忖度」を防ぐには?
-
2
取手市がVDIと決別した理由 更改費用「4倍超」を約1.7倍に圧縮
-
3
「データストレージの活用方法」に関するアンケート
-
4
自宅のWi-Fiが「遅い」「途切れる」本当の原因は? Dellが推奨する鉄則
-
5
本当に安いPCで十分か? “すぐ重くなる”を防ぐノートPC選びの絶対条件
-
6
Claudeの不可視透かしに批判殺到 著作権消失や誤判定に潜む企業リスク
-
7
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
8
221人調査で分かった「情シス最大のストレス」は?
-
9
LLMの「過学習」、正しく説明している文章はどれ?
-
10
レガシー基幹システムをSAPに統合 山善が突き止めた「標準化と個別最適」の境界線
ホワイトペーパーランキング PR
-
1
年収2000万「クラウドセキュリティのプロ」になれる資格とは
-
2
セキュリティソフトをすり抜ける標的型攻撃メール、不審メールの見破り方とは?
-
3
Windows Updateの通信集中で回線が逼迫、ネットワーク刷新事例に学ぶ解決策
-
4
財務を戦略的組織へ進化させるAI活用術、4つの主要な障壁と解消方法
-
5
「NAS」「SAN」「DAS」は何が違う? いまさら聞けないストレージの基礎
-
6
“あのファイル転送”で暗躍するノーウェアランサム
-
7
標的型攻撃メールを見破るには? サンプル文面を例に傾向を解説
-
8
商用利用の安全性を確保し大量のコンテンツを高速で生成する、AI活用の秘訣
-
9
マンガで解説、1日で生成AI環境を構築できるワークショップの中身とは?
-
10
Dark AIが台頭する時代の新発想、「より高度なAIで対抗する」具体的方法とは?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー