AI-readyなデータ基盤の現実解
生データをAIに渡すな デジタル庁が明かすMCP×意味定義の実践知
AIに生データを渡すだけでは誤集計は防げない。デジタル庁が約7.5万件のデータで検証した、MCPと意味定義層でLLMの誤読を抑え込む「AI-ready」な設計思想と実装手法を解剖する。
社内データを生成AIに渡して分析させようとしたものの、計算ミスや項目の取り違えが多発し、結局人間がExcelで検算し直す羽目になった経験はないだろうか。デジタル庁は2026年8月13日、国の行政手続などについての調査データ約7万5000件を対象に、対話形式の自然言語で分析できる検証用実装をGitHubで公開した。
AIに生データを直接渡さず、LLMには検索条件の指定のみを担わせて計算を外部サーバ側で処理する構成を採った。以下では、データの誤読や不適切な集計を抑え込むための意味定義層と品質管理の仕組みを解剖する。
生データを渡さずサーバ側で集計を実行
今回の検証で対象としたのは、デジタル庁が公表する国の法令などに基づく行政手続などのオンライン化状況などをまとめた調査データ(38列、約7万5000件)だ。事業者が直面する手続の電子化状況や、引越し・結婚・法人設立といったライフイベント横断の手続件数を自然言語で検索・集計できる。
最大の特徴は、生データをLLMに直接読み込ませるのではなく、外部連携の標準規格である「MCP(Model Context Protocol)」を採用した点にある。LLMの役割を検索や集計の条件指定にとどめ、算術処理はMCPサーバ側で完結させるアーキテクチャを採用した。これにより、LLM特有の計算ミスやコード値の誤用を防いでいる。
データの格納形式にはCSVではなく列指向の圧縮バイナリ形式である「Apache Parquet」を採用。約7万5000行、39列の調査データが約3MBに圧縮される。Parquetファイルの末尾に含まれるメタデータのみをサーバ起動時に読み込み、実データはクエリ実行時に初めてメモリへロードする遅延ロードによって省メモリ化を図っている。
国際標準SDMXを参考にした意味定義と品質把握
生データをMCP経由でAIに提供するだけでは、欠損値の扱いや指標の解釈ミスを防ぎきれない。そこで同実装では、統計データの国際標準規格「SDMX」のデータ構造定義(DSD)の考え方を参考に、独自形式の設定ファイル「dataset.yaml」を用意した。
この設定ファイルでは、分析の軸となる分類項目(dim)、数値項目(measure)、サーバ側で算出する指標(computed_measures)を定義している。例えば「オンライン手続件数」の欠損値(null)は「0件」ではなく「件数不明」を意味するといった解釈上の注意(notes)を付与し、AIが誤った推測で数値を引用しないよう制御している。
データの探索から分析までは、役割を分けた4つのMCPツールで実行する。データセットの存在を確認する「list_datasets」と構造を把握する「inspect_dataset」の探索層ツールを経て、実データの取得を行う「query_records」および「summarize_records」を呼び出す。inspect_datasetは設定ファイルの定義に加え、実データから充填率や数値統計を動的に算出してAIに返す仕様とした。
ユーザーインタフェースには、チャットUI内にグラフや表を直接表示できる拡張仕様「MCP Apps」を試作した。集計軸の数に応じて、円グラフ、棒グラフ、ヒートマップ、ツリーマップなどを自動で切り替えて描画できる。
型揺れや漢字の誤読を吸収する対話向け設計
LLMがツールを呼び出す際に発生する入力の揺れでも、サーバ側で多層的な保護策を講じた。
LLMがツール引数を辞書形式で送るかJSON文字列で送るかが一定しない問題では、複数の入力形式を正規化して受け入れる処理を実装した。また、LLMが似た漢字を混同して出力する現象では、完全一致、Unicode NFKC正規化、ライブラリによる近似一致の3段階で項目名を照合する。近似一致はフィールド名という閉じた語彙(ごい)に限定し、誤補正を防ぐガードを設けた。
さらに、ツール応答を辞書の配列形式から列指向形式へ変換することで、キー名の繰り返しを排除し、消費トークン数の削減も図っている。
同実装はGitHubのリポジトリ「administrative-procedures-mcp」で公開されており、Python 3.10以上の環境で検証できる。また、ブラウザの内蔵AIを利用し、APIキーなしでローカル環境のみで動作を確認できるプレビュー機能も備えている。
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget ニュースプラス
国内のIT業界ニュースを迅速に報道します。企業動向から導入事例、市場トレンドまで幅広く取り上げ、実務に直結する情報をタイムリーに提供する連載です。
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社kickflow] 2社の事例に学ぶワークフロー改革:属人化解消や年数万件の申請書類削減のコツ -
製品資料
[NTTPCコミュニケーションズ株式会社] 「回線速度不足」だけが原因ではない? Web会議の遅延を解決する方法とは -
製品資料
[東京エレクトロン デバイス株式会社] 工場の可用性向上に重要な「7つの領域」と対策 OTセキュリティ強化の基礎知識 -
製品資料
[リコージャパン株式会社] 問い合わせ対応で本来の業務が進まない、総務や情シスの負担をどう減らす? -
製品資料
[リコージャパン株式会社] 自社データから高精度な回答を生成、簡単に生成AIチャットボットを構築する方法
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
全社標準Copilotに絶望? MS Copilotで問い合わせ6割減できた企業は何が違った
-
2
ITエンジニア1265人調査 生成AIを使い込むほど「人の確認」が重い理由
-
3
Microsoft製品でここまで自動化できる 情シスがやめられる手作業10選
-
4
脱VMwareの前提が崩れる BroadcomのVDDK公開停止で確認すべき点
-
5
「Copilot」はなぜ放置される? “議事録要約止まり”を脱する処方箋
-
6
「Microsoft一択」で本当にいいのか 知らぬ間にライセンス費用が膨らむ真相
-
7
APIキー奪取から3時間でクラウド掌握 Anthropicが暴いた「バイブハッキング」の現実的な防御策
-
8
「Wi-Fi 7」は何がすごい? Wi-Fi 5、Wi-Fi 6からの抜本的な進化とは
-
9
全社標準「Copilot」にダメ出し? 現場の8割が不満を抱く“致命的な欠点”
-
10
【漫画付き】"RAG導入失敗3例"と処方箋 「入れても使われない」を終わらせる
ホワイトペーパーランキング PR
-
1
5回聞くだけじゃ足りない? トヨタ式「なぜなぜ分析」の正しい実践方法
-
2
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
3
生成AIで文書活用を進めるには? 効率化と安全性をどう両立する
-
4
Windows PCとMacの選択制で生産性向上 LINEヤフーが実践する運用管理方法とは
-
5
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
6
国税庁の次世代基幹システム「KSK2」稼働開始に向けて、対応すべき変更点とは?
-
7
「スクラム」と「カンバン」の違いとは? アジャイル型開発手法を徹底比較
-
8
AI時代に成功するための「ナレッジマネジメント」ベストプラクティス
-
9
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
10
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー