AI-readyなデータ基盤の現実解
生データをAIに渡すな デジタル庁が明かすMCP×意味定義の実践知
AIに生データを渡すだけでは誤集計は防げない。デジタル庁が約7.5万件のデータで検証した、MCPと意味定義層でLLMの誤読を抑え込む「AI-ready」な設計思想と実装手法を解剖する。
社内データを生成AIに渡して分析させようとしたものの、計算ミスや項目の取り違えが多発し、結局人間がExcelで検算し直す羽目になった経験はないだろうか。デジタル庁は2026年8月13日、国の行政手続などについての調査データ約7万5000件を対象に、対話形式の自然言語で分析できる検証用実装をGitHubで公開した。
AIに生データを直接渡さず、LLMには検索条件の指定のみを担わせて計算を外部サーバ側で処理する構成を採った。以下では、データの誤読や不適切な集計を抑え込むための意味定義層と品質管理の仕組みを解剖する。
生データを渡さずサーバ側で集計を実行
今回の検証で対象としたのは、デジタル庁が公表する国の法令などに基づく行政手続などのオンライン化状況などをまとめた調査データ(38列、約7万5000件)だ。事業者が直面する手続の電子化状況や、引越し・結婚・法人設立といったライフイベント横断の手続件数を自然言語で検索・集計できる。
最大の特徴は、生データをLLMに直接読み込ませるのではなく、外部連携の標準規格である「MCP(Model Context Protocol)」を採用した点にある。LLMの役割を検索や集計の条件指定にとどめ、算術処理はMCPサーバ側で完結させるアーキテクチャを採用した。これにより、LLM特有の計算ミスやコード値の誤用を防いでいる。
データの格納形式にはCSVではなく列指向の圧縮バイナリ形式である「Apache Parquet」を採用。約7万5000行、39列の調査データが約3MBに圧縮される。Parquetファイルの末尾に含まれるメタデータのみをサーバ起動時に読み込み、実データはクエリ実行時に初めてメモリへロードする遅延ロードによって省メモリ化を図っている。
国際標準SDMXを参考にした意味定義と品質把握
生データをMCP経由でAIに提供するだけでは、欠損値の扱いや指標の解釈ミスを防ぎきれない。そこで同実装では、統計データの国際標準規格「SDMX」のデータ構造定義(DSD)の考え方を参考に、独自形式の設定ファイル「dataset.yaml」を用意した。
この設定ファイルでは、分析の軸となる分類項目(dim)、数値項目(measure)、サーバ側で算出する指標(computed_measures)を定義している。例えば「オンライン手続件数」の欠損値(null)は「0件」ではなく「件数不明」を意味するといった解釈上の注意(notes)を付与し、AIが誤った推測で数値を引用しないよう制御している。
データの探索から分析までは、役割を分けた4つのMCPツールで実行する。データセットの存在を確認する「list_datasets」と構造を把握する「inspect_dataset」の探索層ツールを経て、実データの取得を行う「query_records」および「summarize_records」を呼び出す。inspect_datasetは設定ファイルの定義に加え、実データから充填率や数値統計を動的に算出してAIに返す仕様とした。
ユーザーインタフェースには、チャットUI内にグラフや表を直接表示できる拡張仕様「MCP Apps」を試作した。集計軸の数に応じて、円グラフ、棒グラフ、ヒートマップ、ツリーマップなどを自動で切り替えて描画できる。
型揺れや漢字の誤読を吸収する対話向け設計
LLMがツールを呼び出す際に発生する入力の揺れでも、サーバ側で多層的な保護策を講じた。
LLMがツール引数を辞書形式で送るかJSON文字列で送るかが一定しない問題では、複数の入力形式を正規化して受け入れる処理を実装した。また、LLMが似た漢字を混同して出力する現象では、完全一致、Unicode NFKC正規化、ライブラリによる近似一致の3段階で項目名を照合する。近似一致はフィールド名という閉じた語彙(ごい)に限定し、誤補正を防ぐガードを設けた。
さらに、ツール応答を辞書の配列形式から列指向形式へ変換することで、キー名の繰り返しを排除し、消費トークン数の削減も図っている。
同実装はGitHubのリポジトリ「administrative-procedures-mcp」で公開されており、Python 3.10以上の環境で検証できる。また、ブラウザの内蔵AIを利用し、APIキーなしでローカル環境のみで動作を確認できるプレビュー機能も備えている。
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget ニュースプラス
国内のIT業界ニュースを迅速に報道します。企業動向から導入事例、市場トレンドまで幅広く取り上げ、実務に直結する情報をタイムリーに提供する連載です。
関連記事
新着ホワイトペーパー PR
-
製品資料
インシデント発生後に最も重要な「最初の48時間」 どう乗り切る? -
製品資料
急激なデジタル化の裏で増大するデバイスのリスク 東急建設はどう対処した? -
製品資料
「フロンティアAI」実践解説:セキュリティ対応に向けた5つのステップ -
製品資料
WSUS非推奨化でさらに混迷 複雑化するサーバ環境の運用負荷をどう解消する? -
市場調査・トレンド
数百万台規模のデータで判明、企業のIT環境に潜む「見えない課題」とは
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
Microsoft製品でここまで自動化できる 情シスがやめられる手作業10選
-
2
Oracle巨大ITプロジェクトはなぜつまずいたのか 8年で導入1割、追加で170億ドル
-
3
ISMSの“コンサル丸投げ”が招く数千万円の無駄 NTTドコモビジネスの脱出劇
-
4
IBM iのブラックボックス化を打破 資産継承と進化を実現する「IBM Bob」の実力
-
5
「即戦力」は幻想? 中途の3割が消えるAI時代のエンジニア生存戦略
-
6
同じ攻撃で明暗 CISAの侵入テストで見えた「機能するSOC」3つの鉄則
-
7
AIインフラの理想形? 「5層のケーキ」を垂直統合するための近道とは
-
8
ランサムウェア被害額が平均3.5億円に拡大 なぜ企業の復旧は遅れるのか
-
9
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
10
VMware離れを食い止めるか? 今「VCF 9.1」が再評価される理由
ホワイトペーパーランキング PR
-
1
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
2
財務・会計はAI活用でどう変わる? 調査で見えた変革の道筋
-
3
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
-
4
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
5
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
6
「結局、一部の人しか使わない」 AI活用が業務に定着しない根本的な理由
-
7
コスト分析で見る「デバイス復旧」の代償 損失額から導きだされた投資戦略とは
-
8
Macの安全神話は崩壊? 最新の脅威動向から見えた攻撃のトレンドと有効な対策
-
9
ゼロトラストにおける「IDaaSの課題」と補完すべき重要機能とは?
-
10
情報セキュリティ対策早分かりガイド:25の自社診断で弱点と解決策を理解
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー