ボトルネックは「評価データ」
AIエージェント開発を「20倍高速化」 中南米の銀行が本番データを待たない理由
デジタル銀行のNubankは、AIエージェントの出荷、改善速度を20倍に高める「SimulationMaxxing」の手法を紹介している。従来数週間かかっていたA/Bテストや評価サイクルを短縮、顧客満足度(TNPS)を向上させた。
AIエージェントを改善するために、プロンプトや利用するLLM、ツールを変更した。だが、その変更が本当に有効なのかどうかを確認するには、本番環境でA/Bテストを実施し、利用者から十分なフィードバックが集まるまで待たなければならない――。こうした評価作業が、AIエージェント開発の速度を落とす要因になっている。
南米を中心にデジタル銀行を展開するNubankは、この問題を「シミュレーション」で解決しようとしている。
Nubankのプリンシパル機械学習エンジニア、アマン・グプタ氏と、AIエージェント評価基盤を手掛けるSnowglobeのCEO、シュレヤ・ラジパル氏によると、この手法によって、従来は数週間かかることがあったAIエージェントの評価、改善サイクルを、1日未満、場合によっては数時間や数分まで短縮できるようになったという。具体的に何をしたのか。
従来のエージェント評価におけるボトルネックを改善
Nubankはブラジル、メキシコ、コロンビアなどで事業を展開するデジタル銀行だ。顧客サポートではAIエージェントと人間の担当者を組み合わせている。定型的な問い合わせの多くをAIエージェントがエンドツーエンドで処理し、複雑な案件や例外的なケースを人間が担当している。
こうしたAIエージェントの品質を高める上で欠かせないのが「評価」(Eval)だ。ラジパル氏によると、評価には大きく分けて「何を基準に評価するかを決める指標」と「その指標を適用するデータ」の2つがある。
指標については、LLMを判定役として利用する「LLM-as-a-Judge」などを使い、人間による評価と照合しながら改善する方法が確立されつつある。一方で、依然として大きなボトルネックになっているのが評価用データの準備だ。
従来型の機械学習や単発の質問応答システムとは異なり、AIエージェントは複数回の会話をしながら外部ツールを呼び出す。1件の評価データを作るだけでも、会話の流れだけでなく、途中で呼び出すツールや、その時点でのシステム状態まで整合させる必要がある。
評価データを人手で作れば、担当者がこうした状態遷移や会話の流れを1つ1つ設計しなければならず、多大な時間がかかる。逆に、本番環境から実際の対話履歴を取得すればデータ作成の手間は抑えられるが、新しいAIエージェントを試すたびに実際の顧客を対象に検証することになる。複数の変更案を並行して試すことも難しい。
グプタ氏によると、AIエージェントのプロンプトやツール、LLMなどを変更する作業自体は、短ければ数時間で済む。だが、人手で整備したデータによるオフライン評価には数日かかる場合がある。さらに本番環境でA/Bテストを実施すると、顧客からのフィードバックは少なく、ばらつきもあるため、改善したのかどうかを統計的に判断できるまで長期間を要することがある。
仮想ユーザーを作り、AIエージェントと会話させる
そこでNubankが取り入れたのが、SnowglobeによるAIエージェントのシミュレーションだ。
シミュレーションではまず、評価したい実際のAIエージェントをSnowglobeのSDKと接続する。その上で、AIエージェントが利用する外部ツールのうち、評価環境で再現する必要のあるものを模擬する。
次に、「誰が、どのような目的でAIエージェントを利用するのか」を表すペルソナやユースケースを用意する。それらを基に仮想ユーザーを生成し、実際のAIエージェントと会話させる仕組みだ。
さらに「短い一文で話す」といった会話スタイルもペルソナに設定できる。これによって、単に質問と回答を生成するのではなく、実際の利用者とのやりとりに近い、複数ターンにまたがる会話を再現する。
Snowglobeはこうした仮想ユーザーを多数生成し、実際のAIエージェントとの間で数千件規模の会話を実行できる。そこで得た会話履歴に評価指標を適用すれば、「どのターンでどのような問題が発生したか」を調べることができる。
つまり開発チームは、本番環境から新しい会話データが集まるまで待たなくても、必要な評価データをその場で作り出せるようになるのだ。
シミュレーションだけを信用してはいけない
ただし、仮想ユーザーとの会話で高い評価を得たAIエージェントが、実際の顧客相手でも同じように機能するとは限らない。
Nubankが重視するのが、シミュレーションと本番環境との間にある差、いわゆる「Sim-to-Real Gap」を確認することだ。
同社は、シミュレーションデータと実際の本番データに同じ評価指標を適用し、結果にどの程度相関があるのかを確認した。さらに専門家による人手評価も実施した。その結果、専門家による評価の80%で、シミュレーションによって実用的な評価データを得られることが確認できたという。この方法は既存のAIエージェントだけでなく、ゼロから開発する新しいAIエージェントにも利用できたとしている。
ラジパル氏らは、シミュレーションによる高速化の効果を得るには、このSim-to-Real Gapを埋めることが重要だと強調する。オフライン評価、本番環境でのオンライン評価、人間によるレビューなどを組み合わせ、シミュレーション結果をどこまで信頼できるのかを継続的に検証する必要がある。
10回のA/Bテストを「まずシミュレーション」に
シミュレーションの導入によって、NubankはAIエージェントを改善する方法そのものも変えた。
同社では、AIエージェントを本番環境に投入して利用状況を観察し、その結果から評価指標を整備する。そこに本番データだけでなくシミュレーションデータを投入し、得られた評価結果を基にプロンプトやツール、LLMといったAIエージェントの構成を改善する。改善を確認した後で本番環境に投入し、再び結果を観察するというループを回している。
従来であれば、例えば四半期に10種類の改善案を検証するには、それぞれをA/Bテストにかける必要があった。シミュレーションを使えば、まず多数の案を仮想環境で評価し、その中から有望なものだけを本番環境のA/Bテストに進められる。
グプタ氏は、「最初の5、6回のA/Bテストを省略するようなものだ」と説明する。開発チームはシミュレーションの結果に納得するまで本番環境には投入しないという。
シミュレーションは不具合の発見にも役立った。Nubankは、本番環境に入れば性能低下につながる可能性があったリグレッションをシミュレーション段階で発見したほか、別のAIエージェントでは、利用者が人間の担当者に頼らず問題を解決できる割合を下げる恐れのある問題も検出したという。
成果として、あるAIエージェントでは顧客満足度を表すTNPS(Transactional Net Promoter Score)が2倍になった。また別のケースでは、セルフサービス率(SSR)を4%改善したという。
「どのLLMを使うか」も大量に試せる
Nubankはシミュレーションを、AIエージェントそのものの改善だけでなく、LLMの選定にも利用している。
例えば複数のオープンソースLLMをAIエージェントに組み込み、それぞれについて同じシミュレーションと評価を実施すれば、どのモデルが自社の用途に適しているのかを比較できる。
従来であれば、それぞれを本番環境で評価する必要があったが、シミュレーションによって多数のモデルを短期間で絞り込める。Gupta氏によれば、この方法で「数週間分」の作業を削減できたという。
AIエージェント開発では、プロンプトを書き換えたり、LLMを交換したりする作業そのものより、「変更によって本当に良くなったのか」を確かめる工程がボトルネックになり得る。
Nubankの取り組みが示すのは、本番データを待つのではなく、評価に必要なデータそのものをシミュレーションで生成するという考え方だ。
ただし、シミュレーションは本番評価の代替ではない。シミュレーションと実環境の結果を照合し、その差を把握した上で、有望な変更だけを本番環境に進める。AIエージェントの改善を高速化するには、「どのLLMを使うか」「どのようなプロンプトを書くか」だけでなく、「評価データをいかに素早く、信頼できる形で用意するか」が重要になりそうだ。
本稿は、AI Engineerが2026年7月30日に公開した動画「SimulationMaxxing:How we ship agents 20× faster-Aman Gupta(Nubank)+Shreya Rajpal(Snowglobe)」を基に作成しました。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
新着ホワイトペーパー PR
-
製品資料
“攻撃者優位”なサイバーセキュリティ、全ての「穴」をふさぐ方法とは? -
製品資料
実際に悪用される脆弱性は4%前後 優先的に対処すべき脆弱性を把握するには? -
製品資料
HubSpotの機能を拡張する法人データ活用法 -
製品資料
面倒で非生産的な「名寄せ」作業 高精度&高効率に実施するには? -
製品資料
名刺管理には「その先」がある 成果のでない営業活動から脱却する秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
ISMSの“コンサル丸投げ”が招く数千万円の無駄 NTTドコモビジネスの脱出劇
-
2
「VMware離れ」は本当か 3000社がVCF 9にかじを切った現実的な理由
-
3
「Microsoft 365」が乗っ取られる 跡形もなくMFAを破る手口
-
4
マンガで解説:KSK2稼働で何が変わる? 税務調査の高度化に備えるデータ管理
-
5
Netflixのバックエンドは「ほぼJava」 3000超のアプリを支える開発基盤の裏側
-
6
なぜ人はいるのにDXが進まない? ライオンも直面した“老害”レガシーシステム
-
7
レガシーコードを捨てJavaで勘定系を再定義 ソニー銀行、フルクラウド化の全容
-
8
AWS障害でも補償ゼロの衝撃 サイバー保険で情シスが見落とす「細則の壁」
-
9
生成AIの7割が「別画面・コピペ運用」 “導入”は進んでも定着せず
-
10
「0.3秒のスピード顔認証」の入退室管理が社員に好評 事例に学ぶオフィス改革
ホワイトペーパーランキング PR
-
1
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
2
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
-
3
財務・会計はAI活用でどう変わる? 調査で見えた変革の道筋
-
4
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
5
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
6
「結局、一部の人しか使わない」 AI活用が業務に定着しない根本的な理由
-
7
コスト分析で見る「デバイス復旧」の代償 損失額から導きだされた投資戦略とは
-
8
Macの安全神話は崩壊? 最新の脅威動向から見えた攻撃のトレンドと有効な対策
-
9
ゼロトラストにおける「IDaaSの課題」と補完すべき重要機能とは?
-
10
「NAS」「SAN」「DAS」は何が違う? いまさら聞けないストレージの基礎
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー