性能とコストにギャップ
情シスを惑わす「特化型AI」のわな 汎用LLMが医療専門AIを精度・信頼性で圧倒
「専門特化型AIこそが正解」という常識が覆されつつある。最新の研究で、GPTやGeminiなどの汎用AIが、巨額投資を受ける医療特化型AIを複数のベンチマークで圧倒した。不透明な「専門AI」のブラックボックス化に警鐘を鳴らし、情シスが決裁前に知るべき、性能とコストのギャップとは?
2022年後半に大規模言語モデル(LLM)が登場して以来、開発者はヘルスケア分野への活用を急ぎ、医療特化型の臨床AIツールを生み出してきた。しかし最新の研究により、一部の医療ベンチマークで汎用AIが特化型臨床AIを上回る性能を示すことが明らかになった。
『Nature Medicine』誌に掲載されたこの研究では、LLMベースの特化型臨床AIツールである「OpenEvidence」と「UpToDate Expert AI」を、汎用LLMである「GPT-5.2」「Gemini 3.1 Pro」「Claude Opus 4.6」の3つと比較検証した。この結果は、LLMを医療ユースケース専用に設計するという業界の注力方針に疑問を投げかけるものだ。
特化型臨床AIへの投資は拡大している。2026年初頭、OpenEvidenceはシリーズDの資金調達で2億5000万ドルを調達し、評価額は120億ドルにまで急騰した。同社はその後、音声による遠隔診療やAIコーディング、処方、優先順位付け機能などをリリースし、急速に事業を拡大している。
特化型臨床AIツールは、汎用AIよりも優れた臨床的性能を提供すると主張している。だが、そのアーキテクチャやベースモデル、学習パイプラインは公開されていない。そのため、医療提供者は独立した証拠なしに価値や安全性を評価せざるを得ない。汎用ツールと比較して、臨床AIの結果の妥当性を検証することは困難な状況にある。
こうした背景から、ニューヨーク大学ランゴン医療センターとテキサス大学オースティン校の研究チームは、3つの医療ベンチマークを用いてツールの評価を実施した。
評価には3つのアセスメントが含まれる。1つ目は、医学知識を評価する米国医師免許試験(USMLE)形式の「MedQA」問題500問。2つ目は、専門医との一致度を評価する「HealthBench」500項目。3つ目は、医師が行ったLLMへのクエリから抽出した100件のリアルな臨床クエリ(RCQ)である。RCQでは、12人の臨床医がランダム化・盲検化されたレビューを実施した。
モデルの性能には差があり、汎用AIがトップに
「エンタープライズAI」に関連する編集部お薦め記事
研究の結果、3つ全ての評価で、汎用的な最先端AIツールが特化型臨床AIツールを上回った。
MedQAの評価では、Geminiが97.4%と最高の精度を達成し、GPTが94.2%、Claudeが90.2%と続いた。一方、OpenEvidenceの精度は89.6%、UpToDateは88.4%にとどまった。
HealthBenchの評価でも同様の結果となり、100点満点中GPTが88点で最高スコアを獲得。Geminiは79.3点、Claudeは77点だった。特化型臨床AIツールはこれより低く、OpenEvidenceは62.6点、UpToDateは61.3点だった。
RCQのベンチマーク評価では、2つの性能層が浮き彫りになった。汎用ツールで構成される第1層は、平均スコアだけでなく個別の質問の大部分で特化型臨床AIツールを上回った。また研究チームは、臨床医が日常的に接する「Google Search AI Overview」もRCQの評価対象に加えた。特化型臨床AIツールの性能は、Google Search AI Overviewと同程度だった。
研究チームは「臨床AIツールは組織的な正当性を持ち、日常的な使用には安全である可能性が高い。しかし今回の結果は、知識やコミュニケーション、臨床的な整合性の面で最先端モデルより優れているわけではないことを示している」と記している。
ただし、研究チームは医療提供者が汎用AIツールのみを使用すべきだと主張しているわけではない。むしろ、組織内のデータを活用した独自のLLMを開発し、機密性の低いタスクには汎用モデルと併用することを提案している。
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget発 先取りITトレンド
米国TechTargetの豊富な記事の中から、最新技術解説や注目分野の製品比較、海外企業のIT製品導入事例などを厳選してお届けします。
この記事の著者
関連記事
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
「Excel至上主義」の終わらせ方 丸2日の手作業地獄から情シスと現場を救うには
-
2
急増する「AIはこう言ってる」マン 判断を狂わせる「AI忖度」を防ぐには?
-
3
取手市がVDIと決別した理由 更改費用「4倍超」を約1.7倍に圧縮
-
4
221人調査で分かった「情シス最大のストレス」は?
-
5
「データストレージの活用方法」に関するアンケート
-
6
「AI時代の統合基盤・エンタープライズAI管理」に関するアンケート
-
7
自宅のWi-Fiが「遅い」「途切れる」本当の原因は? Dellが推奨する鉄則
-
8
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
9
本当に安いPCで十分か? “すぐ重くなる”を防ぐノートPC選びの絶対条件
-
10
Claudeの不可視透かしに批判殺到 著作権消失や誤判定に潜む企業リスク
ホワイトペーパーランキング PR
-
1
年収2000万「クラウドセキュリティのプロ」になれる資格とは
-
2
セキュリティソフトをすり抜ける標的型攻撃メール、不審メールの見破り方とは?
-
3
Windows Updateの通信集中で回線が逼迫、ネットワーク刷新事例に学ぶ解決策
-
4
財務を戦略的組織へ進化させるAI活用術、4つの主要な障壁と解消方法
-
5
「NAS」「SAN」「DAS」は何が違う? いまさら聞けないストレージの基礎
-
6
“あのファイル転送”で暗躍するノーウェアランサム
-
7
標的型攻撃メールを見破るには? サンプル文面を例に傾向を解説
-
8
商用利用の安全性を確保し大量のコンテンツを高速で生成する、AI活用の秘訣
-
9
マンガで解説、1日で生成AI環境を構築できるワークショップの中身とは?
-
10
Dark AIが台頭する時代の新発想、「より高度なAIで対抗する」具体的方法とは?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー