性能とコストにギャップ
情シスを惑わす「特化型AI」のわな 汎用LLMが医療専門AIを精度・信頼性で圧倒
「専門特化型AIこそが正解」という常識が覆されつつある。最新の研究で、GPTやGeminiなどの汎用AIが、巨額投資を受ける医療特化型AIを複数のベンチマークで圧倒した。不透明な「専門AI」のブラックボックス化に警鐘を鳴らし、情シスが決裁前に知るべき、性能とコストのギャップとは?
2022年後半に大規模言語モデル(LLM)が登場して以来、開発者はヘルスケア分野への活用を急ぎ、医療特化型の臨床AIツールを生み出してきた。しかし最新の研究により、一部の医療ベンチマークで汎用AIが特化型臨床AIを上回る性能を示すことが明らかになった。
『Nature Medicine』誌に掲載されたこの研究では、LLMベースの特化型臨床AIツールである「OpenEvidence」と「UpToDate Expert AI」を、汎用LLMである「GPT-5.2」「Gemini 3.1 Pro」「Claude Opus 4.6」の3つと比較検証した。この結果は、LLMを医療ユースケース専用に設計するという業界の注力方針に疑問を投げかけるものだ。
特化型臨床AIへの投資は拡大している。2026年初頭、OpenEvidenceはシリーズDの資金調達で2億5000万ドルを調達し、評価額は120億ドルにまで急騰した。同社はその後、音声による遠隔診療やAIコーディング、処方、優先順位付け機能などをリリースし、急速に事業を拡大している。
特化型臨床AIツールは、汎用AIよりも優れた臨床的性能を提供すると主張している。だが、そのアーキテクチャやベースモデル、学習パイプラインは公開されていない。そのため、医療提供者は独立した証拠なしに価値や安全性を評価せざるを得ない。汎用ツールと比較して、臨床AIの結果の妥当性を検証することは困難な状況にある。
こうした背景から、ニューヨーク大学ランゴン医療センターとテキサス大学オースティン校の研究チームは、3つの医療ベンチマークを用いてツールの評価を実施した。
評価には3つのアセスメントが含まれる。1つ目は、医学知識を評価する米国医師免許試験(USMLE)形式の「MedQA」問題500問。2つ目は、専門医との一致度を評価する「HealthBench」500項目。3つ目は、医師が行ったLLMへのクエリから抽出した100件のリアルな臨床クエリ(RCQ)である。RCQでは、12人の臨床医がランダム化・盲検化されたレビューを実施した。
モデルの性能には差があり、汎用AIがトップに
「エンタープライズAI」に関連する編集部お薦め記事
研究の結果、3つ全ての評価で、汎用的な最先端AIツールが特化型臨床AIツールを上回った。
MedQAの評価では、Geminiが97.4%と最高の精度を達成し、GPTが94.2%、Claudeが90.2%と続いた。一方、OpenEvidenceの精度は89.6%、UpToDateは88.4%にとどまった。
HealthBenchの評価でも同様の結果となり、100点満点中GPTが88点で最高スコアを獲得。Geminiは79.3点、Claudeは77点だった。特化型臨床AIツールはこれより低く、OpenEvidenceは62.6点、UpToDateは61.3点だった。
RCQのベンチマーク評価では、2つの性能層が浮き彫りになった。汎用ツールで構成される第1層は、平均スコアだけでなく個別の質問の大部分で特化型臨床AIツールを上回った。また研究チームは、臨床医が日常的に接する「Google Search AI Overview」もRCQの評価対象に加えた。特化型臨床AIツールの性能は、Google Search AI Overviewと同程度だった。
研究チームは「臨床AIツールは組織的な正当性を持ち、日常的な使用には安全である可能性が高い。しかし今回の結果は、知識やコミュニケーション、臨床的な整合性の面で最先端モデルより優れているわけではないことを示している」と記している。
ただし、研究チームは医療提供者が汎用AIツールのみを使用すべきだと主張しているわけではない。むしろ、組織内のデータを活用した独自のLLMを開発し、機密性の低いタスクには汎用モデルと併用することを提案している。
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget発 先取りITトレンド
米国TechTargetの豊富な記事の中から、最新技術解説や注目分野の製品比較、海外企業のIT製品導入事例などを厳選してお届けします。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
比較資料
[セコムトラストシステムズ株式会社] 「自社に合うEDR」はどれか分かる? 比較・検討時の見極めポイントを解説 -
製品資料
[アルプス システム インテグレーション株式会社] まだ社内で眠らせたまま? AI活用の糧となる「データ資産」を有効利用するには -
市場調査・トレンド
[AvePoint Japan株式会社] “SCS評価制度”対応の第一歩、自社環境と要求事項とのギャップを把握する方法 -
製品資料
[株式会社BREXA Technology] 情報整理の自動化でインシデントの初動対応を効率化、AIエージェント活用のコツ -
製品レビュー
[ヴィーム・ソフトウェア株式会社] SCS評価制度を導入するだけで十分? 組織の防御力を高める活用方法とは
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
2
Claude Codeでは「エージェントを作るな、スキルを作れ」 Anthropicが示すAI構築術
-
3
「WSUS」終了の時限爆弾 “本命”移行先ツールとMicrosoft提唱の新管理手法
-
4
「企業におけるAIの運用」に関するアンケート
-
5
VMware離れの決め手は“機能”以外だった 情シス109人が選んだ新基準と死角は
-
6
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
7
パッチなしで「今すぐサーバを落とせ」 Kiteworks異例警告の波紋
-
8
なぜAnthropicはClaude Codeで「エージェントを作るな、スキルを作れ」と言うのか
-
9
「企業内サーバ環境の利用実態」に関するアンケート
-
10
「ITインフラとデータ保護・バックアップ対策」に関するアンケート
ホワイトペーパーランキング PR
-
1
「Google Workspace」活用事例34選、先進の生成AIによる組織変革の全貌
-
2
Linuxのスキルを証明する“激推し”の認定資格はこれだ
-
3
バックアップは“取っているから大丈夫”なのか? ランサムウェア時代の備え方
-
4
ネットワーク遅延の原因、「パケットロス」の基礎知識と効果的な解決策
-
5
月1000枚の紙を削減 9年動けなかった組織が、業務改革のその先に得たもの
-
6
「改正物流効率化法対策」徹底解説 総物流費を抑制するサプライチェーン戦略
-
7
Windows PCとMacの選択制で生産性向上 LINEヤフーが実践する運用管理方法とは
-
8
ソフトウェア開発の属人化と手戻りをどう防ぐ? 速さと品質を両立させる方法
-
9
AI活用を停滞させる「2:6:2の壁」を乗り越えるためのポイントとは?
-
10
ドラマで分かる、標的型攻撃メールの被害を受ける企業と回避できる企業の分岐点
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー