LLMベンチマークの全体像を知る【前編】
LLM、どれを使えばいいの? 性能を評価するための「ベンチマーク」とは
自分が使っているLLMの性能はどの程度なのか。そもそもLLMの性能を評価するにはどうすればよいのか。そうした疑問を解消する、LLMの「ベンチマーク」や実施方法を紹介する。
大規模言語モデル(LLM)は、質問への回答、ソースコードの作成、そのテスト方法の提案が可能だ。しかし、LLMが生成する内容が常に信頼できるとは限らない。さまざまなLLMの中から、自組織に最適なものをどう選ぶべきか迷った際に有用なのが、LLMを客観的に評価する「ベンチマーク」だ。LLMのベンチマークは何を調べ、どのように測定するのか。
LLMのベンチマークとは
LLMのベンチマークは、LLMの性能を評価するための標準化された手順や指標だ。LLMに実行させる一連のタスクを提示し、特定の指標に基づいてLLMのタスク達成能力を評価し、その指標に基づいてスコアを算出する。ベンチマークを利用して、コーディング、推論、文章の要約、読解、事実知識の想起など、さまざまなタスクを実行する能力を測定できる。
ソフトウェアの品質評価ではメモリの使用量、処理速度、消費電力といった指標に注目する。これに対してLLMを評価する場合は、その問題解決能力に着目する。
組織はベンチマークを使って、複数のLLMの性能を同一タスクで比較したり、LLMを微調整して性能を向上させる際の指針を得たりすることが可能だ。
ベンチマークを実施するには
ベンチマークを使ったテストは、以下の順に実行する。
- セットアップ
- ベンチマーク用のデータセットを用意する。このデータセットには、文章の理解や要約、質問への応答の能力を測るためのテキスト文書、プログラミング能力を測るための問題、論理的思考や計算能力を測るための数学の問題などが含まれる。
- テスト
- 準備したデータを使い、課題に対するLLMの準備度合いに応じてベンチマークテストを実施する。
- ゼロショット(Zero-shot)
- タスクの手本を示さずに、LLMの汎用(はんよう)的な知識のみで課題を解かせる評価手法。
- フューショット(Few-shot)
- プロンプト(質問や指示)内で幾つかの具体例を示し、LLMにタスクの意図を理解させてから課題を解かせる評価手法。
- ファインチューニング(Fine-tuning)済みモデルでの評価
- 特定用途向けの小規模データセットを用いてパラメーターを微調整したLLMを評価する手法。
- ゼロショット(Zero-shot)
- 準備したデータを使い、課題に対するLLMの準備度合いに応じてベンチマークテストを実施する。
- 採点
- 以下の指標を基に、0~100でLLMの性能を測定する。
- 正解率(Accuracy)
- 再現率(Recall)
- 困惑度(Perplexity)
- 以下の指標を基に、0~100でLLMの性能を測定する。
ベンチマークでは、特定の能力に焦点を当てることが一般的だが、複数の分野にまたがる場合もある。対象とする分野には、歴史、読解力、数学的推論、科学などがある。このうち読解力については、プロンプトの内容理解、論理的証明、推論といった分野に細分化できる。与えられた文章の段落の中から代名詞の主語を特定する能力や、「熱が出たらどうすればいいのか」「牛乳を常温に何分までなら置いても問題ないのか」といったプロンプトに対して、常識的なアドバイスをする能力を評価するベンチマークもある。
これらのベンチマークテストには、人間の試験と同様、採点について課題がある。誰が採点しても同じ結果となる問題を出せば、効率よく採点できる。そうではない場合、採点には時間がかかりやすい。そのためベンチマークテストでは、答えが同一となる数学や選択式の問題が選ばれる傾向にある。LLM同士で性能を比較しやすくするために、ベンチマークテストのスコアの総合点やその内訳を生成する必要がある。ベンチマークテストを実施する一部の組織は、その内容を外部に公開しておらず、スコアのみを公開している。テストの内容をあらかじめ公開すれば、AIベンダーがその内容を学習データに組み込み、不正に評価点数を高めることができる恐れがあるからだ。この現象を過学習(オーバーフィッティング)と呼ぶ。過学習は、学習データの特定の情報を記憶してしまい、その情報に関する回答の精度は高いものの、新しいデータに適合できず適切に回答することが難しい状態を指す。
LLMのベンチマークテストを実施する際は、スクリプト(簡易プログラム)やAPI(アプリケーションプログラミングインタフェース)を使う。プログラミング言語「Python」で書かれたプログラムが、データベースやテキストファイルから問題を読み込み、API経由でLLMにアクセスするといった具合だ。
ベンチマークテストを実施する際は、出力の再現性を確保し、その再現性を制御できるようにすることが重要だ。イーロン・マスク氏が創業したAI技術ベンダーX.AIの「Grok」、Anthropicの「Claude」、OpenAIのLLM「GPT-4」、Meta Platformsの「Llama」といったLLMは、人間らしいコミュニケーションを実現できるよう、ランダム性を取り入れている。そのようなランダム性を低減するための設定が利用可能なLLMもある。OpenAIのAIチャットbot「ChatGPT」は、ランダム性を調整する設定「Temperature」(温度)を用意している。Temperatureを小さくすれば、ランダム性は下がる。他にも、回答のばらつきを決めるための値「シード値」を固定する、質問するたびに新規ユーザーとして質問するといった方法でランダム性を減らすことが可能だ。使用しているLLMにそのような機能がない場合、テストを複数回実施し、その結果の平均値や中央値を取ることでおおよそのスコアを得ることができる。
中編は、注目すべきLLMベンチマークや、ベンチマークの限界について紹介する。
TechTarget.AIとは
TechTarget.AI編集部は生成AIなどのサービスを利用し、米国Informa TechTargetの記事を翻訳して国内向けにお届けします。
Copyright © ITmedia, Inc. All Rights Reserved.
本記事は制作段階でChatGPT等の生成系AIサービスを利用していますが、文責は編集部に帰属します。
TechTarget.AI
TechTarget.AI編集部は生成AIなどのサービスを利用し、米国TechTargetの記事を翻訳して国内向けにお届けします。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
“攻撃者優位”なサイバーセキュリティ、全ての「穴」をふさぐ方法とは? -
製品資料
実際に悪用される脆弱性は4%前後 優先的に対処すべき脆弱性を把握するには? -
製品資料
HubSpotの機能を拡張する法人データ活用法 -
製品資料
面倒で非生産的な「名寄せ」作業 高精度&高効率に実施するには? -
製品資料
名刺管理には「その先」がある 成果のでない営業活動から脱却する秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
ISMSの“コンサル丸投げ”が招く数千万円の無駄 NTTドコモビジネスの脱出劇
-
2
Netflixのバックエンドは「ほぼJava」 3000超のアプリを支える開発基盤の裏側
-
3
「Microsoft 365」が乗っ取られる 跡形もなくMFAを破る手口
-
4
「VMware離れ」は本当か 3000社がVCF 9にかじを切った現実的な理由
-
5
「結局使わなくなる」Microsoft 365 Copilotを半年で定着 キリンの3施策
-
6
「WSUS」終了の時限爆弾 “本命”移行先ツールとMicrosoft提唱の新管理手法
-
7
IT人材の42%が転職予備軍 辞めさせない組織の4つの共通
-
8
「HDD終了」は本当か 巨大クラウド2社が下した大容量フラッシュへの決断
-
9
AIが本番環境を削除し復旧に13時間 「暴走」ではなかったAWS事例
-
10
ただなのに「12時間以内の復旧」も要求 無償OSSに商用レベルを求める企業の末路
ホワイトペーパーランキング PR
-
1
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
2
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
-
3
財務・会計はAI活用でどう変わる? 調査で見えた変革の道筋
-
4
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
5
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
6
「結局、一部の人しか使わない」 AI活用が業務に定着しない根本的な理由
-
7
コスト分析で見る「デバイス復旧」の代償 損失額から導きだされた投資戦略とは
-
8
Macの安全神話は崩壊? 最新の脅威動向から見えた攻撃のトレンドと有効な対策
-
9
ゼロトラストにおける「IDaaSの課題」と補完すべき重要機能とは?
-
10
「NAS」「SAN」「DAS」は何が違う? いまさら聞けないストレージの基礎
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー