LLMベンチマークの全体像を知る【後編】
今すぐLLMを比較したい 性能が一目で分かる「リーダーボード」はどれ?
LLMの性能をまとめて評価したい場合に有用なのが、リーダーボードだ。さまざまなLLMの性能を評価した情報が公開されている。LLM選びの参考にできる、主要なリーダーボードを紹介する。
大規模言語モデル(LLM)の性能は日々更新され、さまざまなベンチマークが存在する。そのため、ベンチマークテストの実行やツールの比較は簡単ではない。本稿は、ベンチマークやLLMを比較検討するためのリーダーボード(ランキング表)を掲載しているWebサイトを紹介する。
LLMの「リーダーボード」はこれだ
併せて読みたいお薦め記事
連載:LLMベンチマークの全体像を知る
LLMを詳しく知る
LLMやベンチマークの情報を収集するのであれば、AI(人工知能)モデルやデータセットの共有・公開サービス「Hugging Face」を訪れるのは一つの手だ。Hugging Faceは、エンドユーザーがLLMの性能をランキング形式で掲載するリーダーボードを提供している。注目すべきリーダーボードには以下がある。
- Big Benchmarks Collection
- Chatbot Arena LLM Leaderboard
- OpenVLM Leaderboard
- GAIA Leaderboard
ベンチマークを選定するに当たっては利用料がどの程度発生するかも考慮に入れる必要がある。オープンソースソフトウェア(OSS)であれば、ソースコードが公開されており、無料または安価な費用で利用できる。エンドユーザーの手元にある端末で実行可能だ。一方、ソースコードが公開されていないクローズドソースソフトウェアはその性能やセキュリティといった要素の評価が難しい上、利用料も発生する。
Hugging Face以外でベンチマークの評価、測定値といった情報を入手したい場合、以下の情報が役に立つ。
- AIアプリケーション開発ツールVellumのWebサイトが提供する「LLM Leaderboard」
- 2024年4月以降に公開された、主要なLLMベンチマークの最新版の性能をリーダーボードで評価している。Vocifyが運営している。
- 「SWE-bench」のWebサイト
- SWE-benchは、ソースコード管理ツールGitHubに存在するIssue(課題)から作られたデータセットを基にしたベンチマークだ。Issueを自動的に解決するLLMの能力を測定する。SWE-benchのWebサイトでは、リーダーボードでLLMの問題解決率を掲載している。
- Berkeley Function-Calling Leaderboard
- LLMが、サードパーティーツールをどれだけ正確に選び、結果を解釈できているか、能力を測定し、評価を掲載している。
- 「LiveBench」のWebサイト
- LiveBenchは、推論、データ分析、数学、コーディング、言語理解、指示への追従の6つの分野、17のタスクで構成されるベンチマークだ。LLMの推論や問題の処理能力、簡単なコーディングタスクの性能を測定し、リーダーボードに掲載している。
- LLMベンチマーク「Humanity's Last Exam」の紹介サイト
- AI技術の安全性に関するNPO(非営利団体)CAIS(Center for AI Safety)とAIベンダーScale AIは、ベンチマーク「Humanity's Last Exam」を提供している。同ベンチマークは、人間の高度な知識でAI技術の限界を試すことを目的に設計された。Scale AIが運営するWebサイト「scale.com」では、Humanity's Last Examを使ったLLMの性能の評価をリーダーボードに掲載している。
ベンチマークの限界は?
LLMのベンチマークには、組織が抱える特定の課題を反映できないという制約がある。代表的な例が「HumanEval」だ。HumanEvalは、プログラミング言語「Python」で記述したソースコードをどの程度実用的かつ正確に生成できるかを評価する。
HumanEvalを使えば、単純な英語のプロンプト(質問や指示)からソースコードをどの程度の精度で生成できるかを評価することは可能だ。一方、以下の要素はHumanEvalの評価対象外だ。
- 3D(3次元)画像の処理能力
- すでにあるソースコードのリファクタリング(ソースコードの動作を変えずに内部構造を整理すること)
- ソースコードの読みやすさ
- CI/CD(継続的インテグレーション/継続的デリバリー)ツールとの連携
- Python以外のプログラミング言語で記述したソースコードの生成
一般的に、ベンチマークの大半は、ツールの処理速度やレイテンシ(遅延)、システムやセキュリティといった運用面の課題は評価の対象外だ。LLMベンチマークであれば、クラウドサービス、自社のサーバあるいは端末でLLMを稼働させた場合、性能がどう異なるのかは評価できない。例としてHumanEvalは、GUI(グラフィカルユーザーインタフェース)で生じる画面サイズ変更時のエラー、フォントの視認性、アクセシビリティー(利用のしやすさ)といった項目は評価対象外だ。
AIモデルが自律的に意思決定して行動する「AIエージェント」についても、信頼性の高い網羅的な評価手法は存在していない。一部の専門家は、AIエージェントが自律的にソースコードをソースコード管理ツールに登録したり、データベースを更新したり、CIツールを実行して本番環境にソースコードを反映させたりするようになると期待している。一方で、AIエージェントに関するベンチマークには、2022年に公開された「MARL-eval」や2024年に公開された「Sotopia-π」があるが、信頼性の確立は途上にある。
オープンアクセスリポジトリarXiv.orgに公開されている論文
MARL-eval:Towards a Standardised Performance Evaluation Protocol for Cooperative MARL
Sotopia-π:SOTOPIA-: Interactive Learning of Socially Intelligent Language Agents
LLMは言語の翻訳、数学的な問題への回答、3D画像の形状調整、データの中にある不適切な項目の識別、事実の記憶、段落の構成など、単一のモーダル(データ形式)を処理するのが得意だ。
現行のLLMのベンチマークでは、感情的知性、人間性、誠実さといった要素の測定は難しい。そのため、どのLLMを、誰が、いつ、どの業務に使うかは、各組織が自ら判断する必要がある。多角的な評価指標を持つことで、自組織にとって適切なLLMを見極める助けになる。
TechTarget.AIとは
TechTarget.AI編集部は生成AIなどのサービスを利用し、米国Informa TechTargetの記事を翻訳して国内向けにお届けします。
Copyright © ITmedia, Inc. All Rights Reserved.
本記事は制作段階でChatGPT等の生成系AIサービスを利用していますが、文責は編集部に帰属します。
TechTarget.AI
TechTarget.AI編集部は生成AIなどのサービスを利用し、米国TechTargetの記事を翻訳して国内向けにお届けします。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[LRM株式会社] 「標的型攻撃メール」事例・サンプル集 -
製品資料
[LRM株式会社] セキュリティ教育はなぜ「年間計画」を立てる必要があるのか? -
製品資料
[LRM株式会社] セキュリティの重要性が伝わらない…… 効果がない社員教育から脱却する方法 -
製品資料
[LRM株式会社] 「標的型攻撃メール訓練」導入ガイド 社員の意識を確実に高める仕組みの作り方 -
事例
[株式会社マクニカ] アイカ工業に学ぶ脆弱性対策 情シスが把握できずにいたアセットも正確に把握
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
「VMware離れ」は本当か 3000社がVCF 9にかじを切った現実的な理由
-
2
「Microsoft 365」が乗っ取られる 跡形もなくMFAを破る手口
-
3
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
4
Oracle巨大ITプロジェクトはなぜつまずいたのか 8年で導入1割、追加で170億ドル
-
5
AI全部入り「Microsoft 365 E7」に企業が二の足を踏む訳 移行意向はわずか4%
-
6
Microsoft製品でここまで自動化できる 情シスがやめられる手作業10選
-
7
なぜOpenAIやAnthropicのAIは「脱走」したのか 情シスが迫られるエージェント統制
-
8
Netflixのバックエンドは「ほぼJava」 3000超のアプリを支える開発基盤の裏側
-
9
「技術屋」で終わらないために 情シスが今取るべき認定資格5選
-
10
「Windows派」「Linux派」を分ける決定的な違い
ホワイトペーパーランキング PR
-
1
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
2
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
-
3
5回聞くだけじゃ足りない? トヨタ式「なぜなぜ分析」の正しい実践方法
-
4
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
5
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
6
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
7
PostgreSQLの「機能」「性能」「運用」「拡張性」に関する悩みの解消法
-
8
5分で分かる「セキュア大容量ファイル転送サービス」の機能とメリット
-
9
Macの安全神話は崩壊? 最新の脅威動向から見えた攻撃のトレンドと有効な対策
-
10
情報セキュリティ対策早分かりガイド:25の自社診断で弱点と解決策を理解
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー