推論は新境地へ【後編】
汎用人工知能(AGI)に近づいた「OpenAI o3」の注目すべき技術とは?
OpenAIが開発した最新のLLM「OpenAI o3」は、従来のAIモデルを大幅に超える性能を誇る。その主要な技術革新と実力を詳しく解説する。
2024年12月、AI(人工知能)ベンダーOpenAIのCEOサム・アルトマンは、同社主催のイベント「12 Days of OpenAI」で、LLM(大規模言語モデル)シリーズ「OpenAI o3」のプレビュー版を発表した。2025年1月には軽量モデルの「o3-mini」の一般提供を開始した。本稿は、OpenAI o3の性能面、安全性における技術的革新とその実力について解説する。
汎用人工知能(AGI)に近づいた「OpenAI o3」の注目すべき技術
併せて読みたいお薦め記事
連載:推論は新境地へ
AIと人間の関係性を考える
OpenAI o3は深層学習モデル「Transformer」をベースとしたLLMで、知識に基づく回答、要約、テキスト生成など基本的な機能を備えている。前身となる「OpenAI o1」から大幅に進化を遂げており、特に以下のような特徴を持つ。
- 高度な推論機能
- OpenAI o3は段階的な論理的推論を実行でき、詳細な分析を要する複雑なタスクに適している。
- 優れたプログラミング能力
- OpenAI o3は優れたコーディング能力を持ち、プログラミングスキルを測定するベンチマークテスト「Codeforces」の「Elo-MMR」のスコアにおいて、International Grandmaster(2727)のスコアを記録。加えて、ソフトウェア開発タスクのベンチマークテスト「SWE-bench」で71.7%の正答率を達成し、OpenAI o1のスコアから20%向上を記録した。
- 数学的計算能力
- OpenAI o3は高度な数学的計算にも対応し、数学コンテスト「American Invitational Mathematics Examination」(AIME)で96.7%の正答率を達成。OpenAI o1の83.3%を大幅に上回る結果となった。
- 科学研究における知識
- OpenAI o3は科学分野でも強みを発揮し、博士号レベルの科学問題を扱うベンチマークテスト「GPQA」の「ダイヤモンド」レベルにおいて87.7%の正答率を達成した。
- セルフファクトチェック機能
- OpenAI o3は応答の正確性を向上させるため、セルフファクトチェック機能を搭載している。これにより、誤った情報の生成リスクを低減し、より信頼性の高い出力を実現している。
- AGIへの該当度
- OpenAIは、汎用(はんよう)人工知能(AGI)に関するベンチマークテスト「ARC-AGI」(注)で87.5%の正答率を記録している。OpenAI o1の32%から大幅な改善を遂げただけでなく、人間の平均正答率(85%)を大幅に上回る結果となり、OpenAI o3の推論能力と汎用性の高さが示された。
※注:ARC-AGIは、ピクセルパターンの認識を通じて、学習データに含まれていない未知の課題に適応する能力を評価する指標。
OpenAI o3の新しい安全技術
OpenAI o3には、従来のOpenAIのAIモデルにはなかった新しい安全技術「Deliberative Alignment」(熟慮的アライメント)が採用されている。これは、OpenAI o3の推論能力を生かして、ユーザーのプロンプト(AIツールへの指示)が安全性にどのような影響を与えるかを評価する仕組みだ。
従来のLLMの安全対策は、安全・危険なプロンプトの例を学習させ、それに基づいて判断基準を設定する方式だった。一方のDeliberative Alignmentは、AIモデル自身がプロンプトの意図や内容を直接評価する。
OpenAI o3は設定された安全基準を基にプロンプトを精査し、隠された意図や、システムを欺こうとする試みを検出する。これにより、危険なコンテンツをより正確に拒否しつつ、安全なコンテンツが誤ってブロックされるリスクを軽減することが可能となった。
Deliberative Alignmentは、以下のように段階的なプロセスを経て機能する。
- 学習プロセス
- まず、基本的な有用性を向上させるためのトレーニングを実施する。この段階では、安全性に特化したデータは使用されない。
- AIモデルに、安全性に関する基準やポリシーへの直接的なアクセス権を持たせる。
- データ分析プロセス
- プロンプトを安全性カテゴリーごとに分類し、適切な安全基準とひも付ける。AIモデルにプロンプトを入力し、安全基準を参照しながら分析させる。その際、推論の各ステップを明示する「Chain-of-Thought」(CoT:思考の連鎖)手法を活用し、安全性評価の精度を高める。
- ファインチューニングプロセス
- 「教師ありファインチューニング」(SFT:Supervised Fine Tuning)の手法で、ラベル付きデータを用いてAIモデルの推論能力を最適化する。SFTの後、強化学習を用いてAIモデルをさらに調整し、CoT推論の精度をさらに高める。
- 推論プロセス
- AIモデルがプロンプトを受け取ると、自動でCoT推論を開始し、安全基準に照らし合わせながら分析する。これにより、ポリシーに準拠した適切な応答の生成が可能となる。
こうした新技術により、OpenAI o3はより高度な安全管理を実現し、ユーザーに対してより信頼性の高い応答を提供できるようになった。
TechTarget発 先取りITトレンド
米国Informa TechTargetの豊富な記事の中から、最新技術解説や注目分野の製品比較、海外企業のIT製品導入事例などを厳選してお届けします。
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget発 先取りITトレンド
米国TechTargetの豊富な記事の中から、最新技術解説や注目分野の製品比較、海外企業のIT製品導入事例などを厳選してお届けします。
この記事の著者
関連記事
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
急増する「AIはこう言ってる」マン 判断を狂わせる「AI忖度」を防ぐには?
-
2
取手市がVDIと決別した理由 更改費用「4倍超」を約1.7倍に圧縮
-
3
「Excel至上主義」の終わらせ方 丸2日の手作業地獄から情シスと現場を救うには
-
4
221人調査で分かった「情シス最大のストレス」は?
-
5
「データストレージの活用方法」に関するアンケート
-
6
「AI時代の統合基盤・エンタープライズAI管理」に関するアンケート
-
7
自宅のWi-Fiが「遅い」「途切れる」本当の原因は? Dellが推奨する鉄則
-
8
本当に安いPCで十分か? “すぐ重くなる”を防ぐノートPC選びの絶対条件
-
9
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
10
Claudeの不可視透かしに批判殺到 著作権消失や誤判定に潜む企業リスク
ホワイトペーパーランキング PR
-
1
年収2000万「クラウドセキュリティのプロ」になれる資格とは
-
2
セキュリティソフトをすり抜ける標的型攻撃メール、不審メールの見破り方とは?
-
3
Windows Updateの通信集中で回線が逼迫、ネットワーク刷新事例に学ぶ解決策
-
4
財務を戦略的組織へ進化させるAI活用術、4つの主要な障壁と解消方法
-
5
「NAS」「SAN」「DAS」は何が違う? いまさら聞けないストレージの基礎
-
6
“あのファイル転送”で暗躍するノーウェアランサム
-
7
標的型攻撃メールを見破るには? サンプル文面を例に傾向を解説
-
8
商用利用の安全性を確保し大量のコンテンツを高速で生成する、AI活用の秘訣
-
9
マンガで解説、1日で生成AI環境を構築できるワークショップの中身とは?
-
10
Dark AIが台頭する時代の新発想、「より高度なAIで対抗する」具体的方法とは?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー