推論は新境地へ【後編】
汎用人工知能(AGI)に近づいた「OpenAI o3」の注目すべき技術とは?
OpenAIが開発した最新のLLM「OpenAI o3」は、従来のAIモデルを大幅に超える性能を誇る。その主要な技術革新と実力を詳しく解説する。
2024年12月、AI(人工知能)ベンダーOpenAIのCEOサム・アルトマンは、同社主催のイベント「12 Days of OpenAI」で、LLM(大規模言語モデル)シリーズ「OpenAI o3」のプレビュー版を発表した。2025年1月には軽量モデルの「o3-mini」の一般提供を開始した。本稿は、OpenAI o3の性能面、安全性における技術的革新とその実力について解説する。
汎用人工知能(AGI)に近づいた「OpenAI o3」の注目すべき技術
併せて読みたいお薦め記事
連載:推論は新境地へ
AIと人間の関係性を考える
OpenAI o3は深層学習モデル「Transformer」をベースとしたLLMで、知識に基づく回答、要約、テキスト生成など基本的な機能を備えている。前身となる「OpenAI o1」から大幅に進化を遂げており、特に以下のような特徴を持つ。
- 高度な推論機能
- OpenAI o3は段階的な論理的推論を実行でき、詳細な分析を要する複雑なタスクに適している。
- 優れたプログラミング能力
- OpenAI o3は優れたコーディング能力を持ち、プログラミングスキルを測定するベンチマークテスト「Codeforces」の「Elo-MMR」のスコアにおいて、International Grandmaster(2727)のスコアを記録。加えて、ソフトウェア開発タスクのベンチマークテスト「SWE-bench」で71.7%の正答率を達成し、OpenAI o1のスコアから20%向上を記録した。
- 数学的計算能力
- OpenAI o3は高度な数学的計算にも対応し、数学コンテスト「American Invitational Mathematics Examination」(AIME)で96.7%の正答率を達成。OpenAI o1の83.3%を大幅に上回る結果となった。
- 科学研究における知識
- OpenAI o3は科学分野でも強みを発揮し、博士号レベルの科学問題を扱うベンチマークテスト「GPQA」の「ダイヤモンド」レベルにおいて87.7%の正答率を達成した。
- セルフファクトチェック機能
- OpenAI o3は応答の正確性を向上させるため、セルフファクトチェック機能を搭載している。これにより、誤った情報の生成リスクを低減し、より信頼性の高い出力を実現している。
- AGIへの該当度
- OpenAIは、汎用(はんよう)人工知能(AGI)に関するベンチマークテスト「ARC-AGI」(注)で87.5%の正答率を記録している。OpenAI o1の32%から大幅な改善を遂げただけでなく、人間の平均正答率(85%)を大幅に上回る結果となり、OpenAI o3の推論能力と汎用性の高さが示された。
※注:ARC-AGIは、ピクセルパターンの認識を通じて、学習データに含まれていない未知の課題に適応する能力を評価する指標。
OpenAI o3の新しい安全技術
OpenAI o3には、従来のOpenAIのAIモデルにはなかった新しい安全技術「Deliberative Alignment」(熟慮的アライメント)が採用されている。これは、OpenAI o3の推論能力を生かして、ユーザーのプロンプト(AIツールへの指示)が安全性にどのような影響を与えるかを評価する仕組みだ。
従来のLLMの安全対策は、安全・危険なプロンプトの例を学習させ、それに基づいて判断基準を設定する方式だった。一方のDeliberative Alignmentは、AIモデル自身がプロンプトの意図や内容を直接評価する。
OpenAI o3は設定された安全基準を基にプロンプトを精査し、隠された意図や、システムを欺こうとする試みを検出する。これにより、危険なコンテンツをより正確に拒否しつつ、安全なコンテンツが誤ってブロックされるリスクを軽減することが可能となった。
Deliberative Alignmentは、以下のように段階的なプロセスを経て機能する。
- 学習プロセス
- まず、基本的な有用性を向上させるためのトレーニングを実施する。この段階では、安全性に特化したデータは使用されない。
- AIモデルに、安全性に関する基準やポリシーへの直接的なアクセス権を持たせる。
- データ分析プロセス
- プロンプトを安全性カテゴリーごとに分類し、適切な安全基準とひも付ける。AIモデルにプロンプトを入力し、安全基準を参照しながら分析させる。その際、推論の各ステップを明示する「Chain-of-Thought」(CoT:思考の連鎖)手法を活用し、安全性評価の精度を高める。
- ファインチューニングプロセス
- 「教師ありファインチューニング」(SFT:Supervised Fine Tuning)の手法で、ラベル付きデータを用いてAIモデルの推論能力を最適化する。SFTの後、強化学習を用いてAIモデルをさらに調整し、CoT推論の精度をさらに高める。
- 推論プロセス
- AIモデルがプロンプトを受け取ると、自動でCoT推論を開始し、安全基準に照らし合わせながら分析する。これにより、ポリシーに準拠した適切な応答の生成が可能となる。
こうした新技術により、OpenAI o3はより高度な安全管理を実現し、ユーザーに対してより信頼性の高い応答を提供できるようになった。
TechTarget発 先取りITトレンド
米国Informa TechTargetの豊富な記事の中から、最新技術解説や注目分野の製品比較、海外企業のIT製品導入事例などを厳選してお届けします。
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget発 先取りITトレンド
米国TechTargetの豊富な記事の中から、最新技術解説や注目分野の製品比較、海外企業のIT製品導入事例などを厳選してお届けします。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
-
4
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
5
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
6
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
7
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
8
BMWも導入 78兆円市場に化ける「フィジカルAI」の衝撃
-
9
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
10
「AI活用を前提とした業務PCへの移行」に関するアンケート
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー