押さえておきたいLLMの基礎【前編】
GAN、VAE、Transformerとは? 生成AIがよく分かる「深層学習モデル」5選
テキストや画像を識別し、生成できる「生成AI」は、深層学習モデルを基盤として成り立っている。生成AIを支える代表的な深層学習モデルを5つ解説する。
テキストや画像、音声、ソースコードなど、さまざまなコンテンツを生成する人工知能(AI)技術である「生成AI」の発展には、深層学習モデルが大きく寄与している。本稿は、その中でも代表的な以下の深層学習モデルについて解説する。
- GAN(Generative Adversarial Network:敵対的生成ネットワーク)
- VAE(Variational Auto Encoder:変分オートエンコーダー)
- 拡散モデル (Diffusion Model)
- Transformer(トランスフォーマー)
- NeRF(Neural Radiance Fields)
「GAN」「VAE」「Transformer」とは? 5つの深層学習モデルを解説
併せて読みたいお薦め記事
生成AIの基礎技術解説
GAN(Generative Adversarial Network:敵対的生成ネットワーク)
GANは2014年に登場した深層学習モデルだ。「生成ネットワーク」と「識別ネットワーク」の2つのニューラルネットワーク(人間の脳の神経回路を模倣した機械学習モデル)が競い合う仕組みだ。
具体的には、生成ネットワークがコンテンツを生成し、識別ネットワークはAIが生成した画像か、本物の画像かを識別する。この2つが競い合うことで、AIモデルはより本物に近いコンテンツを作成できるようになる。
VAE(Variational Auto Encoder:変分オートエンコーダー)
GANと同じく2014年に登場したVAEは、ニューラルネットワークを使用して、データのエンコード(データを他の形式に変換する)とデコード(元のデータ形式へ復号する) を実施する。これにより、新しいデータを生成する技術を学習する。
エンコーダーはデータを圧縮する過程で、重要な情報のみを抽出し、不要な情報を取り除く。デコーダーは圧縮されたデータをデコードして、入力データを再構成する。このようにして、VAEは効率的にコンテンツを生成できる。
拡散モデル (Diffusion Model)
2015年に登場した拡散モデルは、データの拡散過程(ノイズが付与されて破壊される過程)を学習したモデルで、画像生成によく使用される。
拡散モデルでは、まず入力データに徐々にノイズを加えて、ランダムなノイズ分布を作成する。その後、このプロセスを逆転させて、ノイズから新しいデータを生成する。
「DALL・E」や「Midjourney」などの画像生成サービスは、他のAIモデルと併せて拡散モデルを使用している。
Transformer(トランスフォーマー)
言語翻訳を改善するために2017年に登場したトランスフォーマーは、機械学習手法「アテンションメカニズム」を使用する深層学習モデルだ。アテンションメカニズムとは、人間が何かに集中するように、コンピュータも重要な部分に注意を向けられるようにする方法だ。
アテンションメカニズムにより、Transformerは大量のラベル付けされていないテキストを処理し、データセット内の単語やサブワード(単語をさらに分解したもの)間のパターンや関係性を発見できる。
Transformerは、大規模な生成AIモデル、特にLLMの発展を促した。さまざまなLLMが、文脈に基づいたテキストを生成するために、Transformerを使用している。
NeRF(Neural Radiance Fields)
2020年に登場したNeRFは、機械学習とニューラルネットワークを用いて、2D(2次元)や3D(3次元)のコンテンツを生成できる。さまざまな角度から撮影された2D画像を分析し、3D構造を推測することで、写実的な3Dコンテンツを生成できる仕組みだ。ロボット工学や仮想現実(VR)など、さまざまな分野を発展させる可能性を秘めている。
生成AIツールと用途
代表的な生成AIツールとして、
- OpenAIの「ChatGPT」やGoogleの「Gemini」(旧Bard)といったAIチャットbot
- 「DALL・E」や「Midjourney」といった画像生成ツール
- 「GitHub Copilot」や「Amazon Q Developer」といったソースコード生成ツール
- 「AudioPaLM」や「VALL-E」といった音声生成ツール
などがある。
生成AIにはさまざまなモデルやツールがあり、以下のような幅広い用途に活用できる。
- マーケティング用コンテンツの作成
- ユーザーに合わせてパーソナライズ化した広告の作成
- 調査や会議内容の要約作成
生成AIツールの特徴や機能は個々に異なる。適切な生成AIツールを選ぶには、自社の目的に合った機能を備えているかどうかを調査することが欠かせない。
次回は、半世紀にわたるLLMの歴史について解説する。
TechTarget発 先取りITトレンド
米国TechTargetの豊富な記事の中から、最新技術解説や注目分野の製品比較、海外企業のIT製品導入事例などを厳選してお届けします。
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget発 先取りITトレンド
米国TechTargetの豊富な記事の中から、最新技術解説や注目分野の製品比較、海外企業のIT製品導入事例などを厳選してお届けします。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社MatrixFlow] 「物流リソース最適化」ガイド:人員・配車・傭車を出庫依頼の確定前に決めきる -
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
3
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
4
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
5
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
6
ChatGPTは“検索しまくり”でGeminiは“淡泊”? データが明かすAIの裏側
-
7
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
8
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
9
「結局使わなくなる」Microsoft 365 Copilotを半年で定着 キリンの3施策
-
10
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー