AIの業務活用、どこまでできる?【前編】
生成AIがクラウドではなく「ローカルPC」でどこまで動くのか検証してみた
LLMをPCで動かす時代が来た。実際にIT記者がローカルPCで複数のLLMを検証してみた。ハードウェアの最適な構成を探った内容と併せて紹介する。
生成AI(AI:人工知能)を用いた作業効率化が進む一方で、クラウドサービス経由でのAI利用には、回数制限やコスト、セキュリティの懸念といった壁が存在する。こうした制約を回避する選択肢として、手元のPCでLLM(大規模言語モデル)を稼働させる方法が注目されている。
本稿は、ローカルLLM(手元のPCで動かすLLM)がどれだけ使えるのか、その有効性を検証した内容を紹介する。検証では、無料ダウンロードが可能な以下のLLMを個人のPC上で稼働させ、動作や出力の品質を試した。
- Googleの「Gemma 3」
- Meta Platformsの「Llama 3.3」
- Anthropicの「Claude 3.7 Sonnet」
- Mistralの「Mistral」「Mistral Small 3.1」「Mistral Nemo」「Mixtral」
- IBMの「Granite 3.2」
- Alibabaの「Qwen 2.5」
- DeepSeekの「DeepSeek R1」(※)
※厳密には、DeepSeek-R1の蒸留モデル。蒸留とは、大規模モデルから学習した知識を、小規模モデルの訓練に活用する手法。ここでは、LlamaおよびQwenといったオープンソースモデルをベースに、DeepSeek-R1の推論パターンを学習させたもの。
今回の検証では、「PCでLLMを安定稼働させることができるのかどうか」「実用に足るアウトプットが得られるのかどうか」の2点が大きな焦点となった。その検証結果について解説する。
LLMは「ローカルPC」でどこまで動くのか検証してみた
今回は、米Informa TechTargetがフランスで展開するIT専門メディア「LeMagIT」の編集部が、業務におけるローカルLLM活用の有効性を検証。記者が取材中に録音した音声をAIツールに渡し、それを記事として公開できる形に変換してもらった。
検証では、PCでLLMが使えるようになるソフトウェア「LM Studio」を使用した。LM StudioにはLLMを直接ダウンロードする機能があり、無料で利用できるLLMをAI開発プラットフォーム「Hugging Face」からダウンロードした。
まずLLMに対し、記事の書き方を説明するプロンプト(AIモデルに対する指示)を約1500トークン分投入する。トークンはテキストデータを処理する際の基本的な単位で、1500トークンは英語で約6000文字、雑誌約2ページに相当する。
続けて、45分程度のインタビュー音声を文字起こししたテキストを、約1万1000トークン分追加で投入する。
これだけのトークン量となると、一般的なLLMの無料利用枠を大幅に超えてしまう。そこで有効なのが、LLMをPCにダウンロードして実行する方法だ。これにより、大規模なAIモデルでも、処理コストを抑えつつ活用できる。
ローカルLLM活用ではメモリ量が鍵に
PCにおけるLLMの動作は、使用可能なメモリ量に大きく依存する。出力品質を損なわずに処理速度を高める方法は、クロック周波数の高いSoC(System on a Chip)もしくはコア数の多いSoCを搭載するPCを選択することだ。
検証では、使用したLLMのうちで最も高性能なLLMはGemma 3の「27B Q8_0」バージョンだった。以下の構成で、毎秒6.82トークンの処理速度を実現した。
- 270億のパラメーター(AIモデルの振る舞いを決定する変数)を8bitに量子化(圧縮)してメモリ消費量を抑制
- AppleのPC「Mac」で、同社のSoC「M1 Max」と64GBのRAM(Random Access Memory)を搭載するモデルで実行
- 48GBのメモリを、一般的な処理の制御を担うCPU(中央演算処理装置)コア、並列処理による計算を担うGPU(グラフィックス処理装置)コア、AI処理に特化したNPU(ニューラル処理装置)コアで共有
- コンテキストウィンドウ(生成AIがやりとりの中で保持する情報量)は3万2000トークン、投入したプロンプトは1万5000トークン
一方この条件下では、メモリの使用量が非常に大きくなるため、よりパラメーター数の多いLLMは読み込み時点でエラーになったり、出力が途中で途切れてしまったりする場合がある。LLMのパラメーター数を減らせばメモリ消費量は抑えられるが、出力品質は低下し、繰り返し表現や曖昧な記述が目立つようになる。パラメーターをより少ないbit数に量子化すれば処理速度は向上するものの、文法ミスや造語の混入など、出力品質の低下は避けられない。
プロンプトがメモリ容量を圧迫するようであれば、パラメーター数の少ないLLMを選択するのが現実的だ。ただしその代償として、出力品質は妥協する必要がある。
ローカルAIに適したアーキテクチャとは
専門家によれば、生成AIを個人の端末で効果的に動作させるためには、全てのコアが同一のRAMに同時にアクセスできるアーキテクチャが最適だという。具体的には、CPU、GPU、NPUなどの各プロセッサが物理的および論理的に同一のメモリアドレス空間(メモリアドレスによってアクセスできるメモリ領域)を共有する、SoCプロセッサを搭載した端末が該当する。この構成では全コアが共有メモリに直接アクセスでき、データの重複コピーを必要としない。
一方、以下のようなアーキテクチャでは、各コアが同じデータを保持する複製メモリを確保する必要があり、その分だけRAMの使用効率が下がってしまう。
- 外部GPUが専用のメモリとして「VRAM」(Video RAM)を搭載している場合
- SoCを採用していても、CPU、GPU、NPUがRAMのそれぞれの専用領域にしかアクセスできない場合
例えば、Appleのチップ「M」シリーズでは、48GBの共有RAMを搭載していれば、270億パラメーターのLLMを8bitに量子化して安定して実行できる。一方、OS「Windows」搭載マシンで同じく48GBのRAMを搭載していても、24GBがCPU専用、残り24GBがGPU専用に分かれている構成では、実質的に130億パラメーター程度が限界となる。
M1 Max搭載のMacでローカルLLMの実行が成功した理由は、M1 Maxがユニファイドメモリ(UMA)を備えたSoCであり、すべてのコアが統一されたメモリアクセスを可能にすることにあったと考えられる。
このアーキテクチャを採用する動きは広がりつつあり、2025年1月にはAdvanced Micro Devices(AMD)がプロセッサ「Ryzen AI Max」シリーズでUMAを導入している。Intelの「Core Ultra」シリーズはCPU、GPU、NPUを内包したSoCではあるものの、現時点ではUMAによる完全なメモリアクセスは実現していない。
次回は、記者の業務はAIツールを活用することで軽減されたのかどうかを解説する。
Computer Weekly発 世界に学ぶIT導入・活用術
米国Informa TechTargetが運営する英国Computer Weeklyの豊富な記事の中から、海外企業のIT製品導入事例や業種別のIT活用トレンドを厳選してお届けします。
Copyright © ITmedia, Inc. All Rights Reserved.
Computer Weekly発 世界に学ぶIT導入・活用術
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
“攻撃者優位”なサイバーセキュリティ、全ての「穴」をふさぐ方法とは? -
製品資料
実際に悪用される脆弱性は4%前後 優先的に対処すべき脆弱性を把握するには? -
製品資料
HubSpotの機能を拡張する法人データ活用法 -
製品資料
面倒で非生産的な「名寄せ」作業 高精度&高効率に実施するには? -
製品資料
名刺管理には「その先」がある 成果のでない営業活動から脱却する秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
ISMSの“コンサル丸投げ”が招く数千万円の無駄 NTTドコモビジネスの脱出劇
-
2
「VMware離れ」は本当か 3000社がVCF 9にかじを切った現実的な理由
-
3
仮想化環境の死角を“未知の脅威”が狙う時代――新たな敵をどう見破るか?
-
4
なぜ人はいるのにDXが進まない? ライオンも直面した“老害”レガシーシステム
-
5
「Microsoft 365」が乗っ取られる 跡形もなくMFAを破る手口
-
6
ただなのに「12時間以内の復旧」も要求 無償OSSに商用レベルを求める企業の末路
-
7
AI全部入り「Microsoft 365 E7」に企業が二の足を踏む訳 移行意向はわずか4%
-
8
221人調査で分かった「情シス最大のストレス」は?
-
9
「データストレージの活用方法」に関するアンケート
-
10
SESや多重請け案件の“負のループ”を脱却、中小のシステム開発会社を救う策
ホワイトペーパーランキング PR
-
1
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
2
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
-
3
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
4
「NAS」「SAN」「DAS」は何が違う? いまさら聞けないストレージの基礎
-
5
コスト分析で見る「デバイス復旧」の代償 損失額から導きだされた投資戦略とは
-
6
“あのファイル転送”で暗躍するノーウェアランサム
-
7
「結局、一部の人しか使わない」 AI活用が業務に定着しない根本的な理由
-
8
Macの安全神話は崩壊? 最新の脅威動向から見えた攻撃のトレンドと有効な対策
-
9
3分で分かる経理DX 富士通が約20%の業務効率化を実現した方法とは
-
10
ランサムウェア攻撃を“二重の防御構造”で防ぐ、クラウド型基幹システムの実力
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー