オンプレミスシステムでLLMを動かす方法【後編】
「LLMをPCで使いたい」「複数人で使いたい」を実現するには何が必要?
技術革新が進み、LLMをクラウドサービスや自社データセンターではなく、手元のPCで動かすことが技術的に可能になった。何をすれば実現できるのか。複数人での利用時に発生する問題点を解消できるツールとは。
クラウドサービスに頼らずローカルマシンでLLM(大規模言語モデル)を動かすことが現実的になってきた。社内LANでの運用はプライバシーの確保やインターネット接続なしでの利用につながる一方、運用面での課題をクリアしなければ実現は難しい。特に複数のエンドユーザーで利用する場合には、負荷分散のための工夫も必要になる。どのようなツールを活用すればよいのか。
手元のPCでLLMを動かすには?
併せて読みたいお薦め記事
連載:オンプレミスシステムでLLMを動かす方法
LLMを知る
企業は専用のツールやサービスを活用して、エンドユーザーのデバイスでLLMを実行可能だ。これらのツールが提供するAPI(アプリケーションプログラミングインタフェース)を使用して、外部ソースから得た情報を用いてAIモデルの出力精度を高める手法「RAG」(Retrieval-Augmented Generation:検索拡張生成)を組み込んだアプリケーションを構築できる。
オンプレミスシステムでLLMを実行するためのツールの例を以下に挙げる。
- Ollama
- GPT4All
- LM Studio
Ollamaは「macOS」「Linux」「Windows」で利用可能だ。リポジトリ(保管場所)から最適化されたLLMをダウンロードし、実行するためのCLI(コマンドラインインタフェース)を提供する。LLM実行アプリケーション「AnythingLLM」や、ソースコード生成AIアシスタント「Continue」などの外部ツールとの連携が可能だ。
マルチユーザー向けのLLM運用に役立つツール
Ollamaは単一エンドユーザーでの利用には適するが、複数のエンドユーザーにサービスを提供する中央集約型システムで使うには、別のツールが必要だ。この場合、LLM用サーバソフトウェア「vLLM」や、機械学習用サーバソフトウェア「NVIDIA Triton Inference Server」といったツールを使うことになる。
vLLMは、単一GPUに加えて、「テンソル並列処理」という技術で、大規模なLLMを複数のGPUに分散させ、複数サーバやGPUを使う構成でもLLMを実行できる。コンピュータがGPUを搭載していない場合は、CPUを使ってLLMを動かすことも可能だ。
テンソル並列処理が必要になる場面を考えてみよう。「NVIDIA H200 Tensor Core GPU」のメモリ容量は141GBと比較的大容量だが、大規模LLMを格納するには不十分な場合がある。そのため複数のGPUを組み合わせ、テンソル並列処理を活用する必要がある。複数のノードにまたがる大規模な構成では、サーバ間での高速な通信が不可欠だ。可能であれば、サーバ同士を接続するインターコネクト技術「InfiniBand」といった技術を採用するとよい。
vLLMはコンテナオーケストレーションツール「Kubernetes」と組み合わせて使うことができ、スケーラビリティや高可用性といったKubernetesの利点を生かした推論サービスを構築できる。フレームワーク(プログラム部品やドキュメントの集合体)「Ray」を使えば、複数サーバでの推論が可能になる。Rayはプログラミング言語「Python」で開発されたAIアプリケーションでの利用を想定したフレームワークだ。
Kubernetesを使ってvLLMを運用する際、vLLMは複数の独立したコンテナとして動作し、それぞれが異なるネットワークアドレスで通信を受け付ける。このため、エンドユーザーからのリクエストを適切に各コンテナに振り分ける負荷分散(ロードバランシング)が重要になる。これにはKubernetesの標準機能であるHTTPロードバランシング機能や、「LiteLLM」などの専用プロキシサービスを使うとよい。NVIDIAが提供する、各コンテナがホストマシンのGPUを利用できるようにするためのプラグインをインストールすることも不可欠だ。
vLLMを導入することで、企業は「LangChain」などのフレームワークを用いて独自アプリケーションやサービスを構築できるようになる。同じシステムを用いてLLMをファインチューニング(特定用途向けの小規模データセットを用いた調整)することも可能だ。
複数ユーザーで利用するLLMを稼働させるための別の選択肢として「NVIDIA AI Enterprise」がある。NVIDIA AI EnterpriseはRayを含むvLLMと同様の機能、サービス群を提供する一方、商用サービスであるため、コストがかかる点には注意しなければならない。
TechTarget発 世界のインサイト&ベストプラクティス
米国TechTargetの豊富な記事の中から、さまざまな業種や職種に関する動向やビジネスノウハウなどを厳選してお届けします。
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget発 世界のインサイト&ベストプラクティス
米国TechTargetの豊富な記事の中から、さまざまな業種や職種に関する動向やビジネスノウハウなどを厳選してお届けします。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
技術文書・技術解説
[Jamf Japan 合同会社] MDMだけでモバイルセキュリティは十分? 不足する対策を16項目でチェック -
事例
[Wrike Japan 株式会社] 世界的な家電メーカーが実践する「クリエイティブプロセス効率化」の方法とは? -
事例
[Wrike Japan 株式会社] 世界的テクノロジー企業に学ぶ、プロセス標準化とプロジェクト納品自動化の秘訣 -
事例
[Wrike Japan 株式会社] ソニー・ピクチャーズ テレビジョンに学ぶ、次世代サービスデリバリーのヒント -
事例
[Wrike Japan 株式会社] ソミック石川に学ぶ、ICT浸透後に直面した「工数管理」の課題と解決策
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
脱VMwareの前提が崩れる BroadcomのVDDK公開停止で確認すべき点
-
2
AI全部入り「Microsoft 365 E7」に企業が二の足を踏む訳 移行意向はわずか4%
-
3
【基本情報技術者試験】「デュプレックスシステム」と「デュアルシステム」の違いは?
-
4
「データストレージの活用方法」に関するアンケート
-
5
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
6
「Microsoft一択」で本当にいいのか 知らぬ間にライセンス費用が膨らむ真相
-
7
「VMware離れ」は本当か 3000社がVCF 9にかじを切った現実的な理由
-
8
「Microsoft 365」が乗っ取られる 跡形もなくMFAを破る手口
-
9
Oracle巨大ITプロジェクトはなぜつまずいたのか 8年で導入1割、追加で170億ドル
-
10
MS月例パッチが1000件突破 人手不足の情シスを襲う「月1回メンテ」の崩壊
ホワイトペーパーランキング PR
-
1
生成AIのハルシネーションを防止 回答精度を高めるセマンティックレイヤーとは
-
2
5回聞くだけじゃ足りない? トヨタ式「なぜなぜ分析」の正しい実践方法
-
3
AIエージェントで多様な日常業務を効率化するための入門ガイド
-
4
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
5
「脱Excel」か「Excel快適化」か? 現場にやさしい業務改善の進め方
-
6
マンガで解説:「ゼロトラスト」「SASE」の必要性とメリット
-
7
5分で分かる「セキュア大容量ファイル転送サービス」の機能とメリット
-
8
情報セキュリティ対策早分かりガイド:25の自社診断で弱点と解決策を理解
-
9
国税庁の次世代基幹システム「KSK2」稼働開始に向けて、対応すべき変更点とは?
-
10
AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー