生成AIの台頭で変わるストレージ市場
NASやSANではなく「オブジェクトストレージ」が“AI時代の主役”に躍り出る?
大量のデータを扱うAI活用プロジェクトでは、ストレージの選定が重要な要素の一つになる。企業はNAS、SAN、オブジェクトストレージといった選択肢から最適なストレージを選択することが求められている。
大規模言語モデル(LLM)をはじめとする生成AI(AI:人工知能)の導入が進む中、企業はAIモデルの学習データだけでなく、AIモデルの出力データも管理する必要がある。
大量のデータを扱う生成AIの導入プロジェクトでは、システム全体のストレージ戦略を見直すことが不可欠だ。特に、ストレージエリアネットワーク(SAN)、ネットワーク接続ストレージ(NAS)、オブジェクトストレージなど、多様なストレージ方式の中から最適なものを選択することが重要な課題となっている。
本稿は、各ストレージの特徴を整理するとともに、生成AIの業務活用が広がる中でストレージ要件がどのように変わっていくのかを考察する。
NASやSANではなく「オブジェクトストレージ」が主流になるのか?
生成AIの導入プロジェクトで扱う大量のデータが1カ所に集約されていることはまれだ。データベースに格納された構造化データだけでなく、文書、画像、音声などの非構造化データを含む複数のデータソースから横断的にデータを取得することになる。これらのデータは、オンプレミス環境とクラウド環境の双方に分散して存在していることがほとんどだ。
特にLLMの性能は、学習データの量と多様性に左右されるため、自社が保有するさまざまな業務データをLLMと連携させ、回答の精度や自社業務への関連性を高めようとする動きが加速している。このようなデータには、文書ファイルに加え、業務アプリケーションが利用するリレーショナルデータベース(RDB)内の構造化データも含まれる。
これらのデータをどこに保存し、どうアクセスするかは、生成AIの導入プロジェクトにおける重要な検討事項の一つだ。最も単純な方法は、既存のストレージにあるデータをそのまま活用することだが、以下のような理由から常に可能とは限らない。
- データの前処理をする必要がある
- AIアプリケーションを本番システムから隔離して運用する必要がある
- 既設ストレージのスループットでは、AIモデルの処理要件を満たせない
ベクトル化によるデータ量の急増も無視できない要因だ。ベクトル化とは、文書や画像、音声などのデータを、AIが処理できるように数値(ベクトル)に変換する処理を指す。場合によっては、この処理によってデータ量が10倍以上に膨れ上がることもあるため、スケーラビリティ(拡張性)を備えたストレージが求められる。
AI活用のフェーズによって求められるストレージ性能も異なる。学習フェーズでは、前処理されていない大量のローデータ(生データ)を高速に取り込む必要がある。推論フェーズでは、扱うデータ量は学習フェーズほど多くないものの、レイテンシやスループットの値がパフォーマンスを左右する。特に学習段階では、ストレージ間でデータを移行する際に発生するオーバーヘッド(転送負荷や遅延)が、パフォーマンスとコストにどの程度影響を与えるかを慎重に見極める必要がある。
NASとSAN、どちらにデータを置くか
一般的に、企業は非構造化データをNASに保存する傾向がある。NASは導入や拡張が比較的容易でコスト効率にも優れ、DAS(直接接続型ストレージ)に比べて扱いやすいという特長がある。
一方、構造化データはブロックストレージであるSANに保存されるのが一般的だ。ERP(統合基幹業務システム)やCRM(顧客関係管理)などの業務アプリケーションでは、データベースファイルをSANまたはDASに配置しているケースが多い。小規模なAIプロジェクトであれば、DASでも要件を満たせることがある。実際のAIプロジェクトでは、NASとSANの両方からデータを読み込む構成が一般的となっている。
ストレージベンダーStorMagicでチーフプロダクトオフィサーを務めるブルース・コーンフェルド氏は、「重要なのは、AIモデルがデータへアクセスする方法だ」と指摘する。例えば、データをSANに保存しても、AIモデルがブロック単位でデータを読み込めるとは限らない。多くの場合、AIモデルがブロックストレージ内のデータにアクセスする際は、ファイルアクセスプロトコルを介して処理する。
どのストレージが最適かは、扱うデータの種類や求められる処理性能によって異なる。文書や画像など比較的負荷の小さいデータを扱うAIシステムの場合、NASで十分な性能を確保できることがある。自動運転やリアルタイム監視などの高性能が求められるアプリケーションは、SANなど高速なストレージが適している。
オブジェクトストレージという選択肢
AIプロジェクトにおける大規模データの保存基盤として注目を集めているのがオブジェクトストレージだ。従来はクラウドでの利用が中心だったが、近年ではオンプレミス環境への導入も拡大している。
オブジェクトストレージは以下のような特性を持つ。
- シンプルな構造
- ファイル階層を持たず、全てのデータグローバル名前空間で一元的に管理する。
- 管理が容易
- 複雑なパスやフォルダ構成の管理が不要。
- スケーラビリティの高さ
- 物理ストレージを意識せずに、容量を柔軟に拡張できる。
- 低コスト
- 大容量データを長期保存するユースケースに適しており、アーカイブ用途などにも強みを発揮する。
ただし、オブジェクトストレージはこれまで、スループットやレイテンシといった性能面で課題があるとされていた。そのためリアルタイム性や高速処理が求められるAIアプリケーションには不向きとされ、主にバックアップやアーカイブなどの用途で使われてきた
しかし近年では、こうした制約を克服するストレージ製品や技術が登場している。例えば、Pure Storageの「FlashBlade」やNetAppの「ONTAP」搭載製品は、オブジェクト形式以外にも複数のデータアクセスに対応している。1つのストレージから複数のアクセス方法を使い分けることで、用途に応じて効率よくデータを扱えるようになった。
Hammerspaceの「Hyperscale NAS」のように、ファイル共有システムNFS(Network File System)でアクセスするストレージでも高いスループットを実現できる製品も開発されている。
AI時代におけるストレージの在り方とは
生成AIの導入プロジェクトにおいては、NASやSAN、オブジェクトストレージ、DASを組み合わせて活用するのが現実的なアプローチとなる。ただし、どのストレージをどう使い分けるかという判断は、AI活用のフェーズや、AI開発ツールの進化に応じて変化する可能性がある。
スミス氏によると、非構造化データ向けのストレージ基盤に対するニーズは明らかに高まっている。一方で、ブロックストレージやベクトルデータベースに関しては、既存のハードウェア構成で多くの企業が十分に対応できている状況だという。
「生成AIにとって重要なのは、データ間の“意味的な関係性”を正しく捉えることだ」とスミス氏は説明する。生成AIの理解の土台となるのが、文書、画像、音声、ソースコードといった非構造化データで、これは通常、ファイル形式やオブジェクト形式で保存されている。そこから生成されるベクトルデータは、高速な読み書きが必要になるため、主にブロックストレージに格納される。「つまり、AIのワークフロー全体では、非構造化データからベクトルデータという処理段階に応じて、異なるストレージ形式が適材適所で使われているということだ」(同氏)
Copyright © ITmedia, Inc. All Rights Reserved.
Computer Weekly発 世界に学ぶIT導入・活用術
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[o9ソリューションズ・ジャパン株式会社] 「改正物流効率化法対策」徹底解説 総物流費を抑制するサプライチェーン戦略 -
製品資料
[o9ソリューションズ・ジャパン株式会社] 「サプライチェーン最適化」実践ガイド:効果的な意思決定を実現する秘訣とは? -
製品資料
[株式会社リンプレス] 非デジタル/IT人材を「自走するDX推進者」に変えるための育成ロードマップ -
市場調査・トレンド
[ワンアイルコンサルティング株式会社] AI時代の組織設計:「判断と責任」を人に残すための2つの原則とは? -
技術文書・技術解説
[ワンアイルコンサルティング株式会社] システムの保守がモダン化を阻む? 「変えない判断」から脱却する方法とは
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
1200万円のSaaS導入を回避 スギ薬局「運用費10万円」のAIエージェント構築術
-
2
現役エンジニアに聞く「顔認証システム」開発の舞台裏
-
3
ソフトウェア開発生産性向上に取り組む企業は4割 調査で学ぶ「停滞」の正体
-
4
エージェンティックAIで、コンタクトセンターの「おもてなし」をどう進化する?
-
5
クラウド資格コレクターは評価されない? 年収1000万を分ける“OSの理解度”
-
6
「完璧な設計」なのに3000万円溶けた AWSの失敗事例から学ぶ3つの教訓
-
7
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
8
Microsoft製品でここまで自動化できる 情シスがやめられる手作業10選
-
9
なぜMicrosoft製品か Copilotで問い合わせ6割減の企業事例
-
10
年収700万超エンジニアに共通するスキルと「もっと勉強すべきだった分野」
ホワイトペーパーランキング PR
-
1
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
2
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
3
「Google Workspace」活用事例34選、先進の生成AIによる組織変革の全貌
-
4
DX/AI投資の壁を突破、現代の最高財務責任者が直面する課題と克服のヒント
-
5
「人員を増やす」という選択肢はない 情シスが負の連鎖から抜け出すには?
-
6
Windows PCとMacの選択制で生産性向上 LINEヤフーが実践する運用管理方法とは
-
7
生成AIで文書活用を進めるには? 効率化と安全性をどう両立する
-
8
「問題が深刻化しやすいプロジェクト管理」から脱却する方法とは?
-
9
Linuxのスキルを証明する“激推し”の認定資格はこれだ
-
10
NTTドコモが実践したクラウド統合監視 業務量2倍でも残業削減を実現できた理由
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー