フラッシュドライブの信頼性向上【前編】
SSDの信頼性検証の歴史を振り返る
物理的破損が生じない分だけHDDよりも信頼性が高いとされるSSD。しかしSSDにもデータが破損する問題が存在した。まずはSSDの課題が検証されてきた歴史を再確認しよう。
SSDはPCやサーバベースコンピューティングの速度を向上させる。デジタル変革に乗り出して、AI(人工知能)などの技術を使ってデータから優れた洞察を得ようとするなら、ストレージ容量を増やすだけでなくアクセス速度も上げる必要がある。
Total Gas & Powerはフラッシュストレージを導入して、クラウドサービスとの統合を必要とするオンプレミスアプリケーションの速度を向上させる可能性を探っている。同社はNutanixのハイパーコンバージドインフラを導入すると同時に、NetAppのファイラーをフラッシュベースのストレージアレイに置き換えた。
「当社は大掛かりな統合に取り組んでいる」と話すのは、Total Gas & Powerでテクノロジーアーキテクトを務めるドミニク・メイドメント氏だ。同社はAPIの管理にMuleSoft製品を使用し、フラッシュがハイブリッド統合をどの程度サポートするかを探っている。「オンプレミスのデータ資産は、アクセスを可能な限り高速かつ軽量にしなければならない」とメイドメント氏は語る。
ストレージの革命
HDDは、1分間に数千回転する円盤と各円盤のほんの数マイクロメートル上に浮かぶヘッドから成る。浮揚するヘッドが円盤にぶつかるとデータが欠損する恐れがある。SSDはNANDフラッシュメモリを使っており、回転する円盤が不要なのでHDDよりも信頼性が高いといわれる。本当にそうだろうか。
SSDは極めて信頼性が高い。だが、それでもデータ損失を引き起こす傾向があり、データ破損を防ぐための対策を必要とする。
SSDはデータをブロック単位でメモリに格納する。つまり、データは1ページ当たり4KBずつSSDに書き込まれる。消去は256KBのブロック単位だ。ここまでは問題ない。だが、2008年にジェット推進研究所(JPL:Jet Propulsion Laboratory)が行った調査によると、SSDの同じメモリブロックに書き込みと消去を連続的に繰り返すとエラーの発生率が高まるという。
データストレージ企業Qumuloで製品管理部門のバイスプレジデントを務めるベン・ギテンスタイン氏は、SSDのセクターに一定数の上書きを繰り返すと使えなくなると話す。つまり、SSDは限られた回数の書き込みを行うと「摩耗」する。
2008年のJPLの調査によると、多くのシステムがウェアレベリングを実装していたという。ウェアレベリングによってデータをあるブロックから別のブロックに頻繁に移し、各ブロックの書き込みと消去のサイクルを他のブロックと均等にする。
データブロックの動的管理以外に、SSDを必要以上にプロビジョニングするという対策も取る傾向がある。必要以上にプロビジョニングしておけば、不良セクターがあっても動的再割り当てが可能になる。大規模データセンターでは、エラーや不良チップを減らすために定期メンテナンスを行って、SSDを定期的に交換する必要がある。
2016年、データセンターでのSSDの使用を調べていた研究者は、SSDが稼働する日数の大半で修復不可能なエラーが最低1回は起きると警告した。ただしその研究者によると、ユーザーの目に触れないようにドライブを隠せる透過的エラーは、ユーザーの目に触れる非透過的エラーに比べればめったに起きないという。
データセンターにおけるフラッシュストレージの信頼性に関するこの研究結果は、米カリフォルニア州サンタクララで開催された「14th USENIX Conference on File and Storage Technologies」(Fast'16)で、トロント大学のビアンカ・シュレーダー准教授とGoogleでエンジニアを務めるラガフ・ラギセッティ氏およびアリフ・マーチャント氏によって発表された。
この研究は、Googleのデータセンターで6年間かけて評価された。その結果、SSDはHDDよりも交換率が大幅に低かったという。ただし、修復不可能なエラーの発生率はSSDの方が高かった。
この研究では、さまざまな世代のフラッシュ技術を使った幅広いSSDで同じデータの読み取りと書き込みを調べている。テスト対象の全システムで同じエラー訂正コードが使われた。その結果、最も発生したエラーは操作を再試行しても解決できない読み取りエラーだった。このエラーが非透過的エラーと呼ばれる。
この研究論文では、書き込みエラーが非透過的エラーになることはほとんどないとして次のように記されている。「このモデルで最終的に書き込みエラーとなったのは、全ドライブの1.5~2.5%。1万台のドライブのうち1~4台だった。最終的な書き込みエラーとは、再試行しても書き込み操作が成功しなかったことを指す」
最終的な読み取りエラーと最終的な書き込みエラーに頻度の違いがあるのは、書き込み操作に失敗してもドライブ上の他の場所への書き込みを再試行している可能性が高いとして研究者は次のようにまとめている。「読み取りエラーは読み取りを行ったセルの一部のみの信頼性が低かったことに原因がある。最終的な書き込みエラーが起きるのは、ハードウェアに大規模の問題が起きていることを示している」
研究では、最大80%のドライブで不良データブロックが生じ、テスト対象のドライブの2~7%でライフサイクルの最初の4年間に不良NANDフラッシュメモリチップが生じていたことが分かった。不良チップを除外するメカニズムがなければ、こうしたドライブは修理するかメーカーに返却する必要があるという。
後編(Computer Weekly日本語版 9月16日号掲載予定)では、セルの摩耗だけでなくPCIeバス経由でのデータ転送で生じる問題とSSDの展望を紹介する。
Copyright © ITmedia, Inc. All Rights Reserved.
Computer Weekly日本語版
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[o9ソリューションズ・ジャパン株式会社] 「改正物流効率化法対策」徹底解説 総物流費を抑制するサプライチェーン戦略 -
製品資料
[o9ソリューションズ・ジャパン株式会社] 「サプライチェーン最適化」実践ガイド:効果的な意思決定を実現する秘訣とは? -
製品資料
[株式会社リンプレス] 非デジタル/IT人材を「自走するDX推進者」に変えるための育成ロードマップ -
市場調査・トレンド
[ワンアイルコンサルティング株式会社] AI時代の組織設計:「判断と責任」を人に残すための2つの原則とは? -
技術文書・技術解説
[ワンアイルコンサルティング株式会社] システムの保守がモダン化を阻む? 「変えない判断」から脱却する方法とは
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
「完璧な設計」なのに3000万円溶けた AWSの失敗事例から学ぶ3つの教訓
-
2
LLMの「過学習」、正しく説明している文章はどれ?
-
3
100億円の「Linux更新」を回避 みずほ銀行が選んだ“おきて破り”のRHEL延命策
-
4
1200万円のSaaS導入を回避 スギ薬局「運用費10万円」のAIエージェント構築術
-
5
Microsoft製品でここまで自動化できる 情シスがやめられる手作業10選
-
6
「AIバブル」は崩壊するのか? 熱狂の後に来る“尻拭い”と4つの防衛策
-
7
パナソニックが国内製造26拠点のERPを「SAP S/4HANA」に統一 アドオン7割削減
-
8
高額な「AI PC」を一般従業員も使えたら? 費用のハードルを一気に下げる方法
-
9
脱VMwareの前提が崩れる BroadcomのVDDK公開停止で確認すべき点
-
10
「コピペ運用の限界」に直面するAI活用 7割超が“別画面”のまま使う理由は?
ホワイトペーパーランキング PR
-
1
JR西日本ITソリューションズが「監視業務の属人化」を解消した方法とは?
-
2
インシデント対応工数を約3割削減、東京ガスの事例に学ぶ監視体制刷新のコツ
-
3
生成AIで文書活用を進めるには? 効率化と安全性をどう両立する
-
4
Windows PCとMacの選択制で生産性向上 LINEヤフーが実践する運用管理方法とは
-
5
DX/AI投資の壁を突破、現代の最高財務責任者が直面する課題と克服のヒント
-
6
「Google Workspace」活用事例34選、先進の生成AIによる組織変革の全貌
-
7
「人員を増やす」という選択肢はない 情シスが負の連鎖から抜け出すには?
-
8
Linuxのスキルを証明する“激推し”の認定資格はこれだ
-
9
「問題が深刻化しやすいプロジェクト管理」から脱却する方法とは?
-
10
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー