トークンコストで絶望しないために【前編】
気づけば請求額が爆発 LLMコストを膨らませる4つの落とし穴
LLMの利用拡大に伴い、入力・出力トークンの消費増加が課題となっているという声がある。トークンの請求額を膨らませる4つの要因と、増大を誘発させる従業員のアクションを紹介する。
トークンは、大規模言語モデル(LLM)が処理・生成するテキストの基本単位だ。プロンプトと回答に含まれる単語はトークンに分割され、その量に応じて課金される。
この支出を改善する手法に「トークンマキシング」(Tokenmaxxing)がある。トークンマキシングは、本来は従業員がAI使用量を競って「Token Legend」などのリーダーボード上位を狙い、トークン消費を最大化する行動を指す言葉として広まった。しかし、CFO(最高財務責任者)へのAIコスト説明を求められるCIO(最高情報責任者)の間では、より少ないトークンで最大の成果を出すコスト最適化を意味する用法も生まれている。本記事は後者の文脈で、トークンの請求額を膨らませる要因と、無駄な消費を引き起こすアクションを紹介する。
トークンマキシングの壁となるアクションは?
併せて読みたいお薦め記事
AIツール利用の勘所を把握する
LLMの取引には2つの側面がある。入力トークンは、システムプロンプト、会話履歴、参照文書、ユーザーのクエリなど、モデルに送信される全てをカバーする。出力トークンは回答をカバーし、モデルやプロバイダーにもよるが、通常は入力の2倍から4倍のコストがかかる。
価格はLLMの階層によっても異なる。最先端のフロンティアモデルは、小規模モデルよりも1000トークン当たりの単価が大幅に高い。
Deloitte Consultingで米国ハイブリッドクラウドインフラリーダーを務めるクリス・トーマス氏は、LLMをデプロイする方法によってもコストは変わると指摘する。オンプレミス、パブリッククラウドのAPI、コロケーションでは、同じモデルでもコストが異なる。「LLMで浪費してしまう理由の1つは、コスト構造全体でトークンがどこでどのように生成されるかを組織が理解していないことだ」とトーマス氏は言う。
トークンの請求額を膨らませる4つの要因
基本料金以外にも、トークンの請求額を膨らませる4つの隠れた要因がある。
1.プロンプトが長すぎる
毎回の呼び出しで、全文書やフィルタリングしていない検索結果全体をプロンプトに入力すると、1回あたりの入力トークン数が急増する。
2.文脈を毎回再投入する
呼び出しごとに同じシステムプロンプトやコンテキストを再送すると、同一トークンに繰り返し料金を支払う状態となる。
3.出力長の制限を明示しない
出力長の制限を明示しないと、LLMは必要以上に長いテキストを返す傾向がある。
4.AIエージェントを無駄にループさせてしまう
AIエージェントに明確な終了条件を設けないと、AIエージェントは再計画(re-plan)やモデル再呼び出し(recursive calls)を繰り返し、トークンのコストは爆発的に増える。
コスト増大につながるアクションは?
コストに影響する要因を知ることは重要だが、トークンの請求額を膨らませる行動を誘発させないことも大切だ。
「最大の浪費は会話ではなく構造にある」。ヘルスケアや非営利セクターでCIOやCTOを歴任したOrdovera Advisoryのマネジングディレクター、ブライアン・フェンディング氏はこのように説明する。「3パラグラフで済ませられるプロンプトのはずが、例えばクエリに入力するたびに50ページの文書を読み込むシステムを運用しているのであれば、設計段階の判断ミスでトークンを無駄に消費している状態だ」
AT&TのリードデータAIエンジニアであるモニカ・マリク氏は、一般的な導入環境で見られる複数の非効率なパターンとして以下を挙げる。
- 過剰なコンテキストを入力している
- 必要なのは一部であるにもかかわらず、文書全体や長いチャット履歴をプロンプトに流し込む。
- デフォルトで最上級モデルを使用する
- 分類、抽出、要約、ルーティングなどの作業は、安価なモデルで十分対応可能だ。
- RAG(検索拡張生成)の状態が不適切
- 検索するデータの中に不要なものが混ざっている。あるいは、フィルタリングやランキングをせずに生のテキストをそのまま渡している。
- プロンプトが肥大化している
- システムプロンプトや書式ルールを際限なく追加し、テンプレートがコスト高でメンテナンスが困難になっている。
- キャッシュを使っていない
- プロンプトや要約を再利用せず、呼び出しのたびに出力を再生成させている。
「LLMの導入初期は、コストを意識した設計よりも、導入の速さを優先しがちだ」。マリク氏はこう指摘する。しかし、利用規模が拡大すればコストは積み上がる。ソフトウェアベンダーJellyfishでAI研究の責任者を務めるニコラス・アルコラーノ氏は、「過剰にトークンを使っている状態からは、タスクの定義不足や不要な入力の繰り返しがうかがえる」と指摘する。
後編では、トークン量を抑制するための施策を紹介する。
Copyright © ITmedia, Inc. All Rights Reserved.
TechTarget発 先取りITトレンド
米国TechTargetの豊富な記事の中から、最新技術解説や注目分野の製品比較、海外企業のIT製品導入事例などを厳選してお届けします。
この記事の著者
関連記事
新着ホワイトペーパー PR
-
製品資料
[株式会社キーエンス] なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは -
製品資料
[株式会社セールスフォース・ジャパン] 「CRMは設計と無関係」は本当か? PLMとの融合で実現する高速開発 -
事例
[日本ヒューレット・パッカード合同会社] AIエージェントの時代にどう備える? 「新たな働き手」を支える3要素とは -
製品資料
[日本ヒューレット・パッカード合同会社] “横並びの自動化”から脱却、AI活用で生産性と競争力を高める秘訣 -
製品資料
[サイボウズ株式会社] AIが「わざわざ使うツール」になっていない? 業務で自然に使う導線にする秘訣
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
なぜ「全社配布Copilot」は使われないのか? 失敗に学ぶAI定着
-
2
情シスの約8割が転職や退職を意識 調査で分かった“辞めたくなる最大の理由”
-
3
法務と開発者で「言葉が通じない」問題 トヨタやソニーが語るOSS管理の真実
-
4
AIの導入効果はどう測る? DMM.comのエンジニア組織に学ぶ効果検証のノウハウ
-
5
【漫画付き】ひとり情シス協会が明かす、RAG導入でしくじる企業「2つの共通点」
-
6
損保ジャパンはなぜ「COBOL」を捨てなかったのか? 脱メインフレームの真相
-
7
情報漏えいはなぜ繰り返されるのか 今すぐ見直すべき「境界」
-
8
「Wi-Fi 7」経由でWindowsが乗っ取られる? 最高権限奪取の恐怖
-
9
なぜ「Gemini 4 Argon」は出遅れたのか? Googleが狙う“逆転のシナリオ”
-
10
「中堅・中小企業のネットワーク・セキュリティ運用実態」に関するアンケート
ホワイトペーパーランキング PR
-
1
不審メールの経路や見せ方に変化? 2026年夏の3事例から見えた動向と対処方法
-
2
家庭用Wi-Fiルーターの業務利用は危険? 避けるべき理由と具体的な対策
-
3
Microsoft 365を安全に運用 うっかりミスやサイバー攻撃に備えるデータ保護術
-
4
財務部門がAIを最大限に活用する方法 無駄のない戦略的リーダーシップへの道
-
5
LLMが兵器化? 元FBI高官が鳴らす警鐘とセキュリティツール統合のポイント
-
6
「オンプレミス回帰」せざるを得ない“合理的な理由”
-
7
なぜRPA導入は頓挫する? シナリオ作成の壁を乗り越える解決策とは
-
8
生成AIを開発に導入しても効果が見えない? 実証実験で分かった成果と課題
-
9
経産省DX指針から読み解く、受発注業務デジタル化ロードマップ
-
10
HDDを使わない「SSDオンリー」が無謀なのはなぜ?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー