セルフホストLLMとAPI:チームの総保有コストを比較する方法
GPU価格やToken単価だけでなく、実際のworkload、品質、運用、障害対応まで含めてLLMのTCOを比べる方法です。
目次
GPU価格と100万Token当たりの単価だけでは、総コストは分かりません。ローカルモデルには、計算資源、更新、可観測性、セキュリティ、バックアップ、エンジニアの担当時間が必要です。APIではその一部を外部化できますが、利用料、統合、制限、外部Endpointへの依存は残ります。同じタスクと同じ合格基準で比較し、万能な勝者ではなく、自社で撤回可能な構成を選びます。
1. workloadと品質境界を先に固定する
固定schemaへの文書分類、社内ナレッジ検索、testを伴うコードレビュー、構造化レポート、background batchなど、反復するタスクを3~5件選びます。各タスクについて、input/output量、通常日の実行数、ピーク同時実行数、許容時間、合格条件を記録します。JSON validator、根拠資料、test結果のような検証可能な条件が必要です。
| シナリオ | 1日の実行数 | ピーク同時実行 | Input / Output | 許容時間 | 品質基準 |
|---|---|---|---|---|---|
| 文書分類 | schema valid | ||||
| コードレビュー | test合格 | ||||
| 社内検索 | 出典確認済み |
API側の比較には現行料金を使います。 TCO計算に入れる前にBetterTokenのモデルと料金を確認してください。BetterTokenの現行料金を見る
従量課金APIの測定例として、BetterTokenのDashboardでは時刻、モデル、HTTP status、input、output、cache Token、課金を確認できます。現行モデルと料金を確認し、Workspaceの実測値を比較表へ移します。BetterTokenはself-hosting基盤ではなく、この比較ではAPI側の一例です。
2. セルフホストTCOはGPU以外も数える
通常日を数日と想定ピークを含む運用周期で測定します。
self_hosted_tco =
hardware_amortization
+ hosting_and_electricity
+ storage_and_network
+ engineer_time
+ monitoring_and_security
+ backup_or_overflow
+ incident_cost
実際に導入する構成、償却期間、使用可能メモリを使います。公開された金額には筐体、ネットワーク、冗長化、配送、地域の電力料金が含まれない場合があります。モデルとcontextが、タスクや品質を変えずにメモリへ収まるか確認します。Runtime導入、モデル検証、serving、更新、profiling、queue、可観測性、アクセス制御、障害対応の工数も記録します。
ローカル実行はデータ配置を制御しやすくしますが、自動的に安全になるわけではありません。OS/runtime更新、secret、ネットワーク分離、audit logs、backup、管理者権限を含めます。停止時間と未処理jobも計測し、第2ノード、復旧queue、非機密overflow用に許可したAPIもTCOへ入れます。外部送信禁止データは価格ではなく必須制約です。
3. API TCOはTokenだけではない
Providerの実際のusage schemaに合わせ、inputに含まれるcache Tokenを二重計上しません。
api_tco =
uncached_input_cost
+ cache_read_cost
+ cache_write_cost
+ output_cost
+ retry_cost
+ integration_and_operations
+ incident_or_fallback_cost
Pilotの前に、自分のkeyで利用可能なModel IDを選び、BetterTokenのカタログにある現行料金を表へ記録します。cache read/writeは実際のusage schemaと別途表示される現行料金だけで計算し、欠けている値をゼロで補わないでください。統合、401/429/5xx処理、制限付きretry、queue、可観測性、結果検証も加えます。
4. 通常負荷とピーク負荷を分ける
- 通常: 一般的な稼働週の流量。
- ピーク: 品質確認を無効にせず、事前定義した同時実行数とbatch。
| 指標 | セルフホスト:通常 / ピーク | API:通常 / ピーク |
|---|---|---|
| 合格結果 | / | / |
| p50 / p95時間 | / | / |
| エラーとretry | / | / |
| エンジニア工数 | / | / |
| 期間コスト | / | / |
結果はテスト構成だけを表し、将来の安定性を保証しません。
5. 可逆的なpilotを行う
最初から全製品を移行せず、1シナリオを選び、共通interfaceを保ち、providerをadapterの後ろへ置きます。同じsampleで両方を実行し、通常・ピーク、同期間のToken・基盤・工数を測定します。ローカルノード停止と外部API停止を試し、構成変更後に主要タスクを再実行します。報告書にAPI Key、.env、private prompt、機密回答全文を含めません。
6. 選択条件と撤退条件
データ配置が必須で、workloadが予測でき、運用担当を置けるならself-hostingが候補です。負荷変動、短期導入、runtime運用を避けたい場合はAPIが候補です。機密処理をローカルに残し、許可済みのピークや別用途だけAPIへ送るhybridもあります。
- 品質、ピーク、更新要件を工数内で満たせなければself-hosted pilotを停止する。
- 必須データを外部へ送れない、または合格タスク単価を管理できなければAPI pilotを停止する。
- モデル、料金、hardware、workload変更時は両方を再計算する。
- 品質低下やfallback削除で得た低価格を採用しない。
成果物は、日付、構成、品質、ピーク挙動、責任者を記したTCO表です。
出典
- BetterTokenの現行モデルとAPI料金
- BetterToken Docs
- BetterToken Product Fact Sheet