Self-hosted LLM과 API: 팀의 총소유비용을 비교하는 방법
GPU 가격이나 Token 단가를 넘어 실제 workload, 품질, 운영과 장애 비용까지 반영하는 LLM TCO 비교 방법입니다.
GPU 가격과 100만 Token당 요금만 비교해서는 총비용을 알 수 없습니다. 로컬 모델에는 용량, 업데이트, 관측성, 보안, 백업, 엔지니어 시간이 필요합니다. API는 인프라 업무 일부를 줄이지만 사용량, 통합, 제한, 외부 Endpoint 의존 비용은 남습니다. 두 방식을 같은 작업과 같은 품질 기준으로 검증해야 합니다. 목표는 보편적인 승자가 아니라 팀이 되돌릴 수 있는 구성을 찾는 것입니다.
1. workload와 품질 경계를 먼저 고정하기
고정 schema 문서 분류, 내부 지식 검색, test를 실행하는 코드 리뷰, 구조화 보고서, background batch 등 반복 작업 3~5개를 고릅니다. 각 작업의 input/output 크기, 일반적인 하루의 실행 횟수, 피크 동시성, 허용 시간, 합격 조건을 기록합니다. JSON validator 통과, 근거 문서 제시, 특정 test 통과처럼 검증 가능한 기준을 사용합니다.
측정 가능한 종량제 API 사례로 BetterToken Dashboard는 시간, 모델, HTTP status, input, output, cache Token과 차감을 보여 줍니다. 현재 모델과 요금을 확인하고 Workspace의 실제 pilot 지표를 표에 옮기세요. BetterToken은 self-hosting 플랫폼이 아니며, 이 비교에서는 API 선택지 하나일 뿐입니다.
2. Self-hosted TCO에는 GPU 외 비용도 포함하기
일반 운영일 여러 날과 예상 피크 한 번 이상을 포함한 전체 주기로 측정합니다.
실제로 배포할 구성의 가격, 감가상각 기간, 사용 가능 메모리를 기록합니다. 게시물의 금액에는 섀시, 네트워크, 이중화, 배송, 지역 전기 요금이 빠질 수 있습니다. 작업이나 품질을 바꾸지 않고 모델과 context가 메모리에 들어가는지 확인합니다. Runtime 설치, 모델 검증, serving, 업데이트, profiling, queue, 관측성, 접근 제어, incident 대응 시간도 집계합니다.
로컬 배포는 데이터 위치를 더 통제할 수 있지만 자동으로 안전해지지는 않습니다. OS/runtime patch, secret, 네트워크 분리, audit logs, backup, 관리자 접근을 포함합니다. 중단 시간과 미처리 job도 기록하세요. 두 번째 노드, 복구 queue, 비민감 overflow용으로 승인된 API도 TCO에 들어갑니다. 특정 데이터를 외부로 보낼 수 없다면 가격 변수가 아니라 필수 제약으로 다룹니다.
3. API TCO에서 Token은 첫 항목일 뿐
Provider의 실제 usage schema에 맞춰 계산하고, input에 이미 포함된 cache Token을 중복 합산하지 않습니다.
2026년 8월 23일 BetterToken의 Claude 그룹 claude-sonnet-5 공개 데이터는 100만 input Token당 $1.36, 100만 output Token당 $6.80이었습니다. Cache 없이 input 100,000과 output 20,000을 사용하면 $0.272입니다. 이 예시는 모델, 그룹, 날짜에 한정됩니다. Pilot 전에 현재 가격을 다시 확인하고 cache read/write는 당시 schema와 요금으로 계산하세요. 통합, 401/429/5xx 처리, 제한된 retry, queue, 관측성, 결과 검증도 더합니다.
4. 일반 부하와 피크 부하를 나눠 측정하기
- 일반: 평소 업무 주간의 전형적인 흐름.
- 피크: 품질 검사를 끄지 않은 상태에서 사전 정의한 동시성과 task batch.
측정값은 시험한 구성만 설명하며 미래 안정성을 보장하지 않습니다.
5. 되돌릴 수 있는 pilot 실행하기
처음부터 전체 제품을 이전하지 마세요. 시나리오 하나를 고르고 공통 application interface를 유지한 채 provider를 adapter 뒤에 둡니다. Input, 품질, 금지 데이터를 고정하고 같은 sample로 양쪽을 실행합니다. 일반·피크, 같은 기간의 Token·인프라·팀 시간을 측정하고 로컬 노드와 외부 API 각각의 장애를 시험합니다. 구성 변경 후 핵심 작업을 반복하세요. 보고서에 API Key, .env, private prompt, 민감한 전체 응답을 넣지 않습니다.
6. 선택 기준과 종료 조건
데이터 위치 통제가 필수이고 workload가 예측 가능하며 운영을 맡을 팀이 있다면 self-hosting이 적합할 수 있습니다. 부하가 변하고 빠른 시작이 필요하거나 runtime 운영을 맡기 어렵다면 API가 적합할 수 있습니다. 민감 작업은 로컬에 두고 허용된 피크나 별도 시나리오만 API로 보내는 hybrid도 가능합니다.
- 품질, 피크, 업데이트 요건을 가용 엔지니어 시간 안에 충족하지 못하면 self-hosted pilot을 중단합니다.
- 필수 데이터를 외부 Endpoint로 보낼 수 없거나 합격 작업당 비용을 관리할 수 없으면 API pilot을 중단합니다.
- 모델, 요금, hardware, workload가 바뀌면 양쪽을 다시 계산합니다.
- 품질을 낮추거나 fallback을 빼서 얻은 낮은 총액은 선택하지 않습니다.
최종 산출물은 날짜, 구성, 품질, 피크 동작, 책임자를 담은 TCO 표여야 합니다.
출처
- BetterToken 현재 모델 및 API 요금
- BetterToken Docs
- BetterToken Public Pricing API,
claude-sonnet-5, 2026년 8월 23일 재확인 - BetterToken Product Fact Sheet, 2026년 7월 31일 버전