GPT-6 Luna와 GPT-5.6 Luna: 승인된 Codex 작업의 실제 비용 계산법
GPT-6 Luna의 토큰 단가는 GPT-5.6 Luna보다 훨씬 낮지만, Codex 모델은 표시 가격이 아니라 승인된 작업당 비용으로 선택해야 합니다. 이 글은 2026-09-25에 확인한 OpenAI Standard와 BetterToken 가격, 동일한 가상 토큰 구성, 승인률·재시도·소요 시간·전체 작업 비용을 비교하는 재현 가능한 방법을 제공합니다.
목차

Codex에서 결정해야 할 것은 어느 Luna 세대가 더 새로워 보이는지가 아니라, 다음 작업 묶음을 어느 모델로 시작하고 실패 후 언제 전환할지입니다. 이 글을 읽고 나면 시도당 비용으로 첫 후보를 고른 뒤, 승인률·재시도·수동 수정 시간을 더해 성공 작업 하나의 실제 비용을 계산할 수 있습니다.
먼저 선택하기: 자동 검증이 가능한 작업은 대부분 gpt-6-luna부터 시험한다
범위가 명확하고 테스트, lint, 승인 스크립트가 잘못된 결과를 빠르게 거를 수 있다면 gpt-6-luna가 더 나은 첫 후보입니다. 시도당 토큰 비용이 낮아 적은 예산으로 기준선을 만든 뒤, 복잡한 작업을 gpt-5.6-luna로 돌려야 할지 판단할 수 있습니다.
| 당신의 상황 | 먼저 할 일 | 권고가 바뀌는 조건 |
|---|---|---|
| 자동 테스트가 있는 작은 수정이나 일괄 변경 | gpt-6-luna부터 시작 | 반복 실패하거나 수동 수정이 가격 이점을 없앰 |
| 여러 파일 기능, 리팩터링, 인터페이스 변경 | 두 모델을 같은 조건으로 짝지어 시험 | gpt-5.6-luna가 재시도와 수정 시간을 뚜렷하게 줄이면 이 유형을 맡김 |
| 입력이 272K에 가깝거나 초과 | 불필요한 파일을 빼고 기록을 줄이거나 작업을 나눔 | 문맥을 줄일 수 없으면 긴 문맥 요금으로 비교 |
| ChatGPT 또는 Codex 플랜 한도를 사용 | API 표가 아니라 플랜 사용량과 Credit 규칙 확인 | API Key나 custom provider로 전환한 뒤 아래 토큰 가격 적용 |
공개 정보에는 같은 Codex 버전, 저장소, reasoning effort에서 두 모델을 짝지어 비교한 결과가 아직 없습니다. 가격으로 시험 순서는 정할 수 있지만, 기본 모델은 자신의 작업 데이터로 정해야 합니다.
인터페이스 한도는 비슷하며 코딩 품질을 예측하지 못한다
두 모델의 핵심 인터페이스와 문맥 한도는 비슷하므로 사양표만으로 자신의 코드베이스에서 어느 쪽이 더 신뢰할 만한지 알 수 없습니다. 둘 다 텍스트·이미지 입력, 텍스트 출력, Responses API, reasoning tokens, none부터 max까지 reasoning effort를 지원하며, 문맥 창은 1,050,000토큰, 최대 입력 922,000토큰, 최대 출력 128,000토큰입니다.
| 항목 | gpt-6-luna | gpt-5.6-luna |
|---|---|---|
| 공식 포지셔닝 | 집중된 대량 작업을 위한 고효율 모델 | 비용에 민감한 대량 workload용 모델 |
| 지식 기준일 | 2026-05-18 | 2026-02-16 |
| Context window | 1,050,000토큰 | 1,050,000토큰 |
| 기본 reasoning effort | medium | medium |
이 사양만으로는 어느 모델이 자신의 코드베이스에서 더 높은 승인률을 보이는지, 더 빨리 끝나는지, 재시도가 적은지 알 수 없습니다. Codex 결과는 작업 유형, context 품질, tool 권한, client 버전, reasoning effort, 승인 기준에도 영향을 받습니다.
272K 이하에서는 gpt-6-luna의 토큰 단가가 더 낮다
전체 입력 문맥이 272K 이하이면 gpt-6-luna의 입력·캐시 읽기·캐시 쓰기 단가는 gpt-5.6-luna의 절반이고, 출력 단가는 약 41.7%입니다. 표는 2026-09-25에 확인했으며 단위는 100만 토큰당 USD입니다. OpenAI Standard와 BetterToken API 과금만 비교하고 ChatGPT/Codex 플랜 한도나 Credit 과금은 포함하지 않습니다.
272K 이하: 이 표로 바로 계산한다
각 요청의 전체 입력 문맥이 272K 이하이면 이 요금 구간을 그대로 사용하고 긴 문맥 배율은 적용하지 않습니다.
| Model ID | 제공자 | 입력 | 캐시 읽기 | 캐시 쓰기 | 출력 |
|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.10 | $0.01 | $0.125 | $0.50 |
gpt-6-luna | BetterToken | $0.068 | $0.0068 | $0.085 | $0.34 |
gpt-5.6-luna | OpenAI Standard | $0.20 | $0.02 | $0.25 | $1.20 |
gpt-5.6-luna | BetterToken | $0.136 | $0.0136 | $0.17 | $0.816 |
BetterToken 가격은 동적으로 바뀔 수 있으므로 게시하거나 구매하는 날 현재 가격 확인을 하고 그날 페이지에 표시된 값을 사용해야 합니다. BetterToken은 OpenAI 공식 제품이 아닙니다. 위 가격은 API, Codex, custom Base URL을 지원하는 도구에서 사용하는 GPT 그룹의 종량제이며, ChatGPT 또는 Codex 구독 한도가 아닙니다.
이 모델들의 OpenAI Batch와 Flex 가격은 Standard의 50%이므로 여기에 표시한 BetterToken 가격보다 낮습니다. 본 비교에는 포함하지 않습니다. 따라서 이 표를 근거로 BetterToken이 모든 OpenAI 처리 방식보다 저렴하다고 말할 수는 없습니다.
272K 초과: 입력을 먼저 줄이고 필요하면 긴 문맥 요금을 쓴다
작업을 나눌 수 있다면 임계값을 넘기기 전에 불필요한 파일을 제외하고 기록을 줄이거나 일을 분할하세요. 임계값은 캐시 부분을 포함한 전체 입력 문맥으로 판단하며, 272K를 넘으면 입력·캐시 읽기·쓰기는 짧은 문맥 요금의 2배, 출력은 1.5배가 됩니다.
| Model ID | 제공자 | 입력 | 캐시 읽기 | 캐시 쓰기 | 출력 |
|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.20 | $0.02 | $0.25 | $0.75 |
gpt-6-luna | BetterToken | $0.136 | $0.0136 | $0.17 | $0.51 |
gpt-5.6-luna | OpenAI Standard | $0.40 | $0.04 | $0.50 | $1.80 |
gpt-5.6-luna | BetterToken | $0.272 | $0.0272 | $0.34 | $1.224 |
네 가지 토큰 항목을 분리하면 한 번의 시도 비용을 재계산할 수 있다
Codex 한 번의 시도를 계산할 때 비캐시 입력, 캐시 읽기, 캐시 쓰기, 출력을 나눠 기록하세요. 아래의 동일한 가상 사용량은 계산 방법을 보여 줍니다. 자신의 청구 내역으로 바꾸면 실제 시도당 비용을 구할 수 있습니다.
- 캐시되지 않은 입력 32,000토큰
- 캐시 읽기 160,000토큰
- 캐시 쓰기 16,000토큰
- 출력 8,000토큰
- 각 요청의 전체 입력 context가 272K 이하이므로 short-context 가격 적용
계산식은 다음과 같습니다.
작업 비용 = 캐시되지 않은 입력 / 1,000,000 × 입력 단가
+ 캐시 읽기 / 1,000,000 × 캐시 읽기 단가
+ 캐시 쓰기 / 1,000,000 × 캐시 쓰기 단가
+ 출력 / 1,000,000 × 출력 단가
| Model ID | 제공자 | 입력 비용 | 캐시 읽기 비용 | 캐시 쓰기 비용 | 출력 비용 | 시도 1회 합계 |
|---|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.003200 | $0.001600 | $0.002000 | $0.004000 | $0.010800 |
gpt-6-luna | BetterToken | $0.002176 | $0.001088 | $0.001360 | $0.002720 | $0.007344 |
gpt-5.6-luna | OpenAI Standard | $0.006400 | $0.003200 | $0.004000 | $0.009600 | $0.023200 |
gpt-5.6-luna | BetterToken | $0.004352 | $0.002176 | $0.002720 | $0.006528 | $0.015776 |
이 가상 토큰 구성에서 gpt-6-luna의 시도 1회 비용은 gpt-5.6-luna의 약 **46.6%**입니다. BetterToken은 두 모델에 동일한 가격 배수를 적용하므로 모델 간 비율은 두 제공자에서 같습니다. 그러나 이는 시도당 비용일 뿐, 성공한 작업당 비용은 아닙니다.
캐시 읽기를 따로 세지 않으면 비용을 과대·과소평가한다
캐시 읽기를 일반 입력 가격으로 계산해서도, 청구에서 빼서도 안 됩니다. Codex는 저장소 문맥, 대화 기록, 도구 결과를 반복해서 읽습니다. 캐시 토큰은 보통 더 싸지만 양이 많을 수 있어 “입력” 하나의 숫자로 합치면 계산이 틀립니다.
각 실행마다 input, cached input, cache write, output을 따로 보관해야 합니다. 접근 계층이 최종 금액만 보여 주고 네 가지 토큰 범주를 제공하지 않으면 어떤 모델이나 작업의 비용이 더 높은 이유를 설명하기 어렵습니다.
기본 모델은 성공 작업당 비용으로 선택한다
싼 호출이 싼 완료 작업을 보장하지는 않습니다. 실패, 롤백, 재시도의 API 비용을 모두 포함해야 합니다. 더 유용한 지표는 다음과 같습니다.
승인된 작업당 비용 = 모든 시도의 API 총비용 / 승인된 작업 수
최소한 다음 항목을 기록합니다.
- 승인률: 개발자가 해결책을 다시 작성하지 않고 사전 정의한 기준을 통과한 작업 비율
- 재시도: 동일 작업에 대한 추가 prompt, rollback, 새 model run
- 전체 소요 시간: 첫 토큰 지연이 아니라 시작부터 승인 가능한 diff까지의 시간
- 수동 수정: 개발자가 생성 코드를 수정했는지와 소요 시간
- 토큰 구성: 캐시되지 않은 입력, 캐시 읽기, 캐시 쓰기, 출력
위의 가상 OpenAI Standard 비용에서 시도당 비율은 0.010800 / 0.023200 ≈ 46.6%입니다. 토큰 구성이 동일하다고 가정하면 gpt-6-luna의 승인률이 gpt-5.6-luna 승인률의 약 46.6%를 넘는 동안 예상 API 비용은 더 낮습니다. 이는 가상 가격에서 나온 손익분기 관계일 뿐, 측정된 품질 결론은 아닙니다. 토큰 사용량, 재시도, 작업 구성이 바뀌면 기준도 달라집니다.
비교를 믿기 전에 다섯 가지 조건을 고정한다
각 모델을 한 번씩 실행하는 것은 신뢰할 만한 비교가 아닙니다. 같은 시작 상태, 동등한 작업, 같은 승인 기준이 필요합니다. 다음 다섯 단계는 캐시, 실행 순서, 사람의 판단에서 생기는 편향을 줄입니다.
1. 환경을 고정하기
두 모델에 동일한 Codex 버전, 시작 Git commit, 설정, tool 권한, reasoning effort, prompt, 승인 명령을 사용합니다. 한 모델은 OpenAI Standard로, 다른 모델은 다른 접근 경로로 호출한 뒤 지연이나 실패 차이를 전부 모델 탓으로 돌리면 안 됩니다.
2. 작업 유형을 분리하기
최소 세 가지 작업 유형을 따로 관리합니다.
| 작업 유형 | 예시 | 권장 승인 기준 |
|---|---|---|
| 작은 수정 | 한두 파일의 명확한 결함 | 대상 테스트 통과, 관련 없는 파일은 변경하지 않음 |
| 여러 파일 변경 | 기능, 리팩터링, 연동된 인터페이스 변경 | 전체 테스트와 lint 통과, 요구한 동작 구현 |
| 리뷰와 진단 | 버그 찾기, 위험 설명, 수정 제안 | 알려진 문제를 찾고 구체적인 코드 근거 제시 |
세 유형을 하나의 평균으로 합치지 마십시오. 작은 수정에서는 두 모델이 비슷해도 여러 파일 작업의 재시도율은 크게 다를 수 있습니다.
3. 모델 실행 전에 승인 기준 정하기
필수 테스트, 수정 가능한 디렉터리, 의존성 정책, 실패 조건을 미리 고정합니다. 출력을 본 뒤 기준을 낮추면 승인률은 의미가 없어집니다.
4. 모델 실행 순서 번갈아 바꾸기
항상 같은 모델을 먼저 실행하지 마십시오. 순서를 번갈아 바꾸거나 가능한 경우 동등한 독립 작업을 사용해 첫 실행 캐시, 환경 복구, 운영자 숙련도가 한쪽에 계속 유리하게 작용하지 않도록 합니다.
5. 작업별 원시 기록 보관하기
유용한 한 행에는 작업 ID, 작업 유형, Model ID, 제공자, 처리 tier, reasoning effort, 시작·종료 시간, 네 가지 토큰 범주, 시도 횟수, 통과 여부, 실패 이유, 수동 수정 시간, 최종 비용이 들어갑니다. 원시 행을 보관한 뒤 작업 유형별로 집계하십시오.
gpt-6-luna를 유지할 때와 gpt-5.6-luna로 바꿀 때
gpt-6-luna의 승인률이 가격 이점을 유지하고 수동 수정 시간도 비슷하다면 기본 후보로 계속 사용하세요. 작업 유형에 따라 결과가 달라지면 하나의 전역 모델을 강제하지 말고 유형별로 라우팅합니다.
| 관찰한 결과 | 권장 조치 |
|---|---|
gpt-6-luna 승인률이 gpt-5.6-luna 승인률의 약 46.6%를 넘고 토큰 구성과 수정 시간이 비슷함 | gpt-6-luna 유지. 기대 API 비용이 더 낮음 |
gpt-6-luna가 손익분기점 아래이거나 재시도·수정으로 총비용이 더 커짐 | 해당 작업 유형을 gpt-5.6-luna로 전환 |
작은 수정은 gpt-6-luna가 싸고 여러 파일 작업은 gpt-5.6-luna의 재작업이 적음 | 작업 유형별로 라우팅하고 하나의 범용 기본값을 고집하지 않음 |
| 차이가 주로 provider 지연, 오류, 제한에서 발생 | 같은 접속 경로로 다시 실행한 뒤 모델 차이로 판단 |
| 입력이 자주 272K를 초과 | 문맥을 최적화한 뒤 재시험하고 요금 구간 변화를 품질 차이로 오해하지 않음 |
46.6%는 위의 가상 토큰 구성에만 해당합니다. 출력 길이, 캐시 사용, 재시도 횟수가 다르면 각 모델의 실제 시도당 비용으로 손익분기점을 다시 계산하세요.
권고: gpt-6-luna로 기준선을 만들고 성공 작업 비용으로 결정한다
오늘 하나를 골라야 한다면 범위가 명확하고 자동 검증할 수 있는 작업은 gpt-6-luna부터 시작하세요. 복잡한 작업의 대표 표본은 남겨 같은 조건에서 gpt-5.6-luna를 대조군으로 실행하고, 한 번의 호출 가격만 비교하지 마세요.
동등한 작업 묶음을 완료한 뒤 승인률, 평균 재시도, 수동 수정 시간, 성공 작업당 비용을 계산합니다. gpt-6-luna가 계속 더 싸면 기본값으로 유지하고, 특정 유형에서 gpt-5.6-luna가 높은 단가를 상쇄할 만큼 재작업을 줄이면 그 유형만 전환하세요.
공식 자료
모델 사양과 OpenAI 가격은 아래 세 공식 페이지에서 다시 확인하면 됩니다.