초대하고 적립

초대 보상 안내

초대 링크를 공유하세요. 친구가 링크로 가입하고 충전하면 이후 충전마다 표시된 보상을 받을 수 있습니다.

GPT-6 Astra·Sol·Luna 선택법: 작업 난이도와 총비용으로 라우팅하기

범위가 명확하고 검증하기 쉬운 작업은 GPT-6 Luna를 저비용 출발점으로, 복잡한 코딩과 에이전트 워크플로는 Sol을 기본 후보로, 실패 비용이 큰 최난도 엔드투엔드 작업은 Astra를 후보로 삼습니다. 이 글은 OpenAI Standard와 BetterToken 가격, 272K 초과 장문 컨텍스트 구간, 캐시, Codex 구독과 API 과금의 차이, GPT-5.5에서 통제된 방식으로 마이그레이션하는 방법을 설명합니다.

목차
GPT-6 Astra·Sol·Luna 선택법: 작업 난이도와 총비용으로 라우팅하기

Luna가 가장 저렴하고 Astra가 가장 강력하다는 사실만으로는 지금 작업에 20배, 100배의 Token 가격을 지불할 가치가 있는지 알 수 없습니다. 기본 규칙은 명확합니다. 자동 검증이 가능한 대량 작업은 Luna, 복잡한 코딩과 일반 에이전트 워크플로는 Sol, 모호하거나 실패 비용이 큰 엔드투엔드 작업은 Astra부터 시작합니다. 이 글을 읽고 나면 시작 모델, 에스컬레이션 신호, 동일 Token 사용량의 OpenAI Standard와 BetterToken 비용을 판단할 수 있습니다.

시작점: 검증 가능한 대량 작업은 Luna, 복잡한 개발은 Sol, 비싼 실패는 Astra

작업 경계와 실패 비용으로 시작 모델을 고른 뒤, 직접 측정한 승인 데이터로 기본 경로를 수정합니다.

모델OpenAI의 공식 포지셔닝우선 배정하기 좋은 작업상위 모델로 올릴 조건
gpt-6-luna집중형·대량 작업을 위한 효율적인 모델범위가 작은 수정, 구조화 추출, 분류, 형식 변환, 명확한 명세에 따른 테스트 작성, 결정적 검증이 있는 배치 작업검증이 반복해서 실패함, 여러 파일을 아우르는 추론이 필요함, 도구 체인이 길어짐, 핵심 모호성이 남음
gpt-6-sol복잡한 코딩과 에이전트 워크플로를 위해 설계된 모델여러 파일에 걸친 기능 개발, 디버깅, 코드 리뷰, 여러 도구 호출이 필요한 저장소 작업, 경계가 명확한 중간 난도의 조사·문서 작업잘못된 계획의 영향이 큼, 여러 번 계획해도 핵심 제약을 놓침, 시스템 간 절충이나 어려운 조사가 필요함
gpt-6-astra가장 어려운 엔드투엔드 작업을 위한 OpenAI의 최고 성능 모델아키텍처 결정, 복잡한 마이그레이션, 시스템 간 장애 분석, 고위험 코드 변경, 조사·문서 작성·computer use가 결합된 긴 작업Astra가 이 세 모델 중 최상위임. 여전히 실패하면 이름만 보고 더 올리지 말고 작업 범위를 줄이고, 근거를 보강하거나 사람의 판단 지점을 추가해야 함

핵심은 “쉬워 보이는 모든 작업은 항상 Luna”라는 고정 규칙이 아닙니다. 요구 품질 기준을 안정적으로 통과하는 가장 저렴한 모델을 찾는 것이 목적입니다. 저렴한 모델이 반복 재작업을 일으키면 최종 비용은 더 높아질 수 있습니다. 반대로 명세가 잘 정리된 모든 작업을 Astra로 시작하면 실제로 쓰지 않는 능력에 비용을 지불할 수 있습니다.

공개 문서에는 Astra, Sol, Luna를 동일한 실제 작업에서 독립적으로 비교한 결과가 아직 없습니다. 이 매트릭스를 실행 가능한 출발점으로 사용하고, 첫 시도 승인율, 재시도, 승인 결과까지의 실제 시간, 승인 작업 1건당 총비용을 기록하세요.

비슷한 컨텍스트 한도가 모델을 서로 대체 가능하게 만들지는 않는다

세 모델의 컨텍스트와 도구 범위는 비슷하므로 창 크기보다 작업 형태, 추론 설정, 실패 비용이 더 중요합니다. OpenAI는 Astra를 복잡한 추론·코딩·computer use·조사·문서 작성, Sol을 복잡한 코딩과 에이전트 워크플로, Luna를 집중형 대량 작업에 배치합니다. 이는 첫 후보를 고르는 기준이며, 기본 모델은 실제 작업 결과로 정해야 합니다.

세 모델 모두 컨텍스트 창은 1,050,000 Token, 최대 입력은 922,000 Token, 최대 출력은 128,000 Token입니다. 따라서 단순히 컨텍스트가 들어가는지만으로는 모델을 구분하기 어렵습니다. 실무에서는 다음 차이가 더 중요합니다.

  • Astra의 reasoning.effort는 low, medium, high, xhigh, max를 지원합니다.
  • Sol과 Luna는 none도 지원하며 기본값은 medium입니다. 범위가 명확한 작업에서는 낮은 추론 강도부터 시험해야 비용 증가가 모델 때문인지 불필요한 reasoning 때문인지 구분할 수 있습니다.
  • 도구 사용이 많은 에이전트 워크플로는 Responses API를 우선하는 편이 좋습니다. Sol과 Luna에서 Chat Completions의 function calling을 사용할 때는 reasoning_effort가 none이어야 합니다.
  • 모델, 컨텍스트, reasoning, 도구, retrieval, 캐시는 모두 사용량에 영향을 줍니다. Prompt 길이만으로 작업 비용을 추정할 수는 없습니다.

공정한 비교를 하려면 인터페이스, 컨텍스트, 도구, reasoning effort, 최대 출력, 승인 조건을 동일하게 고정해야 합니다. 여러 변수를 동시에 바꾸면 관측된 차이가 모델이 아니라 설정 차이에서 생길 수 있습니다.

같은 Token이라면 BetterToken은 OpenAI Standard와 비교한다

동일한 Token 사용량에서 2026-09-24에 확인한 BetterToken 요금은 대응하는 OpenAI Standard 요금의 68%였습니다. 항상 최저 경로라는 뜻은 아닙니다. OpenAI Batch와 Flex는 더 낮고, 재시도·도구·사람의 재작업을 포함한 총비용으로 판단해야 합니다. 표는 USD·100만 Token당, 입력 컨텍스트 272K 이하 요금입니다.

Model ID제공처입력캐시 읽기캐시 쓰기출력
gpt-6-astraOpenAI Standard$10.00$1.00$12.50$50.00
gpt-6-astraBetterToken$6.80$0.68$8.50$34.00
gpt-6-solOpenAI Standard$2.00$0.20$2.50$10.00
gpt-6-solBetterToken$1.36$0.136$1.70$6.80
gpt-6-lunaOpenAI Standard$0.10$0.01$0.125$0.50
gpt-6-lunaBetterToken$0.068$0.0068$0.085$0.34

한 요청의 입력 컨텍스트가 272K를 넘으면 두 서비스 모두 세 GPT-6 모델에 장문 컨텍스트 구간을 적용합니다. 입력, 캐시 읽기, 캐시 쓰기는 표의 2배, 출력은 1.5배가 되며 높은 구간이 요청 전체에 적용됩니다. 예를 들어 장문 컨텍스트의 gpt-6-sol은 입력/캐시 읽기/캐시 쓰기/출력 순으로 OpenAI Standard에서 $4.00/$0.40/$5.00/$15.00, BetterToken에서 $2.72/$0.272/$3.40/$10.20입니다.

가격은 동적으로 바뀝니다. 프로덕션 적용 전 현재 가격 확인을 통해 모델 제공 여부, 통화, 적용 구간을 다시 확인해야 합니다. OpenAI Batch와 Flex는 현재 Standard의 50%이며 이 시점의 BetterToken 요금보다 낮습니다. 비동기 처리나 낮은 우선순위 처리가 가능하다면 OpenAI Standard와 같은 비교 기준에 섞으면 안 됩니다. 표에는 지역 처리 추가 요금, 도구 호출, 컨테이너, 재시도 비용도 포함하지 않았습니다.

BetterToken의 GPT 그룹은 API, Codex, 사용자 지정 Base URL을 지원하는 외부 도구에서 사용할 수 있습니다. BetterToken은 OpenAI 공식 제품이 아니며, BetterToken API 사용량은 ChatGPT나 Codex 구독의 메시지 수, 포함 용량, credits와 동일하지 않습니다.

GPT-5.5를 사용 중이라면 전환 전에 기준을 남긴다

GPT-5.5 워크플로가 안정적이라면 새 모델군이 나왔다는 이유만으로 바꾸지 마세요. 현재 품질, 실제 시간, 비용을 기준으로 저장하고 같은 작업을 Sol, Luna, Astra에서 다시 실행하세요. 아래 요금은 2026-09-24 확인 기준 USD·100만 Token당 가격입니다.

Model ID제공처컨텍스트입력캐시 읽기출력
gpt-5.5OpenAI Standard≤ 272K$5.00$0.50$30.00
gpt-5.5OpenAI Standard> 272K$10.00$1.00$45.00
gpt-5.5BetterToken구간 없음$3.40$0.34$20.40

BetterToken의 gpt-5.5에는 별도의 장문 컨텍스트 구간이 없습니다. OpenAI Standard는 272K를 넘으면 높은 구간을 적용합니다. 캐시 쓰기 가격은 OpenAI가 공개한 GPT-5.5 가격 행에 값이 없으므로 표시하지 않고 추정도 하지 않습니다.

마이그레이션 질문도 두 가지로 나눠야 합니다. OpenAI에 따르면 GPT-5.5는 2026-10-14에 ChatGPT, ChatGPT Work, Codex의 모든 플랜에서 종료되지만 OpenAI API는 영향을 받지 않습니다. Codex 플랜 사용자는 그 날짜 전에 대체 경로를 마련해야 합니다. API Key 기반 워크로드는 플랜 측 종료만을 이유로 급히 마이그레이션할 필요가 없습니다. Codex 플랜 할당량, 추가 credits, USD 종량제 API는 서로 다른 과금 체계입니다.

유용한 지표는 승인 작업 1건당 비용이다

한 번의 호출 가격만으로는 어떤 모델이 작업을 더 싸게 끝내는지 알 수 없습니다. 실패, 재시도, 캐시 쓰기, 도구 요금, 사람의 재작업을 합산해 승인 결과 수로 나눠야 합니다. 아래 예시는 먼저 같은 Token 구성에서 두 과금 경로의 차이만 분리합니다.

승인된 한 번의 실행이 다음을 사용한다고 가정합니다.

  • 캐시되지 않은 입력 120,000 Token
  • 캐시에서 읽은 입력 100,000 Token
  • 출력 10,000 Token
  • 이번 실행에서는 새 캐시 쓰기 없음
  • 총 입력 컨텍스트 220K이므로 짧은 구간 적용

“Token 수 ÷ 1,000,000 × 해당 단가”로 계산한 한 번의 모델 요금은 다음과 같습니다.

Model IDOpenAI StandardBetterToken
gpt-6-luna$0.01800$0.01224
gpt-6-sol$0.36000$0.24480
gpt-6-astra$1.80000$1.22400
gpt-5.5$0.95000$0.64600

이 예시는 같은 Token 조합의 과금만 비교하며 품질, 속도, 최종 가치를 비교하지 않습니다. 같은 Token 조합과 처리 구간에서는 Sol이 Luna의 20배, Astra가 Sol의 5배입니다. 하지만 실패한 시도, 더 긴 출력, 추가 도구, 사람의 재작업이 있으면 총 완료 비용의 차이는 줄거나 뒤집힐 수 있습니다.

더 유용한 공식은 다음과 같습니다.

완료 비용 = 모든 시도의 Token 요금 + 캐시 쓰기 + 도구 요금 + 실패한 재시도와 재작업.

이 합계를 승인된 작업 수로 나누면 승인 결과 1건당 비용을 얻습니다. 프로덕션 라우팅 결정에는 성공한 요청 1회의 가격보다 이 지표가 더 가깝습니다.

워크플로에 따라 첫 모델을 고르고 에스컬레이션을 정한다

기본 경로는 명확하게 정할 수 있습니다. 신뢰할 수 있는 자동 검증이 있는 저위험 작업은 Luna, 복잡한 개발은 Sol, 고위험 또는 강한 모호성이 있는 작업은 Astra부터 시작합니다.

검증 가능한 대량 작업: Luna부터 시작한다

schema, linter, unit test 같은 결정적 규칙이 실패를 빠르게 찾을 수 있다면 Luna를 먼저 시험하세요. 고정 형식 변환, 알려진 필드 추출, 국소 이름 변경, 정확한 명세에 따른 테스트 작성, 신뢰할 수 있는 자동 승인 규칙이 있는 대량 결과가 적합합니다.

검증 실패, 제시되지 않은 의존성 발견, 모듈 간 판단 필요가 생기면 Sol로 올립니다. 작은 모델이 같은 잘못된 방향을 무한히 반복하게 두지 않습니다.

여러 파일 코딩과 에이전트 워크플로: Sol부터 시작한다

여러 파일을 이해하고 도구를 순서대로 사용하거나 실행 결과에 따라 계획을 바꿔야 한다면 Sol부터 시작하세요. 여러 파일의 기능 구현, 테스트 실패 진단, 변경 전 저장소 검색, 도구 결과에 따른 후속 작업이 대표적입니다.

그래도 범위는 제한해야 합니다. “분석하고, 수정하고, 가장 관련성 높은 테스트를 실행하고, 미해결 항목을 보고한다”와 같은 완료 조건이 계획 없이 reasoning.effort만 올리는 것보다 유용합니다. 대표 작업에서 Sol이 아키텍처 제약을 반복해서 놓칠 때 Astra로 올립니다.

모호하거나 고위험인 엔드투엔드 작업: Astra부터 시작한다

잘못된 답의 비용이 모델 추가 요금보다 확실히 크다면 Astra부터 시작하세요. 시스템 간 마이그레이션, 어려운 프로덕션 장애, 핵심 보안 경계, 조사량이 많은 의사결정, 코딩·computer use·긴 도구 체인이 결합된 작업이 이 범주입니다.

Astra도 검증이 필요합니다. 계획, 근거, 변경, 확인의 체크포인트로 나눠 최고 성능 모델이 잘못된 가정을 더 오래 따라가지 않게 해야 합니다.

아직 확신이 없다면 같은 실제 작업으로 비교한다

보편적인 고정 샘플 수는 필요하지 않습니다. 정상·경계·실패 사례를 포함한 대표 작업군과 모든 모델에 동일한 승인 기준이 필요합니다.

  1. 대표 작업군을 고릅니다. 작은 변경, 여러 파일 개발, 디버깅, 도구 사용, 지식 작업을 포함하고 잘 꾸민 데모만 선택하지 않습니다.
  2. 실행 전에 승인 기준을 정합니다. tests, lint, schema, 사실 체크리스트, 사람의 검토를 사용합니다. 답을 본 뒤 기준을 바꾸면 비교 신뢰도가 떨어집니다.
  3. 나머지 변수를 고정합니다. 같은 컨텍스트, 도구, API, 추론 강도, 최대 출력, 환경을 사용합니다. 다른 reasoning.effort는 별도 실험으로 봅니다.
  4. 모든 시도를 기록합니다. 첫 시도 승인, 재시도, 승인 결과까지의 실제 시간, 입력·캐시·출력 Token, 도구 호출, 최종 비용을 저장합니다.
  5. 승인 결과 1건당 비용을 계산합니다. 마지막 성공만이 아니라 실패 시도와 사람의 재작업도 포함합니다.
  6. 작업 유형별로 결론을 냅니다. 코드 변경에는 합격하지만 조사나 긴 에이전트 실행에는 실패하는 모델이 있을 수 있습니다. 하나의 전역 기본값으로 차이를 숨기지 마세요.
  7. 각 유형에 여러 실제 실행이 쌓이면 경로를 다시 봅니다. 상위 모델이 승인율이나 총비용을 반복적으로 개선하지 못하면 작은 모델이나 기존 GPT-5.5 API 워크플로로 돌아갑니다.

최소한 첫 시도 승인율, 최종 승인율, 승인 결과 1건당 총비용, 완료 시간의 중앙값과 높은 백분위수를 비교하세요. 실제 품질 기준에서 지속적으로 우세한 모델만 기본값으로 삼습니다.

모델 등급이 아니라 반복 실패와 위험으로 에스컬레이션한다

비싼 모델이 자동으로 더 낫다고 가정하지 말고, 관찰 가능한 실패 신호로 에스컬레이션하세요.

  • Luna → Sol: 같은 유형의 결정적 검증이 반복 실패함, 파일·모듈을 넘는 추론이 필요함, 도구 결과가 계획을 크게 바꿈, 또는 조건을 보충해도 핵심 모호성이 남음.
  • Sol → Astra: 여러 계획에서 핵심 제약이 계속 누락됨, 오류가 프로덕션·보안·대규모 마이그레이션에 영향을 줌, 또는 어려운 추론·조사·문서·실행을 함께 다룸.
  • Astra → 작업 축소: Astra도 승인 기준을 넘지 못하면 컨텍스트와 추론을 계속 늘리지 말고 근거를 추가하고 단계를 나누거나 사람의 결정을 요청합니다.
  • 새 모델 → GPT-5.5 롤백: API에서는 GPT-5.5가 품질, 지연, 유지보수 요구를 충족하는 동안 유지할 수 있습니다. 새 이름만으로는 마이그레이션 이유가 되지 않습니다.

기본 체인은 Luna → Sol → Astra입니다. 신뢰할 수 있는 검증기가 있으면 Luna, 복잡한 개발이면 Sol, 고위험이면 Astra를 사용하고, 직접 측정한 승인율·재시도·실제 시간·승인 결과 비용이 다른 경로를 지지할 때만 바꾸세요.

LLM 워크플로를 최적화할 준비가 되셨나요?

하나의 API로 모델을 연결하고 키와 AI 비용을 관리하세요.

무료로 시작하기