GPT-6 Astra와 Claude Fable 5.1, 무엇부터 시험할까?
복잡한 도구 세션은 Astra, 큰 컨텍스트 재사용은 Fable부터. 요금과 벤치마크의 조건, 자신의 작업으로 비교하는 절차를 설명합니다.
목차

도구를 사용하는 복잡한 세션, 특히 실행 도중 작업 방향을 조정해야 한다면 GPT-6 Astra부터 시험해 보세요. 큰 컨텍스트를 반복해서 쓰거나 매우 긴 입력의 비용이 중요하다면 Claude Fable 5.1이 첫 후보입니다. 코딩에서는 자신의 저장소에서 몇 가지 작업을 골라 같은 테스트를 적용하고, 수동 수정이 얼마나 필요한지 비교하는 편이 좋습니다.
2026년 9월 5일 기준으로 두 모델 모두 BetterToken 카탈로그에 올라 있습니다. 본인 계정과 API Key로 사용 중인 도구에 연결해 같은 작업의 결과를 비교할 수 있습니다. Dashboard에서는 모델, 요청 상태, 입력·출력·캐시 토큰과 해당 사용 비용을 확인할 수 있습니다. 직접 평가한 결과의 품질을 요청 비용과 함께 판단할 때 활용할 수 있는 기록입니다.
BetterToken 계정을 만들고 자신의 작업으로 두 모델 비교하기
이런 세션에서 Astra를 먼저 권하는 근거는 OpenAI가 설명하는 비동기 도구 호출과 mid-turn steering, 즉 실행 중 작업 방향을 조정하는 기능입니다. 이는 OpenAI의 모델 기능 설명이며, 선택한 도구와 BetterToken을 통한 연결에서 지원되는지는 별도로 확인해야 합니다. 큰 컨텍스트를 재사용할 때 Fable이 유리한 이유는 요금으로 확인하기가 더 쉽습니다. 캐시 읽기가 저렴하고, 아래에 설명하는 Astra의 입력 272K 토큰 초과 할증도 없습니다.
비용이 달라지는 조건
OpenAI와 Anthropic이 공개한 기본 요금은 두 모델 모두 입력 100만 토큰당 $10, 출력 100만 토큰당 $50입니다. 차이는 컨텍스트를 재사용하거나 매우 긴 입력을 보낼 때 생깁니다. 표는 2026년 9월 5일 기준 공급사 요금이며, BetterToken을 통한 현재 호출 비용은 요금 페이지에서 확인할 수 있습니다.
| 항목 | GPT-6 Astra — OpenAI | Claude Fable 5.1 — Anthropic |
|---|---|---|
| 컨텍스트 / 최대 출력 | 1,050,000 / 128,000 토큰 | 1,000,000 / 128,000 토큰 |
| 일반 입력, 1M 토큰당 | $10 | $10 |
| 출력, 1M 토큰당 | $50 | $50 |
| 캐시 쓰기, 1M 토큰당 | $12.50 | 5분은 $12.50, 1시간은 $20 |
| 캐시 읽기, 1M 토큰당 | $1 | $0.25 |
| 긴 입력 | 입력 272K 토큰 초과 시 요청 전체의 입력·캐시는 2x, 출력은 1.5x | 최대 1M 컨텍스트에 기본 요금 적용 |
사양과 요금의 출처는 GPT-6 Astra 및 Claude Fable 5.1 문서입니다. Fable의 최대 1M 컨텍스트 기본 요금은 Anthropic 컨텍스트 윈도 문서에서도 확인됩니다.
Astra 요청의 입력이 272K 토큰을 넘으면 할증은 요청 전체에 적용됩니다. 입력과 캐시 비용은 2배, 출력 비용은 1.5배가 되며, 처음 272K 입력 토큰도 포함됩니다. 큰 저장소나 문서 묶음을 넣을 때는 답변 품질이 비슷해도 이 조건 때문에 선택이 달라질 수 있습니다.
공급사 요금으로 예를 들어 보겠습니다. 첫 요청이 공통 접두부 100K 토큰을 캐시에 쓰고, 이후 아홉 요청은 그 전체를 캐시에서 읽습니다. 출력 합계는 50K 토큰입니다. Fable에는 5분 캐시 쓰기 요금을 적용하고, 모든 읽기가 캐시 유효기간 안에 이뤄진다고 가정합니다. Astra 요청의 입력은 각각 272K 토큰 미만입니다.
Astra: 0.1 × $12.50 + 0.9 × $1.00 + 0.05 × $50 = $4.65
Fable: 0.1 × $12.50 + 0.9 × $0.25 + 0.05 × $50 = $3.975 ≈ $3.98
이 계산에는 공통 접두부와 출력 토큰만 들어갑니다. 새 입력과 재시도에는 별도 비용이 듭니다. Fable의 절감 효과는 실제 캐시 재사용에 달려 있습니다. 접두부가 바뀌거나 TTL, 즉 보관 기간이 끝나면 다시 써야 합니다. 1시간 쓰기는 5분 쓰기보다 비싸므로 요청 간격에 맞춰 선택하세요.
공개 벤치마크를 읽는 방법
OpenAI는 Astra를 2026년 9월 3일에, Anthropic은 Fable 5.1을 9월 1일에 공개했습니다. 확인 시점에 OpenAI의 Astra 직접 접근은 단계적으로 제공되고 있습니다. Fable은 Claude API와 Anthropic이 명시한 클라우드 플랫폼에서 사용할 수 있습니다. 이는 공급사의 직접 접근 조건이며, BetterToken 카탈로그에는 이미 두 모델이 등록되어 있습니다.
OpenAI가 공개한 비교에는 다음 결과가 포함됩니다.
| 테스트 | GPT-6 Astra | Claude Fable 5.1 | 결과 공개 주체 |
|---|---|---|---|
| AutomationBench | 41.4 | 31.4 | OpenAI |
| Terminal-Bench 4.0 | 57.9 | 55.8 | OpenAI |
| DeepSWE | 74.1 | 67.4 | OpenAI |
| Humanity’s Last Exam with tools | 57.2 | 65.0 | OpenAI |
이 결과는 도구를 사용하는 작업에서 Astra를 먼저 시험할 근거가 됩니다. 다만 OpenAI의 각주에는 설정과 harness의 차이도 명시되어 있습니다. harness는 도구, 컨텍스트, 재시도를 관리하는 테스트 환경입니다.
독립 평가 기관 Artificial Analysis의 Intelligence Index에서 Astra는 약 61점, Fable 5.1은 66점입니다. Fable의 66점은 max effort와 기본 활성화된 Anthropic 서버 측 fallback을 사용한 결과입니다. 테스트 출력 토큰의 약 4%가 Opus 4.8/5에서 나왔으므로 모델 단독이 아닌 시스템의 점수입니다. Coding Agent Index에서는 각각 67점과 70점입니다. 이 비교에서 Astra는 Codex, Fable은 Claude Code에서 실행되므로 모델과 도구의 조합을 평가한 결과입니다. 자신의 저장소에 쓸 모델을 고르려면 구체적인 버그 수정이나 변경을 같은 인수 테스트로 비교하는 편이 더 유용합니다. 이 글을 준비하면서 두 모델을 직접 유료로 호출하는 A/B 테스트는 수행하지 않았습니다.
BetterToken으로 두 모델 비교하기
정확한 Model ID와 알맞은 API Key 그룹을 사용하세요. 2026년 9월 5일 기준 BetterToken 구조화 카탈로그의 정보는 다음과 같습니다.
| 모델 | Model ID | API Key 그룹 | 프로토콜 |
|---|---|---|---|
| GPT-6 Astra | gpt-6-astra | GPT | OpenAI-compatible |
| Claude Fable 5.1 | claude-fable-5-1 | Claude | 도구에 따라 Anthropic-compatible 또는 OpenAI-compatible |
본인 계정에서 필요한 API Keys를 만드세요. Codex 연결 안내 또는 Claude Code 연결 안내를 따릅니다. Base URL, 인증 방식, 프로토콜은 도구에 따라 선택해야 하며, 하나의 설정을 모든 경우에 적용할 수는 없습니다.
프로그램이 도구 호출을 강제한다면 tool_choice를 확인하세요. Anthropic 문서에 따르면 Fable 5.1은 any 또는 특정 tool을 지정하면 400을 반환합니다. 지원되는 값은 auto와 none입니다. 특정 도구를 반드시 호출해야 하는 프로그램이라면 이 조건이 연동 방식에 영향을 줍니다.
익숙한 버그 수정, 테스트를 포함한 작은 변경, 문서 묶음에 근거한 답변처럼 실제 작업 몇 개를 고르세요. 두 모델에 같은 자료와 인수 기준을 주고 결과, 수동 수정량, 소요 시간, 요청 비용을 확인합니다. 서로 다른 도구를 쓰면 이름과 버전을 기록하고, 결과 편차가 크면 작업을 반복하세요.
허용 가능한 비용, 시간, 수동 작업량 안에서 일을 끝내는 모델을 선택하세요. 수정 횟수가 적은 것도 완성된 결과의 비용에 영향을 줍니다.