DeepSeek V4 Flash / V4.1 Flash 코딩 성능: 공식 벤치마크, max_tokens, 가격, 도구 연동
DeepSeek V4 Flash, 0731 릴리스, 최신 V4.1 Flash를 구분해 설명하는 실전 가이드입니다. GPQA, SWE-bench, Terminal-Bench, DeepSWE, NL2Repo, HumanEval 공식 결과를 한데 모으고, 1M 컨텍스트와 max_tokens의 차이, BetterToken 가격, Python 호출, 코딩 도구 설정, 승인된 작업당 실제 비용을 재현 가능하게 측정하는 방법을 다룹니다.
목차

한국어 검색어 **“코딩”**은 범위가 너무 넓어 영어 기술 문서가 경쟁하기 어렵습니다. 이 글은 그보다 구체적인 검색 의도인 “DeepSeek V4 Flash 코딩 성능 벤치마크”, “DeepSeek V4 max_tokens”, **“DeepSeek V4 Flash 공식 benchmark”**에 답합니다. 단순히 빠르거나 저렴하다고 말하는 대신, DeepSeek가 공개한 점수와 평가 조건, 실제 개발 도구에서 확인해야 할 항목을 분리해 설명합니다.
먼저 가장 많이 혼동되는 부분부터 정리해야 합니다. DeepSeek V4 Flash, V4 Flash 0731, 최신 DeepSeek V4.1 Flash는 서로 다른 릴리스입니다. 초기 V4 Flash는 총 284B 규모의 MoE 구조이며 토큰당 약 13B 파라미터가 활성화됐습니다. V4.1 Flash는 552B MoE 백본으로 바뀌었고, prefill 단계에서는 약 8B, decode 단계에서는 약 16B가 활성화됩니다. 예전 아키텍처, 최신 모델 ID, 여러 릴리스의 점수를 한 표에 섞으면 보기에는 완전해 보여도 재현할 수 없는 정보가 됩니다.
2026년 9월 18일 기준 상태: 현재 DeepSeek API의 모델 ID는
deepseek-flash입니다. 기존 V4 Flash와 Vision 별칭은 호환 라우팅 기간에 있으며, 일시적으로 V4.1로 연결될 수 있습니다. 운영 환경의 평가에서는 모델 ID뿐 아니라 날짜, 공급자, 추론 단계, 요청 파라미터를 함께 기록해야 합니다.
핵심 사양 요약
| 항목 | DeepSeek V4 Flash / 0731 | DeepSeek V4.1 Flash |
|---|---|---|
| 상태 | 이전 릴리스, 기존 별칭이 재라우팅될 수 있음 | 현재 Flash 릴리스 |
| 컨텍스트 윈도 | 1,000,000 tokens | 1,000,000 tokens |
| 아키텍처 | 284B MoE, 약 13B active | 552B MoE, prefill 약 8B / decode 약 16B active |
| 긴 출력 관련 안내 | 로컬 high/max 설정에서 최대 출력 길이 384K 권장 | 현재 공식 API는 최대 384K 출력, 로컬 벤치마크 재현은 max_tokens >= 256K 권장 |
| 입력 모달리티 | 텍스트 | 텍스트와 이미지 |
| 추론 제어 | 기존 high/max 사고 설정 | API에서 reasoning_effort 등 지원 |
| 현재 API 모델 ID | deepseek-v4-flash는 구형 명칭 | deepseek-flash |
384K와 256K를 모든 호스팅 API에 공통으로 적용되는 하드 리밋으로 해석하면 안 됩니다. 서로 다른 버전과 실행 환경에서 제시된 권장값입니다. 실제 상한은 공급자, SDK, 게이트웨이, 계정 정책에 따라 더 낮을 수 있습니다. 긴 작업을 설계하기 전에 실제로 호출할 엔드포인트의 최신 모델 정보를 확인하세요.
max_tokens가 실제로 제어하는 것
max_tokens는 응답이 생성할 수 있는 최대 토큰 수를 제한합니다. 모델의 컨텍스트 윈도 크기를 변경하는 파라미터가 아닙니다. 컨텍스트 예산에는 일반적으로 입력, 대화 기록, 도구 실행 결과, 출력용으로 남겨 둔 공간이 함께 포함됩니다. 1M 컨텍스트를 지원한다고 해서 모든 요청에 256K나 384K 출력이 필요한 것은 아닙니다.
작업별 시작값은 다음처럼 잡을 수 있습니다.
max_tokens=4096: 코드 설명, 단일 함수 수정, 짧은 SQL, 설정 오류 분석.max_tokens=16384: 여러 파일의 변경 계획, 긴 테스트 보고서, 마이그레이션 가이드.max_tokens=32768이상: 저장소 단위 분석, 긴 에이전트 실행, 대규모 코드 생성. 엔드포인트 상한과 실제 필요성을 확인한 뒤 사용합니다.
값이 너무 작으면 패치, 테스트 결과, 결론 전에 답변이 끊길 수 있습니다. 필요 이상으로 크면 최악의 경우 비용과 지연이 커집니다. 코딩 에이전트에서는 저장소 전체 해답을 한 번에 생성하게 하기보다, 제한된 출력 예산으로 읽기–수정–테스트를 반복하는 방식이 더 안전합니다.
가시 출력 토큰, 추론 토큰, 과금 토큰의 집계 방식도 API마다 다를 수 있습니다. 비용은 실제 응답의 usage 필드와 이용한 엔드포인트의 청구 내역으로 계산해야 합니다.
공식 벤치마크: 버전, 모드, 평가 하네스를 맞춰 보기
공식 점수는 문서화된 평가 조건에서 모델이 달성한 결과를 보여 줍니다. 내 저장소에서도 같은 결과가 나온다는 보장은 아닙니다. 아래에서는 릴리스를 구분하고 원래 벤치마크 이름을 유지했습니다. 서로 다른 테스트나 추론 설정을 하나의 가상 종합 점수로 합치지 않기 위해서입니다.
초기 V4 Flash 모델 카드의 대표 결과
| Benchmark | 점수 | 해석 |
|---|---|---|
| GPQA Diamond (Pass@1) | 88.1 | high/max 추론 설정에서 보고 |
| LiveCodeBench (Pass@1) | 91.6 | 코드 생성 성능 |
| SWE-bench Verified (Resolved) | 79.0 | 실제 저장소 이슈 해결 |
| Terminal-Bench 2.0 (Acc) | 56.9 | 터미널 에이전트 작업 |
| HumanEval Base (Pass@1) | 69.5 | Base 모델 결과, Max와 직접 비교 불가 |
이 숫자들은 DeepSeek 공식 모델 카드에서 가져온 것이며, 동일한 조건으로 수행한 하나의 독립 재평가가 아닙니다. 특히 HumanEval Base는 높은 추론 설정의 행과 조건이 다릅니다. 69.5와 91.6을 단순히 빼서 능력 차이라고 해석할 수 없습니다. 이 표는 어떤 역량 영역이 평가됐는지 확인하는 용도로 보는 것이 적절합니다.
0731, V4 Pro, V4.1 Flash 공식 계열 비교
| Benchmark | V4 Flash 0731 | V4 Pro | V4.1 Flash |
|---|---|---|---|
| GPQA Diamond | 89.9 | 92.4 | 90.9 |
| Terminal-Bench 2.1 | 82.7 | 87.9 | 90.6 |
| Terminal-Bench 4.0 | 7.0 | 12.4 | 31.2 |
| DeepSWE v1.1 | 54.4 | 62.7 | 74.2 |
| NL2Repo-Bench | 54.2 | 61.5 | 64.0 |
핵심은 모든 항목에서 무조건 1위를 했다는 뜻이 아닙니다. V4.1 Flash가 터미널 에이전트, 저장소 단위 소프트웨어 엔지니어링, 자연어에서 저장소를 구성하는 작업에서 크게 개선됐다는 점이 중요합니다. Terminal-Bench 4.0은 2.1보다 훨씬 어렵기 때문에 두 행의 숫자를 같은 척도처럼 교환해 비교해서도 안 됩니다.
공식 표의 V4.1 Flash와 프런티어 모델 비교
| Benchmark | V4.1 Flash | GPT-5.6 Sol | Opus-5.0 | GLM-5.3 |
|---|---|---|---|---|
| GPQA Diamond | 90.9 | 94.1 | 93.4 | 88.1 |
| Terminal-Bench 2.1 | 90.6 | 88.8 | 89.1 | 88.2 |
| Terminal-Bench 4.0 | 31.2 | 39.9 | 51.8 | 37.9 |
| DeepSWE v1.1 | 74.2 | 73.0 | 74.0 | 66.9 |
| NL2Repo-Bench | 64.0 | 56.8 | 75.3 | 58.0 |
이 비교는 DeepSeek가 V4.1 모델 카드에 직접 게시한 것입니다. 따라서 완전히 중립적인 순위표가 아니라 공급자 보고 데이터로 봐야 합니다. 같은 행과 같은 하네스 안에서 비교하고, 독립 자료와 자체 작업으로 추세를 다시 확인하세요. V4.1은 Terminal-Bench 2.1과 DeepSWE v1.1에서 강하지만, Terminal-Bench 4.0과 NL2Repo-Bench를 포함한 모든 항목에서 최고인 것은 아닙니다.
HumanEval은 함수 단위 코드 생성의 빠른 점검에는 여전히 쓸 수 있지만, 최신 코딩 에이전트를 평가하기에는 범위가 좁습니다. SWE-bench, DeepSWE, Terminal-Bench, NL2Repo는 저장소를 읽고, 도구를 호출하고, 파일을 수정하고, 테스트를 실행하고, 실패 후 다시 고치는 실제 작업에 더 가깝습니다.
벤치마크를 올바르게 읽는 방법
- 평가 하네스 버전을 확인합니다. Terminal-Bench 2.0, 2.1, 4.0은 과제와 난이도가 다릅니다.
- 추론 단계와 출력 예산을 기록합니다.
low,high,max는 성공률, 지연, 토큰 사용량을 크게 바꿀 수 있습니다. - 요청 가격을 승인된 작업당 비용으로 환산합니다. 세 번 재시도하는 저가 모델은 한 번에 끝내는 고가 모델보다 비쌀 수 있습니다.
- 내 저장소에서 재평가합니다. 의존성 설치, 테스트 시간, 도구 권한, 파일 수, 코딩 규칙이 에이전트 성능에 영향을 줍니다.
공식 벤치마크는 후보 모델을 추리는 데 유용하지만, 운영 라우팅이나 구매, 수락 테스트를 대신할 수는 없습니다.
가격: 토큰 단가가 낮아도 작업 비용은 높을 수 있다
2026년 9월 18일 기준 DeepSeek가 공개한 deepseek-flash 공식 기준 요금은 다음과 같습니다.
| 과금 항목 | 피크 가격 | 오프피크 가격 |
|---|---|---|
| 캐시 적중 입력 | $0.006 / 1M tokens | $0.003 / 1M tokens |
| 캐시 미적중 입력 | $0.30 / 1M tokens | $0.15 / 1M tokens |
| 출력 | $1.20 / 1M tokens | $0.60 / 1M tokens |
이 수치는 DeepSeek의 공식 기준 요금이며 BetterToken의 고정 판매 가격이 아닙니다. BetterToken 카탈로그는 실시간 가격 API로 갱신되고, 액세스 그룹, 캐시 규칙, 최소 과금 단위, 재시도 처리도 달라질 수 있습니다. 호출 전 현재 요금을 확인하고 날짜를 저장한 뒤 실제 usage로 계산하세요.
request_cost =
cache_hit_input / 1_000_000 * cache_hit_rate
+ cache_miss_input / 1_000_000 * cache_miss_rate
+ output_tokens / 1_000_000 * output_rate
cost_per_accepted_task = sum(request_costs) / accepted_tasks
코딩에서는 첫 시도 테스트 통과율, 평균 재시도 횟수, 승인된 패치당 총 토큰, 테스트 통과까지 걸린 시간, 사람이 다시 수정한 시간이 더 유용한 지표일 때가 많습니다. 100만 토큰당 가격은 입력 변수 하나에 불과합니다.
Artificial Analysis는 평가 세트 규모, 출력량, 속도, 추정 비용을 함께 보는 다른 관점을 제공합니다. 공급자 청구서와 완전히 같은 산식은 아니지만, 표시 가격만 비교하는 것보다 작업 단위 판단에 가깝습니다.
Python API 호출 예제
아래 예제는 OpenAI 호환 SDK, BetterToken Base URL, 현재 모델 ID를 사용합니다. 4K 출력 예산이면 연결과 기본 코드 품질을 확인하기에 충분합니다. 1M 컨텍스트를 “활용”한다는 이유만으로 저장소 전체를 한 번에 보내지 마세요.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["BETTERTOKEN_API_KEY"],
base_url="https://www.bettertoken.ai/v1",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "user", "content": "이 Python 함수를 검토하고 테스트 실패 원인을 찾아 최소 수정안을 제시하세요. 관련 없는 코드는 리팩터링하지 마세요."}
],
max_tokens=4096,
reasoning_effort="low",
)
print(response.choices[0].message.content)
reasoning_effort="low"는 빠른 반복 작업에 적합한 기본값입니다. 복잡한 회귀, 파일 간 의존성, 여러 차례의 도구 호출이 필요한 경우 high 또는 max를 비교하세요. 설치된 SDK가 이 필드를 직접 지원하지 않으면 추가 요청 파라미터로 전달하거나 현재 게이트웨이 문서를 따릅니다.
Cursor, Cline, Aider, OpenCode 등 도구 연동
- Cursor / Cline / Aider / OpenCode: OpenAI 호환 공급자를 선택하고 Base URL은
https://www.bettertoken.ai/v1, 모델은deepseek-flash로 설정합니다. API Key는 환경 변수나 도구의 보안 저장소에 보관합니다. - Codex 및 외부 에이전트: 사용자 지정 OpenAI 호환 엔드포인트를 지원할 때만 같은 방식으로 설정할 수 있습니다. 도구가
/v1을 자동으로 붙이는지 확인해 경로 중복을 피하세요. - Claude Code: 기본적으로 Anthropic 프로토콜을 사용합니다. BetterToken의 Anthropic 호환 Base URL은
https://bettertoken.ai이며 요청 필드도 다릅니다. 위 OpenAI Python 설정을 그대로 복사하면 안 됩니다. - 장시간 실행 에이전트: 작업 예산, timeout, 최대 재시도 횟수, 중단 조건을 지정합니다. 도구 호출을 지원한다고 해서 파일 시스템과 명령 권한을 무제한으로 열 필요는 없습니다.
설정 후에는 사용 가능한 모델 목록 조회, 짧은 메시지 전송, 테스트가 포함된 단일 파일 수정이라는 세 가지 작은 점검을 먼저 수행하세요. 모두 성공한 뒤 저장소 단위 작업으로 확대하면 인증, 모델 ID, 프로토콜 문제를 모델 품질 문제와 분리할 수 있습니다.
내 작업으로 재현 가능한 테스트 만들기
정답을 알고 있는 20~50개의 작업을 선택합니다. 결과를 본 뒤 특정 모델에 유리한 예제를 고르는 것이 아니라, 실제로 맡길 업무를 반영해야 합니다.
- 저장소 commit, runtime, dependency cache, 도구 권한을 고정합니다.
- 모든 모델에 같은 프롬프트, timeout, 재시도 정책을 적용합니다.
low,high,max를 따로 평가하고 평균으로 섞지 않습니다.- 입력, cache hit/miss, 가시 출력, 재시도, 총 경과 시간을 기록합니다.
- 자동 테스트를 통과하고 짧은 사람 검토에서 승인된 패치만 성공으로 계산합니다.
| 기록 항목 | 권장 값 |
|---|---|
| Model ID | deepseek-flash |
reasoning_effort | low, high, max |
max_tokens | 작업 유형별 4K / 16K / 32K 고정 |
| 승인 기준 | 테스트 통과, 무관한 변경 없음, 요구사항 충족 |
| Token usage | input, cache hit/miss, output, retries |
| 시간 | 첫 응답, 테스트 통과, 사람 재작업 시간 |
최소 두 번은 실행해 콜드 캐시, 일시적 도구 오류, 짧은 서비스 변동이 결론을 지배하지 않게 합니다. 성공률, 승인 작업당 비용, 완료 시간을 함께 보고해야 합니다.
low, high, max 선택 기준
low: 일상 질문, 코드 설명, 작은 패치, 대량 자동화. 일반적인 기본값으로 적합합니다.high: 복잡한 디버깅, 여러 파일 수정, 더 강한 계획이 필요한 작업. 성공률 향상이 추가 비용을 상쇄할 때 사용합니다.max: 가장 어려운 에이전트 작업, 아키텍처 마이그레이션, 빈도는 낮지만 가치가 큰 문제. 명확한 예산과 timeout을 적용합니다.- 단계적 전환:
low로 시작하고, 실패하면 로그와 테스트 결과를 유지한 채high로 올립니다. 환경이나 권한 문제가 아니라 추론 부족이라는 근거가 있을 때만max를 사용합니다.
의존성 설치 실패, 잘못된 테스트 명령, 필요한 파일 누락, 쓰기 권한 부족이 원인이라면 추론 단계를 높여도 근본 문제는 해결되지 않고 비용만 늘어날 수 있습니다.
결론
DeepSeek V4 Flash 계열의 가치는 눈에 띄는 단일 점수보다 긴 컨텍스트, 낮은 토큰 가격, 향상된 소프트웨어 엔지니어링 능력을 한 제품군에서 제공한다는 데 있습니다. 새 연동에서는 V4.1 Flash와 deepseek-flash를 중심으로 보고, V4와 0731의 아키텍처 및 점수는 과거 비교 자료로 사용하세요.
신뢰할 수 있는 판단 순서는 버전과 파라미터 확인, 같은 조건의 공식 결과 비교, 내 저장소에서 성공률·완료 시간·승인 작업당 비용 측정입니다. 이는 “100만 토큰 가격이 가장 싸다”거나 “한 벤치마크에서 1위다”라는 이유만으로 고르는 것보다 운영에 더 유용합니다.
자주 묻는 질문
DeepSeek V4 Flash의 컨텍스트 윈도는 얼마인가요?
V4 Flash, 0731, V4.1 Flash의 공식 모델 카드는 모두 1,000,000 tokens를 명시합니다. 호스팅 엔드포인트는 더 낮은 제한을 둘 수 있으며, 입력, 대화 기록, 도구 결과, 예약 출력이 같은 예산을 공유합니다.
DeepSeek V4의 max_tokens는 얼마로 설정해야 하나요?
짧은 코딩 작업은 4K, 긴 변경은 16K로 시작하고, 저장소 단위 작업은 제한을 확인한 뒤 32K 이상을 검토하세요. 현재 DeepSeek 공식 API는 최대 384K 출력을 명시하며, V4.1 모델 카드는 로컬 벤치마크 재현에 max_tokens >= 256K를 권장합니다. 어느 값도 모든 게이트웨이나 계정에 공통인 하드 리밋은 아닙니다.
현재 어떤 model ID를 사용해야 하나요?
현재 DeepSeek API는 deepseek-flash를 사용합니다. 기존 별칭이 일시적으로 V4.1로 연결될 수 있지만, 운영 설정에서는 최신 ID를 쓰고 공급자와 날짜를 기록해야 합니다.
공식 벤치마크로 Cursor나 Aider의 실제 성능을 예측할 수 있나요?
직접 예측할 수는 없습니다. 프롬프트, 도구 구현, 저장소 구조, 네트워크, 권한, 테스트 시간, 재시도 정책도 결과에 영향을 줍니다. 자체 작업 세트로 다시 평가해야 합니다.
DeepSeek V4.1 Flash는 코딩에 적합한가요?
공식 Terminal-Bench 2.1, DeepSWE v1.1, NL2Repo-Bench 결과는 강한 소프트웨어 엔지니어링 역량을 보여 줍니다. 1M 컨텍스트와 추론 제어도 제공합니다. 실제 적합성은 내 환경의 성공률, 지연, 비용, 코드 리뷰 결과로 판단해야 합니다.