코딩용 DeepSeek V4 Flash: 가격, 벤치마크, 도구 연동
DeepSeek V4 Flash의 모델 ID, 가격, 벤치마크 모드, 설정, 호환성 문제와 공정한 검증 방법을 다룹니다.
DeepSeek V4 Flash는 잦은 코딩 호출, 서브에이전트, 완료 조건이 명확한 작업에 시험해 볼 만한 저비용 모델입니다. 그러나 토큰 가격이 낮다고 긴 추론, 클라이언트 오류, 재시도의 비용까지 사라지지는 않습니다. 무거운 아키텍처 작업에서는 같은 저장소에서 Flash와 Pro를 비교해야 하며, Flash를 플래그십의 “싼 복사본”으로 취급해서는 안 됩니다.
작은 예산으로 Flash를 시험하려면, 2026년 8월 13일 BetterToken 카탈로그에서 deepseek-v4-flash-0731의 가격은 입력 100만 토큰당 약 0.191였습니다. 자신의 API 키를 만들고 안전한 테스트를 한 번 실행한 뒤 Workspace에서 모델 ID와 사용량을 확인하세요. 모델 ID와 가격은 선택한 공급자에 따라 달라질 수 있으므로 다음 실행 전에도 카탈로그를 다시 확인해야 합니다.
어떤 DeepSeek V4 Flash를 말하는가
4월 24일 공식 발표는 V4 Preview를 소개했습니다. 8월 13일 DeepSeek 모델 페이지는 안정 API 모델 ID deepseek-v4-flash, deepseek-v4-pro와 MODEL VERSION DeepSeek-V4-Flash-0731, DeepSeek-V4-Pro-0813을 표시했습니다.
버전과 모델 ID의 역할은 다릅니다. 버전은 DeepSeek가 현재 제공하는 빌드를, 안정 모델 ID는 공식 API에 쓰는 문자열을 뜻합니다. 다른 공급자의 카탈로그명은 다를 수 있습니다. BetterToken은 당시 deepseek-v4-flash-0731와 deepseek-v4-pro를 표시했지만 deepseek-v4-pro-0813은 표시하지 않았습니다. 선택한 엔드포인트의 카탈로그를 열어 거기 있는 이름을 복사하고, 설정에 0813을 자동으로 덧붙이지 마세요.
0731, 0813은 제공 빌드의 시기를 뜻할 뿐 모든 엔드포인트에 통하는 별칭이 아닙니다. 문서와 공식 모델 카드에 따르면 Flash는 총 2,840억, 활성 130억 파라미터, 100만 토큰 컨텍스트, 최대 384K 출력을 제공합니다. Thinking/Non-Thinking과 추론 비교용 High/Max가 있습니다. 100만 토큰은 기술적 상한일 뿐 어떤 코드량에서도 같은 품질을 약속하지 않습니다. 긴 도구 이력 뒤에도 컨텍스트 중간 정보를 찾아내고 프로젝트 규칙을 지키는지 시험하세요.
에이전트 실행 비용
공식 DeepSeek API는 캐시 히트 입력 0.14, 출력 0.14 + 0.02 × 0.0336`입니다. 모든 입력이 캐시에 맞으면 $0.00616이지만, 실제 에이전트는 이력·도구 결과·파일을 바꾸므로 일부 접두사는 더 이상 일치하지 않습니다.
BetterToken 카탈로그 요율로 캐시를 분리 계산하지 않은 같은 물량은 0.2 × $0.095 + 0.02 × $0.191 = $0.02282입니다. 이 합계가 추론 사용량을 가리면 안 됩니다. 큰 max_tokens는 유용한 답을 내기 전에 예산 상당 부분을 쓸 수 있습니다. 비용 비교에서는 100만 토큰당 가격뿐 아니라 완료 작업당 토큰을 기록하세요.
Non-Think, High, Max의 차이
공식 모델 카드의 세 모드 수치는 다음과 같습니다.
- LiveCodeBench: Non-Think 55.2, High 88.4, Max 91.6.
- Terminal Bench 2.0: 49.1, 56.6, 56.9.
- SWE Verified: 73.7, 78.6, 79.0.
- SWE Pro: 49.1, 52.3, 52.6.
- MRCR 1M: 37.5, 76.9, 78.7.
이는 공급자/모델 카드 결과이지 독립적인 운영 벤치마크가 아닙니다. Thinking을 끄면 일부 코딩·긴 컨텍스트 테스트 점수가 크게 떨어지고, High에서 Max로의 향상은 Non-Think에서 High로의 향상보다 작습니다.
- Non-Think: 자신의 예제로 검증한 서식화, 추출, 명백한 국소 수정.
- High: 버그 수정, 리뷰, 여러 관련 파일의 주 후보.
- Max: 어려운 디버깅, 긴 에이전트 계획, 추가 토큰보다 오류가 더 비싼 작업.
표에서 숫자가 가장 크다는 이유만으로 Max를 기본값으로 삼지 마세요.
Flash가 합리적인 작업
요청이 많고 각 단계를 자동 검증할 수 있을 때 Flash는 특히 흥미롭습니다. 서브에이전트의 파일 탐색과 사실 수집, 특정 CI 테스트 실패 설명, 한 규칙을 검사하는 일괄 리뷰, 이미 정의된 인터페이스의 테스트 생성, 짧고 동일한 배치로 나눈 코드 마이그레이션이 예입니다. 반대로 명확한 제약 없는 새 아키텍처, 상충하는 요구사항, 모델이 수 시간 독자적으로 제품 결정을 해야 하는 작업에서는 덜 자명합니다. 재시도가 가격 이점을 없애 Pro나 다른 모델이 수락 결과당 더 저렴해질 수 있습니다.
Claude Code 연결
DeepSeek는 Anthropic 호환 엔드포인트를 제공하며, 공식 예시는 Pro를 주 에이전트로, Flash를 Haiku와 서브에이전트로 나눕니다.
비싼 모델은 아키텍처를 결정하고 Flash는 좁은 하위 작업을 처리하므로 이 분리는 유용합니다. Flash를 주 에이전트로 시험하려면 별도 프로필을 만들어 결과를 비교하고, 공식 권장 구성으로 표현하지 마세요. 시작 뒤 Base URL, 실제 서브에이전트 모델, 도구 호출 한 번을 확인해야 합니다. 텍스트 응답만으로는 부족하며 호환성 문제는 첫 도구 호출 뒤에 나타나기 쉽습니다.
OpenCode 연결
공식 가이드는 OpenCode 1.14.24 이상을 요구합니다.
UI에서 /connect를 실행하고 DeepSeek를 선택한 뒤 대화상자에 키를 붙여 넣습니다. 모델 목록을 열고, 공식 공급자에 deepseek-v4-flash가 실제로 있을 때만 Flash를 선택하세요. BetterToken은 확인 당시 deepseek-v4-flash-0731을 사용했습니다. 해당 엔드포인트의 카탈로그를 확인하지 않고 이름을 바꾸지 마세요. 파일을 읽게 하고 도구를 호출한 뒤 도구 결과 후에도 추론을 계속하게 하는 다단계 테스트가 필요합니다. 두 번째 턴에서 reasoning_content 문제가 드러납니다.
reasoning_content 오류와 32K 한도
Thinking 모드에서 DeepSeek는 후속 요청 이력에 reasoning_content를 되돌려 보낼 것을 요구합니다. OpenCode issue #24130은 이 필드를 잃어 도구 호출 뒤 실패한 클라이언트를 설명하고, 관련 수정은 PR #24146에서 논의되었습니다. 현행 공식 가이드는 별도로 OpenCode 1.14.24 이상을 요구합니다. issue나 PR만 보고 수정된 버전을 추정하지 마세요.
오류가 남으면 OpenCode를 업데이트하고, 현재 DeepSeek 공급자를 확인하며, 메시지를 직접 정규화할 때 추론 필드를 삭제하지 말고, 도구 하나로 2턴 테스트를 반복한 뒤에야 모델 ID와 네트워크를 점검합니다. 임의 댓글의 수제 JSON은 임시로 도움이 될 수 있으나 클라이언트 계약과 함께 갱신되는 공식 공급자가 더 안전합니다.
OpenCode issue #29363은 모델 문서상 384K인데 클라이언트 설정이 출력을 32K로 제한한 사례를 보고했습니다. 모델 한도와 앱이 요청에 보내는 한도는 서로 다른 계층입니다. 384K를 자동 요청하지 마세요. 높은 상한은 잠재 비용과 시간을 늘립니다. 응답이 length로 끝나면 Flash가 긴 응답을 못 낸다고 결론내리기 전에 실제 max_tokens, 공급자 어댑터, 추론 모드를 확인하세요.
개별 사용자 보고와 공정한 테스트
한 실전 코딩 토론에는 성공한 저장소 감사와 짧은 마이그레이션뿐 아니라 누락된 요구사항, 수정이 필요한 계획, 작은 테스트 작업의 반복 오류도 있습니다. 이 보고들은 프롬프트·커밋·하니스·독립 검증을 공유하지 않습니다. 평균 성능 수치가 아니라 자신의 수락 테스트 시나리오입니다. 별도 issue #1483는 일부 V4 Flash 요청에서 답변이 중국어로 바뀌었다고 보고합니다. 이는 단일 보고이지 알려진 결함률이 아닙니다. 응답·주석 언어, 프로젝트 규칙 준수, 실패한 도구 호출 뒤 복구를 명시적으로 확인하세요.
Non-Think, High, Max를 같은 10개 작업으로 비교하고 커밋을 고정하며 모드 사이에 프롬프트를 바꾸지 마세요. 테스트 통과 비율, 완성 diff까지 시간, 입력·출력·추론 토큰, 재시도 횟수, 규칙·언어 위반, 수락 작업당 비용을 측정합니다. High가 10개 중 9개를 끝내고 Max도 같은 9개를 두 배 사용량으로 끝낸다면 Max는 이득이 아닙니다. 어려운 버그를 Max만 해결한다면 그 작업군에서는 높은 비용이 정당화됩니다.