DeepSeek V4 Flash e V4.1 Flash para programação: benchmarks oficiais, max_tokens, preço e ferramentas
Guia prático que separa o DeepSeek V4 Flash, a versão 0731 e o atual V4.1 Flash. Reúne resultados oficiais de GPQA, SWE-bench, Terminal-Bench, DeepSWE, NL2Repo e HumanEval, explica a diferença entre janela de contexto de 1M e max_tokens e mostra preços, chamada em Python, configuração de ferramentas de programação e um método reproduzível para medir o custo real por tarefa aceita.
Conteúdo

Quem pesquisa “deepseek v4 flash benchmark official” normalmente precisa de algo mais útil do que a afirmação de que o modelo é rápido ou barato. A intenção é confirmar quais resultados o DeepSeek realmente publicou, em quais condições eles foram obtidos e o que dizem sobre programação no dia a dia. Já “deepseek v4 max_tokens” é uma busca de parâmetro: qual é a janela de contexto, quanto uma resposta pode gerar e que valor deve ser enviado à API?
A primeira distinção é essencial: DeepSeek V4 Flash, V4 Flash 0731 e o atual DeepSeek V4.1 Flash são versões diferentes. O V4 Flash original usava uma arquitetura MoE de 284 bilhões de parâmetros, com cerca de 13 bilhões ativos por token. O V4.1 Flash passou para um backbone MoE de 552 bilhões, com aproximadamente 8 bilhões ativos no prefill e 16 bilhões na decodificação. Misturar a arquitetura antiga, o model ID atual e pontuações de vários releases gera uma ficha bonita, mas impossível de reproduzir.
Status em 18 de setembro de 2026: o model ID atual na API do DeepSeek é
deepseek-flash. Os aliases antigos de V4 Flash e Vision estão em uma fase de compatibilidade e podem ser redirecionados temporariamente para o V4.1. Em avaliações de produção, registre model ID, data, provedor, nível de raciocínio e parâmetros da requisição.
Especificações principais
| Especificação | DeepSeek V4 Flash / 0731 | DeepSeek V4.1 Flash |
|---|---|---|
| Status | Release histórico; alias legado pode ser redirecionado | Release Flash atual |
| Janela de contexto | 1.000.000 tokens | 1.000.000 tokens |
| Arquitetura | 284B MoE, cerca de 13B ativos | 552B MoE; cerca de 8B ativos no prefill e 16B no decode |
| Orientação para saída longa | Configurações locais high/max recomendavam comprimento máximo de 384K | A API oficial atual permite até 384K; para reproduzir avaliações locais, recomenda-se max_tokens >= 256K |
| Modalidade de entrada | Texto | Texto e imagens |
| Controle de raciocínio | Configurações anteriores high/max | API aceita controles como reasoning_effort |
| Model ID atual | deepseek-v4-flash segue o padrão antigo | deepseek-flash |
Os valores 384K e 256K não representam um limite rígido e universal para qualquer API hospedada. São recomendações de versões e formas de execução diferentes. Provedor, SDK, gateway ou política da conta podem impor um teto menor. Antes de planejar uma tarefa longa, verifique a capacidade do endpoint que será realmente usado.
O que max_tokens controla de fato?
max_tokens limita a quantidade máxima de tokens que a resposta pode gerar. Ele não redimensiona a janela de contexto. O orçamento de contexto normalmente inclui entrada, histórico, resultados de ferramentas e espaço reservado para a resposta. Suportar contexto de 1M não significa que toda chamada precise gerar 256K ou 384K.
Pontos de partida práticos:
max_tokens=4096para explicar código, corrigir uma função, escrever SQL curto ou depurar configuração.max_tokens=16384para planos envolvendo vários arquivos, relatórios maiores de testes ou migrações.max_tokens=32768ou mais para análise de repositório, trajetórias longas de agentes ou geração extensa, apenas após confirmar o limite e a utilidade real.
Um valor baixo demais pode cortar o patch antes dos testes ou da conclusão. Um valor alto sem necessidade aumenta o pior cenário de custo e latência. Para agentes de programação, costuma ser mais seguro limitar cada saída e repetir o ciclo ler–editar–testar do que pedir a solução inteira do repositório em uma única resposta.
Também não confunda tokens visíveis, tokens de raciocínio e tokens faturáveis. A contabilização varia entre APIs. Use os campos de usage e a fatura do endpoint chamado.
Benchmarks oficiais: versão, modo e harness precisam coincidir
Uma pontuação oficial responde a uma pergunta restrita: o que o modelo conseguiu em um ambiente documentado. Ela não garante o mesmo resultado no seu repositório. As tabelas a seguir mantêm os releases separados e preservam os nomes originais para não fundir testes ou níveis de raciocínio diferentes em uma nota artificial.
Resultados representativos do model card do V4 Flash original
| Benchmark | Pontuação | Como interpretar |
|---|---|---|
| GPQA Diamond (Pass@1) | 88.1 | Resultado reportado com raciocínio high/max |
| LiveCodeBench (Pass@1) | 91.6 | Geração de código |
| SWE-bench Verified (Resolved) | 79.0 | Resolução de issues em repositórios reais |
| Terminal-Bench 2.0 (Acc) | 56.9 | Tarefas de agente no terminal |
| HumanEval Base (Pass@1) | 69.5 | Modelo Base; não é comparação direta com Max |
Esses números vêm do model card oficial do DeepSeek, não de uma única repetição independente e uniforme. A linha HumanEval Base usa uma configuração diferente das linhas com raciocínio alto. Portanto, subtrair 69.5 de 91.6 não mede uma diferença válida de capacidade. A tabela é mais útil para entender quais áreas foram avaliadas.
Comparação oficial da família: 0731, V4 Pro e V4.1 Flash
| Benchmark | V4 Flash 0731 | V4 Pro | V4.1 Flash |
|---|---|---|---|
| GPQA Diamond | 89.9 | 92.4 | 90.9 |
| Terminal-Bench 2.1 | 82.7 | 87.9 | 90.6 |
| Terminal-Bench 4.0 | 7.0 | 12.4 | 31.2 |
| DeepSWE v1.1 | 54.4 | 62.7 | 74.2 |
| NL2Repo-Bench | 54.2 | 61.5 | 64.0 |
A conclusão útil não é que todas as métricas ficaram maiores sem exceção. O ponto é que o V4.1 Flash avançou bastante em agentes de terminal, engenharia de software no nível de repositório e criação de projetos a partir de linguagem natural. O Terminal-Bench 4.0 também é muito mais difícil que o 2.1; as duas linhas não são versões intercambiáveis da mesma escala.
V4.1 Flash contra modelos de fronteira na tabela oficial
| Benchmark | V4.1 Flash | GPT-5.6 Sol | Opus-5.0 | GLM-5.3 |
|---|---|---|---|---|
| GPQA Diamond | 90.9 | 94.1 | 93.4 | 88.1 |
| Terminal-Bench 2.1 | 90.6 | 88.8 | 89.1 | 88.2 |
| Terminal-Bench 4.0 | 31.2 | 39.9 | 51.8 | 37.9 |
| DeepSWE v1.1 | 74.2 | 73.0 | 74.0 | 66.9 |
| NL2Repo-Bench | 64.0 | 56.8 | 75.3 | 58.0 |
Essa comparação foi publicada pelo próprio DeepSeek no model card do V4.1. Portanto, trate-a como dados reportados pelo fornecedor, e não como um ranking totalmente neutro. Compare modelos dentro da mesma linha e do mesmo harness, depois valide o padrão em fontes independentes e nas suas tarefas. O V4.1 é forte no Terminal-Bench 2.1 e no DeepSWE v1.1, mas não lidera todas as linhas, especialmente Terminal-Bench 4.0 e NL2Repo-Bench.
O HumanEval ainda serve como verificação rápida de geração de funções, porém é limitado para agentes modernos. SWE-bench, DeepSWE, Terminal-Bench e NL2Repo se aproximam mais do trabalho real: ler repositório, usar ferramentas, editar arquivos, executar testes e se recuperar de falhas.
Como interpretar benchmarks corretamente
- Confirme a versão do harness. Terminal-Bench 2.0, 2.1 e 4.0 têm tarefas e dificuldades diferentes.
- Registre nível de raciocínio e orçamento de saída.
low,highemaxpodem alterar sucesso, latência e consumo. - Converta preço por requisição em custo por tarefa aceita. Um modelo barato com três tentativas pode custar mais do que outro que conclui na primeira.
- Priorize um teste no seu repositório. Instalação de dependências, duração dos testes, permissões, quantidade de arquivos e convenções afetam o agente.
Benchmarks oficiais ajudam a montar uma lista curta. Eles não substituem testes de aceitação para produção, compra ou roteamento.
Preço: token barato não garante tarefa barata
Em 18 de setembro de 2026, as tarifas-base oficiais do DeepSeek para deepseek-flash eram:
| Medição | Preço de pico | Preço fora do pico |
|---|---|---|
| Entrada com cache hit | $0.006 / 1M tokens | $0.003 / 1M tokens |
| Entrada sem cache hit | $0.30 / 1M tokens | $0.15 / 1M tokens |
| Saída | $1.20 / 1M tokens | $0.60 / 1M tokens |
Essas são tarifas-base oficiais do DeepSeek, não um preço garantido da BetterToken. O catálogo da BetterToken é atualizado pela API de preços ao vivo; grupos de acesso, cache, unidade mínima e repetição podem variar. Confira a tarifa vigente, salve a data e calcule com o usage real:
request_cost =
cache_hit_input / 1_000_000 * cache_hit_rate
+ cache_miss_input / 1_000_000 * cache_miss_rate
+ output_tokens / 1_000_000 * output_rate
cost_per_accepted_task = sum(request_costs) / accepted_tasks
Para programação, os indicadores mais úteis costumam ser aprovação dos testes na primeira tentativa, média de repetições, tokens totais por patch aceito, tempo até os testes ficarem verdes e minutos de retrabalho humano. Preço por milhão é apenas uma variável.
O Artificial Analysis oferece outra perspectiva ao combinar tamanho da avaliação, volume de saída, velocidade e custo estimado. A metodologia não é idêntica a uma fatura de provedor, mas ajuda mais do que comparar somente preços de tabela.
Exemplo de API em Python
O exemplo abaixo usa SDK compatível com OpenAI, a Base URL do BetterToken e o model ID atual. Um orçamento de 4K é suficiente para validar conexão e qualidade básica. Não envie o repositório inteiro apenas para “usar” o contexto de 1M.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["BETTERTOKEN_API_KEY"],
base_url="https://www.bettertoken.ai/v1",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "user", "content": "Revise esta função Python, descubra por que o teste falha e proponha a menor correção possível. Não refatore código não relacionado."}
],
max_tokens=4096,
reasoning_effort="low",
)
print(response.choices[0].message.content)
reasoning_effort="low" é um bom padrão para iteração rápida. Compare high ou max em regressões difíceis, dependências entre arquivos ou várias rodadas de ferramentas. Se a versão instalada do SDK não expuser o campo, envie-o em parâmetros adicionais ou siga a documentação atual do gateway.
Cursor, Cline, Aider, OpenCode e outras ferramentas
- Cursor / Cline / Aider / OpenCode: escolha um provedor compatível com OpenAI, informe
https://www.bettertoken.ai/v1como Base URL, usedeepseek-flashe armazene a chave em variável de ambiente ou cofre seguro. - Codex e agentes externos: só funciona quando a ferramenta aceita endpoint OpenAI personalizado. Confira se ela adiciona
/v1automaticamente para não duplicar o caminho. - Claude Code: usa nativamente o protocolo Anthropic. A Base URL compatível do BetterToken é
https://bettertoken.ai, e os campos da requisição são diferentes. Não copie a configuração Python de OpenAI sem adaptação. - Agentes de longa duração: defina orçamento, timeout, máximo de tentativas e condição de parada. Suporte a ferramentas não justifica permissões ilimitadas.
Depois de configurar, faça três testes pequenos: listar modelos, enviar uma mensagem curta e corrigir um arquivo com teste. Passe para tarefas de repositório somente quando os três funcionarem. Isso separa falhas de autenticação, model ID e protocolo de problemas de qualidade.
Faça um teste reproduzível com suas tarefas
Selecione de 20 a 50 tarefas cujo resultado correto já seja conhecido. Elas devem representar o trabalho real, e não exemplos escolhidos depois de descobrir qual modelo os resolve.
- Fixe commit, runtime, cache de dependências e permissões.
- Use o mesmo prompt, timeout e política de repetição em todos os modelos.
- Avalie
low,highemaxseparadamente. - Registre entrada, cache hit/miss, saída visível, repetições e tempo total.
- Considere sucesso apenas o patch que passe nos testes e em uma revisão humana breve.
| Campo | Registro recomendado |
|---|---|
| Model ID | deepseek-flash |
reasoning_effort | low, high ou max |
max_tokens | 4K / 16K / 32K fixos por classe de tarefa |
| Critério de aceitação | Testes passam, sem alterações alheias, requisitos atendidos |
| Uso de tokens | input, cache hit/miss, output, retries |
| Tempo | primeira resposta, testes verdes, minutos de retrabalho |
Execute pelo menos duas rodadas para que cache frio, erro temporário de ferramenta ou oscilação curta do serviço não dominem o resultado. Mostre juntos taxa de sucesso, custo por tarefa aceita e tempo de conclusão.
Como escolher low, high ou max
low: perguntas diárias, explicações, pequenos patches e automação em volume. Normalmente deve ser o padrão.high: depuração complexa, alterações em vários arquivos e tarefas que exigem mais planejamento. Mantenha se o ganho de sucesso pagar o custo extra.max: tarefas mais difíceis de agentes, migrações de arquitetura ou trabalho raro de alto valor. Aplique orçamento e timeout explícitos.- Política de escalada: comece em
low; se falhar, preserve logs e testes e tentehigh; usemaxapenas quando houver evidência de raciocínio insuficiente, e não ambiente quebrado.
Se uma dependência não instala, o comando de teste está errado, faltam arquivos ou não há permissão de escrita, aumentar o raciocínio geralmente só aumenta a conta.
Conclusão
O valor da família DeepSeek V4 Flash não está em uma única pontuação chamativa, mas na combinação de contexto longo, baixo preço por token e capacidade crescente de engenharia de software. Para novas integrações, concentre-se no V4.1 Flash e em deepseek-flash; trate V4 e 0731 como referências históricas.
A ordem confiável é: verificar release e parâmetros, comparar resultados oficiais em condições equivalentes e então medir no seu repositório a taxa de sucesso, o tempo e o custo por tarefa aceita. Isso informa melhor do que escolher apenas pelo milhão de tokens mais barato ou pelo primeiro lugar em um benchmark.
Perguntas frequentes
Qual é a janela de contexto do DeepSeek V4 Flash?
Os model cards oficiais de V4 Flash, 0731 e V4.1 Flash indicam 1.000.000 de tokens. Um endpoint hospedado pode oferecer menos, e entrada, histórico, resultados de ferramentas e saída reservada compartilham o orçamento.
Que valor usar em max_tokens?
Comece com 4K em tarefas curtas, 16K em mudanças maiores e considere 32K ou mais para repositórios após checar o limite. A API oficial atual do DeepSeek informa saída de até 384K, enquanto o model card V4.1 recomenda max_tokens >= 256K para reproduzir benchmarks localmente. Não são limites universais para todo gateway ou conta.
Qual model ID usar agora?
A API atual do DeepSeek usa deepseek-flash. Um alias antigo pode apontar temporariamente para V4.1, mas produção deve usar o ID vigente e registrar provedor e data.
Benchmarks oficiais preveem o desempenho no Cursor ou Aider?
Não diretamente. Prompt, implementação de ferramentas, estrutura do repositório, rede, permissões, duração de testes e política de repetição também influenciam. Avalie com suas próprias tarefas.
DeepSeek V4.1 Flash é bom para programação?
Os resultados oficiais em Terminal-Bench 2.1, DeepSWE v1.1 e NL2Repo-Bench indicam boa capacidade de engenharia de software. Ele também oferece contexto de 1M e controles de raciocínio. A adequação final depende de sucesso, latência, custo e revisão de código no seu ambiente.
Fontes
- Model card oficial do DeepSeek V4 Flash
- Model card oficial do DeepSeek V4 Flash 0731
- Model card oficial do DeepSeek V4.1 Flash
- Anúncio oficial do DeepSeek V4.1 Flash
- Documentação do DeepSeek sobre thinking mode
- Preços oficiais do DeepSeek
- Artificial Analysis: DeepSeek V4.1 Flash
- Documentação da API BetterToken
- Preços da BetterToken