DeepSeek V4 Flash para programação: preço, benchmarks e integração de ferramentas
IDs de modelo, preços, modos de benchmark, configuração, problemas de compatibilidade e um método de teste justo para DeepSeek V4 Flash.
Vale testar o DeepSeek V4 Flash como modelo de baixo custo para chamadas de programação frequentes, subagentes e tarefas com definição de pronto objetiva. Preço baixo por token não elimina o custo de raciocínio longo, erros do cliente e novas tentativas. Em arquitetura pesada, compare Flash e Pro no mesmo repositório, em vez de tratar Flash como uma “cópia barata” do carro-chefe.
Quer testar Flash com pouco orçamento? No catálogo da BetterToken, em 13 de agosto de 2026, deepseek-v4-flash-0731 custava cerca de 0.191 por milhão de saída. Crie sua própria chave API, faça um teste seguro e confira ID do modelo e consumo no Workspace. Consulte o catálogo novamente antes da próxima execução: IDs e preços dependem do provedor escolhido e podem mudar.
Qual DeepSeek V4 Flash está em discussão?
O anúncio oficial de 24 de abril apresentou o V4 Preview. Em 13 de agosto, a página de modelos da DeepSeek mostrava dois IDs estáveis de API, deepseek-v4-flash e deepseek-v4-pro, com MODEL VERSION DeepSeek-V4-Flash-0731 e DeepSeek-V4-Pro-0813.
Versão e ID têm papéis diferentes: a versão identifica o build servido atualmente, enquanto o ID estável continua sendo a string da API oficial. Outro provedor pode ter nomes de catálogo diferentes. A BetterToken listava deepseek-v4-flash-0731 e deepseek-v4-pro, não deepseek-v4-pro-0813. Abra o catálogo do endpoint escolhido e copie o nome exibido; não acrescente 0813 automaticamente.
Os números 0731 e 0813 indicam a idade do build servido, não um alias universal. A documentação e o model card oficial dizem que Flash tem 284 bilhões de parâmetros totais, 13 bilhões ativos, contexto de um milhão de tokens e saída máxima de 384K. Há modos Thinking e Non-Thinking e níveis High e Max de raciocínio.
Um milhão de tokens é teto técnico, não promessa de qualidade igual em qualquer volume de código. Teste se o modelo recupera informações no meio do contexto e preserva regras do projeto após um histórico longo de ferramentas.
Quanto custa uma execução de agente
Na API oficial DeepSeek, entrada com cache custa 0.14 e saída 0.14 + 0.02 × 0.0336`. Com todo o input em cache, seria $0.00616, mas esse é um caso teórico: um agente real altera histórico, resultados de ferramentas e arquivos, e parte do prefixo deixa de coincidir.
Pelas taxas do catálogo BetterToken, o mesmo volume sem contabilização separada de cache custa 0.2 × $0.095 + 0.02 × $0.191 = $0.02282. Esse valor não deve esconder o uso de raciocínio. Com max_tokens alto, o cliente pode consumir grande parte do orçamento antes de uma resposta útil. Registre tokens por tarefa concluída, não apenas preço por milhão.
Non-Think, High e Max
O model card oficial compara:
- LiveCodeBench: 55.2 em Non-Think, 88.4 em High, 91.6 em Max.
- Terminal Bench 2.0: 49.1, 56.6 e 56.9.
- SWE Verified: 73.7, 78.6 e 79.0.
- SWE Pro: 49.1, 52.3 e 52.6.
- MRCR 1M: 37.5, 76.9 e 78.7.
São resultados do fornecedor/model card, não benchmark independente de produção. Desativar Thinking reduz muito alguns testes de programação e contexto longo; o ganho de High para Max é bem menor que o de Non-Think para High.
- Non-Think: formatação, extração ou ajuste local óbvio, depois de validar nos seus exemplos.
- High: principal candidato para correção de bugs, revisão e vários arquivos relacionados.
- Max: depuração difícil, plano longo de agente ou tarefa em que o erro custa mais que tokens extras.
Não faça de Max o padrão apenas pelo maior número da tabela.
Cargas em que Flash é racional
Flash é especialmente interessante quando há muitas solicitações e cada etapa pode ser verificada automaticamente: um subagente encontra arquivos e reúne fatos, a CI explica uma falha específica, uma revisão em lote checa uma regra, um agente gera testes para uma interface definida ou uma migração é dividida em lotes curtos e idênticos.
É escolha menos óbvia para arquitetura nova sem restrições claras, requisitos conflitantes ou trabalho em que o modelo precisa decidir sozinho questões de produto por horas. Repetições podem consumir a vantagem de preço; Pro ou outro modelo pode custar menos por resultado aceito.
Conexão com Claude Code
A DeepSeek oferece endpoint compatível com Anthropic. No exemplo oficial, Pro é o agente principal e Flash atua como Haiku e subagente:
A divisão é útil: o modelo caro toma decisões arquiteturais e Flash executa subtarefas estreitas. Para experimentar Flash como agente principal, crie um perfil separado e compare o resultado; não apresente isso como configuração oficialmente recomendada. Depois de iniciar, verifique Base URL, modelo real do subagente e uma chamada de ferramenta. Só uma resposta textual não basta: problemas de compatibilidade frequentemente surgem na primeira ferramenta.
Conexão com OpenCode
O guia oficial exige OpenCode 1.14.24 ou posterior:
Na interface, execute /connect, escolha DeepSeek e cole a chave no diálogo. Abra a lista de modelos. O guia demonstra Pro; selecione Flash apenas se deepseek-v4-flash estiver presente no provedor oficial. Na BetterToken, o nome verificado era deepseek-v4-flash-0731. Não troque esses nomes sem conferir o catálogo daquele endpoint.
O teste deve ter várias etapas: pedir leitura de arquivo, chamar uma ferramenta e continuar o raciocínio depois do resultado. É o segundo turno que revela falhas de reasoning_content.
Por que ocorre o erro reasoning_content
No modo Thinking, a DeepSeek exige que reasoning_content seja devolvido no histórico das solicitações seguintes. A issue #24130 do OpenCode descreve cliente que perdia esse campo e falhava após uma chamada de ferramenta; a correção relacionada foi discutida na PR #24146. O guia atual da DeepSeek exige separadamente OpenCode 1.14.24 ou mais novo. Não deduza uma versão corrigida apenas de uma issue ou PR.
Se o erro continuar:
- atualize OpenCode;
- confirme o provedor DeepSeek atual;
- não remova campos de raciocínio ao normalizar mensagens manualmente;
- repita teste de dois turnos com uma ferramenta;
- só então examine ID do modelo e rede.
JSON manual vindo de comentário aleatório pode ajudar temporariamente, mas o provedor oficial é mais seguro porque acompanha o contrato do cliente.
De onde vem o limite de 32K
A issue #29363 do OpenCode relatou que a configuração do cliente limitava saída a 32K, embora o modelo documente 384K. São camadas distintas: o limite do modelo e o limite enviado pelo aplicativo. Não solicite 384K automaticamente; teto alto aumenta custo e tempo potenciais. Se a resposta terminar com length, verifique max_tokens efetivo, adaptador do provedor e modo de raciocínio antes de concluir que Flash não produz respostas longas.
O que relatos individuais mostram
Numa discussão prática de programação, usuários relataram auditorias de repositório e migrações curtas bem-sucedidas, além de requisitos perdidos, planos corrigidos e erros repetidos em uma tarefa pequena. Os relatos não compartilham prompt, commit, harness ou verificação independente. Eles dão cenários para sua própria aceitação, não uma média de desempenho.
Uma issue #1483 separada relata respostas mudando para chinês em algumas solicitações V4 Flash. É um relato individual, não taxa de defeito conhecida. Inclua verificações explícitas de idioma das respostas e comentários, adesão às regras do projeto e recuperação após falha de ferramenta.
Como testar sem se enganar
Compare Non-Think, High e Max em dez tarefas idênticas. Congele o commit e não altere o prompt entre os modos. Meça proporção de tarefas que passam nos testes, tempo até o diff pronto, tokens de entrada, saída e raciocínio, reexecuções, violações de regras e idioma e custo por tarefa aceita.
Se High conclui nove de dez e Max as mesmas nove com o dobro do consumo, Max não compensa. Se só Max resolve um bug difícil, o custo maior se justifica para essa classe de tarefa.
Fontes
- Anúncio oficial do V4 Preview
- Preços e limites atuais da API DeepSeek
- DeepSeek em agentes de programação
- DeepSeek V4 Flash: model card oficial
- Issue OpenCode #24130: reasoning_content
- PR OpenCode #24146: correção relacionada
- Issue OpenCode #29363: limite de saída
- Issue #1483: relato individual de mudança de idioma
- Relatos mistos de usuários sobre programação