DeepSeek V4 Flash para programação: preço, benchmarks e integração de ferramentas

IDs de modelo, preços, modos de benchmark, configuração, problemas de compatibilidade e um método de teste justo para DeepSeek V4 Flash.

Vale testar o DeepSeek V4 Flash como modelo de baixo custo para chamadas de programação frequentes, subagentes e tarefas com definição de pronto objetiva. Preço baixo por token não elimina o custo de raciocínio longo, erros do cliente e novas tentativas. Em arquitetura pesada, compare Flash e Pro no mesmo repositório, em vez de tratar Flash como uma “cópia barata” do carro-chefe.

Quer testar Flash com pouco orçamento? No catálogo da BetterToken, em 13 de agosto de 2026, deepseek-v4-flash-0731 custava cerca de 0.095pormilha~odetokensdeentradae0.095 por milhão de tokens de entrada e 0.191 por milhão de saída. Crie sua própria chave API, faça um teste seguro e confira ID do modelo e consumo no Workspace. Consulte o catálogo novamente antes da próxima execução: IDs e preços dependem do provedor escolhido e podem mudar.

Qual DeepSeek V4 Flash está em discussão?

O anúncio oficial de 24 de abril apresentou o V4 Preview. Em 13 de agosto, a página de modelos da DeepSeek mostrava dois IDs estáveis de API, deepseek-v4-flash e deepseek-v4-pro, com MODEL VERSION DeepSeek-V4-Flash-0731 e DeepSeek-V4-Pro-0813.

Versão e ID têm papéis diferentes: a versão identifica o build servido atualmente, enquanto o ID estável continua sendo a string da API oficial. Outro provedor pode ter nomes de catálogo diferentes. A BetterToken listava deepseek-v4-flash-0731 e deepseek-v4-pro, não deepseek-v4-pro-0813. Abra o catálogo do endpoint escolhido e copie o nome exibido; não acrescente 0813 automaticamente.

Onde o modelo é chamadoFlashProO que copiar para a configuração
API oficial DeepSeekDeepSeek-V4-Flash-0731DeepSeek-V4-Pro-0813deepseek-v4-flash ou deepseek-v4-pro
BetterToken, verificado em 13 de agostodeepseek-v4-flash-0731deepseek-v4-proID do catálogo BetterToken atual

Os números 0731 e 0813 indicam a idade do build servido, não um alias universal. A documentação e o model card oficial dizem que Flash tem 284 bilhões de parâmetros totais, 13 bilhões ativos, contexto de um milhão de tokens e saída máxima de 384K. Há modos Thinking e Non-Thinking e níveis High e Max de raciocínio.

Um milhão de tokens é teto técnico, não promessa de qualidade igual em qualquer volume de código. Teste se o modelo recupera informações no meio do contexto e preserva regras do projeto após um histórico longo de ferramentas.

Quanto custa uma execução de agente

Na API oficial DeepSeek, entrada com cache custa 0.0028,entradasemcache0.0028, entrada sem cache 0.14 e saída 0.28pormilha~odetokens.Umaexecuc\ca~ocom200.000tokensdeentradae20.000desaıˊda,semcache,custa0.2×0.28 por milhão de tokens. Uma execução com 200.000 tokens de entrada e 20.000 de saída, sem cache, custa `0.2 × 0.14 + 0.02 × 0.28=0.28 = 0.0336`. Com todo o input em cache, seria $0.00616, mas esse é um caso teórico: um agente real altera histórico, resultados de ferramentas e arquivos, e parte do prefixo deixa de coincidir.

Pelas taxas do catálogo BetterToken, o mesmo volume sem contabilização separada de cache custa 0.2 × $0.095 + 0.02 × $0.191 = $0.02282. Esse valor não deve esconder o uso de raciocínio. Com max_tokens alto, o cliente pode consumir grande parte do orçamento antes de uma resposta útil. Registre tokens por tarefa concluída, não apenas preço por milhão.

Non-Think, High e Max

O model card oficial compara:

  • LiveCodeBench: 55.2 em Non-Think, 88.4 em High, 91.6 em Max.
  • Terminal Bench 2.0: 49.1, 56.6 e 56.9.
  • SWE Verified: 73.7, 78.6 e 79.0.
  • SWE Pro: 49.1, 52.3 e 52.6.
  • MRCR 1M: 37.5, 76.9 e 78.7.

São resultados do fornecedor/model card, não benchmark independente de produção. Desativar Thinking reduz muito alguns testes de programação e contexto longo; o ganho de High para Max é bem menor que o de Non-Think para High.

  • Non-Think: formatação, extração ou ajuste local óbvio, depois de validar nos seus exemplos.
  • High: principal candidato para correção de bugs, revisão e vários arquivos relacionados.
  • Max: depuração difícil, plano longo de agente ou tarefa em que o erro custa mais que tokens extras.

Não faça de Max o padrão apenas pelo maior número da tabela.

Cargas em que Flash é racional

Flash é especialmente interessante quando há muitas solicitações e cada etapa pode ser verificada automaticamente: um subagente encontra arquivos e reúne fatos, a CI explica uma falha específica, uma revisão em lote checa uma regra, um agente gera testes para uma interface definida ou uma migração é dividida em lotes curtos e idênticos.

É escolha menos óbvia para arquitetura nova sem restrições claras, requisitos conflitantes ou trabalho em que o modelo precisa decidir sozinho questões de produto por horas. Repetições podem consumir a vantagem de preço; Pro ou outro modelo pode custar menos por resultado aceito.

Conexão com Claude Code

A DeepSeek oferece endpoint compatível com Anthropic. No exemplo oficial, Pro é o agente principal e Flash atua como Haiku e subagente:

export ANTHROPIC_BASE_URL="https://api.deepseek.com/anthropic" export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY" export ANTHROPIC_MODEL="deepseek-v4-pro[1m]" export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek-v4-flash" export CLAUDE_CODE_SUBAGENT_MODEL="deepseek-v4-flash" export CLAUDE_CODE_EFFORT_LEVEL="max"

A divisão é útil: o modelo caro toma decisões arquiteturais e Flash executa subtarefas estreitas. Para experimentar Flash como agente principal, crie um perfil separado e compare o resultado; não apresente isso como configuração oficialmente recomendada. Depois de iniciar, verifique Base URL, modelo real do subagente e uma chamada de ferramenta. Só uma resposta textual não basta: problemas de compatibilidade frequentemente surgem na primeira ferramenta.

Conexão com OpenCode

O guia oficial exige OpenCode 1.14.24 ou posterior:

opencode --version opencode

Na interface, execute /connect, escolha DeepSeek e cole a chave no diálogo. Abra a lista de modelos. O guia demonstra Pro; selecione Flash apenas se deepseek-v4-flash estiver presente no provedor oficial. Na BetterToken, o nome verificado era deepseek-v4-flash-0731. Não troque esses nomes sem conferir o catálogo daquele endpoint.

O teste deve ter várias etapas: pedir leitura de arquivo, chamar uma ferramenta e continuar o raciocínio depois do resultado. É o segundo turno que revela falhas de reasoning_content.

Por que ocorre o erro reasoning_content

No modo Thinking, a DeepSeek exige que reasoning_content seja devolvido no histórico das solicitações seguintes. A issue #24130 do OpenCode descreve cliente que perdia esse campo e falhava após uma chamada de ferramenta; a correção relacionada foi discutida na PR #24146. O guia atual da DeepSeek exige separadamente OpenCode 1.14.24 ou mais novo. Não deduza uma versão corrigida apenas de uma issue ou PR.

Se o erro continuar:

  1. atualize OpenCode;
  2. confirme o provedor DeepSeek atual;
  3. não remova campos de raciocínio ao normalizar mensagens manualmente;
  4. repita teste de dois turnos com uma ferramenta;
  5. só então examine ID do modelo e rede.

JSON manual vindo de comentário aleatório pode ajudar temporariamente, mas o provedor oficial é mais seguro porque acompanha o contrato do cliente.

De onde vem o limite de 32K

A issue #29363 do OpenCode relatou que a configuração do cliente limitava saída a 32K, embora o modelo documente 384K. São camadas distintas: o limite do modelo e o limite enviado pelo aplicativo. Não solicite 384K automaticamente; teto alto aumenta custo e tempo potenciais. Se a resposta terminar com length, verifique max_tokens efetivo, adaptador do provedor e modo de raciocínio antes de concluir que Flash não produz respostas longas.

O que relatos individuais mostram

Numa discussão prática de programação, usuários relataram auditorias de repositório e migrações curtas bem-sucedidas, além de requisitos perdidos, planos corrigidos e erros repetidos em uma tarefa pequena. Os relatos não compartilham prompt, commit, harness ou verificação independente. Eles dão cenários para sua própria aceitação, não uma média de desempenho.

Uma issue #1483 separada relata respostas mudando para chinês em algumas solicitações V4 Flash. É um relato individual, não taxa de defeito conhecida. Inclua verificações explícitas de idioma das respostas e comentários, adesão às regras do projeto e recuperação após falha de ferramenta.

Como testar sem se enganar

Compare Non-Think, High e Max em dez tarefas idênticas. Congele o commit e não altere o prompt entre os modos. Meça proporção de tarefas que passam nos testes, tempo até o diff pronto, tokens de entrada, saída e raciocínio, reexecuções, violações de regras e idioma e custo por tarefa aceita.

Se High conclui nove de dez e Max as mesmas nove com o dobro do consumo, Max não compensa. Se só Max resolve um bug difícil, o custo maior se justifica para essa classe de tarefa.

Quer otimizar seu fluxo de trabalho com LLMs?

Conecte modelos por uma única API, gerencie chaves e controle os gastos com IA.