DeepSeek V4 Flash / V4.1 Flash コーディング評価:公式ベンチマーク、max_tokens、料金、ツール連携
DeepSeek V4 Flash、0731、現行のV4.1 Flashを混同せずに比較する実践ガイドです。GPQA、SWE-bench、Terminal-Bench、DeepSWE、NL2Repo、HumanEvalの公式結果、1Mコンテキストとmax_tokensの違い、料金、Python呼び出し、コーディングツール設定、採用タスク当たりの実コストを再現可能に測る方法をまとめています。
目次

「deepseek v4 flash benchmark official」で検索する開発者が知りたいのは、「速い」「安い」という宣伝文句だけではありません。DeepSeekが実際に公開したスコアはどれか、どの評価条件で得られた数字か、日常のコーディングにどこまで参考になるか、という点です。「deepseek v4 max_tokens」はさらに明確で、コンテキスト長、1回の応答で生成できる量、APIに指定すべき値を確認したい検索です。
最初に、もっとも重要な区別をしておきます。DeepSeek V4 Flash、V4 Flash 0731、現行のDeepSeek V4.1 Flashは別リリースです。 初期のV4 Flashは総284BのMoE構成で、1トークン当たり約13Bのパラメータが有効でした。V4.1 Flashは総552BのMoEバックボーンへ移行し、prefillでは約8B、decodeでは約16Bが有効になります。旧アーキテクチャ、新しいモデルID、複数リリースのスコアを一枚に混ぜると、見栄えは良くても再現できない仕様表になります。
2026年9月18日時点の状態: DeepSeekの現行APIモデルIDは
deepseek-flashです。旧V4 FlashおよびVisionのエイリアスは互換ルーティング期間中で、一時的にV4.1へ転送される場合があります。実運用の評価では、モデルIDだけでなく、日付、プロバイダー、推論レベル、リクエスト設定も保存してください。
主要仕様の早見表
| 項目 | DeepSeek V4 Flash / 0731 | DeepSeek V4.1 Flash |
|---|---|---|
| 状態 | 過去リリース。旧エイリアスは転送される可能性あり | 現行Flashリリース |
| コンテキストウィンドウ | 1,000,000 tokens | 1,000,000 tokens |
| アーキテクチャ | 284B MoE、約13B active | 552B MoE。prefillで約8B、decodeで約16B active |
| 長文出力の目安 | ローカルのhigh/max構成では最大出力長384Kを推奨 | 現行公式APIは最大384K出力。ローカルでのベンチマーク再現はmax_tokens >= 256Kを推奨 |
| 入力モダリティ | テキスト | テキストと画像 |
| 推論制御 | 旧来のhigh/max思考設定 | APIでreasoning_effortなどを指定可能 |
| 現行APIモデルID | deepseek-v4-flashは旧形式の名称 | deepseek-flash |
384Kと256Kは、すべてのホステッドAPIに共通するハード上限ではありません。異なるリリース、異なる実行方式に対する推奨値です。プロバイダー、SDK、ゲートウェイ、アカウントポリシーによって上限が低くなる場合があります。長いタスクを設計する前に、実際に利用するエンドポイントの現行仕様を確認してください。
max_tokensは何を制御するのか
max_tokensが制限するのは、その応答で生成できる最大トークン数です。モデルのコンテキストウィンドウ自体を変更する設定ではありません。コンテキスト予算には通常、入力、会話履歴、ツール結果、出力用に確保する領域が含まれます。1Mコンテキスト対応だからといって、すべての呼び出しで256Kや384Kの出力が必要になるわけではありません。
実用的な初期値は次の通りです。
max_tokens=4096:コード説明、単一関数の修正、短いSQL、設定トラブルの調査。max_tokens=16384:複数ファイルの変更計画、長めのテスト報告、移行手順。max_tokens=32768以上:リポジトリ分析、長いエージェント実行、大規模コード生成。エンドポイント上限と必要性を確認してから使います。
値が小さすぎると、パッチ、テスト結果、結論の前で出力が途切れます。必要以上に大きいと、最悪時のコストと遅延が増えます。コーディングエージェントでは、1回でリポジトリ全体の答えを生成させるより、適度な上限を設けて「読む→編集する→テストする」を繰り返す方が安全です。
また、可視出力トークン、推論トークン、課金対象トークンの扱いはAPIによって異なります。コスト計算には、実際のレスポンスに含まれるusageと請求明細を使ってください。
公式ベンチマーク:リリース、モード、評価系をそろえる
公式スコアが示すのは、文書化された評価条件でモデルが達成した結果です。自分のリポジトリで同じ結果になる保証ではありません。以下ではリリースを分け、評価名を原文のまま残しています。異なるテストや推論設定を一つの総合点にまとめないためです。
初期V4 Flashモデルカードの代表値
| Benchmark | スコア | 読み方 |
|---|---|---|
| GPQA Diamond (Pass@1) | 88.1 | high/max推論設定で報告 |
| LiveCodeBench (Pass@1) | 91.6 | コード生成能力 |
| SWE-bench Verified (Resolved) | 79.0 | 実リポジトリのIssue解決 |
| Terminal-Bench 2.0 (Acc) | 56.9 | ターミナルエージェント課題 |
| HumanEval Base (Pass@1) | 69.5 | Baseモデル。Max設定とは直接比較できない |
これらはDeepSeek公式モデルカードの数値であり、すべてを同一条件で第三者が再実行した結果ではありません。特にHumanEval Baseは、高推論設定の行と条件が異なります。69.5と91.6の差を、そのまま能力差として扱うことはできません。この表は、どの能力領域が評価されたかを見るために使うべきです。
0731、V4 Pro、V4.1 Flashの公式ファミリー比較
| Benchmark | V4 Flash 0731 | V4 Pro | V4.1 Flash |
|---|---|---|---|
| GPQA Diamond | 89.9 | 92.4 | 90.9 |
| Terminal-Bench 2.1 | 82.7 | 87.9 | 90.6 |
| Terminal-Bench 4.0 | 7.0 | 12.4 | 31.2 |
| DeepSWE v1.1 | 54.4 | 62.7 | 74.2 |
| NL2Repo-Bench | 54.2 | 61.5 | 64.0 |
ここで注目すべきなのは、すべての指標で無条件に首位になったという話ではありません。V4.1 Flashは、ターミナルエージェント、リポジトリ単位のソフトウェアエンジニアリング、自然言語からのリポジトリ構築で大きく改善しています。 Terminal-Bench 4.0は2.1より大幅に難しいため、二つの行を同じ物差しとして置き換えることもできません。
公式表におけるV4.1 Flashとフロンティアモデル
| Benchmark | V4.1 Flash | GPT-5.6 Sol | Opus-5.0 | GLM-5.3 |
|---|---|---|---|---|
| GPQA Diamond | 90.9 | 94.1 | 93.4 | 88.1 |
| Terminal-Bench 2.1 | 90.6 | 88.8 | 89.1 | 88.2 |
| Terminal-Bench 4.0 | 31.2 | 39.9 | 51.8 | 37.9 |
| DeepSWE v1.1 | 74.2 | 73.0 | 74.0 | 66.9 |
| NL2Repo-Bench | 64.0 | 56.8 | 75.3 | 58.0 |
この比較はDeepSeekがV4.1モデルカードで公開したものです。したがって、完全に中立なランキングではなく、ベンダー報告値として扱う必要があります。同じ行、同じ評価系の中で比較し、第三者データと自分のタスクで傾向を検証してください。V4.1はTerminal-Bench 2.1とDeepSWE v1.1で強い一方、Terminal-Bench 4.0やNL2Repo-Benchを含むすべての項目で首位ではありません。
HumanEvalは関数単位のコード生成を素早く確認する用途には残っていますが、現代のコーディングエージェント評価としては狭すぎます。SWE-bench、DeepSWE、Terminal-Bench、NL2Repoの方が、リポジトリを読み、ツールを使い、ファイルを変更し、テストし、失敗から修正する実務に近い評価です。
ベンチマークを正しく読む四つの条件
- 評価系のバージョンを確認する。 Terminal-Bench 2.0、2.1、4.0は課題と難易度が異なります。
- 推論レベルと出力予算を記録する。
low、high、maxでは成功率、遅延、トークン消費が大きく変わります。 - 1リクエストの価格ではなく、採用タスク当たりのコストを見る。 3回再試行する安価なモデルは、1回で終わる高価なモデルより高くつく場合があります。
- 自分のリポジトリで再評価する。 依存関係の導入、テスト時間、ツール権限、ファイル数、コーディング規約が結果を左右します。
公式ベンチマークは候補を絞るには有効ですが、ルーティング、調達、本番受け入れテストの代わりにはなりません。
料金:トークン単価が安くても、タスク単価が安いとは限らない
2026年9月18日時点で、DeepSeek公式のdeepseek-flash基準料金は次の通りです。
| 課金項目 | ピーク料金 | オフピーク料金 |
|---|---|---|
| キャッシュヒット入力 | $0.006 / 1M tokens | $0.003 / 1M tokens |
| キャッシュミス入力 | $0.30 / 1M tokens | $0.15 / 1M tokens |
| 出力 | $1.20 / 1M tokens | $0.60 / 1M tokens |
これはDeepSeekの公式基準料金であり、BetterTokenの固定販売価格ではありません。BetterTokenのカタログはライブ料金APIから更新され、アクセスグループ、キャッシュ規則、最低課金単位、再試行の扱いも変わります。呼び出し前に現行料金を確認し、日付を保存して実際のusageから計算してください。
request_cost =
cache_hit_input / 1_000_000 * cache_hit_rate
+ cache_miss_input / 1_000_000 * cache_miss_rate
+ output_tokens / 1_000_000 * output_rate
cost_per_accepted_task = sum(request_costs) / accepted_tasks
コーディングでは、初回テスト成功率、平均再試行回数、採用パッチ当たりの総トークン、テスト成功までの時間、人手による修正時間の方が重要です。「100万トークン当たりの価格」は一要素にすぎません。
Artificial Analysisは、評価セット全体の規模、出力量、速度、推定コストを合わせて見る別の視点を提供しています。プロバイダーの請求書と同じ計算方式ではありませんが、定価だけを比べるより実務判断に近づきます。
Python APIの呼び出し例
次の例は、OpenAI互換SDK、BetterTokenのBase URL、現行モデルIDを使います。4Kの出力予算で接続確認と基本的なコード品質の確認には十分です。1Mコンテキストを「使い切る」ためだけに、リポジトリ全体を送信しないでください。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["BETTERTOKEN_API_KEY"],
base_url="https://www.bettertoken.ai/v1",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "user", "content": "この Python 関数を確認し、テストが失敗する原因を特定して、最小限の修正を提案してください。無関係なコードはリファクタリングしないでください。"}
],
max_tokens=4096,
reasoning_effort="low",
)
print(response.choices[0].message.content)
reasoning_effort="low"は高速な反復に向く初期値です。難しい回帰、ファイル間依存、複数回のツール利用が必要な場合にhighやmaxを比較します。SDKがこのフィールドを直接公開していない場合は、追加リクエスト引数を使うか、ゲートウェイの現行ドキュメントに従ってください。
Cursor、Cline、Aider、OpenCodeなどの設定
- Cursor / Cline / Aider / OpenCode: OpenAI互換プロバイダーを選び、Base URLを
https://www.bettertoken.ai/v1、モデルをdeepseek-flashに設定します。APIキーは環境変数またはツールの安全なシークレット領域に保存します。 - Codexや外部エージェント: カスタムOpenAI互換エンドポイントをサポートする場合のみ利用できます。ツール側が
/v1を自動付与するか確認し、パスの重複を避けてください。 - Claude Code: ネイティブではAnthropicプロトコルを使います。BetterTokenのAnthropic互換Base URLは
https://bettertoken.aiで、リクエスト項目も異なります。上のOpenAI設定をそのまま貼り付けないでください。 - 長時間エージェント: タスク予算、タイムアウト、最大再試行回数、停止条件を設定します。ツール利用に対応しているからといって、無制限のファイル・コマンド権限を与える必要はありません。
設定後は、利用可能モデルの一覧取得、短いメッセージ送信、テスト付きの単一ファイル修正、という三つの小さな確認を行います。すべて成功してからリポジトリ単位へ広げると、認証、モデルID、プロトコルの問題とモデル品質を切り分けやすくなります。
自分のタスクで再現可能な評価を行う
正解が分かっている20〜50件のタスクを選びます。モデルの結果を見てから都合のよい例を選ぶのではなく、実際に任せたい仕事を反映させてください。
- リポジトリのcommit、実行環境、依存キャッシュ、ツール権限を固定します。
- すべてのモデルで同じプロンプト、タイムアウト、再試行規則を使います。
low、high、maxを別々に評価し、平均で混ぜません。- 入力、cache hit/miss、可視出力、再試行、総経過時間を記録します。
- 自動テストに通り、短い人手レビューで承認されたパッチだけを成功とします。
| 記録項目 | 推奨値 |
|---|---|
| Model ID | deepseek-flash |
reasoning_effort | low、high、max |
max_tokens | タスク種類ごとに4K / 16K / 32Kで固定 |
| 採用条件 | テスト成功、無関係な変更なし、要件を満たす |
| Token usage | input、cache hit/miss、output、retries |
| 時間 | 初回応答、テスト成功、人手修正時間 |
最低二回は実行し、コールドキャッシュ、一時的なツール障害、短時間のサービス変動が結論を支配しないようにします。成功率、採用タスク当たりのコスト、完了時間を必ず同時に示してください。
low、high、maxの選び方
low: 日常の質問、コード説明、小規模修正、高頻度自動化。通常のデフォルトに向きます。high: 複雑なデバッグ、複数ファイル変更、より強い計画が必要なタスク。成功率向上が追加コストに見合う場合に使います。max: 最難関のエージェント作業、アーキテクチャ移行、低頻度で高価値な問題。明確な予算とタイムアウトを付けます。- 段階的フォールバック:
lowから開始し、失敗したらログとテスト結果を残してhighへ上げます。環境や権限ではなく推論不足が原因と確認できた場合のみmaxを使います。
依存関係が入らない、テストコマンドが誤っている、必要ファイルがない、書き込み権限がない、といった問題は、推論レベルを上げても解決せず、料金だけ増えることがあります。
まとめ
DeepSeek V4 Flash系の価値は、一つの派手なスコアではなく、長いコンテキスト、低いトークン単価、向上したソフトウェアエンジニアリング能力を同じ製品系列で提供している点にあります。新規利用ではV4.1 Flashとdeepseek-flashを中心にし、V4 / 0731の構成とスコアは過去比較として扱うのが適切です。
判断の順序は、リリースとパラメータを確認し、同条件の公式結果を比較し、最後に自分のリポジトリで成功率、完了時間、採用タスク当たりのコストを測ることです。「100万トークンが最安」や「一つのベンチマークで1位」だけで選ぶより、実運用に強い結論になります。
よくある質問
DeepSeek V4 Flashのコンテキストウィンドウは?
V4 Flash、0731、V4.1 Flashの公式モデルカードはいずれも1,000,000 tokensを示しています。ホステッドAPIでは低い上限になる場合があり、入力、履歴、ツール結果、出力予約が同じ予算を共有します。
DeepSeek V4のmax_tokensはいくつにすべきですか?
短いコード作業は4K、長い変更は16Kから始め、リポジトリ規模では上限確認後に32K以上を検討します。現行のDeepSeek公式APIは最大384K出力を示し、V4.1モデルカードはローカルでのベンチマーク再現にmax_tokens >= 256Kを推奨しています。どちらも全ゲートウェイや全アカウント共通の上限ではありません。
現在使うべきmodel IDは?
DeepSeekの現行APIはdeepseek-flashです。旧エイリアスが一時的にV4.1へ向く場合はありますが、本番設定では現行IDを使い、プロバイダーと日付も記録してください。
公式ベンチマークでCursorやAiderの性能を予測できますか?
直接は予測できません。プロンプト、ツール実装、リポジトリ構造、ネットワーク、権限、テスト時間、再試行方針も結果に影響します。自分のタスクセットで再評価してください。
DeepSeek V4.1 Flashはコーディングに向いていますか?
公式のTerminal-Bench 2.1、DeepSWE v1.1、NL2Repo-Benchは強いソフトウェアエンジニアリング能力を示しています。1Mコンテキストと推論制御も利用できます。最終判断は、自分の環境での成功率、遅延、コスト、コードレビュー結果に基づけるべきです。