DeepSeek-V4-Flash-0731 来了:架构没动,Agent 能力暴涨 6 倍,缓存省 90%,但你的代码一行不用改

摘要

7 月 31 日,DeepSeek 悄悄上线了 V4-Flash 正式版(0731),没有发布会,没有预热。模型架构一个参数没改,纯靠重做后训练,Agent 能力就把自家 1.6T 旗舰的预览版全面压住了。还原生支持了 Responses API,Codex 终于可以直连。缓存命中价只要 0.02 元/百万 Token,优化好了能省 90%。另外 8 月 6 号 DeepSeek 官方已公告即将大幅涨价,缓存省钱技巧现在更得用起来。


一、为什么会写这篇

最近项目里要把 Codex 接上 DeepSeek,之前一直用 Chat Completions 降级跑,Agent 功能残了一半。7 月 31 号那天看到 DeepSeek 更新日志——V4-Flash 正式版原生支持 Responses API 了,Codex 可以直连。

更让我意外的是基准成绩:DeepSWE 从 7.3 涨到 54.4,涨了 645%。一个 284B 参数、13B 激活的"轻量"模型,在 Agent 任务上把自家 1.6T / 49B 激活的 Pro 预览版逐项压住了。

这种"不换引擎只换调音师"的操作,门主觉得值得好好聊聊。而且 8 月 6 号 DeepSeek 官方直接弹窗公告:计划近期整体上调 API 服务定价,预计涨幅较大。缓存优化和省钱技巧,现在比以前更重要了。


二、DeepSeek-V4-Flash-0731 到底提升了什么

2.1 先说结论

架构、参数、价格都没变,就重做了一遍后训练,Agent 能力直接起飞。

2.2 关键参数不变

参数 V4-Flash-Preview V4-Flash-0731
总参数 2840 亿 2840 亿
激活参数 130 亿 130 亿
上下文窗口 100 万 Token 100 万 Token
最大输出 384K Token 384K Token
架构 MoE MoE
精度 FP4+FP8 混合 FP4+FP8 混合
许可 MIT MIT

结构完全一致,变了的只有后训练。

2.3 后训练做了什么

DeepSeek 的后训练分两步:

  1. 分领域训练专家模型:按推理、编码、数学、世界知识、Agent 工具使用分别用 SFT + GRPO 训出专家模型
  2. 行为分布蒸馏合并:不是简单看专家的输出分布,而是观察专家的"行为分布"做在线策略蒸馏——学的不是"专家说了什么",而是"专家怎么思考的"

0731 这次的重点就是:在第二步里专门强化了 Agent 与工具使用方向的蒸馏力度

同一台引擎,换了个调音师,声音就完全不一样了。

2.4 九项基准全面暴涨

基准 0731 正式版 Flash 预览版 提升 说明
Terminal Bench 2.1 82.7 61.8 +34% 终端环境真实任务
NL2Repo 54.2 39.4 +38% 自然语言生成完整仓库
Cybergym 76.7 38.7 +98% 网络安全漏洞利用
DeepSWE 54.4 7.3 +645% 深度软件工程任务
Toolathlon-Verified 70.3 49.7 +41% 多应用工具调用
Agents’ Last Exam 25.2 新增 专家级知识+工具链
AutomationBench 25.1 新增 跨应用流程自动化
DSBench-FullStack 68.7 新增 全栈开发(内部集)
DSBench-Hard 59.6 25.8 +131% 高难度编程(内部集)

DeepSWE 从 7.3 到 54.4,这个幅度已经不是"优化"了,更像是把 Agent 长链任务里的工具调用规划从"没上过课"补到了"精通"。

门主提醒:DSBench 两项是 DeepSeek 内部测试集,不可与其他家公开数字横向比较,但趋势是真实的。

2.5 反超自家 1.6T 旗舰

跟 V4-Pro 预览版比,9 项全部领先:

基准 V4-Flash-0731 V4-Pro-Preview Flash 领先
Terminal Bench 2.1 82.7 72.1 +10.6
DeepSWE 54.4 12.8 +41.6
Toolathlon-Verified 70.3 55.9 +14.4
DSBench-Hard 59.6 31.1 +28.5
Cybergym 76.7

一个 284B / 13B 激活的模型,参数量差近六倍,激活参数差近四倍,在 Agent 任务上把自家旗舰逐项压住。按常理该反过来,这就是后训练的威力。

第三方独立评测也盖了章:Artificial Analysis 综合智能指数 V4-Flash-0731 = 50,V4-Pro-Preview = 44,Flash 比自家旗舰高 6 分。

2.6 原生支持 Responses API + Codex 适配

这个才是对开发者影响最大的变化:

  • 原生支持 Responses API 格式:Codex、Agent 框架可以直连,不再需要协议翻译代理
  • 针对性适配 Codex 场景:代码开发场景下的接口调用流畅度和响应准确率都提了一大截
  • 目前只有 deepseek-v4-flash 支持 Responses API,deepseek-v4-pro 预计 2026 年 8 月初才能用上

三、写代码的时候用户有哪些感受

门主这几天拿 V4-Flash-0731 跑 Codex,聊点真实体感。

3.1 Codex 终于能直连了

以前接 Codex 要么降级到 Chat Completions 模式(wire_api = "chat"),Agent 功能砍半;要么用 CC Switch、LiteLLM 等本地代理做协议转换,多了一层维护,边界行为还不稳定。

现在一条命令搞定:

# macOS / Linux
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)

# Windows PowerShell
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

或者手动配置 ~/.codex/config.toml

model = "deepseek-v4-flash"
model_provider = "deepseek"
preferred_auth_method = "apikey"
forced_login_method = "api"
model_reasoning_effort = "high"
model_catalog_json = "~/.codex/models.json"

[model_providers.deepseek]
name = "deepseek"
base_url = "https://api.deepseek.com/"
wire_api = "responses"  # 关键!以前是 "chat",现在原生支持 "responses"
experimental_bearer_token = "<你的 DeepSeek API Key>"

注意wire_api = "responses" 是 0731 才支持的,预览版只能用 "chat",不要混用。

3.2 Agent 长链任务终于能跑通了

之前的 Flash 预览版跑 Codex,稍微复杂的任务——多文件修改、终端操作、错误定位——经常中途断掉或工具调用失败。0731 明显稳了,四五个连续工具调用不打嗝,测试验证能自动跑完。

有开发者实测,4 个 Agent 任务全部跑过,总花费不到 5 分钱。这个性价比,确实狠。

3.3 速度和价格

V4-Flash 的并发限制是 2500(V4-Pro 只有 500),速度体感是"秒回"。编码场景下,Flash 的输出价格只有 Pro 的 1/3,日常写代码完全够用。

3.4 推理深度可调

# config.toml
model_reasoning_effort = "high"  # low / high / max

简单任务用 low 省钱省 Token,复杂 Bug 用 max 磕深度。这个灵活性比一刀切舒服。

3.5 不爽的地方也有

  • 没有图片输入:目前 V4-Flash 只支持文本,截图报 Bug 的场景还得换模型
  • Responses API 无状态previous_response_idconversation 不支持,多轮状态得客户端自己维护
  • Pro 还没正式版:复杂推理还得等 Pro 正式版(预计 8 月初)

四、缓存命中省钱小妙招

这部分认真看,真能省钱。DeepSeek 的缓存机制用好了能省 90%,用不好就是白烧钱。

4.1 先搞懂 DeepSeek 缓存的脾气

DeepSeek 的缓存不是缓存最终答案,而是缓存输入 prompt 重复前缀的中间计算结果

规则简单粗暴:从 prompt 的第 0 个 token 开始,逐个往下比,中间任何一个 token 不一样,从那个位置起后面全部算 miss。

System+Context 命中

Query2 不命中

第1次请求: System + Context + Query1

缓存构建: 整段存入硬盘

第2次请求: System + Context + Query2

前缀匹配?

命中部分: 0.02元/百万Token

未命中部分: 1元/百万Token

4.2 命中和未命中差多远

门主插一句:8 月 6 号 DeepSeek 官方公告"计划近期整体上调 API 定价,预计涨幅较大",具体新价还没公布。下面表格是现行价格,涨完之后只会更贵,缓存优化的价值更大。

项目 V4-Flash 缓存命中 V4-Flash 缓存未命中 差距
输入价格 0.02 元/百万 Token 1 元/百万 Token 50 倍
项目 V4-Pro 缓存命中 V4-Pro 缓存未命中 差距
输入价格 0.025 元/百万 Token 3 元/百万 Token 120 倍

命中和未命中差 50 倍到 120 倍。这不是小钱。

4.3 六个省钱妙招

妙招一:System Prompt 保持字节级稳定

把角色设定、工具定义、知识库前缀等不变的内容放在 System Prompt 最前面,中途千万不要动它

# 好的做法:system prompt 整个会话期间不动
system_prompt = """你是一个专业的 Java 开发助手。
你熟悉 Spring Boot、MyBatis Plus、Redis、RabbitMQ。
请用企业级标准回答问题。"""

# 每一轮请求都带着这个不变的 system prompt
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": system_prompt},  # 稳定前缀
        {"role": "user", "content": user_input}         # 变化在后面
    ]
)

妙招二:变化的内容塞到 Prompt 末尾

# 差的做法:动态信息插在中间,打断前缀
messages = [
    {"role": "system", "content": system_prompt},
    {"role": "system", "content": f"当前时间: {now}"},  # 动态内容插中间,缓存断裂
    {"role": "user", "content": user_input}
]

# 好的做法:动态信息放到最后
messages = [
    {"role": "system", "content": system_prompt},  # 稳定前缀
    {"role": "user", "content": user_input + f"\n\n当前时间: {now}"}  # 变化在尾巴
]

妙招三:长对话复用会话,别频繁新建

每次新建会话,System Prompt 和上下文全部按未命中计费。在同一会话内连续追加请求,前几轮的上下文自动命中缓存。

# 差的做法:每次都新建对话
for question in questions:
    response = client.chat.completions.create(
        model="deepseek-v4-flash",
        messages=[
            {"role": "system", "content": system_prompt},
            {"role": "user", "content": question}
        ]
    )

# 好的做法:在同一对话中追加
conversation = [{"role": "system", "content": system_prompt}]
for question in questions:
    conversation.append({"role": "user", "content": question})
    response = client.chat.completions.create(
        model="deepseek-v4-flash",
        messages=conversation  # 前面的轮次自动命中缓存
    )
    conversation.append({"role": "assistant", "content": response.choices[0].message.content})

妙招四:批量合并相似请求

多个相似查询合并为一个请求,共享相同前缀:

# 差的做法:10 次独立请求,10 次未命中
for doc in documents:
    ask_question(doc, question)

# 好的做法:1 次请求,1 次未命中 + 后续命中
combined_input = "\n---\n".join([f"文档{i}: {doc}" for i, doc in enumerate(documents)])
ask_question(combined_input, question)

妙招五:监控缓存命中率

API 返回的 usage 里有 prompt_cache_hit_tokensprompt_cache_miss_tokens,实时看命中率:

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=messages
)

usage = response.usage
hit = usage.prompt_cache_hit_tokens
miss = usage.prompt_cache_miss_tokens
total = hit + miss
rate = hit / total * 100 if total > 0 else 0

print(f"缓存命中率: {rate:.1f}% (命中: {hit}, 未命中: {miss})")

门主踩坑经验:命中率低于 50%,赶紧查 Prompt 结构。

妙招六:错峰调用避开高峰翻倍

DeepSeek 已实行峰谷计费,工作日 9:00–12:00 和 14:00–18:00 高峰时段价格翻倍。

import datetime

def should_use_api():
    now = datetime.datetime.now()
    hour = now.hour
    is_weekday = now.weekday() < 5
    is_peak = is_weekday and (9 <= hour < 12 or 14 <= hour < 18)

    if is_peak:
        print("高峰时段,非实时任务建议延后")
        return False
    return True

把数据批量处理、日志分析、定时报告这些非实时任务全部丢到 18:00 后或周末跑,立省 50%。

4.4 优化效果大概这样

优化程度 缓存命中率 成本变化
不做优化 ~30% 基准
长对话复用 ~50% 约降 30%
前缀稳定 + 长对话 ~70% 约降 55%
完整优化(含批量合并) ~90%+ 约降 80%–90%

五、V4-Flash-0731 对比 V4-Flash-Preview 和 V4-Pro 的优势

5.1 参数对比

以下价格为现行价,DeepSeek 8 月 6 日已公告即将大幅涨价,新价待公布。

参数 V4-Flash-Preview V4-Flash-0731 V4-Pro-Preview
总参数 284B 284B 1.6T
激活参数 13B 13B 49B
上下文窗口 1M 1M 1M
最大输出 384K 384K 384K
Responses API 不支持 原生支持 不支持(8月初)
Codex 适配 不支持 原生支持 不支持(8月初)
并发限制 2500 2500 500
价格(输入未命中) 1元/百万Token 1元/百万Token 3元/百万Token
价格(输入命中) 0.02元/百万Token 0.02元/百万Token 0.025元/百万Token
价格(输出) 2元/百万Token 2元/百万Token 6元/百万Token

5.2 Agent 跑分对比

基准 V4-Flash-Preview V4-Flash-0731 V4-Pro-Preview
Terminal Bench 2.1 61.8 82.7 72.1
NL2Repo 39.4 54.2
Cybergym 38.7 76.7
DeepSWE 7.3 54.4 12.8
Toolathlon-Verified 49.7 70.3 55.9
Agents’ Last Exam 25.2
AutomationBench 25.1
DSBench-FullStack 68.7
DSBench-Hard 25.8 59.6 31.1

0731 vs Preview:9 项全面暴涨,DeepSWE 涨 645%

0731 vs Pro-Preview:9 项全面领先,一个 284B 模型压住 1.6T 旗舰

5.3 到底选哪个

你的任务是什么?

需要 Agent 能力?

需要最高精度?

复杂推理?

V4-Pro 输出价3倍 但推理最强

V4-Flash-0731 Agent已反超Pro 且便宜3倍

日常编码/对话/批量任务 → V4-Flash-0731

复杂数学/深度推理/旗舰品质 → V4-Pro

门主建议:日常写代码、跑 Agent、批量任务用 V4-Flash-0731;复杂推理、数学、需要极致精度才上 V4-Pro。 0731 的 Agent 能力已经反超 Pro 预览版了,真没必要什么任务都上 Pro,白花三倍的钱。


六、三模型对接架构图

6.1 接口怎么走

模型

DeepSeek API

客户端

原生支持

Agent 工作流

传统对话

对话/摘要

Anthropic 生态

目前仅支持

支持

支持

支持

支持

Codex CLI / IDE

自定义 Agent

普通对话应用

Responses API
/v1/responses

Chat Completions API
/v1/chat/completions

Anthropic Messages API

deepseek-v4-flash
(V4-Flash-0731)
284B / 13B 激活
并发 2500

deepseek-v4-pro
(V4-Pro-Preview)
1.6T / 49B 激活
并发 500

6.2 Codex 接入对比

项目 V4-Flash-Preview V4-Flash-0731 V4-Pro
wire_api "chat"(降级) "responses"(原生) 暂不支持
协议翻译代理 需要 CC Switch / LiteLLM 不需要
子 Agent 调度 不支持 支持
并行工具调用 受限 原生支持
代码审查工作流 不完整 完整支持

6.3 Responses API 怎么调

from openai import OpenAI

client = OpenAI(
    api_key="<你的 DeepSeek API Key>",
    base_url="https://api.deepseek.com"
)

# Responses API 调用(0731 新支持)
response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful coding assistant.",
    input="帮我写一个 Spring Boot 的 Redis 工具类",
)

print(response.output_text)
# 流式输出
stream = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful coding assistant.",
    input="帮我写一个 Spring Boot 的 Redis 工具类",
    stream=True,
)

for event in stream:
    if event.type == "response.output_text.delta":
        print(event.delta, end="")

6.4 双模型协作(企业级玩法)

简单任务

复杂规划

用户请求

任务复杂度判断

V4-Flash 执行器
高频 / 便宜 / 快速

V4-Pro 规划器
低频 / 强能力 / 精准

独立 Session
Flash 缓存独立

独立 Session
Pro 缓存独立

结果汇总

返回用户

这种架构下,Flash 和 Pro 各跑独立 Session,前缀缓存互不干扰。简单任务走 Flash 省钱,复杂规划交给 Pro,不会因为模型切换导致缓存失效。


七、现在模型调用量排行

数据来自 OpenRouter 平台,7 月 27 日–8 月 2 日那周的统计。只统计走 OpenRouter 网关的流量,不代表全球全量,但趋势是真实的。

7.1 Top 10

排名 模型 归属 周调用量(约) 份额
1 DeepSeek V4 Flash DeepSeek 7.2 万亿 Token ~12%
2 小米 MiMo-V2.5 小米 5.1 万亿 Token ~9%
3 腾讯混元 Hy3 腾讯 5.0 万亿 Token ~9%
4 DeepSeek V4 Flash 0731 DeepSeek 3.5 万亿 Token ~6%
5 GPT-5.6 Luna OpenAI 3.0 万亿 Token ~5%
6 DeepSeek V4 Pro DeepSeek 3.0 万亿 Token ~5%
7 智谱 GLM-5.2 智谱 2.9 万亿 Token ~5%
8 Nemotron-3-Ultra 英伟达 2.4 万亿 Token ~4%
9 MiniMax M3 MiniMax 1.8 万亿 Token ~3%
10 阶跃星辰 Step 3.7 Flash 阶跃星辰 1.5 万亿 Token ~3%

7.2 榜单里几个有意思的事

  • DeepSeek 一个人占了三席(Flash + 0731 + Pro),加起来超过总量的 23%
  • 国产模型包揽了前四,不过 GPT/Claude 自家官网和企业私有部署的流量不在这个统计里,别直接等同于全球市场
  • V4 Flash 0731 上线才 2 天就冲到第四,势头猛
  • GPT-5.6 Luna 降价 80% 后调用量暴涨 738%,价格战还没打完
  • 国产模型周调用量已经连续 14 周超过海外模型了

但门主得说句实话:调用量高 ≠ 综合能力最强。这份榜单反映的是"谁被用得最多",不是"谁最强"。日常编码、批量处理选国产 Flash 性价比确实高,但碰到超复杂深度推理,海外旗舰闭源模型还是有优势的。

7.3 DeepSeek 自家三模型对比

模型 周调用量 定位
V4 Flash(含旧版) ~7.2 万亿 主力,日常开发首选
V4 Flash 0731 ~3.5 万亿 新上线,增长很快
V4 Pro ~3.0 万亿 旗舰推理,复杂任务

Flash 系列调用量远超 Pro。说白了,大多数开发者日常要的就是性价比,不是极限性能。


👇 三连支持,动力源泉

如果这篇文章帮你省下了踩坑的时间,欢迎:

🔹 点赞 —— 让更多人看到这篇干货
🔹 在看 —— 你的认可是我持续输出的动力
🔹 转发 —— 分享给身边正在做AI Agent的朋友

你的每一个小动作,对我都很重要 ❤️


🙏 关于作者

你好,我是 空门技术栈,一个常年和Bug战斗、持续填坑的Java开发者。

专注分享:

  • ✅ Java / Spring Boot / Spring AI Alibaba 企业级实战
  • ✅ RAG知识库、AI Agent、多智能体协作落地经验
  • ✅ Docker部署、微服务架构、线上问题排查
  • ✅ 偶尔聊聊「如何保住头发」这类程序员终极话题 😂

不搞水文,不贩卖焦虑,只写能跑通、能落地、能帮你少加班的实战内容。

关注我,咱们一起少踩坑,多写优雅代码。


📖 更多干货推荐


🤝 项目合作 / 技术咨询

平时工作之余,也会接一些技术项目和咨询,主要方向:

⚔️ 企业级开发

  • Java / Spring Boot 项目开发与重构
  • 微服务架构设计与落地
  • 系统性能调优、线上问题排查

🤖 AI 应用落地(这是我最近的主力方向)

  • Spring AI Alibaba / RAG / Agent 应用开发
  • 企业私有知识库搭建
  • AI能力接入现有业务系统
  • 大模型本地化部署与调优

🛠️ 技术顾问 / 疑难Bug排查

  • 项目架构评审与方案设计
  • 线上疑难问题定位解决
  • 技术选型与团队培训

如果你正遇到以下情况,欢迎找我聊聊:

  • ✅ 想做AI项目,但技术方案拿不准
  • ✅ 项目卡在某个Bug上很久,团队搞不定
  • ✅ 想把AI接入现有业务,不知道从哪下手
  • ✅ 需要靠谱的开发外包或长期技术顾问

📮 联系渠道(按回复速度排序)

  1. 最快:私信空门技术栈

一个人踩坑,是事故;一群人踩坑,就是《避坑宝典》。

—— IT 空门,与诸君共修技术大道 😎

Logo

智能硬件社区聚焦AI智能硬件技术生态,汇聚嵌入式AI、物联网硬件开发者,打造交流分享平台,同步全国赛事资讯、开展 OPC 核心人才招募,助力技术落地与开发者成长。

更多推荐