DeepSeek-V4-Flash-0731 来了:架构没动,Agent 能力暴涨 6 倍,缓存省 90%,但你的代码一行不用改
DeepSeek-V4-Flash-0731 来了:架构没动,Agent 能力暴涨 6 倍,缓存省 90%,但你的代码一行不用改
摘要
7 月 31 日,DeepSeek 悄悄上线了 V4-Flash 正式版(0731),没有发布会,没有预热。模型架构一个参数没改,纯靠重做后训练,Agent 能力就把自家 1.6T 旗舰的预览版全面压住了。还原生支持了 Responses API,Codex 终于可以直连。缓存命中价只要 0.02 元/百万 Token,优化好了能省 90%。另外 8 月 6 号 DeepSeek 官方已公告即将大幅涨价,缓存省钱技巧现在更得用起来。
一、为什么会写这篇
最近项目里要把 Codex 接上 DeepSeek,之前一直用 Chat Completions 降级跑,Agent 功能残了一半。7 月 31 号那天看到 DeepSeek 更新日志——V4-Flash 正式版原生支持 Responses API 了,Codex 可以直连。
更让我意外的是基准成绩:DeepSWE 从 7.3 涨到 54.4,涨了 645%。一个 284B 参数、13B 激活的"轻量"模型,在 Agent 任务上把自家 1.6T / 49B 激活的 Pro 预览版逐项压住了。
这种"不换引擎只换调音师"的操作,门主觉得值得好好聊聊。而且 8 月 6 号 DeepSeek 官方直接弹窗公告:计划近期整体上调 API 服务定价,预计涨幅较大。缓存优化和省钱技巧,现在比以前更重要了。
二、DeepSeek-V4-Flash-0731 到底提升了什么
2.1 先说结论
架构、参数、价格都没变,就重做了一遍后训练,Agent 能力直接起飞。
2.2 关键参数不变
| 参数 | V4-Flash-Preview | V4-Flash-0731 |
|---|---|---|
| 总参数 | 2840 亿 | 2840 亿 |
| 激活参数 | 130 亿 | 130 亿 |
| 上下文窗口 | 100 万 Token | 100 万 Token |
| 最大输出 | 384K Token | 384K Token |
| 架构 | MoE | MoE |
| 精度 | FP4+FP8 混合 | FP4+FP8 混合 |
| 许可 | MIT | MIT |
结构完全一致,变了的只有后训练。
2.3 后训练做了什么
DeepSeek 的后训练分两步:
- 分领域训练专家模型:按推理、编码、数学、世界知识、Agent 工具使用分别用 SFT + GRPO 训出专家模型
- 行为分布蒸馏合并:不是简单看专家的输出分布,而是观察专家的"行为分布"做在线策略蒸馏——学的不是"专家说了什么",而是"专家怎么思考的"
0731 这次的重点就是:在第二步里专门强化了 Agent 与工具使用方向的蒸馏力度。
同一台引擎,换了个调音师,声音就完全不一样了。
2.4 九项基准全面暴涨
| 基准 | 0731 正式版 | Flash 预览版 | 提升 | 说明 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | +34% | 终端环境真实任务 |
| NL2Repo | 54.2 | 39.4 | +38% | 自然语言生成完整仓库 |
| Cybergym | 76.7 | 38.7 | +98% | 网络安全漏洞利用 |
| DeepSWE | 54.4 | 7.3 | +645% | 深度软件工程任务 |
| Toolathlon-Verified | 70.3 | 49.7 | +41% | 多应用工具调用 |
| Agents’ Last Exam | 25.2 | — | 新增 | 专家级知识+工具链 |
| AutomationBench | 25.1 | — | 新增 | 跨应用流程自动化 |
| DSBench-FullStack | 68.7 | — | 新增 | 全栈开发(内部集) |
| DSBench-Hard | 59.6 | 25.8 | +131% | 高难度编程(内部集) |
DeepSWE 从 7.3 到 54.4,这个幅度已经不是"优化"了,更像是把 Agent 长链任务里的工具调用规划从"没上过课"补到了"精通"。
门主提醒:DSBench 两项是 DeepSeek 内部测试集,不可与其他家公开数字横向比较,但趋势是真实的。
2.5 反超自家 1.6T 旗舰
跟 V4-Pro 预览版比,9 项全部领先:
| 基准 | V4-Flash-0731 | V4-Pro-Preview | Flash 领先 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 72.1 | +10.6 |
| DeepSWE | 54.4 | 12.8 | +41.6 |
| Toolathlon-Verified | 70.3 | 55.9 | +14.4 |
| DSBench-Hard | 59.6 | 31.1 | +28.5 |
| Cybergym | 76.7 | — | — |
一个 284B / 13B 激活的模型,参数量差近六倍,激活参数差近四倍,在 Agent 任务上把自家旗舰逐项压住。按常理该反过来,这就是后训练的威力。
第三方独立评测也盖了章:Artificial Analysis 综合智能指数 V4-Flash-0731 = 50,V4-Pro-Preview = 44,Flash 比自家旗舰高 6 分。
2.6 原生支持 Responses API + Codex 适配
这个才是对开发者影响最大的变化:
- 原生支持 Responses API 格式:Codex、Agent 框架可以直连,不再需要协议翻译代理
- 针对性适配 Codex 场景:代码开发场景下的接口调用流畅度和响应准确率都提了一大截
- 目前只有
deepseek-v4-flash支持 Responses API,deepseek-v4-pro预计 2026 年 8 月初才能用上
三、写代码的时候用户有哪些感受
门主这几天拿 V4-Flash-0731 跑 Codex,聊点真实体感。
3.1 Codex 终于能直连了
以前接 Codex 要么降级到 Chat Completions 模式(wire_api = "chat"),Agent 功能砍半;要么用 CC Switch、LiteLLM 等本地代理做协议转换,多了一层维护,边界行为还不稳定。
现在一条命令搞定:
# macOS / Linux
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
# Windows PowerShell
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
或者手动配置 ~/.codex/config.toml:
model = "deepseek-v4-flash"
model_provider = "deepseek"
preferred_auth_method = "apikey"
forced_login_method = "api"
model_reasoning_effort = "high"
model_catalog_json = "~/.codex/models.json"
[model_providers.deepseek]
name = "deepseek"
base_url = "https://api.deepseek.com/"
wire_api = "responses" # 关键!以前是 "chat",现在原生支持 "responses"
experimental_bearer_token = "<你的 DeepSeek API Key>"
注意:wire_api = "responses" 是 0731 才支持的,预览版只能用 "chat",不要混用。
3.2 Agent 长链任务终于能跑通了
之前的 Flash 预览版跑 Codex,稍微复杂的任务——多文件修改、终端操作、错误定位——经常中途断掉或工具调用失败。0731 明显稳了,四五个连续工具调用不打嗝,测试验证能自动跑完。
有开发者实测,4 个 Agent 任务全部跑过,总花费不到 5 分钱。这个性价比,确实狠。
3.3 速度和价格
V4-Flash 的并发限制是 2500(V4-Pro 只有 500),速度体感是"秒回"。编码场景下,Flash 的输出价格只有 Pro 的 1/3,日常写代码完全够用。
3.4 推理深度可调
# config.toml
model_reasoning_effort = "high" # low / high / max
简单任务用 low 省钱省 Token,复杂 Bug 用 max 磕深度。这个灵活性比一刀切舒服。
3.5 不爽的地方也有
- 没有图片输入:目前 V4-Flash 只支持文本,截图报 Bug 的场景还得换模型
- Responses API 无状态:
previous_response_id、conversation不支持,多轮状态得客户端自己维护 - Pro 还没正式版:复杂推理还得等 Pro 正式版(预计 8 月初)
四、缓存命中省钱小妙招
这部分认真看,真能省钱。DeepSeek 的缓存机制用好了能省 90%,用不好就是白烧钱。
4.1 先搞懂 DeepSeek 缓存的脾气
DeepSeek 的缓存不是缓存最终答案,而是缓存输入 prompt 重复前缀的中间计算结果。
规则简单粗暴:从 prompt 的第 0 个 token 开始,逐个往下比,中间任何一个 token 不一样,从那个位置起后面全部算 miss。
4.2 命中和未命中差多远
门主插一句:8 月 6 号 DeepSeek 官方公告"计划近期整体上调 API 定价,预计涨幅较大",具体新价还没公布。下面表格是现行价格,涨完之后只会更贵,缓存优化的价值更大。
| 项目 | V4-Flash 缓存命中 | V4-Flash 缓存未命中 | 差距 |
|---|---|---|---|
| 输入价格 | 0.02 元/百万 Token | 1 元/百万 Token | 50 倍 |
| 项目 | V4-Pro 缓存命中 | V4-Pro 缓存未命中 | 差距 |
|---|---|---|---|
| 输入价格 | 0.025 元/百万 Token | 3 元/百万 Token | 120 倍 |
命中和未命中差 50 倍到 120 倍。这不是小钱。
4.3 六个省钱妙招
妙招一:System Prompt 保持字节级稳定
把角色设定、工具定义、知识库前缀等不变的内容放在 System Prompt 最前面,中途千万不要动它。
# 好的做法:system prompt 整个会话期间不动
system_prompt = """你是一个专业的 Java 开发助手。
你熟悉 Spring Boot、MyBatis Plus、Redis、RabbitMQ。
请用企业级标准回答问题。"""
# 每一轮请求都带着这个不变的 system prompt
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": system_prompt}, # 稳定前缀
{"role": "user", "content": user_input} # 变化在后面
]
)
妙招二:变化的内容塞到 Prompt 末尾
# 差的做法:动态信息插在中间,打断前缀
messages = [
{"role": "system", "content": system_prompt},
{"role": "system", "content": f"当前时间: {now}"}, # 动态内容插中间,缓存断裂
{"role": "user", "content": user_input}
]
# 好的做法:动态信息放到最后
messages = [
{"role": "system", "content": system_prompt}, # 稳定前缀
{"role": "user", "content": user_input + f"\n\n当前时间: {now}"} # 变化在尾巴
]
妙招三:长对话复用会话,别频繁新建
每次新建会话,System Prompt 和上下文全部按未命中计费。在同一会话内连续追加请求,前几轮的上下文自动命中缓存。
# 差的做法:每次都新建对话
for question in questions:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": system_prompt},
{"role": "user", "content": question}
]
)
# 好的做法:在同一对话中追加
conversation = [{"role": "system", "content": system_prompt}]
for question in questions:
conversation.append({"role": "user", "content": question})
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=conversation # 前面的轮次自动命中缓存
)
conversation.append({"role": "assistant", "content": response.choices[0].message.content})
妙招四:批量合并相似请求
多个相似查询合并为一个请求,共享相同前缀:
# 差的做法:10 次独立请求,10 次未命中
for doc in documents:
ask_question(doc, question)
# 好的做法:1 次请求,1 次未命中 + 后续命中
combined_input = "\n---\n".join([f"文档{i}: {doc}" for i, doc in enumerate(documents)])
ask_question(combined_input, question)
妙招五:监控缓存命中率
API 返回的 usage 里有 prompt_cache_hit_tokens 和 prompt_cache_miss_tokens,实时看命中率:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=messages
)
usage = response.usage
hit = usage.prompt_cache_hit_tokens
miss = usage.prompt_cache_miss_tokens
total = hit + miss
rate = hit / total * 100 if total > 0 else 0
print(f"缓存命中率: {rate:.1f}% (命中: {hit}, 未命中: {miss})")
门主踩坑经验:命中率低于 50%,赶紧查 Prompt 结构。
妙招六:错峰调用避开高峰翻倍
DeepSeek 已实行峰谷计费,工作日 9:00–12:00 和 14:00–18:00 高峰时段价格翻倍。
import datetime
def should_use_api():
now = datetime.datetime.now()
hour = now.hour
is_weekday = now.weekday() < 5
is_peak = is_weekday and (9 <= hour < 12 or 14 <= hour < 18)
if is_peak:
print("高峰时段,非实时任务建议延后")
return False
return True
把数据批量处理、日志分析、定时报告这些非实时任务全部丢到 18:00 后或周末跑,立省 50%。
4.4 优化效果大概这样
| 优化程度 | 缓存命中率 | 成本变化 |
|---|---|---|
| 不做优化 | ~30% | 基准 |
| 长对话复用 | ~50% | 约降 30% |
| 前缀稳定 + 长对话 | ~70% | 约降 55% |
| 完整优化(含批量合并) | ~90%+ | 约降 80%–90% |
五、V4-Flash-0731 对比 V4-Flash-Preview 和 V4-Pro 的优势
5.1 参数对比
以下价格为现行价,DeepSeek 8 月 6 日已公告即将大幅涨价,新价待公布。
| 参数 | V4-Flash-Preview | V4-Flash-0731 | V4-Pro-Preview |
|---|---|---|---|
| 总参数 | 284B | 284B | 1.6T |
| 激活参数 | 13B | 13B | 49B |
| 上下文窗口 | 1M | 1M | 1M |
| 最大输出 | 384K | 384K | 384K |
| Responses API | 不支持 | 原生支持 | 不支持(8月初) |
| Codex 适配 | 不支持 | 原生支持 | 不支持(8月初) |
| 并发限制 | 2500 | 2500 | 500 |
| 价格(输入未命中) | 1元/百万Token | 1元/百万Token | 3元/百万Token |
| 价格(输入命中) | 0.02元/百万Token | 0.02元/百万Token | 0.025元/百万Token |
| 价格(输出) | 2元/百万Token | 2元/百万Token | 6元/百万Token |
5.2 Agent 跑分对比
| 基准 | V4-Flash-Preview | V4-Flash-0731 | V4-Pro-Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 61.8 | 82.7 | 72.1 |
| NL2Repo | 39.4 | 54.2 | — |
| Cybergym | 38.7 | 76.7 | — |
| DeepSWE | 7.3 | 54.4 | 12.8 |
| Toolathlon-Verified | 49.7 | 70.3 | 55.9 |
| Agents’ Last Exam | — | 25.2 | — |
| AutomationBench | — | 25.1 | — |
| DSBench-FullStack | — | 68.7 | — |
| DSBench-Hard | 25.8 | 59.6 | 31.1 |
0731 vs Preview:9 项全面暴涨,DeepSWE 涨 645%
0731 vs Pro-Preview:9 项全面领先,一个 284B 模型压住 1.6T 旗舰
5.3 到底选哪个
门主建议:日常写代码、跑 Agent、批量任务用 V4-Flash-0731;复杂推理、数学、需要极致精度才上 V4-Pro。 0731 的 Agent 能力已经反超 Pro 预览版了,真没必要什么任务都上 Pro,白花三倍的钱。
六、三模型对接架构图
6.1 接口怎么走
6.2 Codex 接入对比
| 项目 | V4-Flash-Preview | V4-Flash-0731 | V4-Pro |
|---|---|---|---|
| wire_api | "chat"(降级) |
"responses"(原生) |
暂不支持 |
| 协议翻译代理 | 需要 CC Switch / LiteLLM | 不需要 | — |
| 子 Agent 调度 | 不支持 | 支持 | — |
| 并行工具调用 | 受限 | 原生支持 | — |
| 代码审查工作流 | 不完整 | 完整支持 | — |
6.3 Responses API 怎么调
from openai import OpenAI
client = OpenAI(
api_key="<你的 DeepSeek API Key>",
base_url="https://api.deepseek.com"
)
# Responses API 调用(0731 新支持)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful coding assistant.",
input="帮我写一个 Spring Boot 的 Redis 工具类",
)
print(response.output_text)
# 流式输出
stream = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful coding assistant.",
input="帮我写一个 Spring Boot 的 Redis 工具类",
stream=True,
)
for event in stream:
if event.type == "response.output_text.delta":
print(event.delta, end="")
6.4 双模型协作(企业级玩法)
这种架构下,Flash 和 Pro 各跑独立 Session,前缀缓存互不干扰。简单任务走 Flash 省钱,复杂规划交给 Pro,不会因为模型切换导致缓存失效。
七、现在模型调用量排行
数据来自 OpenRouter 平台,7 月 27 日–8 月 2 日那周的统计。只统计走 OpenRouter 网关的流量,不代表全球全量,但趋势是真实的。
7.1 Top 10
| 排名 | 模型 | 归属 | 周调用量(约) | 份额 |
|---|---|---|---|---|
| 1 | DeepSeek V4 Flash | DeepSeek | 7.2 万亿 Token | ~12% |
| 2 | 小米 MiMo-V2.5 | 小米 | 5.1 万亿 Token | ~9% |
| 3 | 腾讯混元 Hy3 | 腾讯 | 5.0 万亿 Token | ~9% |
| 4 | DeepSeek V4 Flash 0731 | DeepSeek | 3.5 万亿 Token | ~6% |
| 5 | GPT-5.6 Luna | OpenAI | 3.0 万亿 Token | ~5% |
| 6 | DeepSeek V4 Pro | DeepSeek | 3.0 万亿 Token | ~5% |
| 7 | 智谱 GLM-5.2 | 智谱 | 2.9 万亿 Token | ~5% |
| 8 | Nemotron-3-Ultra | 英伟达 | 2.4 万亿 Token | ~4% |
| 9 | MiniMax M3 | MiniMax | 1.8 万亿 Token | ~3% |
| 10 | 阶跃星辰 Step 3.7 Flash | 阶跃星辰 | 1.5 万亿 Token | ~3% |
7.2 榜单里几个有意思的事
- DeepSeek 一个人占了三席(Flash + 0731 + Pro),加起来超过总量的 23%
- 国产模型包揽了前四,不过 GPT/Claude 自家官网和企业私有部署的流量不在这个统计里,别直接等同于全球市场
- V4 Flash 0731 上线才 2 天就冲到第四,势头猛
- GPT-5.6 Luna 降价 80% 后调用量暴涨 738%,价格战还没打完
- 国产模型周调用量已经连续 14 周超过海外模型了
但门主得说句实话:调用量高 ≠ 综合能力最强。这份榜单反映的是"谁被用得最多",不是"谁最强"。日常编码、批量处理选国产 Flash 性价比确实高,但碰到超复杂深度推理,海外旗舰闭源模型还是有优势的。
7.3 DeepSeek 自家三模型对比
| 模型 | 周调用量 | 定位 |
|---|---|---|
| V4 Flash(含旧版) | ~7.2 万亿 | 主力,日常开发首选 |
| V4 Flash 0731 | ~3.5 万亿 | 新上线,增长很快 |
| V4 Pro | ~3.0 万亿 | 旗舰推理,复杂任务 |
Flash 系列调用量远超 Pro。说白了,大多数开发者日常要的就是性价比,不是极限性能。
👇 三连支持,动力源泉
如果这篇文章帮你省下了踩坑的时间,欢迎:
🔹 点赞 —— 让更多人看到这篇干货
🔹 在看 —— 你的认可是我持续输出的动力
🔹 转发 —— 分享给身边正在做AI Agent的朋友
你的每一个小动作,对我都很重要 ❤️
🙏 关于作者
你好,我是 空门技术栈,一个常年和Bug战斗、持续填坑的Java开发者。
专注分享:
- ✅ Java / Spring Boot / Spring AI Alibaba 企业级实战
- ✅ RAG知识库、AI Agent、多智能体协作落地经验
- ✅ Docker部署、微服务架构、线上问题排查
- ✅ 偶尔聊聊「如何保住头发」这类程序员终极话题 😂
不搞水文,不贩卖焦虑,只写能跑通、能落地、能帮你少加班的实战内容。
关注我,咱们一起少踩坑,多写优雅代码。
📖 更多干货推荐
- 告别手动复制接口文档!Apifox MCP + AI 自动测试让开发效率起飞
- MySQL MCP Server 从零安装到使用实战,AI 直接查询数据库
- Spring Event 用了三年,同事一句话把我问懵了
- Spring AI Alibaba 多智能体(Multi-agent)实战:6 大协作模式 + 完整代码
- Spring AI Alibaba 智能体作为工具实战:别再让主 Agent 当"人肉路由器"了
- 一文搞懂 Spring AI Alibaba Workflow:10 个实战案例带你彻底掌握 AI 工作流编排
- RAG 知识库为什么越更新越乱?一文讲透生产级文档更新方案
- Transformers VS vLLM:大模型部署到底该选谁?从本地运行到生产上线完整解析
- LangChain Agent终于讲透了:短期记忆、Redis持久化、Middleware企业级实战,一篇带你从入门到生产
- LangChain 流式输出终于讲透了:6 种 stream_mode 一篇全搞懂
- Spring AI 流式对话踩坑:SSE 已关闭,为什么大模型还在继续生成?
- LangChain 结构化输出终于讲透了:ProviderStrategy、ToolStrategy、动态 Schema 一篇全会
- [Spring WebFlux 真的比 MVC 快?我用 5 万长连接测出了真相]
(https://mp.weixin.qq.com/s/CNv2U98Mg5cqftidjatP5w)
🤝 项目合作 / 技术咨询
平时工作之余,也会接一些技术项目和咨询,主要方向:
⚔️ 企业级开发
- Java / Spring Boot 项目开发与重构
- 微服务架构设计与落地
- 系统性能调优、线上问题排查
🤖 AI 应用落地(这是我最近的主力方向)
- Spring AI Alibaba / RAG / Agent 应用开发
- 企业私有知识库搭建
- AI能力接入现有业务系统
- 大模型本地化部署与调优
🛠️ 技术顾问 / 疑难Bug排查
- 项目架构评审与方案设计
- 线上疑难问题定位解决
- 技术选型与团队培训
如果你正遇到以下情况,欢迎找我聊聊:
- ✅ 想做AI项目,但技术方案拿不准
- ✅ 项目卡在某个Bug上很久,团队搞不定
- ✅ 想把AI接入现有业务,不知道从哪下手
- ✅ 需要靠谱的开发外包或长期技术顾问
📮 联系渠道(按回复速度排序):
- 最快:私信空门技术栈
一个人踩坑,是事故;一群人踩坑,就是《避坑宝典》。
—— IT 空门,与诸君共修技术大道 😎
更多推荐



所有评论(0)