今天一位 AI 研究员给我发来消息,直言这是她入行以来最爽的一个夏天。
DeepSeek-V4-Flash 正式版终于落地,性能直接超越了之前的 V4-Pro-Preview。
在基准测试中,它的表现甚至能和 Claude Fable 5 放在同一张表里对标。
那个总参数高达 284B、激活参数仅 13B 的“轻量版”模型,在多项任务上追平了曾经让人仰望的 Opus 4.8。
更离谱的是定价,Flash 版便宜得让人咋舌,两块就能让它输出 100 万 tokens。
她把手头所有的项目都跑了一遍优化,结果花费还没超过一杯奶茶钱。
昨天在开发者群里,气氛突然凝固,所有人停下手中的活,开始疯狂转发评测截图。
她说自己特别开心,甚至产生了一种身处人类黄金时代的错觉。
谁也没料到,DeepSeek 这次又憋了个大招,卡在 7 月底,发布了 DeepSeek V4 Flash 的正式版。
说实话,起初世超对这次更新并没太当回事。
毕竟只是个挂着 Flash 名头的模型更新,主力 Pro 系列纹丝不动。
上一次只更 Flash 不更 Pro 的大厂是谷歌,那会儿大家还拿这个玩梗。
心想你这 Flash 再强,总不能超越自家的 Pro 吧……
???
不是哥们,你这 Flash 跑分怎么比 Pro 还猛?
这还是 Flash 吗?
不对啊,大模型不该这么玩。按套路,你应该先出个 Flash 说只是速度快点,结果你直接让 Flash 追平自家 Pro,价格还只要 2 块钱 / 百万 token,偶尔还有缓存命中打一折的优惠,我周末用了 1 个亿 token 才花了 5 块钱。
世超整理了这次 V4 Flash 亮出的跑分,发现能力确实夸张。
不仅超过了自家大哥 Pro,虽然比不上 Claude Opus5、GPT-5.6 Sol 和 Kimi K3 这些顶级选手,但正式版的 V4 Flash 也就差这几家一丢丢。
有网友把各家大模型的能力与价格汇总成表:
每个模型在图中是一个点,越靠左越便宜,越靠上性能越好。
一眼望去,市面上绝大多数模型都处于尴尬境地。
性能不如 DeepSeek,价格还比它贵。
而那些性能更强的模型,日子也不好过,因为价格实在太贵。
差友们可能没注意,上图横轴是对数坐标,非线性的。
但我们花钱可不是按对数算的。
世超动用久违的 PS 技术,把图拉回线性坐标,真实比例如下:
也就是说,Claude Fable 5、GPT-5.6 Sol 等模型相比 V4 Flash,性能或许只提升两成左右。
但价格却多出两个零。
夸张地说,DeepSeek 又一次重新定义了模型的斩杀线。
那么,DeepSeek 是怎么做到的?架构参数都没大变,为何能力突变?
世超翻阅 DeepSeek 论文及公开资料,找到两个最大概率的原因。
首要点是后训练。
这也是官方承认的,预览版与正式版差距最大的地方。
给不太了解大模型的差友科普一下,大模型训练通常分两阶段。
第一阶段叫预训练。
我们要给模型塞入海量文本、代码及其他数据,让它学会答题的基本功。
这过程像培养高中生,语数外物化生政史地音体美计算机,各领域的知识都要喂给它,以此夯实基础。
第二阶段是后训练,锻炼真正解题干活的能力。
这块主要靠刷题,让模型通过反复练习提高应试能力,学会如何解决问题。
研究人员通过监督微调、强化学习和大量任务数据,让模型掌握理解指令、拆解问题、使用工具以及按人类偏好给出答案的技巧。
同样预训练出来的模型,经过不同的后训练刷题,表现差异巨大。
之前 DeepSeek R1 论文就提过,他们将 V3 引入 GRPO(群组相对策略优化)强化学习后,数学能力飙升,AIME 2024 测试集正确率从 15.6% 暴涨至 71%。
OpenAI 当年的 InstructGPT 亦然。
经过监督微调和 RLHF,一个仅 13 亿参数的模型,在真人盲评中竟能击败参数量大 100 多倍的 GPT-3。
若说预训练决定模型脑子里有没有知识,后训练则决定它能否把这些知识拿出来用。
当然,仅靠后训练或许还不能完全解释 V4 Flash 的惊艳成绩。
细看 DeepSeek 发布说明,还能发现一件事:
部分公开跑分并非模型裸跑得出,而是借助了未发布的 DeepSeek Harness 工具。
Harness 这个词这半年大家听得不少,火热的 Claude Code、Codex、OpenClaw 皆可视为 Harness,即 Agent 工具的一种。
如今常刷到的 Workbuddy、Qoder、Trae 也属此类。
现在 DeepSeek 也要推出自己的 Agent 工具入局。
这件事可能比单更模型更为关键。
在 Agent 时代,模型最终成绩不只取决于自身智商,还取决于外挂的工具链。
裸模型如考场学生,遇复杂问题只能硬算。
Agent 则赋予模型搜索引擎、代码运行环境、项目管理上下文、结果检查乃至错误重试等功能。
这些外置工具为模型加 Buff,极大增强了实际做事能力。
今年初多伦多大学团队做过研究,将同一大模型放入不同 Agent 工具测试。
结果发现,同一模型在不同工具中表现迥异,完成问题的概率最高相差数倍。
前不久有人比喻,AI 发展如爬阶梯。
去年阶梯是思维链,让模型学会思考,拓展能力边界。
今年最重要的阶梯则是 Agent。
此刻,DeepSeek 交出了自己对 Agent 的答案。
凭借高质量后训练与 Agent 工具,原本负责轻量应用的 Flash,直接被拉至全球旗舰模型身后。
说实话,看到这个超级强化后的 Super Pro Max 版 Flash,世超已充满期待。
既然用于下沉市场的小弟,靠着出神入化的后训练和 DeepSeek Harness 工具,能与身娇肉贵的 GPT-5.6 Sol、Claude Fable 5 等“太上皇”掰手腕……
那若 DeepSeek 将这套版本答案套在更强的 V4 Pro 上呢?
撰文:早起
编辑:江江 & 面线
美编:焕妍
图片、资料来源:
https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
https://www.reuters.com/business/retail-consumer/deepseeks-new-ai-model-is-by-far-cheapest-well-known-models-run-research-firm-2026-08-03/
https://artificialanalysis.ai/leaderboards/models
https://artificialanalysis.ai/models
https://artificialanalysis.ai/methodology
https://artificialanalysis.ai/methodology/intelligence-benchmarking
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
https://arxiv.org/abs/2606.19348
https://api-docs.deepseek.com/zh-cn/news/news260424
https://www.deepseek.com/transparency/
https://arxiv.org/abs/2501.12948
https://arxiv.org/abs/2203.02155
https://arxiv.org/abs/2602.09540
https://swebenchmobile.com/













