AI办公工具

DeepSeek V4 Flash 正式发布

完整内容
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!

一、全文速览图

DeepSeek V4 Flash 正式发布,这个价格确实打穿了!
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!

DeepSeek V4 Flash 终于发布了。

但老实说,这次只砸起了一点水花。

它当然强。我也确实把它放进自己的真实工作流里,跑了资料梳理、长文处理、方案分析、结构化输出和一些局部代码任务。

我的结论是:能用,而且已经足够覆盖我日常工作里的大部分需求。

可如果你问我有没有被惊艳到?

没有。

如果 V4 Flash 早一点发布,它获得的关注可能会大得多。可它前面已经站着一个 K3,提前把大家对国产模型在复杂编程、长上下文和 Agent 任务上的期待拉高了。

这里需要强调一下,我并不是说 K3 是全球最强模型。

如果可以直接使用 OpenAI 或者 Anthropic 的高阶模型,复杂任务的能力上限依然是另外一回事。就连 Kimi 自己也承认,K3 的整体表现与最强的闭源模型仍然存在差距。

我说的是,如果前提被限定在国产模型里,K3 已经提前占据了复杂任务这一层。再回过头看 V4 Flash,就很难产生“国产模型又跨了一代”的冲击感。

更何况,严格来说,这也不是整个 V4 系列的全面更新。

这次上线的是 DeepSeek-V4-Flash-0731:Flash 正式版本进入 API 公测,V4 Pro 和 App、Web 端都没有同步更新。核心架构和规模也没有变化,主要提升来自重新后训练,重点增强了 Coding Agent、工具调用和自动化任务能力。

所以,只看模型能力,这次发布确实没有太多可以制造情绪的地方。

但是看完价格,我觉得这篇文章还是必须得写。

按照 DeepSeek 目前的常规 API 价格:

一百万未命中缓存的输入 Token,1 元;

一百万输出 Token,2 元;

如果命中缓存,一百万输入 Token 只要 2 分钱。

官方还预告后面会启用峰谷定价,高峰时段价格翻倍。可即使按翻倍后的价格计算,它依然便宜得离谱。

所以 V4 Flash 真正值得讨论的,不是它有没有重新成为最强国产模型。

而是当一个模型已经足够好用,价格又被压到这个位置之后,它会怎样改变我们使用 AI 的方式。

二、它没有重新定义上限,但把“够用”变得太便宜了

这次我实际用下来的感受很明确。

V4 Flash 已经不是那种“因为便宜,所以只能勉强凑合”的模型了。

在资料整理、内容改写、文档总结、结构提取、轻量分析和局部代码处理这些任务里,它给出的结果基本都能继续往下使用。

有些内容需要我再调整一下,有些任务需要补充要求,但整体上,它已经越过了我对日常模型的可用线。

这点非常重要。

因为大多数普通任务,并不要求模型一定拿到 100 分。

一份资料总结,只要没有漏掉关键信息,结构足够清楚,就可以继续使用;一段 文案 ,只要方向正确,后面本来就需要人工修改;一段局部代码,只要边界明确、能够通过测试,也没必要每次都调用最贵的模型。

在这些任务上,一个模型从 90 分提高到 93 分,实际带来的价值可能没有想象中大。

但如果它的价格下降十几倍甚至几十倍,影响就完全不同了。

DeepSeek V4 Flash 正式发布,这个价格确实打穿了!
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!

按照双方公布的国际 API 价格,V4 Flash 未命中缓存的输入是每百万 Token 0.14 美元,输出是 0.28 美元;K3 分别是 3 美元和 15 美元。

也就是说,K3 的输入价格大约是 V4 Flash 的 21 倍,输出价格大约是 54 倍。

当然,价格相差几十倍,不代表能力也相差几十倍。

但这正是 V4 Flash 最有产品价值的地方:当能力已经越过可用线,价格就开始决定这个模型到底只能偶尔使用,还是可以成为默认能力。

三、公司不是不知道 GPT 和 Claude 更强

经常使用 OpenAI 或者 Anthropic 模型的人,看到现在的国产模型发布,很容易觉得:

也就那样吧。

这种感受并没有错。

如果只是一个人偶尔处理一项复杂任务,当然可以直接选择自己能用到的最强模型。一次调用贵几块钱还是便宜几块钱,通常不会成为决定性因素。

但公司选择模型时,算的不是同一笔账。

你真的进入企业的 AI 项目里,会发现很多公司依然在使用 DeepSeek、豆包或者通义作为底层模型。

难道这些公司的产品经理和技术负责人不知道 GPT、Claude 更强吗?

当然知道。

但个人用户选择的,往往是“哪一个模型能给我最好的这一次回答”;公司采购的,却是一种能够稳定供应、持续接入,并且可以大规模调用的生产能力。

去年下半年,中国企业日均大模型使用量已经达到 37 万亿 Token,比上半年增长 263%。相关统计里,通义、豆包和 DeepSeek 占据了企业 Token 消耗量的前三名。

到了这个规模,模型的单价就不再只是财务报表上的一行数字,而会直接决定产品能不能成立。

一个普通用户发出一次请求,背后可能不是一次模型调用。

Agent 需要先理解任务,再检索资料、调用工具、生成内容、检查结果,失败以后还要重新规划。用户看起来只点了一次按钮,后台可能已经运行了十几次甚至几十次模型。

如果每一次都使用最贵的模型,很多功能不是利润低一点,而是从一开始就没有商业可行性。

除了价格,公司还要考虑数据合规、部署方式、供应稳定性、并发能力、接口兼容、现有系统的迁移成本,以及模型出现问题以后能不能快速处理。

所以企业并不是在单纯比较哪一个模型最聪明。

它真正寻找的是:

一个能力已经越过业务门槛,同时成本、风险和供应都可以控制的模型。

DeepSeek V4 Flash 正式发布,这个价格确实打穿了!
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!

四、价格低到一定程度,改变的是产品形态

模型比较贵的时候,AI 往往会被设计成一个很显眼的功能。

用户需要主动点击;每天有调用次数限制;只有付费用户才能使用;一个任务尽量只调用一次模型。

因为每一次调用都在产生成本。

但当模型价格下降到 V4 Flash 这个位置, 产品设计 的逻辑会开始发生变化。

过去舍不得把整份文档交给模型,现在可以完整处理;过去只能生成一次,现在可以先生成,再检查,再修正;过去只能串行跑一个结果,现在可以并行生成几个候选,再从中选择;过去只能在用户点击时调用,现在可以让 AI 在后台持续完成分类、提取、整理和更新。

模型能力并没有突然发生质变。

但产品敢让它参与的环节变多了。

这也是我认为 V4 Flash 最值得关注的地方:

它没有明显改变“AI 能做什么”,却可能改变一个产品“敢让 AI 做多少次”。

很多 AI 产品过去的问题,并不是模型完全做不到,而是模型每做一次都太贵。

低价模型真正释放出来的,是调用密度。

当一次任务可以承担更多次调用,产品就有空间加入重试、检查、对比和失败升级,用工作流去弥补单次模型的不稳定。

这并不意味着调用三次便宜模型,就一定可以追平一次更强的模型。模型可能连续犯同一种错误,也可能根本意识不到自己错在哪里。

但至少,产品终于有了用冗余换可靠性的经济空间。

这才是“便宜”从采购优势变成产品能力的过程。

五、真正该算的,不是 Token 单价

当然,便宜不等于性价比高。

如果一个模型调用一次只花几分钱,最后却需要人工花半小时重新检查和修改,那它仍然很贵。

反过来,一个更强的模型虽然单次调用价格高很多,但一次就完成了高风险任务,减少了返工和错误,它反而可能更省钱。

所以公司真正应该计算的,不是 Token 单价,而是:

单次有效交付成本 =模型调用成本+重试成本+结果验证成本+升级模型成本+人工返工成本+失败风险

这个公式也能解释,为什么我认为 V4 Flash 可以覆盖日常工作里的 90%,却不建议让它单独承担大型项目开发。

这里的 90%,不是说它在所有任务上都有 90% 的成功率,更不是说所有人的 90% 任务都可以交给它。

它指的是我自己的任务分布。

我平时大量工作都集中在资料梳理、内容处理、信息提取、方案分析、结构调整、简单脚本和局部代码修改上。这些任务边界相对清楚,结果可以检查,失败以后也容易重试。

在这些地方,V4 Flash 已经足够好,而且便宜得几乎不需要犹豫。

但大型项目开发不是这样。

大型项目真正困难的地方,从来不只是“能不能写出某一段代码”。

它需要模型理解整个代码库,记住已有约束,连续执行几十步任务,在工具调用失败以后恢复状态,修改一个模块时不破坏另一个模块,还要在发现方向错误时及时回退。

这类任务执行时间长、上下文复杂,很多错误又不能立刻被发现。

前面九步都做对了,第十步改坏了核心模块,前面省下来的成本就没有意义了。

所以我的判断不是 V4 Flash 不能参与大型项目。

它当然可以负责其中明确、局部、能够测试的执行任务,但我不会让它单独承担整个项目的规划、推进和最终交付。

因为到了这里,真正昂贵的已经不是 Token,而是失败。

我给到的需求:

DeepSeek V4 Flash 正式发布,这个价格确实打穿了!
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!

DeepSeek V4 Flash 的回答

DeepSeek V4 Flash 正式发布,这个价格确实打穿了!
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!

Claude opus5 的回答

DeepSeek V4 Flash 正式发布,这个价格确实打穿了!
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!

他们俩本质上在回答骨架上就有差异

DeepSeek V4 Flash 正式发布,这个价格确实打穿了!
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!

七、如果只用国产模型,我会选择 K3+V4 Flash

先把前提说清楚。

如果 OpenAI 或者 Anthropic 的模型可以正常使用,而且任务失败的成本很高,我依然会优先考虑当时能力更强的模型。

K3 不是全球模型能力的天花板。

但如果限定在国产模型里,目前我最愿意长期使用的组合,确实是 K3 加上 DeepSeek V4 Flash。

V4 Flash 负责高频、明确、可以验证的任务。

比如资料处理、内容生成、格式转换、轻量分析、局部代码修改,以及大量标准化的后台任务。

K3 负责上下文更长、任务更加模糊、需要多轮工具调用,或者失败以后返工成本很高的复杂任务。它原生支持视觉输入和百万上下文,也更适合作为国产模型组合里的复杂任务层。

这套组合并不是简单地让 K3 负责思考、V4 Flash 负责干活。

如果每一个任务都先交给 K3 规划,不仅会把成本重新拉高,两个模型之间的信息交接也可能产生损耗。

更合理的方式,是让 V4 Flash 成为默认执行层。

任务边界清楚、结果能够通过规则或者测试验证,就直接由它完成;当上下文持续变长、连续重试仍然失败、任务开始涉及多模态,或者错误会产生较大损失时,再升级到 K3。

关键任务无论交给哪一个模型,最后都要经过程序测试、人工检查或者业务规则验收。

这样一来,K3 提供的是国产模型组合里的复杂任务上限,V4 Flash 提供的是规模和吞吐量。

一个保证难题有人处理,一个保证日常任务能够低成本地一直运行。

DeepSeek V4 Flash 正式发布,这个价格确实打穿了!
DeepSeek V4 Flash 正式发布,这个价格确实打穿了!

八、AI 产品经理以后管理的,不只是模型

以前做 AI 产品,大家最常问的问题是:

到底应该接哪一个模型?

但模型价格和能力逐渐分层以后,这个问题已经不够用了。

真正需要解决的是,哪些任务默认进入便宜模型,出现什么信号以后升级,哪些结果可以由程序自动验证,哪些任务必须人工检查,以及整个系统每完成一次有效任务到底花了多少钱。

这时候,模型选型就不再是一次性的采购决策,而变成了一套持续运行的任务路由。

对于 AI 产品经理来说,最有价值的工作也不再是追着每次发布会更新一张模型排行榜。

更实际的方法,是从真实业务里抽出几十个高频任务,让不同模型完成,然后记录结果是否可用、重试了几次、人工修改了多久、最终花了多少钱。

模型排行榜告诉你它可能很强。

真实业务评测集才能告诉你,它放进自己的产品以后,到底省不省钱。

而且这套评测不能只运行一次。

模型版本会更新,价格会变化,产品工作流也会变化。今天适合进入 V4 Flash 的任务,可能下一个版本直接完成率大幅提升;今天必须交给 K3 的任务,过一段时间也可能被下放到更便宜的模型。

产品经理真正要运营的,不是哪一个模型,而是一整套任务流量。

每一次选择模型时,最终都应该回到几个很朴素的问题:

它的质量有没有越过业务验收线?结果能不能验证?失败以后损失有多大?把重试、人工和风险全部算进去以后,一次有效交付到底多少钱?

回答完这些问题,模型应该放在哪一层,通常也就清楚了。

九、最后

所以,如果你问我 DeepSeek V4 Flash 这次发布惊不惊艳?

确实没有。

它没有制造第二次 DeepSeek 时刻,也没有重新定义国产模型的能力上限。前面已经有 K3 抬高了大家的预期,再加上这次只更新了 Flash API,发布声量小是很正常的事情。

但发布声量和产品价值,本来就不是同一件事。

有些模型靠更高的能力上限告诉我们,AI 又能完成哪些过去做不到的任务。

V4 Flash 这次做的,是把一档已经够用的能力,压到了可以高频调用、反复验证,甚至长期隐藏在产品后台运行的价格。

它没有让我重新理解模型能够做到什么。

但它确实让我重新计算了一遍,哪些事情值得一直交给模型做。

如果可以使用全球模型,我依然会把最复杂、失败成本最高的任务交给真正处于能力前沿的模型。

如果只使用国产模型,我目前会选择 K3 承担复杂任务,DeepSeek V4 Flash 承担规模化执行。

不是因为这两个模型可以包打天下。

而是放在同一套工作流里,它们刚好解决了两个不同的问题:

一个负责把困难的事情做成,一个负责让大量已经能做的事情,便宜到可以一直做。

DeepSeek V4 Flash 没有惊艳我。

但这个价格,确实打穿了规模化使用 AI 的门槛。

资料附件

当前教程暂无附件。