概要:本文讲 DeepSeek V4.1 Flash 的发布要点、它为什么能把 Agent 长任务的成本打下来、WorkBuddy 全量接入之后普通用户能实测到什么变化。读完你能知道这次升级跟你有什么关系、今天就能上手验证哪三件事。预计阅读时间 6 分钟。

昨晚到底发生了什么

9 月 10 日晚上,DeepSeek 正式发布 V4.1 Flash。552B 参数的 MoE 架构,输入激活 8B,输出激活 16B,原生多模态,能直接看图理解视觉内容。

这次不叫 V5,叫 Flash,定位很明确:性能全面超越上代旗舰 V4 Pro,但价格按性价比档位走。官方公布的评测里,DeepSWE 和 AutomationBench 两项成绩超过上代,也超过部分闭源旗舰。

对每天用 AI 干活的人来说,重点就一句话:更强了,还更便宜了。

Flash 到底快在哪,说人话

看发布会信息,最值得关注的是 KV Cache 的压缩。这个技术词听着陌生,其实道理很直白。

Agent 干长任务时,前面几十轮对话的内容都要存着备用,这份缓存放得越满、读得越勤,成本就越高。V4.1 Flash 把这份缓存压缩到什么程度呢,对显存的需求降到上一代的四分之一,对固态硬盘的需求降到八分之一。

翻译成账本:你的 AI 员工干得越久,省得越多。以前长任务是成本黑洞,现在缓存命中一次的花费能低到忽略不计。这对跑自动化工作流的人是实打实的利好,定时任务每天跑几十轮的那种,月底账单会有体感差异。

还有一个容易被忽略的点:高频并发。毫秒级响应加专为代码补全优化过的吞吐,意味着你在 IDE 里敲代码等补全、Agent 高频调用工具时,不会卡在那转圈。

跟你有什么关系

这次发布有个跟腾讯用户直接相关的消息:WorkBuddy 和 CodeBuddy 是官方合作伙伴,已经全量接入 V4.1 Flash。

也就是说你不用改任何配置,今天打开 WorkBuddy,背后跑的很可能已经是新模型了。

更实在的是切换规则:9 月 14 日之后,原来发往 V4 Pro 的请求会自动路由到 V4.1 Flash,并且按 Flash 的价格计费。原本用旗舰档的用户,等于性能升了一级,价格降了一档,什么都不用做。

今天就能测的三件事

光看参数没用,上手试才作数。给你三个今天就能跑的验证项。

第一件,扔张图进去。V4.1 Flash 原生多模态,找个带图表的截图让它读数、找张白板照片让它整理待办,看它能不能直接理解视觉内容,不再需要先转文字。

第二件,跑一次长任务。把一个多步骤的活丢给 Agent,比如让它查资料、整理、写报告一条龙。重点感受两件事:中间步骤会不会丢上下文,整个流程跑完的花费跟以前比差多少。

第三件,测高频调用。写个小脚本连续调用几十次,或者就在 CodeBuddy 里连续补全一段代码,观察响应速度和有没有报错。稳定性这东西,宣传页说了不算,自己的场景跑通了才算。

三件事测完,这次升级对你来说是真香还是噱头,你自己的数据会给你答案。

顺带一提

我自己是通过魔芋 AI 的平台用上 V4.1 Flash 的,输入 0.40 元、输出 1.60 元每百万 tokens,缓存命中 0.008 元起。他们有个 20 元的体验包含 1000 万 tokens,想做低成本验证的可以试试。我还创了个AI技术交流群,如果大家感兴趣的话,欢迎进群一起探讨!

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐