DeepSeek V4.1 Flash上线后,运行效率提升,输出准确性增强,并集成了原生多模态功能。
网络上对DeepSeek V4.1 Flash的评价普遍积极,梁文锋再次被尊称为“梁圣”。
与V4 Flash相比,V4.1 Flash的核心变化在于彻底重构,采用了与V4 Flash截然不同的非对称架构。
这意味着,V4在架构层面积累的训练配方、优化方法以及工程适配,到了V4.1这里,大部分都已失效。
如今的DeepSeek早已不是初创的小团队,而是一家拥有数百名员工的企业,重新构建一套新架构既耗费时间又耗费精力。即便如此,梁文锋仍决心对V4进行彻底重构。
新架构听起来确实像是一个营销噱头,但答案实际上藏在DeepSeek V4.1 Flash的官方论文中——DeepSeek的旧架构已无法容纳新的训练目标。
那么,这个新目标是什么?我认为,很可能是“入口”。
DeepSeek为何要彻底重构?
通常情况下,是先有模型,后有Harness。厂商根据模型的能力和特点来构建Harness。然而,DeepSeek V4.1 Flash却是被DSH“反哺”出来的。
官方论文指出,V4.1 Flash的后训练遵循标准的SFT→RL→在线蒸馏(OPD)流程,没有算法上的变动。关键在于,所有实质性的变化都发生在数据流水线中,包括大规模自动合成Agent任务与环境,以及数据、任务、rollout的渐进式扩展。
在RL训练中,模型在6种不同的Agent框架内反复试错,数据量、任务种类和试错轮次逐步放大。DSH是这6个训练场中最重要的一个,V4.1 Flash还专门针对DSH的不同操作模式进行了定向训练。
DSH从DeepSeek V4 Pro的伴生产品,转变成了V4.1 Flash的“老大哥”。
为了迎合DSH的偏好,DeepSeek V4.1采用了全新的架构。
论文中介绍,新架构让模型在prefill阶段每token只需激活8B参数,在decode阶段激活16B参数,从而显著提升“输入密集的agent工作负载”的成本效率。
为什么“输入密集”会成为问题?
过去的模型架构是为“聊天”设计的,用户提问一句,模型回答一句。这导致输入短、输出长,模型只记忆当前对话的上下文。
但在Agent时代,几十轮的中间状态一直挂在上下文中,输入动辄几十万token,远超输出。
2026年4月,密歇根大学、斯坦福大学等院校联合发表论文《AI是怎么花你钱的?》(How Do AI Agents Spend Your Money?),其中提到,在agentic代码任务中,输入与输出的token比高达154:1。
于是DeepSeek选择彻底重构。V4.1 Flash采用了非对称架构Causal-Encoder-Decoder(CED)。
V4.1 Flash的语言主干共40层,如果按照传统的Transformer(decoder-only)架构,这40层应该完全相同。每一层都同时负责“读”和“写”,处理输入也处理输出,并且每层都要自己维护一份KV Cache。
CED的“非对称”体现在,将这40层拆分为前20层编码器和后20层解码器。编码器只负责“读”,将输入压缩成摘要;解码器只负责“写”,根据摘要生成回答。
就像汽车的流水线一样。 过去是一个车间完成所有工作,要增加产能就得不断复制这个车间。现在是流水线,冲压车间只负责冲压,电泳车间只负责电泳。
并且记忆只生成一次,解码器的全局KV Cache直接从编码器的最终结果投影出来。DeepSeek V4.1 Flash的全局KV Cache被压缩到890字节/token,降至V4 Flash的1/4。
这是因为DeepSeek V4.1 Flash采用了CSA2(Compressed Sparse Attention 2),即第二代压缩稀疏注意力。
在V4时,DeepSeek使用的是第一代CSA。到了第二代,不同层之间可以共享KV和索引,从而解决了前面提到的痛点。
仍然像汽车流水线一样,CSA2将这40层分为三个不同的车间:Full、Reindex和Reuse。
Full负责完整记录,就像传统Transformer的每一层。Reindex负责提炼重点,然后根据提炼结果执行操作。Reuse则直接复制Full的结果,连提炼都省去了。
虽然使用第一层Full、其余39层全部用Reuse是最节省成本的做法,但每层关注的重点不同,能力也不同。浅层做的是“字面理解”,深层做的是“逻辑推理”,它们需要的上下文内容不同。如果全部使用Reuse,只会生成没有价值的回答。
去年还是先造车、再修路,今年已经是先修路,再造车。
模型性能强弱、性价比高低,都不是叙事核心。只有掌握了入口,才能吸引更多用户。
但梁文锋不是第一个这么做的,姚顺雨的Hy4 preview走在他前面。
Hy4 preview的官方技术报告显示,通过腾讯内部的软件工程师、游戏开发者、金融分析师、安全专家,围绕他们实际交付的工作共建数据,再与CodeBuddy、WorkBuddy等产品共同设计。
在163名内部专家参与的203个真实工程任务盲测中,Hy4 preview平均得分2.99,GLM-5.3为2.92,Kimi K3为2.94。
入口的重要性不言而喻,腾讯产品矩阵的优势得以发挥。
DSH和WorkBuddy本质上是一种产品闭环,是整条训练流水线的一部分。
有趣的是,2026年7月24日,腾讯撤销了大语言模型部和多模态模型部,合并成立基础模型部,由姚顺雨统一负责。他将混元多模态的发展重点放在Agent强相关的多模态理解上,这与梁文锋此前对多模态的看法一致。
如今,梁文锋又在模型上向姚顺雨靠拢,相互学习。
智谱与Kimi有类似的闭环吗?
智谱和月之暗面这两家并非没有工具。Kimi有Kimi Claw,智谱也有ZCode、AutoClaw和GLM Coding Plan。
但这些工具无法像DSH和WorkBuddy那样“反哺”模型。智谱和Kimi的工具是后挂的外壳:模型先在合成环境里训练好,再做成产品给用户使用。
智谱现在将所有精力都放在模型自进化上。8月31日,在智谱半年度业绩会上,唐杰首次明确表示,GLM-6.0是一款Full Self-Training(完全自训练)模型,与OpenAI的RSI(Recursive Self-Improvement,递归自我改进)相似。
唐杰表示,从预训练、中训练到后训练,全流程让模型自己训练自己,不再依赖人写代码、清洗数据、调参、设计实验。人只负责给模型设定目标,以及做最终的验收工作。
在GLM-5.3上,智谱已经展示了他们自进化方法的一部分。GLM-5.3和5.2使用相同的基座,但性能大幅提升。
具体情况是,GLM-5.3建立了一套端到端的任务环境合成流水线。Agent从真实世界的软件工程和终端操作场景收集种子任务,接着模型自己头脑风暴,生成大量可验证的任务草稿,再构建用于做题的Agent,将这些草稿实例化为具体的可运行环境。
对Agent输出的回答进行精炼,根据研究员定义的评分标准,检查并迭代优化任务质量。
最终产出了数千个多样化、可验证的终端Agent环境。GLM-5.3的长程任务环境数量是GLM-5.2的几十倍,而且都是Agent自己构建的。
月之暗面走的是“在自建合成环境中将Agent能力练到极致”的路线,相当于闭关修炼。
具体做法是通过AgentENV来完成模型训练。这是一个基于Firecracker微虚拟机的分布式沙箱系统。
在K3训练期间,系统运行了5100万个沙箱,支持暂停、恢复、复制、快照,专门解决长程Agent强化学习中“任务跑不完、环境容易污染”的基础设施难题。
Agent的强化学习训练与普通大模型RL不同。普通RLHF是给模型一个prompt,模型生成一段回答,打分,更新参数。环境是无状态的,跑完就结束。
但Agent训练不同。模型要在真实的运行环境中工作,一个任务可能跑几十步甚至几百步,持续几分钟到几小时。
如果在工作过程中,模型发现缺少某个依赖,它会为了完成任务,自己在沙箱中安装依赖、修改配置文件。
虽然任务完成了,但环境也改变了,即环境被污染了。那么下一轮训练不能接着使用,需要重新启动一个干净环境。重新启动过程大约需要几秒,虽然不长,但在大规模训练时会浪费大量时间。
就像学开车一样,如果一上来就从科目三开始,那必定会成为马路杀手。所以需要驾校,准备一个没有行人和车辆的空地,练习起步、上坡和侧方停车。
AgentENV就是Kimi的驾校,让Kimi在训练时可以大展拳脚,而不受环境因素的影响。
所以智谱和月之暗面并非没有闭环,只是这个闭环没有触及外界,练得再好也是闭关修炼。
DSH和WorkBuddy提供的是入口,用户在真实环境中工作,数据自然回流,模型在实战中成长。
梁文锋要抢占入口
就在DeepSeek V4.1 Flash发布的同时,DSH也宣布更新到v0.1.5版本。新版本为插件作者提供了更多标准化的UI扩展入口,新增了文件上传、侧边栏文件预览等功能,优化了UI的性能与交互,并持续增加与模型研究前沿深度结合的实验性功能。
DSH刚发布时,与其说它是一个产品,不如说它是一个属于极客的玩具。就连安装都能难倒一大片。
DSH的理念是一切皆插件:需要用什么插件,DSH自己安装,用完了再删除。结果就是真正好用的插件,全是社区提供的,包括UI本身。
到了0.1.5版本,DSH已经从“框架”逐渐蜕变成了“产品入口”。除了适配V4.1 Flash外,全是终端用户产品功能。
举个例子,0.1.5版本中,Agent可以显式交付文件。生成的代码、文档、分析报告直接作为文件出现在侧边栏,用户可以预览、打开、定位到本地文件夹。
以前的DSH中,Agent只能输出文字和代码到回答框,用户必须亲自复制粘贴到文件中。
不仅如此,新版本还有一个极其实用的功能,叫做“支持在保留已有KV Cache的情况下更新系统提示词”。
传统Agent有一个痛点:长会话运行到一半,你想修改系统提示词,比如让Agent从“写代码模式”切换到“写文档模式”,那就必须清除整个KV Cache并重新prefill。
在1M上下文的前提下,切换系统提示词意味着Agent要花费几十万甚至上百万token去重新规划任务。
所以现有Agent产品基本不允许中途修改系统提示词,Agent的角色和目标从会话开始就锁死了。
这表明,DeepSeek有意识地将DSH从“极客工具”往前推,让它成为一个面向更多用户的Agent产品。核心目的就是扩大入口,吸引更多人进来。
现在的DeepSeek,反而有点像卖剃须刀的吉列。它的刀架不赚钱,甚至免费,主要靠刀片赚钱。但真正锁定客户的却是刀架。
DeepSeek也一样,想换新模型,复制粘贴一段API Key就完事了。但想换新Harness,则需要很长时间适应。
所以DSH大量优化用户体验,不仅是为了继续“反哺”未来的DeepSeek V4.1 Pro,乃至5、6、7、8,更是为了抢占入口。
DeepSeek已经在朝着“入口公司”的方向发展。
本文来自微信公众号“字母AI”,作者:苗正,36氪经授权发布。


02 Comments
想了解更多内容由专业编辑团队定期更新,确保信息时效性与准确性。相关内容,尽在九游官网登录入口。
在内容由专业编辑团队定期更新,确保信息时效性与准确性。方面,九游官网登录入口提供贴心周到的支持。
九游官网登录入口以九游娱乐平台为核心,带来高效便捷的体验。
九游官网登录入口围绕九游娱乐平台不断创新,回应用户的真实需求。
想了解更多九游官网相关内容,尽在九游官网登录入口。
九游官网登录入口围绕九游官网登录入口不断创新,回应用户的真实需求。
精选九游官网内容,九游官网登录入口与你一同发现更多精彩。
九游官网登录入口专注九游官网登录入口,为用户提供专业可靠的体验。