光合及目
1lux.xyz
← 报道
公司新闻凤凰网· 2026-09-12

扒完DeepSeek最新论文,我发现了V4.1 Flash便宜大碗的秘密

DeepSeek V4.1 Flash 发布后,DeepSeek 网页版和 App 也更新了,之前需要选择的「快速」、「专家」和「识图」都合并升级为一个入口。

Image

全新的 DeepSeek V4.1 Flash 同时具备了日常对话、图片理解与复杂问题解决能力,看起来像是把过去这一个多月,DeepSeek 发布的 V4 Flash 正式版、Vision Exp、V4 Pro 正式版几个模型,全部融合在一起了。

在社交媒体上,大家对 V4.1 Flash 最多的评价就是「快」。

有网友展示自己在 DeepSeek Harness 内的对话,模型的运行速度是 217 tok/s 左右。而其他的测试结果显示,V4.1 Flash 的运行速度为 420-507 tok/s ,比 Gemini 3.8 Flash 还要更快。

Image

本来是融合了好几个模型,主干参数也接近上一代 Flash 的两倍,从 284B 到了 552B,但怎么速度就变快了。

虽然 4.1 看着是一次小更新,但从 DeepSeek 公开的技术报告来看,V4.1 Flash 采用了重新设计的模型架构,并扩大了训练数据和强化学习规模。

参数的增加,但处理长输入和保存上下文所需的开销却降低了,因为每 Token 的全局 KV cache 只有 890 字节,是自家 V4-Flash 的四分之一;和 2023 年的初代 DeepSeek-V1 相比,缩小了约 437 倍。

Image

总参数变多,但是用来每一次工具调用、每一轮对话,模型上下文的 KV cache 却减少了,而减少的 KV cache 也没有因此让 V4.1 Flash 变弱,在多个 Agent 基准测试上,它打平甚至反超了 Claude Opus-5 和 GPT-5.6 Sol。

我们分析了 V4 Flash 和 V4.1 Flash 的两篇论文技术报告,看到了 DeepSeek 在 Agent 时代到底要做什么样的高效率模型。

Image

图|论文地址:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

模型变大,成本怎么降下来

所谓的 KV cache 可以理解为模型处理过内容后留下的中间状态;后续生成需要参考前文时,复用这些状态,可以省下重新计算的开销。

而当我们的上下文越长时,这个用来保存模型状态的工作台台面就会越大,占的显存越多。

DeepSeek 四代模型的演化,可以说就是在不断地对 KV cache 进行压缩,从 V1 的每 token 389 KB,到 V3.2 的 48 KB、V4-Flash 的 3.5 KB,再到今天的 890 字节,连 1 KB 都不到。

V4.1-Flash 采用的做法是一组组合拳。在架构上,40 层网络被修改成「编码器 + 解码器」两半(CED 架构),Causal Encoder-Decoder,简称 CED。

Image

它把 40 层网络分成前后两部分:前 20 层是因果编码器,后 20 层是解码器。后半部分需要的全局 KV 缓存,可以直接由前半部分的最终输出生成,因此,大部分输入内容无需再完整经过后 20 层。

即解码器需要的全局记忆直接由编码器的输出投影生成,预处理长文本的计算量近乎减半。这对频繁调用工具、缓存经常不命中的 Agent 负载尤其省钱。

Image

图|DeepSeek 各代模型在不同上下文长度下的单 Token 解码(Decode)FLOPs 对比。

具体来说,假设我们让 AI 帮忙选一批办公电脑,看产品资料、查价格、列出配置,最后给采购建议。

第一轮,它读了几款电脑的介绍。第二轮,我们补充预算,让它重新筛选。第三轮,我们又接着说,有两个岗位需要剪视频,配置得单独调整。

就这样每次我们只补充一句话,模型处理的内容却可能越来越长。要接着完成任务,它需要记得前面选过哪些型号、为什么淘汰某一款、预算是多少,以及哪些要求刚刚发生了变化。

V4 是标准的 decoder-only,整个模型「读」和「写」用同一套全部工序。给它一段 100 万 token 的输入,每个 token 都要完整穿过全部 43 层。

现在 V4.1 Flash 大部分只需经过前半段,后半程的解码器不用再把原文逐层过一遍,而是直接拿编码器读完之后「消化好的笔记」,技术上是把编码器最后一层的隐状态投影成解码器的全局 KV cache,然后基于这份笔记开始生成。

Image

图|V4 Flash 和 V4.1 Flash 架构区别

这样一来,模型处理输入时,每个 token 激活约 80 亿参数;生成时,激活约 160 亿参数。对于足够长的输入,技术报告给出的预处理计算量接近减半。

可以说 V4.1 Flash 的 CED 这套结构就是冲着 Agent 负载设计,它优先节省的,正是 Agent 不断接收材料时的计算。资料越长,省去大部分输入在后半网络中的处理,就越有价值。

其次,注意力机制升级为 CSA2,让不同层之间可以「借用」彼此算好的索引和缓存,而不是各算各的;主 KV cache 更是用上了 FP4 量化,并且特意选了 OCP 开放标准格式,理由是「支持尽可能多的硬件平台」。

Image

V4.1-Flash 的 Compressed Sparse Attention 2,简称 CSA2,是让多个网络层共享全局 KV 缓存。有的层负责建立缓存、挑出相关位置;后续层可以沿用这份缓存,重新选择自己需要的位置;还有一些层连选择结果也直接复用。

上一代部署方案会把全局和部分局部 KV 状态长期保存,以便用户重新生成答案,或继续多轮对话。但局部状态往往只在活跃会话的短时间内有用,长期保留会占用大量存储。

V4.1-Flash 把编码器的局部状态放进只保留几分钟的内存池。状态过期后,如果用户又继续任务,就重新计算最近 128 个 token,近似恢复需要的局部状态。DeepSeek 将这个办法称为 SWA Bounded Replay。

Image

它用少量重算,换掉了长期保存这部分状态的开销。移走局部状态,再叠加全局缓存压缩,同等负载下,持久 KV 缓存占用降到上一代的约八分之一,且可以保证驻留 72 小时以上。

换句话说,用户三天内回来继续对话,服务商都不用重新付钱算一遍。

这种近似恢复的方案也会带来取舍,恢复结果与完整重新计算并不完全相同,DeepSeek 在报告中称已测场景中的质量影响很小,并把极端长上下文检索、会话恢复时的状态变化列为后续重点测试对象。

Image

此外,V4.1 Flash 对比 V4 Flash 的不同,还在于 552B 主干之外,模型还外挂了 196B 的「条件记忆」模块 Engram:它不做计算,只做查表。

通过把常见词的 2 到 4 个组合预先存成一张巨大的哈希表,用到时直接查出来接进网络,DeepSeek V4.1 Flash 的成本又能进一步下降。

省下计算和存储之后,模型还得把题做对

V4.1-Flash 使用了包含图像和文本的 45 万亿 token 预训练语料。它从语言模型预训练开始就接触多模态数据,图像经过视觉编码器处理后,与文字一起进入语言主干。

这让 Agent 可以直接利用截图检查工作。例如,在生成网页或办公文件后,读取渲染出来的画面,判断排版、图表或页面是否需要修改。工具返回的文字结果之外,模型多了一种检查依据。

Image

后训练部分,DeepSeek 也写得相当明确:这次沿用了监督微调、强化学习和蒸馏,没有引入新的后训练算法。团队主要投入在训练数据和环境的生产上。

这似乎也在说,RL 的军备竞赛,主战场可能不在论文里的新算法,而在数据工程的水电煤。

他们把一道 Agent 任务拆成三个部分:问题、执行环境、验证系统。模型要面对足够难的要求,环境得能运行,验收也要与题目对应。

成为付费用户可以阅读 深度求索 所有资料

了解更多 →