04
Linear和Sparse被放进同一个模型
MiniMax重新走向Sparse时,类似的变化已经开始在其他模型里出现。过去很多混合注意力架构虽然引入了更高效的Attention,最后仍会保留少量全局Attention。到了2026年,这个结构开始松动。2月发布的MiniCPM-SALA直接把Lightning Attention和Sparse Attention放到了一起;到了8月,Qwen3.8-Flash-Next延续此前三层Gated DeltaNet配一层Attention的结构,却把负责精确检索的那部分进一步改成了Qwen Sparse Attention。这个变化在Qwen身上尤其清楚。三比一的结构没有变,变的是那一层“兜底”的方式。过去由全局Attention直接读取完整历史,现在开始交给Sparse Attention,从长上下文中筛出真正需要的信息。到了GLM-5.3-Flash,类似的组合再次出现:45层模型中,34层采用KDA,另外11层采用KPool-DSA。过去分别由Kimi和DeepSeek推进的Linear与Sparse路线,被放进了同一套模型。Linear和Sparse之所以能够放在一起,恰好因为两者解决的是不同的问题。Linear擅长用较低成本维持一段很长的历史,却不擅长随时恢复其中某个具体细节;Sparse保留token级历史,但每次只读取其中一小部分。前者更像负责“记住整体状态”,后者负责“需要时回去查具体内容”。这也是为什么两种过去看起来彼此竞争的方案,后来开始出现在同一套架构里。三个模型的实现并不相同,但它们指向了一个共同变化:Attention架构正在从寻找一种更好的机制,走向让不同机制承担不同的工作。 Linear或Recurrent Attention负责以更低成本维持长历史,Sparse Attention负责在需要时从中找回更具体的信息。过去被当作不同路线讨论的Linear、Sparse和Full,正在变成同一个架构设计空间里的不同选项。

05
技术开始越过公司的边界
这种组合越来越容易发生,也和过去几年技术扩散的方式有关。2024年,长期研究线性注意力的杨松琳开始维护线性注意力开源社区FLA。她后来回忆,FLA从一开始就不只是为了发布论文,而是希望把Linear Attention变成真正可以复用的基础设施:算法之外,接口、kernel和具体实现也一起开放。后来Kimi推进KDA时,也从这个社区吸收了核心贡献者。技术因此不再只跟着论文流动。代码、社区和研究人员,把一项架构创新带出了最初提出它的团队。到2025年底,杨松琳在讨论Linear Attention下一步时,已经提出过一个当时还很激进的方向:既然Linear在精确检索上仍有缺口,是否可以直接和Sparse结合,让两种机制各自处理不同的问题。她当时举出的例子,就是Kimi的KDA和DeepSeek的DSA。不到一年,这种设想已经出现在真实模型里。这也让“技术路线”越来越难简单地和某一种Attention机制绑定。过去人们习惯说MiniMax做Linear、DeepSeek做Sparse、Kimi做KDA;但当代码可以开源、人员可以流动、已经被验证过的技术可以迅速进入另一家公司的模型,这些标签的有效期会越来越短。真正拉开差距的,也越来越不是“有没有某项技术”,而是什么时候采用它、怎样和其他技术组合,以及愿意在能力、成本和工程风险之间做什么取舍。
06
尾声:路线没有消失
再回到开头那张架构图,Kimi和DeepSeek的名字同时出现在GLM-5.3-Flash里,已经没有那么反常了。过去几年,人们习惯用Linear、Sparse、Full Attention来区分不同公司的技术路线。但MiniMax几次看似反复的选择,其实已经说明,这种划分越来越难解释真实的大模型研发。做Text-01时,MiniMax最先看到的是长上下文带来的成本,于是押注Linear;模型继续Scale以后,未知的能力损失变得更危险,M2因此重新回到Full;到了Agent阶段,不断增长的工作历史又把计算成本推到前台,M3再次转向Sparse。技术没有突然变好或变坏,变化的是每个阶段最先撞到的约束。这也解释了为什么今天很难再用一种Attention机制定义一家公司的路线。真正决定选择的,是模型下一步要处理什么任务,什么成本已经不能继续接受,以及团队愿意为能力上的确定性付出多少代价。GLM-5.3-Flash里KDA和DSA同时出现,记录下来的也不是哪一条路线最终赢了。它更像一个结果:当具体技术越来越容易被验证、吸收和重新组合,所谓“路线”正在从对某一种架构的长期押注,变成一家公司对约束变化的持续判断。技术会扩散,也会被重新组合。真正没有那么容易被复制的,是一家团队判断下一堵墙会出现在哪里。参考资料:1.晚点聊 LateTalk 104:《我给线性注意力找“金主”,字节 say No,MiniMax say Yes》2.MiniMax:《MiniMax-01 is Now Open-Source: Scaling Lightning Attention for the AI Agent Era》
上车,带你看遍全球 AI 顶会精华
成为付费用户可以阅读 深度求索 所有资料
了解更多 →阅读原文 ↗雷峰网