再回到开头那张架构图,Kimi和DeepSeek的名字同时出现在GLM-5.3-Flash里,已经没有那么反常了。过去几年,人们习惯用Linear、Sparse、Full Attention来区分不同公司的技术路线。但MiniMax几次看似反复的选择,其实已经说明,这种划分越来越难解释真实的大模型研发。做Text-01时,MiniMax最先看到的是长上下文带来的成本,于是押注Linear;模型继续Scale以后,未知的能力损失变得更危险,M2因此重新回到Full;到了Agent阶段,不断增长的工作历史又把计算成本推到前台,M3再次转向Sparse。技术没有突然变好或变坏,变化的是每个阶段最先撞到的约束。这也解释了为什么今天很难再用一种Attention机制定义一家公司的路线。真正决定选择的,是模型下一步要处理什么任务,什么成本已经不能继续接受,以及团队愿意为能力上的确定性付出多少代价。GLM-5.3-Flash里KDA和DSA同时出现,记录下来的也不是哪一条路线最终赢了。它更像一个结果:当具体技术越来越容易被验证、吸收和重新组合,所谓“路线”正在从对某一种架构的长期押注,变成一家公司对约束变化的持续判断。技术会扩散,也会被重新组合。真正没有那么容易被复制的,是一家团队判断下一堵墙会出现在哪里。参考资料:1.晚点聊 LateTalk 104:《我给线性注意力找“金主”,字节 say No,MiniMax say Yes》2.MiniMax:《MiniMax-01 is Now Open-Source: Scaling Lightning Attention for the AI Agent Era》