在AI科技评论看来,这些说法翻成研发语言,主要对应三个方向:第一个是训练规模。事实上,国内目前多家头部AI大厂,都在暗中训练超大规模模型,Scaling Law 依然是头部AI公司最核心的防线。所谓 Scaling 迭代,不仅是持续做大基座参数,更包含强化训练深度、推理计算深度以及交互环境复杂度。在这点上,智谱今年8月发布的 GLM-5.3 便是佐证:通过扩大长程任务环境和后训练规模,其端到端任务完成率提升超过 50%。用实际表现证明了,当前阶段的规模红利仍未撞墙。第二个是实验连续性。众所周知,大模型训练对中断很敏感。过去,由于卡资源紧张,实验往往只能串行排期,项目排队拉长了反馈周期。只有算力充裕、不再充当“节流阀”,迭代节奏才有机会从“两月一跳”走向更密集的敏捷演进。要知道,节奏快慢本身就是壁垒,模型能力的差距,很多时候体现在一年里能完成多少轮“提出假设、验证、修正”的高质量闭环飞轮里。第三个是研发体系的管线化。公告中提到,本轮募集资金投入的覆盖范围包含训练数据生成与筛选、任务环境建设、长程推理以及底层算力优化。这几项合在一起,落点其实是整条训练管线,而这一价值超出了单一模型的训练。换基座是周期性动作,管线却是每天都在沉淀和优化的工程资产,这也是大资金沉淀在管线上的核心价值。“整条管线里,任务环境建设最容易被低估。”一位大模型算法专家对AI科技评论曾分析过,“它不直接体现在单点跑分上,却决定了长程复杂能力的天花板。”要让模型掌握持续数天的真实业务逻辑,训练侧就需要先把工作拆解为可执行、可验证、可复现的环境,涉及集群、存储、文档、代码库的一整套系统对接。事实上,这类管线建设,今年在几家头部团队身上均有所体现,差别更多在于投入强度和推进速度。综合以上三个方向,可以看出智谱是想把训练规模、实验频次和工程体系的探索空间都向外拓宽一大圈。
03
为什么下一站是“完全自训练”?
如果说扩充算力与管线是解当下之渴,那么智谱在这笔融资中释放的更前瞻的技术信号,莫过于直指下一代架构的“完全自训练”(Fully Self-Training)。AI科技评论了解到,目前,在框架和算力相对固定的前提下,大模型训练的核心无外乎三大块:数据、环境、Infra 调优。而这三个环节,目前均出现了由 AI 接管的苗头。首先,在数据端,让模型“自产自训”的直接诱因是存量见顶。眼下的一个行业共识是,人工标注的高质量数据和公域可挖掘的数据都接近天花板,而下一代顶级模型需要的是万亿级、高精度的增量数据,于是让模型自己生成、自己筛选,是行业里被讨论得最多的一条路径。从智谱此前发布的公开信息看,它的解法是让模型交叉校验:一个负责生成内容,另一个负责评审校验,只有通过对抗检验的数据才进入训练集。让数据管线从“采买”转向“自产”。不过这套方法并非没有风险。“让模型参与训练模型,难点在于怎么证明它产出的东西是对的。”一位接近智谱研发团队的专家向AI科技评论解释,“生成和评审要一起校准,否则两边容易一起跑偏。”行业里对合成数据的争议也一直存在,模型生成的数据用多了会不会带来退化,目前还没有定论。其次,在任务环境端,交由 AI 构建的动力来自于高昂的搭建成本。模型需要接近真实专家工作流程的任务环境,越贴近真实,训练信号越贵。让模型自己在真实环境中提取、生成、检验、沉淀,是降低这笔成本的方法之一。而 Infra 的难点在经验的稀缺性。系统调度、推理路径、算子效率,这些过去依赖“老师傅手感”的工作,如今正在被AI“渗透”。据公开资料,GLM-5.3 驱动的 infra agent 已经在协助工程师优化算子、诊断性能瓶颈、改进部署服务栈。在数据、环境和Infra上,让上一代模型参与下一代模型的训练,这是智谱在今年7月提出“摸高”(Touch High)战略之后,备受关注的一个技术路线。其实,把这条路线放回行业里看,它并不孤立。今年以来,几家头部实验室都在提高后训练与强化学习的算力占比,也在探索用模型生成训练数据、优化训练系统,海外的讨论里会把这种思路称作把研究流程本身自动化。在AI科技评论看来,智谱与这些方向有明显重合,差别在于它把“完全自训练”写进了公开的战略表述,态度算是比较明确的。不过,自训练有一个问题是,它很贵:数据要自产,环境要新建,Infra 的自我调优要反复试错,三块都需要算力消耗、人才密度、工程堆叠,都需要钱。当然,钱只是其中一个变量。时间窗口、对手的迭代速度,任何一个都可能改变结果。“这条路能不能走通,两三年内大概会分出结果。”上述研发专家认为,“现在下结论都太早。”