资讯 人工智能开发者
此为临时链接,仅用于文章预览,将在时失效

中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场

作者:高允毅
2026/09/28 20:54
中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场
当模型开始参与研发下一代模型,大模型的研发方式正在发生什么样的变化?

    作者丨高允毅

    编辑丨岑   峰

                                                                                                       

大多数科研构想,从未被充分验证。
这并不是研究者缺少灵感。恰恰相反,新的架构猜想、训练策略无时无刻不在涌现。但大多数想法,却在写不完的训练脚本、调不完的参数、排队等调度的 GPU 集群中,被无声消磨。
如果换种玩法,重构大模型研发呢?
你只说了半句话:“我猜想这个架构或许能降低长上下文成本……” 它就能读懂前沿文献,生成候选方案,自动编写代码、调度算力、并行跑消融实验。

这正是近期讨论度很高的 AI for AI。它不是研发工具的升级,是下一代大模型的核心命题。所有人都试图在这个赛道里,触碰人类终极智能。

中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场

01


为什么 AI  for AI 

是下一个十年的核心命题

过去两三年,行业最关注的是编程和数学:端到端完成复杂代码任务,推导悬而未决的数学难题。AI 由此具备了扎实的逻辑推演与代码工程落地能力。
当这些能力成熟,一个更根本的问题浮出水面:能不能把它们用回 AI 自己身上?
2026年,“AI for AI”已经成为海外头部实验室公开的目标。
比如,OpenAI 侧重前沿理论的自动化研究,在 9 月宣布其 AI 已具备“自动化研究实习生”的能力,专门成立 RSI(递归式自我改进)团队,目标在 2028 年 3 月前实现完全自动化的 AI 研究员,让 AI 自主生成、审计高质量训练数据,接管自身研发全流程;
Anthropic 侧重工程的自动化探索,在6月发布《When AI Builds Itself》报告时便披露,其内部 80% 以上的可运行代码已由 Claude 独立编写,每名工程师的产出效率提升了 8 倍。而9月曝光的最新进展中,其内部最核心的研发平台上,有30,000 个 AI Agent 同时协作,日夜不停地在数字沙盒里进行代码跑测与算法实验。
Google 内部也在加码 AI for AI 的投入,一方面,推出自进化编码智能体 AlphaEvolve,加速 Gemini 的迭代。另一方面,Google 迎来人事地震,哈萨比斯卸任 Google DeepMind CEO,全面转战 AGI 长期战略、全球事务以及 Isomorphic Labs 的 AI 药物研发。
此外,Google 灵魂人物 Jeff Dean 前段时间官宣离职创办 Discovery Loop,专攻自动化机器学习。短短几周内,估值就被推到了 500 亿美元,连老东家 Google 也下场投资。
国内,AI 参与 AI 研发的实践也在密集出现,而且切入的环节各不相同:面壁用 AI 编写预训练框架,智谱让 AI 搭建国产芯片上的推理基础设施。有的团队从训练框架入手,有的从推理系统入手,也有的直接研究"会进化的智能体"本身。AI 能接手的研发环节,正在一段一段被打通。
Naive AI 的尝试把这些环节串了起来。架构探索、训练系统、推理优化,AI 都参与其中;同时,模型本身也被专门训练去承担研发工作。它既是这套研发方式的产物,也是这套方式的下一个执行者。这一差异化打法,让 Naive AI 仅创办7 个月,估值飙升至 14.2 亿美元。
无数资本涌入,巨头纷纷押注。所有人都意识到,全面重构智能迭代速度这件事,能在有限资源内不断突破性能边界,或许才是通往 AGI 的第二增长曲线。
当下,AI for AI 早已不是概念。
AI 从只能帮工程师写单个 PyTorch 函数,进化到可以独立阅读顶会论文、编写完整训练脚本、调度 GPU 集群、分析日志报错、完成一键微调。
以 Devin、Aider、OpenHands  为代表的研发智能体已经成熟,机器学习工程(MLE)正式成为 RSI 的核心试验场。
中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场

02


中训练与后训练:

AI for AI 最先落地的地方

要理解 Naive AI 的路线,先要分清模型研发的几个阶段。
预训练是把模型"做出来":用数以万亿计的公开数据,让模型学习语言规律,建立对世界的通识认知。它投入大、周期长,一次完整实验往往以月计。中训练与后训练则是把模型"做强":在已有基座上,用数百亿到数万亿 tokens 的高质量数据,长出想要的能力。
两者的研发节奏截然不同。中训练与后训练由大量实验构成:注意力结构怎么改,长上下文撑到多长,推理速度能不能翻倍,每个问题背后都是一连串消融实验、参数调优和工程优化。实验多、周期短、结果可以快速评估,这让它成为 AI 最先能够大规模承担研发工作的地方。它是 AI for AI 的起点,而不是边界。
开源生态的成熟让这条路更加可行。DeepSeek、Qwen等高质量开源基座陆续发布,任何团队都能站在巨人的肩膀上启动研发。模型之间的差距,越来越多地来自基座之后的那几步。一部分实验室开始把重心转向中训练与后训练。
Naive AI 押注的正是这条路:不从零预训练,而是以开源基座为起点,把投入集中在中训练和后训练上。
即便是坚持自研基座的厂商,也在把中训练和后训练单独拎出来。智谱的 GLM-5 在 27T tokens 的预训练之后,专门安排了约 1.55T tokens 的中训练:分 32K、128K、200K 三段逐步拉长上下文,重点补充长上下文与 Agent 数据。到了今年 8 月发布的 GLM-5.3,智谱更进一步,沿用与 GLM-5.2 相同的基座,不再重新预训练,能力提升全部来自后训练,主要依靠强化学习,内部编程评测成绩却提升了约 50%。基座不变,模型照样能大步向前,差距正越来越多地产生在基座之后。
这和常见的"拿开源模型微调一下"不是一回事。Naive AI 先重构了基座的注意力架构:保留滑动窗口注意力(SWA)处理局部信息,把原有的全局注意力层全部替换为稀疏注意力,形成每 5 层 SWA 搭配 1 层 DSA 的混合结构,整个网络不再含有任何全局注意力。
中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场
图注:Naive‑N0.5‑Flash 为AI for AI场景打造的SWA–DSA 混合注意力架构
稀疏注意力本身也做了改造,原版 DSA 中的 MLA 被替换为 4 个 KV 分组的 GQA,并配套设计了只有 16 个 query 头的轻量索引器。
架构变了,模型就得重新适应,这需要一轮完整的训练,而不是一次微调。为此,Naive-N0.5-Flash 全程保持 1M 上下文,分三个阶段累计训练了 3.25T tokens:
  • 索引器预热,50B tokens:冻结模型其余参数,只训练新加入的 DSA 索引器,以原来全局注意力的分布为参照,先让索引器学会挑出关键信息;
  • 稀疏注意力训练,3T tokens:切换到稀疏注意力,进行大规模继续预训练(也就是中训练),让模型适应新的信息读取方式,同时重点强化编程和 AI 研发能力;
  • 学习率衰减,200B tokens:进入 SFT 阶段,逐步降低学习率,让能力稳定成型。
不止模型在被训练,训练系统本身也在被 AI 优化。
比如通信太慢。AI 注意到架构中的 DSA 层要读全部上下文,而SWA 层只关心局部上下文,于是提出分工,一个用全序列并行,一个只用相邻分片交换数据,大幅降低长序列通信开销。
在显存管理的问题上,它还把显存怎么用、哪些中间结果该留,细到每一个算子,还特意锁住已经选好的关键位置,别让重算把它们打乱,把1M 长序列下的显存效率拉到极致。
它还会自己修 Bug,在长序列训练中,AI 主动发现、定位并修复了位置编码精度不足、序列索引越界等一系列底层问题,自己发现、定位、修复和验证。
这种路线的选择,和创始人代季峰的技术底色密不可分。作为 AI 领域的顶级学者,代季峰在技术圈的特质极其鲜明:从早年被写入 PyTorch 框架的标准算子可变形卷积,到自动驾驶感知的行业标杆 BEVFormer,再到在开源社区斩获千万级下载的多模态基座 InternVL,他始终擅长以极致的工程效率去打破原有的性能天花板。
在这种基因下,Naive AI 成立仅 7 个月,在“AI 研发 AI”全新模式下,快速产出开源模型 Naive‑N0.5‑Flash。
由于它本身就是“AI 自进化的产物”,因此它不仅能干活,还能作为基础工具,被其他科研人员直接拿来训练和研发下一代更聪明的 AI。
中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场

03


当 AI 成为研究员,

Naive‑N0.5‑Flash 是如何诞生的

现在AI大模型的构建不仅仅是研究工作,更是一套复杂的工业化研发体系。全球领先的人工智能公司依靠庞大的专家团队分工协作,支撑这套体系的运转,覆盖模型架构、基础设施、训练、推理、部署与评测等环节,每个前沿模型背后都是持续不断的实验、迭代与优化循环。
Naive AI 先做的是,研发环节的重新分工。
从成立的第一天起,Naive AI 就摒弃了传统以人类为中心的研发体系。传统的大模型研发,研究员要亲手写代码、调参数、跑实验、看曲线,全流程主导实验。这套工作下来,少则数周,多则数月,其中有不少是重复且枯燥的“工程脏活”。现在,这些活都交给了 AI 研究员。
在 Naive AI 研发体系里,人类研究员把精力集中在三件事上:提出目标,设定约束与评价标准,以及作出最终决策,核心能力转向“科研品味”的高低。
为了让 AI 可靠地承担执行层工作,Naive AI 建立一套以 AI 为中心的研发基础设施。简单说,就是给模型一个安全、隔离的运行环境,再配上 GPU 算力,让它能大规模稳定运行。这个系统每周能跑近千万个沙箱,最多能同时跑 10 万个。系统背后有一个统一平台,集中管理算力、环境、工具、权限和安全。
AI既是正在被实验、被升级的“产品”,同时又是写代码、改架构的“开发者”,由此诞生的 Naive‑N0.5‑Flash, AI 研发和编程能力突出。
这个小模型一头撞进了全球大模型考场,在专门针对 AI 研发能力的评测中,展现出了对标顶尖闭源模型的实力。 
在考核前沿论文复现能力的 PaperBench 评测中,Naive-N0.5-Flash 超越了Claude Opus 4.7 、GPT-5.5 等主流模型。在考察机器学习实验能力的 MLE-bench-30 评测中,Naive-N0.5-Flash 超越了 Claude Sonnet 5、Gemini 3.6 Flash。这意味着它能像真正的科研人员一样,读懂晦涩的顶会论文并复现其实验。
中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场
图注:Naive-N0.5-Flash在考察AI研究能力的分类评测中,展现惊人的性能效率
它还有不错的编程能力。在评估复杂编程能力的 SWE-bench Pro 上,Naive‑N0.5‑Flash 得分 73.6,超过 2.4T 参数的 Qwen 3.8 Max 。该模型仅以 15.5B 激活参数(不足自身总参数 6%),便超越了拥有 2.4T 参数的大模型,上演了一场以小胜大的效率奇迹。
目前,模型权重和推理代码均以 MIT 许可证发布。同时提供 API 访问服务,输入Token每百万0.6元,输出Token每百万2.6元,缓存命中读取每百万Token 0.07元人民币,具备极高性价比。
从一开始,Naive AI 专门强化了三种研究能力,分别是读论文(复现前沿论文)、做实验(自主跑消融实验)、管理研究成果(系统化管理研究仓库与版本),这三件事正是人类研究员每天投入最多的事,也是让递归式自我改进(RSI)能闭环的三件事。
让 AI 深度参与下一代大模型自己的研发,正是 Naive AI 的长期目标。
中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场

04


 AI 研究员的两大实战

AI for AI 说了这么久,AI 到底能不能真刀真枪下场做研发?
Naive AI 用 AI 做了两个真实研发任务。一个让 AI 去优化自家推理系统,另一个是从头摸索做一个世界模型。这期间,人类只负责定 KPI,剩下的具体操作由 AI 负责。
惊艳的是,前者创造出推理运行时 NaiveRT ,解决了推理系统 “慢” 的痛点问题。开启极速模式后,输出吞吐量达到 2122 Token/s,是传统单流解码的30‑50倍。后者在 Naive AI 团队都不懂的领域,AI 从零开始摸索,做出的世界模型 AutoWM,挤入行业第一梯队。

▎6 天 151 轮实验,做出更快的推理系统

在RL训练里最让人崩溃的是什么?是推理速度慢。
其中,有一个核心动作叫 Rollout(滑跑阶段)。简单来说,就是让 AI 拿着当前的策略,在沙盒环境里完整地跑一次实验,把其中的交互轨迹全部收集起来,当作升级的养料。
然而,一条接近 1M 级别的超长 Rollout,读入只要几分钟,解码却要耗费几个小时。其中,跑得最慢的样本,往往正是难度最高、含金量最大的核心数据。
在传统的同步管线里,整个 GPU 芯片集群必须等所有样本全部生成完,才能统一进入下一步训练;而在异步管线里,又容易因为超时被直接废弃,导致前功尽弃。
唯一的解法就是提升单流解码的绝对速度。为此,人类研究员定下三个KPI:“速度要快、质量不能降、结果必须百分百确定”。
然后 AI 就开始了它的 151 轮实验。有意思的是,这 151 轮里只有 63 轮被采纳,71 轮被回滚,还有 17 轮是备选的探索路径。它像一个真正的研究员,不看单一算子的微基准测试,而是盯着端到端的最终性能做取舍。
比如,某一轮实验中, AI 写出了一个新优化,在短上下文里能省下 3微秒(μs),但只要长上下文飙到 2200 tokens 以上,性能反而会倒退 3 微秒。AI 直接砍掉。
还有针对 MoE(混合专家模型)的内核融合,AI 连续折腾了 7 轮迭代,虽然每次跑出来的数值精度完全正确,但一测端到端的最终吞吐,发现全部都在下降。于是,AI 立即叫停实验,果断回滚,继续沿用原本的方案。
在通过“全链路梳理合并、零散算子打包协同、内核细节微秒级打磨”层层优化后,完整一轮投机解码耗时从 SGLang 的 12.3ms 降到 3.4ms,同时保持了逐位确定的结果一致性。
这什么概念?大概就是你眨两次眼的时间,它已经生成完了一整段代码。
NaiveRT 采用以 AI 为中心的研发模式构建和优化,结合了巨型内核融合、程序化依赖启动(PDL)与投机解码技术。标准模式下单用户输出速度为 50 tokens/s,极速模式下最高可达 2000 tokens/s。 
作为对比,目前业界主流推理引擎,如 vLLM 或 SGLang,在处理类似超长上下文任务时,单用户平均输出速度通常只有 30 至 70 Token/s。这意味着 NaiveRT 的极速模式将业内现有的生成效率提高近 30 到 50 倍。
中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场
图注:NaiveRT把解码耗时从 SGLang 的 12.3ms 降到 3.4ms

▎人类研究员不会的,AI 研究员直接做出第一梯队世界模型

如果说第一个实验,还在 Naive AI 团队的舒适区,那在第二个实验中,Naive AI 团队并不熟悉世界模型,谁也无法指导 AI 的行动,只能给一个目标。
刚开始,AI “照葫芦画瓢”。它从复现 FlowWAM 起步,按业界标准搭好框架,尝试了无分类器引导等常规优化,但收效甚微。
然后它开始自己找路,它自己动手重写视频描述,把训练集从 2.5K 暴增到 22.5K;自己调整网络结构,更换更强的基座。
但不是所有调整都能带来正向收益。比如测试帧采样时,它发现 16 帧效果明显优于 8 帧,32 帧虽有收益,但边际效应在减弱。
在自我迭代中,神奇的事情发生了,它竟然发现了人类都没注意到的新方法。
在训练与测试交错中,AI 敏锐地察觉到一个规律。WorldArena 的部分评测指标,根本不需要对照真实参考视频就能计算。 它没有局限于把这个信号用来评估生成结果,反而用它指导输出选择和后处理策略。
它先探索了多时间步选择,为每段视频匹配最佳时间步,直接让成绩超过了当时榜单的公开最高分。
最关键的一个方法上的创新,是它把单帧选择问题,直接建模成了一个用动态规划求解的背包问题。
后续它又陆续探索了 Best-of-N 视频选择策略、为每段视频匹配最优后处理方案,还针对闪烁、抖动这类视频常见问题优化后处理方法。当然也有试错:比如对比不同 DP 配置后发现,N=32 的效果反而不如 N=16,就主动放弃了更高的数值,保留了更优的方案。
在累计400小时研究,15轮主要实验后,AI 创造的世界模型 AutoWM 在 WorldArena-1 Track 1 拿到 77.43 分,超过公开榜最高分73.64。
中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场
图注:可以看到 AutoWM 在世界模型榜单WorldArena-1 Track 1 拿到 77.43 分,超过公开榜最高分73.64。
AI证明了研发能力可以跨领域迁移,未来,不需要人类在每个细分领域都成为专家,AI能自己学。
中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场

05


深水区思辨:

AI 研究员迈向“强 RSI”的五大卡点

从 NaiveRT 的 151 轮迭代,到 AutoWM 的 400 小时探索,两个真实案例清晰地展现了当前 AI 研究员的能力边界。但重新审视整个行业的进展,我们仍处在弱 RSI 的起点:AI 的角色更像刚入行的科研实习生,能在已知框架内完成参数调优与方案组合,远未达到独立主导完整科学研究的阶段。
而距离真正能够自主阅读前沿文献、提出研究假设、调度算力资源、端到端完成模型迭代的强 RSI 形态,即全自动 AI 研究员,OpenAI 给出的目标节点是 2028 年。
这中间,还有许多卡点无法跨越。
首先是验证难。软件代码写完可以马上运行并获得及时反馈,但模型训练的反馈周期要漫长得多。151 轮实验看似密集,背后是算力的并行堆砌,而非 AI 本身的思考速度。越往底层架构走、越靠近预训练环节,AI 的迭代效率就越受限于物理算力与训练周期。它可以一口气生成上百个候选方案,但最终能验证多少,依然要等算力排队,要等训练跑完。如果涉及机器人、材料科学等物理世界的实验,反馈周期和成本更会随实验规模呈指数级上升。
比验证难更深一层的困境,是发现能力。当前所有 AI for AI 的迭代,本质上都是现有知识的排列组合与参数调优。AI 可以把已知方向的研究做得又快又极致,但无法独立开创出全新的研究范式。当年 Transformer 能取代 RNN,需要对领域的深层理解、对未来方向的直觉判断,甚至一定的审美与运气。这些就是人类研究员的 “科研品味”,也是当前 AI 无法替代的核心价值。
再往底层剖析,则绕不开模型因果能力的匮乏。纯文本语料训练出来的大模型,因果判断天然不稳定,逻辑推演极易受到表述形式的干扰。这也正是杨立昆近年不遗余力推崇世界模型的核心原因:只有在与物理世界的交互中习得的因果律才是扎实的。纯文本里学到的 “因果”,很多时候只是语言层面的相关性,而非真正的逻辑因果。
在世界模型实验中,AI 敏锐地发现了 “部分评测指标无需参考视频” 的规律,并以此优化了输出策略,最终拿到了更高的分数。但这个规律,是底层逻辑的必然,还是特定数据集上的偶然?AI 能高效地发现关联,却很难独立判断这个关联是不是真正的因果。
同时,评估器能力不足也是一个迫切的难题。科学研究最核心的部分在于科研品味,而这种创新性与长期价值很难被量化成明确的指标。如果训练系统一味使用可量化的跑分做奖励信号,AI 会倾向于为了刷高指标而进行投机优化,反而会牺牲真正的创新性。
然而,这些都还不算真正的深水区。元递归,也就是“迭代的方法本身”,才是从弱 RSI 走向强 RSI 的一道门槛。 
比如研发工作流要不要调整、实验设计的逻辑要不要改?什么时候 AI 能自己推翻一套沿用已久的实验范式,自己提出一套更高效的研究逻辑,AI 才真正成为了 “会进化的研究员”。
在 Naive AI 的官方主页上,悄然写着这样一句标语:“100x Intelligence for the pioneers”(为先驱者提供 100 倍的智能)。
中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场
图注:Naive AI 官网标语
AI for AI 的终局,从来不是为了干掉人类研究员。
当我们回望人类群星闪耀时,那些一闪而过的灵感,不再因来不及落地,而无声消亡。
雷峰网(公众号:雷峰网)参考链接:https://naive.ai/en/research/
中训练、后训练持续升温,模型快速迭代,成为 AI for AI 最佳试炼场
长按图片保存图片,分享给好友或朋友圈

正在生成分享图...

取消
相关文章