智谱把“密集反馈”拆成三部分,分别是正确性反馈、系统行为反馈、性能反馈。它们对应的是Infra系统中三个底层问题,“算得对不对”、“卡在哪一步” 以及 “哪种解法最优”。这就像一个资深的推理工程师,突然遇到告警,他会脑中自动弹出一条排查路径。要想理解智谱这套体系,我们不妨跟着三个真实的工程案例,看看人类工程师的工程直觉,是怎么被编码成 AI 的能力的。
系统在做大模型推理时,有一步叫“Prefill(预填充)”,就是先把用户的提示词理解一遍,并生成需要的缓存。理想情况下,系统应该“一边用 GPU 计算,一边跨节点搬运缓存数据”。然而结果显示,两者加起来的总时间,比单独做计算慢了整整 20%。这意味着搬运基本是在“排队等”,没有和计算同步进行。面对这种问题,传统的排查方式极其痛苦。工程师需要拉出一张巨幅的“全链路时序图”去人眼检查时间线,甚至得跨语言去翻看底层通信库(DeepEP)的 C++ 源码,盲猜是不是全局解释器锁(GIL)忘了释放,导致负责搬运的 Python 线程被卡死。智谱把这套排查逻辑做成了“系统行为反馈体系”,相当于给 AI 装了一台“全链路 X 光机”:它会自动拉取执行时序,看计算和通信有没有重叠。一旦发现该重叠的没重叠,直接在时序图上把异常时间片标红。发现异常后,AI 会顺着调用链一路往下追,跨过 Python 和 C++ 的语言边界,直接钻到最底层的接口实现里去检查锁的状态。定位到问题后,它会自动给出修复方案,并且用“时序 + 性能”两个标准一起验证:既要看时间片有没有真的重叠起来,也要看端到端性能有没有真的提上去。 这样原本需要数天才能解决并发问题,AI几秒内就能快速解决。
▎案例三:解码内核冗余计算(性能反馈)
模型在生成文字时,会调用一个核心计算模块(解码内核)。如果这个模块跑得不够快,会拖慢整体速度。资深的Infra工程师会去肉眼翻看底层的汇编或算子代码。为了让多张芯片同时以最高速干活,系统通常会采用“分块(Tiling)”策略,把一个庞大的计算任务切成四个小块同时推进。这会导致一些本来只需要算一次的公共步骤,可能会重复计算四次。这是典型的“为了并行而并行”。智谱把大量内核优化里的通用套路,变成了可复用的“优化模板库”,再配合性能反馈体系,让 AI 拥有了一套自动化搜索引擎:首先,性能反馈会先判断瓶颈在哪。然后,AI 会去“优化模板库”里找匹配的套路。这个库是 AI 读遍了 SGLang、Flash Linear Attention、DeepGEMM 这些项目里高手手写的内核,提炼出来的通用优化骨架。当匹配到对应场景后,AI 直接套用这个思路重构代码,跑个小规模测试验证效果,把有效的保留下来,并反哺回模板库,让它变得越来越强。从定位问题、检查问题到解决问题,在工程层面,AI 的排障能力已经深入算子精度层,跨越了语言边界,而那些成功优化出的经验,正在以前所未有的速度形成复利效应。Infra的RSI将是如此景象,AI工程师具备了资深系统工程师的诊断能力,可以在工程层面,更快更细致地去执行。而人类工程师把关风险和业务决策,Infra系统进化成可以高速运转流水线。