在AI4S,AI出身的人是在等AI出奇迹,而Science出身的人是在给AI立规矩。 作者丨周蕾
编辑丨岑峰
【编者按】这是雷峰网(公众号:雷峰网)AI科技评论“AI4S青年志”系列专访的第一篇。当所有人都在谈论AI4S,我们想听真正在做的人怎么说。本系列与这个领域的青年人对谈,记录他们如何走向两个学科的交界,在难题与弯路中走到今天。
2026年7月7日,上海科学智能研究院“百题马拉松”超级科研工厂直播开启,连续5天不间断跑完135道课题。或许徐丽成和安俊逸自己入行时也没想到,做科研还要“三班倒”盯一场120小时的干湿闭环直播。直播是“一次性的艺术”,没有多少试错空间。徐丽成最紧张的,是配体推荐环节。配体是催化剂的核心组成部分,直接决定反应的效率和选择性。他其实并不确定模型推荐的配体是否能够成功提升反应产率,而直播里不能额外验证——一旦失败,他们来不及再买新的药品。“非常幸运,它确实提升了4个反应的平均产率,我之前也不知道这个实验结果。”徐丽成回忆起当时的情景,仍然感到十分庆幸。安俊逸负责Agent系统开发,他最担心的是药物发现题目的执行。药物发现主打长链路,调用工具多,单个任务一跑就是5小时、甚至10小时。这种长链路执行会有误差积累,工具的运行也存在不稳定因素,Agent极有可能在后续步骤中连环出错,最终中途崩溃——这也是大部分Agent的通病。“直播的时候,药物发现达到了从未有过的任务成功率。”这是最让安俊逸提心吊胆的一类题目,这个结果让他意外。两人回忆起这场“百题马拉松”时,办公室窗外刚经历了一场盛夏午后的雷阵雨,刚刚放晴。上智院的办公室位于上海西岸,这里也是众多科研机构和科技企业的驻点。黄浦江穿城而过,有波澜壮阔的历史,也有新的船驶向远方。徐丽成和安俊逸这两位“95后”,是上智院物质科学方向的青年科学家,也是上智院重点孵化企业“格物智研”的算法专家,一个从化学走向AI,一个从物理走向计算机再走向AI4S。他们与这个研创一体的团队一起,搭建了国内首个无人介入的物质科学干湿实验全闭环系统——Golab物质科学智能研发工厂。借着这个机会,雷峰网与两位年轻的科学家聊了聊,他们在来到上智院后,是如何在两个AI和Science的交界处,完成一场“化学反应”的。“化学还有太多未知,但继续卷绩点好像已经没有什么挑战了。”徐丽成本科在华东理工大学读应用化学,成绩名列前茅。大二那年AlphaGo正火,他开始上网课自学Python,试图转向AI,但始终不得其门而入,直到大四保研去浙江大学闯进了洪鑫教授的计算化学课题组,方向是当时还很异类的“机器学习for化学”。大多数学生怕计算机难,竟无一人联系。“大家都挺怵的,但我决定去试试。” 徐丽成当了那个“吃螃蟹”的人。他的第一个科研任务,就是从文献中收集湿实验反应数据。一年半的时间,他从数百篇文献收集了上万条烯烃不对称氢化的反应数据,“一个一年级学生去指挥高年级学生,很有挑战。”他后来回忆。赶上疫情,居家两三个月又收了几千条。这个数据集,至今仍是规模最大的结构化不对称催化反应数据集,发表在化学顶刊《德国应用化学》上,也让徐丽成拿到了AI4S世界的入场券。随后,徐丽成经历了短暂的字节实习,在2023年底参加了复旦大学和上智院主办的世界科学智能大赛,带着反应数据集和AI的历练,走进了上海西岸那栋楼。相较于徐丽成的化学背景,安俊逸其实在计算机领域实践更久,但一开始,他其实是怀着对物理的浓厚兴趣进入到南京大学物理系的。在南京大学,物理系是一个盛产“神人”的地方:那里汇聚了全国各省最高分的一群头脑,也承载着相当宏大、甚至有些孤傲的雄心。但物理这门学科极其残酷,低垂的果实早已被前人摘尽,剩下的都是足以消磨掉大多数天才志气的硬骨头。到了选专业的节骨点,他真实地感受到了,一种物理式的无情打击。当兴趣在晦涩的理论深渊中逐渐摊薄,他做出了南大数理大类学生近年来最常见的选择:跨越那道并不算高的门槛,转向更具生机的计算机赛道。2016年,何恺明的ResNet开启了深度学习新时代,安俊逸应潮流转至南大计算机系,师从申富饶教授。申教授极其欣赏安俊逸身上那股物理系的“执念”,引导他将物理学中的能量最小原理、Hopfield网络模型融入神经网络。博士期间,他先从图像做起,工作集中在分类、分割、检测的神经网络架构设计上,但他始终说服不了自己:“把数据相关机理融入到网络设计上能对下游应用有什么确定的影响吗?感觉很虚。”
直到他做3D点云,那些杂乱无章的离散点,在点云处理的旋转等变性公式下,在他面前第一次展现出了让物理学家痴迷的“对称之美”。“一切变得有迹可循”。安俊逸终于找到了那个锚点。沿着这种“实”的思路,他做了几篇点云配准的工作,拿了ICCV竞赛一等奖。2023年,安俊逸偶然认识了如今在上智院担任AI科学家的屈超。当时屈超正在复旦大学特聘教授、上智院院长漆远教授的团队做底层技术,他告诉安俊逸,分子、原子某种程度上也是三维空间中的点云,而且比激光雷达的点更“听话”,没有噪声,信息是固定的,需要引入的物理先验远比点云复杂、也确定得多。安俊逸意识到,自己这种“改模型”的能力放到微观的分子、原子表征里,或许就是开天辟地的巨斧。通过屈超,他又认识了上智院物质科学智能方向首席科学家曹风雷。曹风雷给他描绘了3D化学空间表征模型的蓝图,也让他看到了上智院的平台潜力。“大语言模型已经展现了通用基座模型的超强边界,这一点在分子原子领域同样适用,我想在这里做很多事。”安俊逸回忆。博士毕业那年,他决定加入上智院,曹风雷后来也成为了他的直接leader。2024年初,徐丽成和安俊逸前后脚加入上智院。当时他们还没有什么交集——徐丽成想做一套调用化学模型的Agent系统,安俊逸接到的是做化学空间通用表征模型的任务。入职后的第一次院内会议上,徐丽成提出了Agent的想法,不过漆远听完后没有同意,认为团队当前缺少模型积累,最好还是做一个有技术门槛的模型。徐丽成也意识到,Agent之下的东西都是别人开发的,含金量有限。他开始转向开发通用的反应预测模型:既能预测产率和选择性,又能做合成路线规划。这项工作后来发在了Nature Machine Intelligence(NMI)上,登上了期刊的封面。核心创新是一套面向反应的预训练策略:告诉模型,化学键如何形成和断裂,即有机反应的本质规律。当时有同学甚至审稿人建议他用NLP里常见的next token prediction策略,但他坚持了自己的方案。反应预测模型的成功,给了徐丽成底气。他紧接着启动了过渡态预测——这是他从洪鑫组时期就想做的工作。化学反应里,分子碰撞需要越过一个能垒,像翻过“小土包”,它决定了反应能不能发生、有多快。以前搜索极难:优化算法通常让能量往最低处走,但过渡态恰恰要“往上走”,需要化学家搭出非常接近真实的初始结构,极度依赖专家知识。徐丽成希望做到端到端:在画板上画一个2D过渡态结构,直接生成3D过渡态。然而这个“土包”,他翻了八个月都没翻过去,模型生成的结构始终是一团乱麻。“如果来上智院第一个工作就是过渡态生成,经历八个多月的失败,我肯定扛不住。但好在第一个工作非常顺利,至少证明了自己。”徐丽成回忆。直到2024年秋天,他突然想到:能不能把高阶等变图神经网络引入扩散降噪模型?这是安俊逸反复在组会上提到的词。安俊逸此前在燧人模型的核心模块EST(等变球面变换器,Equivariant Spherical Transformer)中就用到了这一技术——在保证分子空间物理约束不变的前提下,提升模型的expressive poser,即表达能力。“这个词频繁出现在我的耳边。”徐丽成笑称。他做了简单尝试,效果出奇地好,结构基本有序了。他沿着这个思路继续升高阶数,最终完成了核心模块。作为燧人物质科学系列模型的功能模块之一,这项工作以UniTS为名于8月底发表在Nature Communications,并用在了超级科研工厂的实战中。而在徐丽成过渡态工作“卡壳”期间,安俊逸也遭遇了自己那座“土包”。曹风雷给他的任务是,做化学空间中的通用表征模型。当时大模型的涌现能力已经非常明显,安俊逸想,分子领域做表征模型,会不会也有这种涌现?这成为了后来“燧人”系列模型基座层的起点。他带着思考大纲,找到了漆远、曹风雷和徐丽成一起讨论。“Scaling law在分子领域有没有表现?”漆远问。团队一起列了几个影响因素,从参数量到计算量,逐一讨论。安俊逸原本不太敢动手——大模型训一次成本很高,怕试错成本打水漂。但那次讨论后,他心里明确了:找到了理论上、直觉上都好的路线,就往前推进,不再纠结于剩下的选项。针对微观结构的基座模型训练过程没有反复失败,路走得比较顺。但到了测评和应用阶段,燧人却始终和竞品拉不开身位,而且大量的化学和物理下游任务都是分子宏观行为决定的。“微观的模型表征怎么能够用于理解宏观表现”,即如何有效建模玻尔兹曼分布,这是一个横亘在全世界大部分科研工作者前的难题,鲜有人解决,如果不能解决它,燧人分子基座模型的应用就一定会受到限制。安俊逸为此苦恼了很长时间,他尝试过用各种模型结构把微观结构压缩到宏观分子的表征中,但效果都非常糟糕,直到2025年底,他突然开窍:“如果微观表征很难一步压缩进宏观表征,是不是可以用diffusion算法做渐进式的构象压缩?没错,宏观表征可以做diffusion的条件,我之前一直都只把diffusion当一个生成模型。”他立马把这个算法引入实现,2026年初再测评时,发现模型不仅能够直接解决宏观任务,而且表现比竞品有了跨度式的提升。“那天晚上我三四点才睡着觉,纯兴奋。”尽管后续工作也有波折,算法的效果也没有想象中的好,但那个瞬间让他笃定:“这条路是对的,再有什么困难也不怕了。”两个人的“土包”都翻过去了,但他们很快发现,各自的能力需要更大的容器——燧人模型需要调用反应预测和过渡态生成,干湿实验需要Agent来串联,而Agent又需要实验室来验证。2025年底,浑天绫科研Skills平台启动,徐丽成和安俊逸的研究工作,也有了更深刻的交集。不同学科的人凑在一起,往往会陷入各自的巴别塔——说同一种语言,却听不懂彼此在说什么。需求传着传着就变形,最后只能推倒重来。但徐丽成和安俊逸没有这种体验。两个人对彼此工作的理解,在“浑天绫”启动就已经成形。徐丽成说,安俊逸做的是“基座”:分子和原子是构成物质世界的微观单元,把它们的表征和内在机理学清楚,才能支撑更高层面的应用。安俊逸说,徐丽成做的是“桥梁”:他负责理解分子能干什么,但分子在物理世界里能不能得到、怎么得到、遵循什么反应机理,“必须依赖丽成的有机合成催化工作”。安俊逸更在乎算法设计,徐丽成更在乎物理化学机理是否正确、是否可解释。安俊逸可以让算法尽量往物理化学靠,徐丽成也可以让机理里包含可学习的模块。他们用“高内聚、低耦合”来描述这种协作方式:把每个人当成一个独立模块,定义好输入输出,串起来就行。但安俊逸说,实际操作中他们会“往上多了解一层”——不只是知道对方要什么,还知道对方为什么要。这种习惯,让他们很少返工。“浑天绫”是曹风雷的建议,团队开发了不少模型和工具,但让不太懂计算化学的人直接用,门槛太高。Agent是能让人轻松上手科研工具、串起科研流程的好载体。最终“浑天绫”只定了电池、药物、反应、材料几条工作流,把跑得通的工具放进去。平台的分工也很清楚:安俊逸写Agent底层代码,搭智能体框架;徐丽成负责上层化学工具的封装和干湿实验模块的集成。LC-MS谱图解析是个典型例子——徐丽成在化学家指导下写脚本,从谱图里读出反应的转化率;安俊逸把脚本合并进工作流,让实验结果能和自然语言对上。整个平台的运行还会依赖其它的很多功能模块,这离不开团队其它人的贡献。但干实验不是终点,物质科学最终要把虚拟方案落到物理世界,实验室平台自此登场,串起干湿闭环。2026年3月,“Golab物质科学智能研发工厂”的自驱动实验室正式立项。建设初期,安俊逸负责打通最难的链路:药物发现。“花了小半个月才跑通。在那之前每天都很焦虑……它也许永远不成功,也许明天就成功了。”跑通那一瞬间,他觉得后面的路都通了。后处理是核心难点。国内大部分自动化实验室都能做反应,但合成后的分离提纯,这一点鲜少有人做好。传统方法依赖人工过柱和肉眼观察点板来判断流出组分时序,自动化设备难以复制这种基于经验的实时判别。一期实验室的核心能力,正是把这道“卡脖子”环节纳入了闭环。AI科技评论了解到,位于上海漕河泾的一期实验室目前主要覆盖有机小分子合成、偶联反应、电解质制备;生物实验能力尚属欠缺,计划于今年年底至明年年初在青浦建设的二期实验室,将补足这一板块。徐丽成对外解释工厂的价值时,将其分为两个面向:对计算化学研究者,平台封装了大量工具,用户以自然语言描述需求即可调用相关计算资源;对实验科学家,平台可针对目标分子设计合成方案并交由自动化实验室执行。在他看来,“好用”的底层是干实验侧的工具调度能力——计算化学、计算物理工具并非一行命令即可运行,需要编写很长的配置文件,涉及体系大小、链长、温度等复杂参数。Agent自动化执行时,理解偏差或配置错误相当常见。团队为此设计了经验累积机制,将历史任务中的错误经验沉淀下来用于纠正后续过程;当大模型实在不确定时,会选择与人交互讨论。2026年7月的“百题马拉松”直播,成为了这座超级科研工厂的首次公开检验。这些题目是团队从与合作伙伴的共创中整理得出的具体科研问题,归属于反应优化、药物分子设计等大类。配环境、写文件,还要守着反应等十个小时,真人去做确实不难,但极其枯燥繁琐。“直播弹幕里老有人问,怎么又在摇瓶子?加料其实只用5到10分钟,但反应环节可能要摇半天。”徐丽成解释道。预演时原定100道题、5天完成,安俊逸对Agent工具进行了大幅性能优化,引入了大量并行计算,致使任务提前完成,团队临时增补了30余道,最终形成135道题目的规模。正如文章开头提到的那样,安俊逸最担心的仍是药物发现题。最终135道题里,唯一未能完成的,也正是这类药物发现题:分子对接工具处理十万个分子时,因为单个分子报错,模型误判为整体工具失效,经两轮循环后,直接触发了保护性退出。徐丽成印象最深的,还是配体推荐。直播中,四个反应的平均产率提升了约百分之十几,但第四个反应无论使用何种配体均未能达到预期。团队没有弃置这组“阴性数据”,而是将其反馈至模型,切换推荐目标后,模型识别出原有配体类别在第四反应上的局限性,进而推荐了一类结构差异显著的新配体;经第二轮湿实验验证,该配体在第四反应上表现良好。直播中,他的过渡态生成模型UniTS还接受了5项反应机理探索任务的检验,均成功生成了正确的过渡态初始结构。“物理世界发生的事不能算错,只是没达到预期。”徐丽成说。工厂的能力边界十分清晰:其产出定位于实验室级别的小试成果,而非量产级的中试或规模化生产。据团队透露,他们将在秋季释放约100个试用名额,以收集更广泛的用户反馈。“百题马拉松”的135道题跑完,工厂继续迭代,但这些工作的成功并非终点,更像是一种反馈,告诉他们,之前的选择和坚持是对的,也让他们更清楚自己站在哪里、要往哪里走。
对这两位95后而言,真正的沉淀在于他们对AI4S这条“逆行之路”的重新审视。徐丽成发现,AI4S和图像处理、自然语言处理截然不同。在这些领域,AI几乎是全能的,但在Science领域,算法和平台有极强的物理边界。“有些纯做实验的老师听了宣传,兴高采烈找来,发现并不完全适配,就会失望——问题往往在于对方不太懂AI,不知道能力边界在哪里。”
这种失望,其实源自认知差异:外界总把AI看作能点石成金的魔杖,但在科学家眼里,AI只能是在遵循物理定律前提下的“超级算盘”。不懂AI的人,不知道边界在哪里;而懂AI但不感悟Science的人,则根本找不到进场的路。在他看来,计算机界有着开源的习俗,所以Science背景的人去结合 AI 技能,门槛不高,如今有了大语言模型和一些开箱即用的科研基础设施,领域科学家使用AI的门槛进一步降低。相比之下,无论是课题组和师门内的“祖传流程”“祖传代码”,还是学术判断和技能经验,Science领域更自成一套内部传承体系。这恰恰是AI工具天然无法补全的部分。如同作家学会用打字机,可作品的厚度依然取决于作家对人性的理解。在AI4S的语境下,这种“理解”便是对学科底层逻辑的嗅觉。
更大的困难是:计算机科学出身的人做AI4S,很难定义什么问题是重要的。“Science”背后的领域太广,不是每个问题都值得研究。
安俊逸也有同感,他所接触的纯AI背景的同学,拿到问题还是用堆数据、堆算力的思路去做,“和AI4S不match,用数据堆的AI4S模型可能有阶段性成果,但走不到顶点。”“这种技术思路是在等AI大力出奇迹。”安俊逸观察到。“而Science出身的人可以给AI立规矩,让AI更懂科学,同时定位领域研究方向。”在这种互动中,两位年轻科学家打磨出了一套近乎苛刻的算法审美:要精妙,不要堆砌。安俊逸在燧人模型中坚持的“高阶等变”,源自图神经网络表达能力上限的数学原理。尽管很多接触该类模型的人觉得理论晦涩,但他认为值。同样,徐丽成在设计反应预测策略时,也断然拒绝了NLP领域的通配方案,转而寻找更契合化学本质的原创逻辑。行业里不少工作像“缝合怪”,把很多模型硬拼在一起;但他们希望自己的作品,动机和目标能完美契合。他们共同欣赏的是何恺明那样的风格:用一个从未有人想到的公式说明一切,大道至简。 在AI4S的交叉点上,好算法的标准是一致的:要优雅,要经得起细看,要能让人产生“居然还能这样做”的惊喜。这些判断来自他们各自的来路,也定义了他们对自己的期待。回到那个盛夏午后的雷阵雨。雨停之后,西岸的空气里有一种被洗过的清透。徐丽成和安俊逸还要继续盯着工厂的迭代,百题马拉松的135道题,只是这座“物质科学工厂”第一次公开交出的答卷。黄浦江上,新的船正在驶向远方。而在江边的这栋楼里,两个“95后”科学家,一个从化学走向AI,一个从物理走向计算机再走向AI4S,他们站在两个学科的交界处,完成了一场属于自己的“化学反应”,彼此活化、发酵,最终结晶。