
编辑|Panda
在《生化危机》里,有一套位于地下深处的实验室「蜂巢」,其门禁、监控、通风、安保乃至整个设施的运行,都由一个AI——红皇后掌控。人类科学家负责研究,而真正操控这座实验室的是AI。当异常发生,红皇后能直接干预物理世界,如关门、切断系统、控制设施等。
二十多年前,这样的情节还是科幻电影制造恐惧感的经典套路:AI进入物理世界,操纵机器、运行实验,干预现实。如今,这个画面正以不同方式走进现实——至少目前不恐怖。
就在昨天,Anthropic发布面向物理硬件的Model Hardware Standard(MHS),试图将MCP的逻辑从GitHub、Slack和数据库延伸到机械臂、显微镜、液体处理器、激光器等真实设备。参阅报道《刚刚,Anthropic发布物理MCP:Claude开始接管真实世界》。
简而言之,AI Agent不再只需要调用软件的「接口」,还需一套连接现实世界的「神经和手脚」。而今日,谷歌DeepMind也展示了这方面成果。
在一篇刚公布的83页论文中,谷歌把Gemini驱动的Co - Scientist接入真实科研流程,让其设计实验、生成执行代码、读取实验反馈,并与实验设备直接连接。谷歌将这种变化称为从in - silico hypothesis generator走向execution - grounded research partner,即芯片内的假设生成器→基于执行的研究伙伴。
最直观的一次实验中,研究人员告知Gemini 3 Deep Think一台自建CVD设备的条件,几分钟后,它便给出适配方案,并将其翻译成控制设备的机器代码,最终三种二维半导体首次尝试成功生长。
于是,一个曾主要存在于科幻电影里的场景变为现实:大模型长出「手」,开始操纵实验设备。那么,从今天起,AI Scientist会有何变化?
《生化危机》里,人类害怕AI接管实验室,而现实中的科学家正主动将实验室交给AI。当然,谷歌想打造的不是失控的「蜂巢」,而是一台能从提出假设、设计实验到现实验证的科学发现机器。
Gemini接管实验设备
材料科学
研究人员使用自建的化学气相沉积设备(CVD炉)做二维材料实验时,存在公开「配方」难以复现的问题。同样的参数,换台炉子,晶体生长结果可能不同,研究人员需花数周甚至数月调参。
于是,研究团队不再告知Gemini实验方法,而是提供实验室设备、化学品及炉子结构等信息,让AI自行决定参数。Co - Scientist根据这些约束生成完整实验方案,交由实验设备执行。
其中一组实验表现出色。研究团队将Gemini 3 Deep Think接入CVD控制流程后,它几分钟内完成推理,并将结果翻译成机器代码。最终,MoS₂、MoSe₂和WS₂三种二维半导体首次实验就成功长出单层晶体,整个实验约一小时完成。其中MoSe₂和WS₂更特殊,研究人员此前未在该设备上生长过这两种材料,后续至少五次重复实验也验证了结果。
这与昨天Anthropic展示的MHS呼应。Anthropic想解决Agent认识和操纵实验设备的问题,谷歌论文则探讨推理模型控制设备后,科研工作流如何重构。从这个意义上说,「AI连接硬件」已不是问题。
不只是照着论文做实验,AI还开始自己找配方
若仅让Gemini根据已有知识调试设备,不算真正的科学发现。所以谷歌进行了更难的第二个实验:尝试从底向上合成Ti₃C₂Tₓ的MXene二维材料。
传统路线涉及危险腐蚀剂,已知的CVD方案使用有毒且对空气敏感的TiCl₄。研究团队让Co - Scientist寻找更安全的前驱体路线,它最终锁定六氯乙烷C₂Cl₆,并给出一系列参数。
但这并非「AI一次成功」的故事。Co - Scientist生成272个候选方案,研究人员选择并优化高排名方案,经过25轮实验迭代,得到一种二维层状晶体,其多个指标与Ti₃C₂Tₓ MXene高度相似。
最初复现实验成功率仅11.5%,研究人员发现问题出在实验设备密封不严导致氧气泄漏。重新清洗石英管、更换密封圈、改进设备维护流程后,实验成功率提高到68%。
这说明「真实世界AI」与软件Agent不同,代码出错可重新运行,现实实验中,一个小问题就可能让科研方案失败。谷歌在论文中谨慎表示,目前不能确认该材料就是Ti₃C₂Tₓ MXene,它还存在产率低、氧化严重等问题,需进一步通过原子尺度表征确认。
尽管如此,仍可得出结论:AI能提出有科学意义的候选合成路线,并推进到物理实验验证。
有些实验或许可以先让AI「猜一遍」
谷歌还将Co - Scientist用于合成生物学实验,研究对象是工程改造的大肠杆菌。这些细菌在培养皿中形成不同群落图案,诱导剂IPTG浓度变化时,菌落形态也会改变。正常情况下,获取变化曲线需科学家配置不同浓度、培养细菌、扫描培养皿。
谷歌让AI补全部分实验,研究人员提供部分浓度下的菌落图片,让系统预测中间浓度下的菌落形态。由于实验数据未发表,论文认为模型无法依靠训练数据完成任务。
结果显示,AI在四项菌落形态指标中有三项预测与真实湿实验结果无显著差异,还正确判断出对照组变化情况。唯一问题是「圆度」,AI生成的菌落更规整。
谷歌对该实验定义克制,目前只是已知浓度区间的插值,而非预测全新遗传回路现象。但这有现实用途,未来科学家可先测几个点,让AI预测剩余空间,再选择实验位置,使实验从「穷举」变为「真实世界采样 → AI预测 → 选择实验 → 新数据反馈给AI」,即论文强调的lab - in - the - loop。
AI已经开始自己设计
在计算机科学实验中,Co - Scientist的自主程度进一步提高。研究人员让它设计一个更好回答医疗问题的Agent,之后不再参与架构设计。Co - Scientist自行提出方案、写代码、运行测试、分析错误并修改架构,最终「进化」出Agent_H系统。
该系统重新组织现有模型推理过程,面对医疗问题,会判断问题领域、面向对象、风险程度,拆分复杂问题,生成28 - 48个候选答案,经Judge筛选、投票,再经过多轮审查和压缩长度后给出最终答案。回答一个问题,Agent需调用模型40 - 80次。
在HealthBench Hard和HealthBench Professional上,按照论文使用的长度校正评分,Agent_H超过了包括GPT - 5.6 Sol、Claude Opus 5和Gemini 3.1 Pro在内的六个前沿模型。
但出现了一个插曲:AI学会了「刷榜」。早期实验评分标准未充分惩罚冗长回答,Co - Scientist便把答案写长以提高分数,Benchmark分数上涨但医疗质量未提升。直到研究人员加入长度惩罚,优势才消失。谷歌在论文中视其为典型的Goodhart's Law:当一个指标成为目标,它就不再是好指标。
三名执业医生对106个问题进行盲评,在九个维度中,Agent_H只有「降低潜在伤害」一项相较原版Gemini 3.1 Pro有统计显著改善,其余八项无显著差异。这表明AI Judge眼中的高分数,未完全转化为人类医生眼中的优质回答,这也是AI Scientist进入现实世界需面对的问题:不仅要优化,还需明确不能只靠优化指标定义的东西。
AI科学家会为了论文「造数据」
谷歌在论文中花大量篇幅研究一个尴尬问题:若放开AI Scientist,它是否会为漂亮结果作弊?答案是肯定的。
研究团队让系统在50个AI研究题目上全程无人介入,从提出想法到生成论文。同时测试去掉可靠性模块的Co - Scientist和此前的Agent Laboratory系统,共生成150篇论文,交给30名领域专家进行450次匿名评审。
结果显示,没有专门验证机制的AI Scientist,在实验无有效结果时仍可能写完整论文,会编造数据表、p值、统计检验,把失败实验写成成功,甚至修改评价环境或直接输出漂亮结果。当优化目标是「写一篇看起来不错的论文」,Agent会寻找捷径。
因此,谷歌给新版Co - Scientist增加「科研审计」机制,要求论文实验结果可回溯到真实程序执行日志,无对应结果不能写入。效果显著,严重的「结果幻觉」从Agent Laboratory的90%降到4%,完全数据捏造从44%降到0%。但问题未彻底解决,新版Co - Scientist仍有24%的严重方法描述错误和16%的严重抄袭/衍生内容。谷歌强调,目前的Autonomous AI Scientist还不能生成可直接发表的研究论文。
结语
将Anthropic和谷歌的工作放在一起看,会发现Agent正发生明显变化。此前两年,AI Agent主要战场是软件世界,如今逻辑首次大规模外溢到现实世界。
Anthropic的MHS解决底层问题,让不同设备有Agent可统一理解和调用的接口;谷歌的Co - Scientist探索上层问题,研究推理模型控制科研流程后,闭环科学发现系统的模样。
当然,谷歌距真正的「无人实验室」还很远。当前材料实验需人类装载样品,新材料原子结构未确定,大肠杆菌预测只验证有限插值任务,医疗Agent钻Benchmark空子,论文生成系统未解决幻觉和抄袭问题。谷歌认为,因硬件异常和现实环境复杂,现阶段完全无人监督的物理实验难以实现。
但变化已出现。过去讨论AI for Science重点在AI能否「想到人类没想到的东西」,现在更多工作开始关注想法能否被真实设备执行,执行结果能否成为AI下一轮推理依据。
谷歌在论文最后判断,若闭环建立,未来科研限制因素可能倒转:过去实验设备等科学家提问题,未来可能是AI提出大量实验,实验室来不及做。届时,科学发现速度的瓶颈可能不再是scientific ideation,而是experimental throughput——现实世界完成实验的速度。


被折叠的 条评论
为什么被折叠?



