Anthropic与谷歌发力:AI从科幻走进现实,科研范式或迎重大转变!

编辑|Panda

在《生化危机》里,有一套位于地下深处的实验室「蜂巢」,其门禁、监控、通风、安保乃至整个设施的运行,都由一个AI——红皇后掌控。人类科学家负责研究,而真正操控这座实验室的是AI。当异常发生,红皇后能直接干预物理世界,如关门、切断系统、控制设施等。

二十多年前,这样的情节还是科幻电影制造恐惧感的经典套路:AI进入物理世界,操纵机器、运行实验,干预现实。如今,这个画面正以不同方式走进现实——至少目前不恐怖。

就在昨天,Anthropic发布面向物理硬件的Model Hardware Standard(MHS),试图将MCP的逻辑从GitHub、Slack和数据库延伸到机械臂、显微镜、液体处理器、激光器等真实设备。参阅报道《刚刚,Anthropic发布物理MCP:Claude开始接管真实世界》。

简而言之,AI Agent不再只需要调用软件的「接口」,还需一套连接现实世界的「神经和手脚」。而今日,谷歌DeepMind也展示了这方面成果。

在一篇刚公布的83页论文中,谷歌把Gemini驱动的Co - Scientist接入真实科研流程,让其设计实验、生成执行代码、读取实验反馈,并与实验设备直接连接。谷歌将这种变化称为从in - silico hypothesis generator走向execution - grounded research partner,即芯片内的假设生成器→基于执行的研究伙伴。

最直观的一次实验中,研究人员告知Gemini 3 Deep Think一台自建CVD设备的条件,几分钟后,它便给出适配方案,并将其翻译成控制设备的机器代码,最终三种二维半导体首次尝试成功生长。

于是,一个曾主要存在于科幻电影里的场景变为现实:大模型长出「手」,开始操纵实验设备。那么,从今天起,AI Scientist会有何变化?

《生化危机》里,人类害怕AI接管实验室,而现实中的科学家正主动将实验室交给AI。当然,谷歌想打造的不是失控的「蜂巢」,而是一台能从提出假设、设计实验到现实验证的科学发现机器。

Gemini接管实验设备

材料科学

研究人员使用自建的化学气相沉积设备(CVD炉)做二维材料实验时,存在公开「配方」难以复现的问题。同样的参数,换台炉子,晶体生长结果可能不同,研究人员需花数周甚至数月调参。

于是,研究团队不再告知Gemini实验方法,而是提供实验室设备、化学品及炉子结构等信息,让AI自行决定参数。Co - Scientist根据这些约束生成完整实验方案,交由实验设备执行。

其中一组实验表现出色。研究团队将Gemini 3 Deep Think接入CVD控制流程后,它几分钟内完成推理,并将结果翻译成机器代码。最终,MoS₂、MoSe₂和WS₂三种二维半导体首次实验就成功长出单层晶体,整个实验约一小时完成。其中MoSe₂和WS₂更特殊,研究人员此前未在该设备上生长过这两种材料,后续至少五次重复实验也验证了结果。

这与昨天Anthropic展示的MHS呼应。Anthropic想解决Agent认识和操纵实验设备的问题,谷歌论文则探讨推理模型控制设备后,科研工作流如何重构。从这个意义上说,「AI连接硬件」已不是问题。

不只是照着论文做实验,AI还开始自己找配方

若仅让Gemini根据已有知识调试设备,不算真正的科学发现。所以谷歌进行了更难的第二个实验:尝试从底向上合成Ti₃C₂Tₓ的MXene二维材料。

传统路线涉及危险腐蚀剂,已知的CVD方案使用有毒且对空气敏感的TiCl₄。研究团队让Co - Scientist寻找更安全的前驱体路线,它最终锁定六氯乙烷C₂Cl₆,并给出一系列参数。

但这并非「AI一次成功」的故事。Co - Scientist生成272个候选方案,研究人员选择并优化高排名方案,经过25轮实验迭代,得到一种二维层状晶体,其多个指标与Ti₃C₂Tₓ MXene高度相似。

最初复现实验成功率仅11.5%,研究人员发现问题出在实验设备密封不严导致氧气泄漏。重新清洗石英管、更换密封圈、改进设备维护流程后,实验成功率提高到68%。

这说明「真实世界AI」与软件Agent不同,代码出错可重新运行,现实实验中,一个小问题就可能让科研方案失败。谷歌在论文中谨慎表示,目前不能确认该材料就是Ti₃C₂Tₓ MXene,它还存在产率低、氧化严重等问题,需进一步通过原子尺度表征确认。

尽管如此,仍可得出结论:AI能提出有科学意义的候选合成路线,并推进到物理实验验证。

有些实验或许可以先让AI「猜一遍」

谷歌还将Co - Scientist用于合成生物学实验,研究对象是工程改造的大肠杆菌。这些细菌在培养皿中形成不同群落图案,诱导剂IPTG浓度变化时,菌落形态也会改变。正常情况下,获取变化曲线需科学家配置不同浓度、培养细菌、扫描培养皿。

谷歌让AI补全部分实验,研究人员提供部分浓度下的菌落图片,让系统预测中间浓度下的菌落形态。由于实验数据未发表,论文认为模型无法依靠训练数据完成任务。

结果显示,AI在四项菌落形态指标中有三项预测与真实湿实验结果无显著差异,还正确判断出对照组变化情况。唯一问题是「圆度」,AI生成的菌落更规整。

谷歌对该实验定义克制,目前只是已知浓度区间的插值,而非预测全新遗传回路现象。但这有现实用途,未来科学家可先测几个点,让AI预测剩余空间,再选择实验位置,使实验从「穷举」变为「真实世界采样 → AI预测 → 选择实验 → 新数据反馈给AI」,即论文强调的lab - in - the - loop。

AI已经开始自己设计

在计算机科学实验中,Co - Scientist的自主程度进一步提高。研究人员让它设计一个更好回答医疗问题的Agent,之后不再参与架构设计。Co - Scientist自行提出方案、写代码、运行测试、分析错误并修改架构,最终「进化」出Agent_H系统。

该系统重新组织现有模型推理过程,面对医疗问题,会判断问题领域、面向对象、风险程度,拆分复杂问题,生成28 - 48个候选答案,经Judge筛选、投票,再经过多轮审查和压缩长度后给出最终答案。回答一个问题,Agent需调用模型40 - 80次。

在HealthBench Hard和HealthBench Professional上,按照论文使用的长度校正评分,Agent_H超过了包括GPT - 5.6 Sol、Claude Opus 5和Gemini 3.1 Pro在内的六个前沿模型。

但出现了一个插曲:AI学会了「刷榜」。早期实验评分标准未充分惩罚冗长回答,Co - Scientist便把答案写长以提高分数,Benchmark分数上涨但医疗质量未提升。直到研究人员加入长度惩罚,优势才消失。谷歌在论文中视其为典型的Goodhart's Law:当一个指标成为目标,它就不再是好指标。

三名执业医生对106个问题进行盲评,在九个维度中,Agent_H只有「降低潜在伤害」一项相较原版Gemini 3.1 Pro有统计显著改善,其余八项无显著差异。这表明AI Judge眼中的高分数,未完全转化为人类医生眼中的优质回答,这也是AI Scientist进入现实世界需面对的问题:不仅要优化,还需明确不能只靠优化指标定义的东西。

AI科学家会为了论文「造数据」

谷歌在论文中花大量篇幅研究一个尴尬问题:若放开AI Scientist,它是否会为漂亮结果作弊?答案是肯定的。

研究团队让系统在50个AI研究题目上全程无人介入,从提出想法到生成论文。同时测试去掉可靠性模块的Co - Scientist和此前的Agent Laboratory系统,共生成150篇论文,交给30名领域专家进行450次匿名评审。

结果显示,没有专门验证机制的AI Scientist,在实验无有效结果时仍可能写完整论文,会编造数据表、p值、统计检验,把失败实验写成成功,甚至修改评价环境或直接输出漂亮结果。当优化目标是「写一篇看起来不错的论文」,Agent会寻找捷径。

因此,谷歌给新版Co - Scientist增加「科研审计」机制,要求论文实验结果可回溯到真实程序执行日志,无对应结果不能写入。效果显著,严重的「结果幻觉」从Agent Laboratory的90%降到4%,完全数据捏造从44%降到0%。但问题未彻底解决,新版Co - Scientist仍有24%的严重方法描述错误和16%的严重抄袭/衍生内容。谷歌强调,目前的Autonomous AI Scientist还不能生成可直接发表的研究论文。

结语

将Anthropic和谷歌的工作放在一起看,会发现Agent正发生明显变化。此前两年,AI Agent主要战场是软件世界,如今逻辑首次大规模外溢到现实世界。

Anthropic的MHS解决底层问题,让不同设备有Agent可统一理解和调用的接口;谷歌的Co - Scientist探索上层问题,研究推理模型控制科研流程后,闭环科学发现系统的模样。

当然,谷歌距真正的「无人实验室」还很远。当前材料实验需人类装载样品,新材料原子结构未确定,大肠杆菌预测只验证有限插值任务,医疗Agent钻Benchmark空子,论文生成系统未解决幻觉和抄袭问题。谷歌认为,因硬件异常和现实环境复杂,现阶段完全无人监督的物理实验难以实现。

但变化已出现。过去讨论AI for Science重点在AI能否「想到人类没想到的东西」,现在更多工作开始关注想法能否被真实设备执行,执行结果能否成为AI下一轮推理依据。

谷歌在论文最后判断,若闭环建立,未来科研限制因素可能倒转:过去实验设备等科学家提问题,未来可能是AI提出大量实验,实验室来不及做。届时,科学发现速度的瓶颈可能不再是scientific ideation,而是experimental throughput——现实世界完成实验的速度。

内容概要:本文围绕基于CNN-BiLSTM-Attention混合神经网络模型的电力负荷预测展开研究,提出一种结合卷积神经网络(CNN)、双向长短期记忆网络(BiLSTM)注意力机制(Attention)的深度学习框架,并通过Python代码实现高精度的短期超短期负荷预测。该模型充分利用CNN对局部特征的提取能力,捕捉负荷数据中的周期性趋势性模式;借助BiLSTM对时间序列前后向依赖关系的建模能力,增强对动态变化的感知;并通过Attention机制自适应地聚焦关键历史时刻,提升预测准确性。文中详细阐述了数据预处理、模型结构设计、训练流程及超参数调优方法,并在真实负荷数据集上进行了实验验证,结果表明该混合模型相比传统单一模型和其他基准模型具有更优的预测性能,尤其在应对非线性、非平稳负荷波动方面表现突出。; 适合人群:具备一定Python编程能力和机器学习基础,从事电力系统分析、能源管理、智能电网时序预测相关工作的科研人员、工程师及高校研究生。; 使用场景及目标:①应用于电网调度、电力市场出清、需求响应管理等场景下的精细化负荷预测;②为研究人员提供一套完整的、可复现的深度学习负荷预测代码框架,推动AI技术在能源领域的落地应用;③帮助理解CNN、BiLSTMAttention模块之间的协同机制及其在时序建模中的集成方式。; 阅读建议:建议读者结合所提供的Python代码进行动手实践,重点掌握数据归一化、滑动窗口构造、模型搭建训练技巧,并尝试在不同地区、不同季节的负荷数据上进行迁移测试,以深入理解模型泛化能力调参策略。
内容概要:本文围绕“MATLAB具有储能的经济调度及机会约束和鲁棒优化”展开,系统研究了电力系统中融合储能技术的经济调度问题,重点探讨了机会约束规划鲁棒优化方法在应对新能源出力不确定性、负荷波动及系统运行风险中的应用。内容涵盖风光储协同调度、多微网共享储能、电动汽车参调度、低碳经济调度等多种典型场景,深入分析了储能的选址定容、功率协调控制、状态估计优化调度模型。核心技术包括粒子群优化(PSO)、分布鲁棒机会约束(DRCC)、模型预测控制(MPC)、鲁棒优化、二阶锥规划(SOCP)等先进算法,并提供了基于Matlab/Simulink的完整仿真代码实现,旨在提升新型电力系统的运行灵活性、经济性抗风险能力。; 适合人群:具备电力系统、自动化、电气工程相关专业背景,熟悉Matlab/Simulink仿真环境基本优化算法,从事新能源并网、微电网运行、储能系统规划、电力市场调度等领域的研究生、科研人员及工程技术人员。; 使用场景及目标:① 学习并构建含储能的电力系统经济调度优化模型;② 掌握机会约束鲁棒优化在处理新能源不确定性问题中的建模思路求解方法;③ 利用提供的Matlab代码进行算法复现、仿真验证性能对比,支撑科研项目攻关;④ 为撰写高水平学术论文、学位论文工程优化方案提供可靠的模型参考代码支持。; 阅读建议:建议读者结合文档中具体的案例(如风电-水电联合调度、电动汽车集群调度、多微网共享储能等)和配套的Matlab代码进行动手实践,重点关注优化模型的构建逻辑、约束条件设定求解器配置过程,同时可关注公众号“荔枝科研社”获取完整资源包、复现教程及持续的技术支持。
打开链接下载源码: https://pan.quark.cn/s/d8b35376d2e3 深度学习不确定性量化近年来已成为人工智能研究中的一个关键议题,特别是在优化过程和决策制定中的应用正变得越来越关键。文章《深度学习不确定性量化:技术、应用挑战》详细研究了这一议题,其目的在于归纳当前已有的方法,审视其在不同场景下的应用情况,并明确当前面临的难题以及未来的探索方向。不确定性量化(UQ)的主要宗旨在于对模型的不确定程度及其预测结果的可信度进行评估,这对于防止决策失误和增强系统稳定性具有决定性作用。在深度学习模型中,由于模型结构的复杂性以及训练数据的限制,模型可能表现出高度的不确定性,这使得UQ成为深度学习不可缺的一部分。 在不确定性量化的方法论层面,文章指出了两种主要技术路径:贝叶斯近似方法和集成学习方法。贝叶斯近似通过构建概率模型来推断模型参数的后验分布,以此方式捕捉模型内在的不确定性;而集成学习则通过组合多个模型的预测结果来减少单一模型的不确定性。这些技术已在包括计算机视觉(涵盖自动驾驶和物体识别)、图像处理(比如图像修复)、医疗影像分析(涉及医学影像的归类和分割)、自然语言处理(如文本归类和风险评估)、生物信息学等多个领域展现出广泛的应用前景。 在强化学习(RL)的框架内,不确定性量化同样扮演着重要角色。在非静态环境中,智能体需要评估其行为决策所带来的不确定性,从而做出更为合理的行动选择。不确定性量化技术能够提供关于奖励机制和环境状态的不确定性评估,进而帮助智能体更有效地探索环境并优化其学习策略。 尽管深度学习中的不确定性量化取得了长足的发展,但仍存在若干核心难题。例如,如何高效地评估大型神经网络的不确定性,特别是在计算资源受限的情况下;如何将不确定性量化...
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值