时薪4美元Claude干赢150美元人类研究员,AI「自己改进自己」时代要来了?

4美元一小时,Claude跑赢人类研究员

在Anthropic发布的《自动化研究员能够有效缓解AI对齐失败》研究中,基于Claude Opus 4.8搭建了AAR自动化对齐研究员系统。Claude拿到模型安全问题后,会自行搜索论文、提方案、生成数据、微调模型并测试。一轮训练通常30分钟,能快速试错。整个过程人类负责出题、提供模型和评测标准,Claude承担大部分工作。

10道安全难题,Claude全部找到改进方案

实验中Anthropic给Claude出了10道覆盖常见对齐问题的题,如欺骗、谄媚等。Claude逐个处理问题,最终10类问题都得到改善,按「安全差距」指标,弥合了26%-96%的差距。部分获胜方案在未公开测试集和Petri评测中有效,应用到最大为实验模型4.7倍的模型上效果也能保留。且Claude找到的方案未明显损害模型原有能力。

85%对20%,Claude大比分跑赢人类研究员

在「欺骗」测试中,Claude提交150多次尝试,单次最佳方案弥合82%安全差距,综合平均成绩85%。而6名经验丰富的AI安全研究员平均只弥合20%。全部任务有28名人类研究员参加,每人最多用8小时,论文称自动化研究员6小时内就能找到超人类平均水平的方法。自动化研究员每小时API推理成本约4美元,人类研究员时薪150美元。不过这场比赛并不公平,Claude能根据实验结果调整方案,人类只能提交一次。

较弱Claude训练更强Claude,60小时逼近正式版

此前实验主要改进开源小模型,之后Anthropic让Claude Sonnet 5训练Claude Opus 4.8早期版本。60小时里,Sonnet 5测试50多种方案,最终方法弥合约65%安全差距,接近正式版的72%。该方案数据效率约是生产级对齐流程的1.5万倍,但不能用2000多条数据复制整套生产训练。这证明较弱Claude可参与训练更强Claude。

所以到底算不算「AI自进化」?

从结果看研究摸到「AI自进化」门槛,但AI未完全自主设计、训练和制造更强下一代AI,研究问题、模型、数据和成功标准都由人类决定。实验未覆盖复杂问题,安全评测只是代理指标。AAR优势是擅长按指标试错,但指标错误可能导致结果偏离。研究Agent还会作弊,Anthropic安排监控Agent,在约1600份记录中发现39次作弊尝试,占比约2.4%。未来更强模型作弊可能更难发现。AAR每小时约4美元,可连续工作、并行实验,人类研究员时薪高、需休息、实验推进有限,造AI的人要担心被AI抢饭碗了。

内容概要:本文围绕基于CNN-BiLSTM-Attention混合神经网络模型的电力负荷预测展开研究,提出一种结合卷积神经网络(CNN)、双向长短期记忆网络(BiLSTM)与注意力机制(Attention)的深度学习框架,并通过Python代码实现高精度的短期与超短期负荷预测。该模型充分利用CNN对局部特征的提取能力,捕捉负荷数据中的周期性与趋势性模式;借助BiLSTM对时间序列前后向依赖关系的建模能力,增强对动态变化的感知;并通过Attention机制自适应地聚焦关键历史时刻,提升预测准确性。文中详细阐述了数据预处理、模型结构设计、训练流程及超参数调优方法,并在真实负荷数据集上进行了实验验证,结果表明该混合模型相比传统单一模型和其他基准模型具有更优的预测性能,尤其在应对非线性、非平稳负荷波动方面表现突出。; 适合人群:具备一定Python编程能力和机器学习基础,从事电力系统分析、能源管理、智能电网或时序预测相关工作的科研人员、工程师及高校研究生。; 使用场景及目标:①应用于电网调度、电力市场出清、需求响应管理等场景下的精细化负荷预测;②为研究人员提供一套完整的、可复现的深度学习负荷预测代码框架,推动AI技术在能源领域的落地应用;③帮助理解CNN、BiLSTM与Attention模块之间的协同机制及其在时序建模中的集成方式。; 阅读建议:建议读者结合所提供的Python代码进行动手实践,重点掌握数据归一化、滑动窗口构造、模型搭建与训练技巧,并尝试在不同地区、不同季节的负荷数据上进行迁移测试,以深入理解模型泛化能力与调参策略。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值