Anthropic发布Claude Opus 4.7:复杂任务、视觉能力大升级,多方面碾压对手!

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

正式发布

Anthropic正式发布Claude Opus 4.7,将它定义为当前可广泛使用的最强Claude模型。其核心升级落在复杂任务执行、高清视觉理解和更稳的长链路工作流上。对普通用户来说,最直接的变化是更听指令、更会看图、产出更接近成品,不过Token也会烧得更快。

性能超越

Claude Opus 4.7性能不如此前曝光的新一代Claude Mythos Preview,但比普通用户能真正用到的Opus 4.6强了太多,除了Agentic搜索能力略有下降外,实现了全面碾压。官方给出的本次升级的关键词为复杂任务、更强视觉、更稳的长链路执行,以及更少需要人工参与。

视觉能力提升

本次更新最大的亮点是Opus 4.7的视觉能力大幅提升,在测试中从Opus 4.6约50%的分数,直接飙升到接近满分,补上了AI目前最大的视觉短板。

编程能力升级

在编程方面,SWE - bench Multilingual测试中,Opus 4.7拿80.5%,Opus 4.6拿77.8%,涨2.7个百分点;SWE - bench Multimodal测试中,从Opus 4.6的27.1%做到Opus 4.7的34.5%,提了7.4个百分点。

长任务表现

在1M token里的长任务GraphWalks测试中,Parents 1M这趴,Opus 4.7从71.1%提到75.1%;BFS 1M中,Opus 4.7从41.2%干到58.6%,拉开17.4个百分点。Vending - Bench 2测试中,Opus 4.7比Opus 4.6多挣了36%。

屏幕定位能力

ScreenSpot - Pro测试中,低分辨率不带工具时,Opus 4.6拿57.7%,Opus 4.7拿69.0%,拉开11.3个百分点;高分辨率下,Opus 4.7不带工具达到79.5%,叠加工具调用,跑分来到87.6%。

与对手对比

GDPval - AA评估中,Opus 4.7拿1753,高出GPT - 5.4 79分,高出Gemini 3.1 Pro 439分;OfficeQA Pro基准测试中,Opus 4.7跑分高达80.6%,是GPT - 5.4的1.6倍,是Gemini 3.1 Pro的1.9倍;Structural Biology生物分子推理测试中,Opus 4.7从Opus 4.6的30.9%直接冲到74.0%,跃升2.4倍。

普通用户体验变化

普通用户能感受到三大变化。一是指令遵循能力更强,Opus 4.7更倾向于逐条照着执行,但旧提示词有时需重新调整写法;二是Claude看图更细,支持长边最高2576像素的图像输入;三是输出结果更接近可交付的成品,在专业任务上更有审美和创造性,能跨多轮、多会话记住关键备注。

安全方面

Anthropic一周前公布Project Glasswing,Opus 4.7是这套新思路下第一个公开部署的模型,其网络安全能力弱于Mythos Preview,上线带有自动检测和拦截高风险网络安全请求的护栏。合规安全研究人员可申请加入新的Cyber Verification Program。Opus 4.7与Opus 4.6整体安全画像相近,整体上「较为可靠且值得信任」。

受益人群与注意事项

开发者、分析师、法务、研究人员,以及高频处理文档、表格、演示材料的人最先受益。但更高分辨率图像会烧掉更多Token,Opus 4.7换了分词器,同样输入可能多出1.0到1.35倍Token,高Effort下输出Token也会增加。好在价格方面,Opus 4.7和4.6与4.5保持一致。

发展方向

从Opus 4.7发布能看出,Anthropic押注长任务执行、视觉理解、工具协同、少监督交付等能力,官方同步上线的Xhigh Effort、Task Nudgets公测,以及Claude Code里的/ultrareview都围绕此方向。对普通用户来说,Claude Opus 4.7更容易把事情做对,看图更细,写出来的东西更能直接用,大模型从会聊天走向会干活又迈进一大步。

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

内容概要:本文围绕“基于改进秃鹰算法的微电网群经济优化调度”展开研究,提出了一种改进的秃鹰搜索算法(BES),旨在解决微电网群在复杂运行环境下的多目标、强约束、非线性及高维经济调度问题。通过引入特定优化策略,增强了基础算法的全局搜索能力和收敛效率,克服了传统智能算法易陷入局部最优的缺陷。研究构建了一个包含分布式电源、储能系统与多元负荷的微电网群调度模型,以最小化系统综合运行成本为核心目标,综合考虑功率平衡、设备出力能力、储能运行特性等多重约束条件。通过仿真实验验证了所提算法在调度精度、稳定性和计算效率方面相较于传统方法具有明显优势,并进一步展示了其在降低能源开支、提升可再生能源消纳水平方面的实际应用价值。; 适合人群:具备一定电力系统基础知识或优化算法背景,从事新能源调度、智能优化算法研究与应用等相关领域的研究生、科研人员及工程技术人员。; 使用场景及目标:①应用于微电网群、综合能源系统等场景下的经济调度优化;②为秃鹰算法及其他群体智能算法的改进、复现与性能对比提供参考范例;③服务于科研仿真、算法验证及工程化应用需求。; 阅读建议:建议读者结合文中提供的Matlab代码实现进行实践操作,重点关注算法改进机制与调度模型的构建逻辑,同时可借助网盘资源获取完整资料,以加深对算法性能表现与应用场景的理解。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值