
正式发布
Anthropic正式发布Claude Opus 4.7,将它定义为当前可广泛使用的最强Claude模型。其核心升级落在复杂任务执行、高清视觉理解和更稳的长链路工作流上。对普通用户来说,最直接的变化是更听指令、更会看图、产出更接近成品,不过Token也会烧得更快。
性能超越
Claude Opus 4.7性能不如此前曝光的新一代Claude Mythos Preview,但比普通用户能真正用到的Opus 4.6强了太多,除了Agentic搜索能力略有下降外,实现了全面碾压。官方给出的本次升级的关键词为复杂任务、更强视觉、更稳的长链路执行,以及更少需要人工参与。
视觉能力提升
本次更新最大的亮点是Opus 4.7的视觉能力大幅提升,在测试中从Opus 4.6约50%的分数,直接飙升到接近满分,补上了AI目前最大的视觉短板。
编程能力升级
在编程方面,SWE - bench Multilingual测试中,Opus 4.7拿80.5%,Opus 4.6拿77.8%,涨2.7个百分点;SWE - bench Multimodal测试中,从Opus 4.6的27.1%做到Opus 4.7的34.5%,提了7.4个百分点。
长任务表现
在1M token里的长任务GraphWalks测试中,Parents 1M这趴,Opus 4.7从71.1%提到75.1%;BFS 1M中,Opus 4.7从41.2%干到58.6%,拉开17.4个百分点。Vending - Bench 2测试中,Opus 4.7比Opus 4.6多挣了36%。
屏幕定位能力
ScreenSpot - Pro测试中,低分辨率不带工具时,Opus 4.6拿57.7%,Opus 4.7拿69.0%,拉开11.3个百分点;高分辨率下,Opus 4.7不带工具达到79.5%,叠加工具调用,跑分来到87.6%。
与对手对比
GDPval - AA评估中,Opus 4.7拿1753,高出GPT - 5.4 79分,高出Gemini 3.1 Pro 439分;OfficeQA Pro基准测试中,Opus 4.7跑分高达80.6%,是GPT - 5.4的1.6倍,是Gemini 3.1 Pro的1.9倍;Structural Biology生物分子推理测试中,Opus 4.7从Opus 4.6的30.9%直接冲到74.0%,跃升2.4倍。
普通用户体验变化
普通用户能感受到三大变化。一是指令遵循能力更强,Opus 4.7更倾向于逐条照着执行,但旧提示词有时需重新调整写法;二是Claude看图更细,支持长边最高2576像素的图像输入;三是输出结果更接近可交付的成品,在专业任务上更有审美和创造性,能跨多轮、多会话记住关键备注。
安全方面
Anthropic一周前公布Project Glasswing,Opus 4.7是这套新思路下第一个公开部署的模型,其网络安全能力弱于Mythos Preview,上线带有自动检测和拦截高风险网络安全请求的护栏。合规安全研究人员可申请加入新的Cyber Verification Program。Opus 4.7与Opus 4.6整体安全画像相近,整体上「较为可靠且值得信任」。
受益人群与注意事项
开发者、分析师、法务、研究人员,以及高频处理文档、表格、演示材料的人最先受益。但更高分辨率图像会烧掉更多Token,Opus 4.7换了分词器,同样输入可能多出1.0到1.35倍Token,高Effort下输出Token也会增加。好在价格方面,Opus 4.7和4.6与4.5保持一致。
发展方向
从Opus 4.7发布能看出,Anthropic押注长任务执行、视觉理解、工具协同、少监督交付等能力,官方同步上线的Xhigh Effort、Task Nudgets公测,以及Claude Code里的/ultrareview都围绕此方向。对普通用户来说,Claude Opus 4.7更容易把事情做对,看图更细,写出来的东西更能直接用,大模型从会聊天走向会干活又迈进一大步。

6519

被折叠的 条评论
为什么被折叠?



