刚刚,Code Arena最新放榜,国内AI闯入全球编程前二

CodeArena:在线 LLM 编程竞技场!用于测试不同开源 LLM 的编程能力,实时更新排行榜 CodeArena 是一个在线平台,用于测试和比较不同大型语言模型(LLM)的编程能力。通过实时显示多个 LLM 的代码生成过程和结果,帮助开发者选择适合的 LLM,并推动 LLM 技术的发展。 阅读详情

转自:新智元

就在今天,Code Arena最新榜单出炉!

Qwen3.7-Max以1541分闯入全球前四,一举超越了GPT-5.5、Gemini 3.5 Flash等一众顶尖模型。

排在它前面的,只剩Claude Opus 4.7和Opus 4.6。

换句话说,在全球编程模型的竞技场上,阿里是唯一杀进这张牌桌的中国厂商,仅次于Anthropic,位列第二。


Qwen3.7-Max闯入全球前五

唯一非Claude模型


其实在Code Arena放榜之前,Qwen3.7-Max在海外开发者圈子里已经杀出了名声。

Atomic Chat做了一场硬碰硬的对比,让Opus 4.7、GPT-5.5和Qwen3.7-Max同台竞技,任务是写一个能自我训练的俄罗斯方块AI。

结果,Qwen3.7-Max不仅只用$1.32的token成本就把Opus 4.7和GPT-5.5都超越了,而且性能还提升了56%。

另一位海外开发者选择让Qwen3.7-Max构建了一个宇宙的3D模型,效果足以用震撼形容。

在「3D像素风微缩宝塔模型」的生成任务中,Qwen3.7-Max的输出速度和质量同样全面胜出。

左右滑动查看

开发者Paul Couvert更是盛赞,Qwen3.7-Max接入Hermes Agent和OpenCode之后,基本可以替掉GPT-5.5和Opus 4.7。

编程,太能打了


不过跑分再高,不如真刀真枪拉出来练练。

我们给Qwen3.7-Max安排了一场硬核的「赛车游戏」挑战。

一段详细的Prompt丢进去,不一会儿功夫,Qwen3.7-Max直出一个可玩的HTML的文件。

第一版有个小bug,A/D转向键左右搞反了。

但经过第二轮简单对话微调,一个体验完整的3D赛车游戏就跑了起来。

打开的瞬间,说实话,有点被惊到了。

4车同台,3圈环形赛道竞速,赛道上散落着100多枚金币,碰到障碍物会减速、失控。

赛后成绩面板,排名、用时、金币数、最快单圈,一项不缺。

但真正让人意外的,是两个只有Qwen3.7-Max做到的细节。

一个是开始界面。四个模型横向测完,只有它给游戏做了一个正经的开始页面,点「Start」才进入比赛。其他三家全是打开即跑,连个标题画面都没有。

另一个是音效。Prompt最后附了一条要求,加上发动机轰鸣和吃金币的音效。四个模型里,也只有它把这个bonus吃进去了,引擎声和金币叮咚都安排上了。

再看看其他选手的表现。

Gemini 3.5 Flash的画面明显单薄了一档,缺少那种呼之欲出的立体感。

UI布局也有问题,仪表盘信息分散在屏幕四角,视觉焦点一盘散沙。

相比之下,Qwen3.7-Max的处理方式是把关键指标集中到画面中央,更符合玩家视线的自然落点。

Claude Opus 4.6的效果,有点让人一言难尽了。

不仅赛道上金币少得可怜,而且3辆AI赛车几乎同步行驶,毫无随机性,像复制粘贴出来的。

最后是GPT-5.5。

可以看到,画面质感确实比前两家强了不少,操作起来也更流畅。

但不知道为什么,金币被做成了黄色的「甜甜圈」……

造型倒是小事。关键是,Gemini、Claude、ChatGPT三家都修了好几轮bug才跑通全部功能。

只有Qwen3.7-Max首轮生成就基本可玩。

跑分接近,实测不虚,价格只有几分之一。剩下的结论,等开发者用脚投票就行了。


Agent时代的「基座」模型


Qwen3.7-Max之所以能在最卷的编程擂台上打出如此水平,答案就藏在它的产品定位里。

几天前,阿里发布Qwen3.7-Max的时候,给了它一个非常特殊的标签:Agent基座模型

它生来,就是为长时间自主执行任务设计的模型。

内测数据显示,在一次自主编程任务中,Qwen3.7-Max连续运行35个小时,执行1158次工具调用。

最终生成的代码相较于Triton参考实现,达到了惊人的10倍几何平均加速。

更令人震撼的是它的「持久战」能力——

在推演进行到第30个小时之后,模型依然保持敏锐,持续挖掘出新的优化空间。

全程零上下文退化、零指令漂移、零死循环!

不得不说,这件事的难点不在1000次工具调用本身。MCP协议铺开之后,调1000次工具不算稀奇。

难点在于,35小时的连贯推理。

绝大多数模型跑长任务时会崩盘:要么上下文越积越乱,前半段定的目标到后面忘得干干净净;要么进入死循环,反复尝试同一个失败的方案。

Qwen3.7-Max把「持续做对事」这件事,做出来了。

核心技术揭秘


Qwen3.7-Max这波编程跃升,我们理解核心可能与两个训练方法的升级有关。

第一个是,环境扩展。

Qwen3.7-Max在做编程训练时,每个任务会被拆成三个独立维度,任务本身、执行框架、验证方式,三者自由组合。

同一道题,有时候在Claude Code的框架里做,有时候在OpenClaw里做,有时候换一种验证方式。

效果就像一个实习生被轮岗到了所有项目组。它被迫学会的是解决问题的通用策略,不是「在某个特定框架里怎么取巧」。

这解释了一个反直觉的现象,Qwen3.7-Max在Claude Code、OpenClaw、Qwen Code这几个框架里的表现都很稳,没有出现「在自家框架里很强、换一个就拉胯」的情况。

第二个升级是长程自主执行。

在训练中,团队引入了「动态累积生存博弈」框架。

也就是,让模型在持续变化的模拟环境中做超过一千步的连续决策,自己建立假设、根据反馈调整策略,而且不能因为跑太久就「上下文腐化」。

这里有一个直观的数据,YC-Bench模拟创业公司经营一整年,Qwen3.7-Max做到了208万美元营收,是上一代(105万)的两倍。

更关键的是,它展现出了策略进化,中期遇到危机能自主调整方向,识别并拉黑恶意客户,最终收敛到稳定的执行循环。

这就是35小时kernel优化案例的底层支撑,也是为什么在Kernel Bench L3上,Qwen3.7-Max能让96%的场景跑出加速效果。

而编程还只是第一个战场。这套长程推理加工具调用的底子,指向的是一个更大的野心——通用Agent基座。


编程决赛,多了一个搅局者


Code Arena上线至今,考的从来都是硬活,多步推理、工具编排、完整项目交付,全是Agent级的真刀真枪。

今天,Qwen3.7-Max凭借着1541分的成绩楔进了第四的位置,卡在Opus 4.6 Thinking和Opus 4.6之间。

在这条Claude统治了大半年的赛道上,它给出了自己的回答,中国模型不只是追赶者,也可以是定义者。

全球编程模型的竞赛,已经不再是硅谷的独角戏了。

图片

往期热文:

没有团队,没有融资,他一个人靠开发网站一年赚千万!

AI编程开发小程序,有人已经日入1千,赚了10万块了!

30分钟!开发了“全能手电筒补光”小程序!

目前我们星球是有全套的AI编程零基础开发微信小程序的教程(可以学1整年),我们会教你全套的从零开始如何用AI编程开发小程序+副业变现;

有兴趣的可以看看。我自己也在全力深耕这个赛道,欢迎志同道合的小伙伴加入我们!

图片

国内编程模型TOP3,性能比肩Claude Code 国产编程模型与ClaudeCode对比分析摘要(149字): 国产编程模型在2026年取得显著突破,Qwen3.6-Plus、GLM-5和KimiK2.5位列国内三。Qwen3.6-Plus全球排名第,性能接近ClaudeOpus4-6;GLM-5具备顶尖工程能力;KimiK2.5擅长处理大型代码库。相比ClaudeCode,国产工具在中文支持、本土框架适配、访问稳定性和成本方面优势明显,且支持私有化部署。虽然ClaudeOpus仍保持全球领先,但国产头部模型已实现并跑甚至局部超越。综合性能与本土化需求 阅读详情

相关推荐

GLM-4.6 在 LMArena Code Arena 榜单中与顶级模型并列首位:技术分析与启示

摘要:LMArena平台的CodeArena最新榜单显示,智谱AI的GLM-4.6与Claude、GPT-5系列在编程任务上并列第一。该开源模型(MIT许可)以高效web构建和低成本(0.15美元/百万tokens)见长,支持256K长上下文。榜单基于数万次用户投票,采用盲测机制评估代码正确性、效率等指标。结果提示开发者可根据需求混合使用模型:GLM-4.6适合快速原型开发,Claude系列擅长复杂调试。这一进展标志着AI编程评估正向多轮交互能力倾斜。

Ashtar_katay的博客 1845

Code Arena全球,开源第一:GLM-5.2写代码到底有多强?

智谱AI开源旗舰模型GLM-5.2,以753B参数实现与万亿级闭源模型比肩的性能:Code Arena全球、开源第一,Design Arena全球第一,Agentic能力与GPT-5.5基本持平。三大核心技术——IndexShare架构(计算量降2/3)、MTP训练方法(提升长程依赖)和稳定1M上下文——支撑其企业级工程能力。采用MIT协议开源,适配国产算力平台,标志着开源模型首次在企业级工程能力上实现局部反超,验证了架构创新对参数效率的提升价值,或将重塑企业AI选型标准。

haylee的专栏 2764

提升AI Agent能力的上下文技术

模型能力决定Agent的天花板,上下文工程才是决定真实业务落地表现的地板。

酌沧 299

阿里、中科院等发布CodeArena: 基于人类偏好的代码大模型评估与对齐

值得注意的是,全合成数据微调的Qwen2.5-SynCoder相对使用真实数据微调的Qwen2.5-32B-Instruct,在CodeArena上的表现比在其他benchmark上差别更大。助手,为了更好衡量生成代码对人类偏好的满足程度,本文提出了一个应用场景广泛、编程语言全面、问题来源真实的基准测试集,CodeArena,以及SynCode-Instruct,一个高质量、大规模的代码文本合成指令语料库。当的代码大语言模型(CodeLLMs)专注于合成正确的代码片段,忽略了与人类偏好的一致性。

强化学习曾小健 1393

AI工具百宝箱|CodeArena:开源编程语言模型代码对决平台,等你来战!

智能目标:使用历史数据来为季度制定更好的目标。另外它还提供与项目相关的任何问题的答案,帮助你更清晰地了解正在发生(或没有发生)的事情。由知名开源作者Hassan开发的开源编程语言模型的代码对决平台,可以让各类开源编程LLM在相同的编程任务中展开实时PK,通过排行榜展示其代码生成能力的开源平台。除了通常的语法和拼写错误检查外,Grammarly可以根据您编写的内容和阅读对象提供个性化建议例如语气调整、策略建议和整句重写。除此之外,Grammarly 适用于用户使用的所有应用程序和网站。

金融机器智能社区 391

AI 模型评测平台 LMArena 公布了最新AI 编程大模型排名

近日,全球知名的 AI 模型评测平台 LMArena 公布了最新AI 编程大模型排名,令人瞩目的是,美国的 Anthropic 公司推出的 Claude、OpenAI 的 GPT-5 以及智谱科技的 GLM-4.6,这三款 AI 编程模型在排行榜上不分上下,齐齐占据了全球第一的位置。

weixin_43822578的博客 1568

中国AI闯入全球编程面只剩Claude

这解释了一个反直觉的现象,Qwen3.7-Max在Claude Code、OpenClaw、Qwen Code这几个框架里的表现都很稳,没有出现「在自家框架里很强、换一个就拉胯」的情况。四个模型横向测完,只有它给游戏做了一个正经的开始页面,点「Start」才进入比赛。这里有一个直观的数据,YC-Bench模拟创业公司经营一整年,Qwen3.7-Max做到了208万美元营收,是上一代(105万)的两倍。换句话说,在全球编程模型的竞技场上,阿里是唯一杀进这张牌桌的中国厂商,仅次于Anthropic,位列第

2501_91883294的博客 393

国产AI编码突破全球壁垒:GLM-4.6登顶Code Arena榜单背后的技术革命与产业价值

在过去的一个多月里,通过对国内多款AI产品与模型的深度测试与日常使用,我深刻感受到国产AI软件的进步已经从量变积累到了质变阶段。无论是底层基座模型的性能跃升,还是终端应用产品的体验优化,都呈现出令人振奋的发展态势。这种进步不仅体现在技术参数的提升上,更反映在实际应用场景中的落地能力。上周末,当我习惯性浏览LMArena的模型评测排行榜时,意外发现该平台完成了今年最重要的一次评估体系升级——全新的C

gitblog_00930的博客 835

国产开源大模型全面崛起:Design Arena排行榜15名全是中国造

国产开源大模型在Design Arena排行榜上表现亮眼,15名全部来自中国,阿里、DeepSeek、智谱等科技公司密集发布新一代开源模型。这些国产开源模型已能与闭源顶尖模型分庭抗礼,使应用公司专注模型调优和应用优化,加速AI技术落地。中国开源大模型的崛起正在重塑全球AI版图,未来先进模型开源或成必选项。

2301_76168381的博客 1311

全球开源大模型,十五名全是中国的

现在说起开源的大模型,大多数人的第一反应早已不是 Llama,而是 Qwen 和 DeepSeek。有人认为,正是 DeepSeek 等开源大模型能够与闭源顶尖模型分庭抗礼,才让众多应用端公司得以转变工作重点,把精力放在模型调优和应用优化的工作上来,进而加速了 AI 技术的落地。此还有机构 Interconnects(深度聚焦沿 AI 研究的高质量内容平台)汇总了国内顶尖的 19 家开源模型实验室,包括 DeepSeek 这样的顶级机构,以及一些通过技术报告和小众模型崭露头角的新兴学术实验室。

计算机科研圈的博客 1272

Kimi K3 深夜炸场:2.8万亿参数、Code Arena全球第一,国产开源模型这次真把桌子掀了

中国AI模型KimiK3在多个榜单登顶全球第一,成为首个在编程能力盲测中超越Claude和GPT的开源模型。该模型采用创新架构设计,包括自研注意力机制和896选16的极端稀疏MoE结构,参数规模达2.8万亿但计算效率提升2.5倍。K3在芯片设计、科研代码复现等复杂任务中展现强大能力,7月27日将开源完整权重。分析师认为,这标志着国产AI已从中文优势拓展到全球竞争力,开源与闭源模型的差距正在缩小。建议开发者通过聚合平台灵活调用不同模型应对多样化需求。

m0_65682055的博客 920

阿里 Qwen3.7-Max 编程能力飙升至全球Code Arena 盲测 1541 分,超越 Claude Opus 4.6

阿里通义千问Qwen3.7-Max以1541分登顶CodeArena全球编程盲测榜第四位,成为首个突破1540分的国产大模型。该榜单采用真实开发者匿名盲测机制,通过端到端工程能力评估模型实际编程表现。Qwen3.7-Max采用Agent优先架构,支持35小时长程任务和千次工具调用,已在阿里云百炼平台上线。其表现标志着国产模型首次在真实编程场景达到国际顶尖水平,为开发者提供了Claude之外的新选择。

qq_36229933的博客 2897

上线 48 小时,Claude Opus 4.6 横扫三榜,顺手开了个「氪金模式」!

上线 48 小时,Claude Opus 4.6 横扫三榜,顺手开了个「氪金模式」!

hunteritself的博客 1683

2026年AI编程助手全面对比:底层原理、技术架构与实战评测(5月更新版)

2026年5月,AI编程助手市场格局剧变:Claude Code以80.9% SWE-bench领跑Agent能力,Cursor Background Agent实现云端异步执行,Copilot转向按量计费,国产工具通义灵码免费且中文生态最优。本文从底层原理、技术架构、实战评测三大维度全面对比八款主流工具,涵盖多模型路由、子Agent架构、Agentic Search等核心技术,并给出按场景与技术栈的选择建议。

lipansfj的博客 3821

2026 AI编程“百模大战”:Minimax 2.7开源、GLM-5.1登顶、DeepSeek V4将至,但Java开发者真正缺的是什么?

稍早,智谱GLM-5.1正式开源,在Code Arena榜单上登顶全球开源模型第一,位列全球模型第三。大模型能生成代码片段,但生成一个完整、可运行的Java项目(包含Controller、Service、DAO层、配置文件、SQL脚本)并处理依赖关系,需要专门针对Java生态优化的工具。大模型不会帮你检查SQL注入、不会帮你整理代码规范、不会生成完整的测试用例——这些只有专门的Java编程助手能做到。当便宜的“梯子”被撤走,开发者需要的是一套可持续、高可用的Java工程化工具链。

CalEx_Tech的博客 1234

阿里Qwen3.6-Plus登顶Code Arena,国产大模型编程能力崛起

4月3日,LMArena旗下聚焦AI编程能力的Code Arena公布新一期排名,阿里巴巴最新一代大语言模型Qwen3.6-Plus登上全球榜单第,成为该榜单上排名最高的中国大模型。本次Qwen3.6-Plus斩获第的React专项榜单,考察的是大模型在真实复杂Web开发场景下的自主编码能力,要求模型具备完整的工程思维和端到端开发能力。Qwen3.6-Plus拥有原生多模态理解、推理能力,并在代码生成与Agent能力上表现突出,以更少的参数实现了更强的性能,成为当国产模型中编程能力的标杆。

IT界那些事儿 83

B2B企业AI搜索可见度诊断与GEO技术优化实践:从0%到67%的架构重构之路

B2B采购的AI化不是趋势,而是已经发生的现实。确保品牌被写进AI的大脑。用中立监测工具做一次AI可见度体检,定位品牌在12+模型中的存在感盲区;将官网从“展示窗口”重构为“AI信源”,重点改造信息架构、FAQ体系和资质事实页;建设企业知识库,统一多信源口径,为AI提供高置信度的引用素材。今天不做,明天你的客户就会被AI推荐到竞品那里。技术团队应抓住当窗口期,用工程化手段解决AI可见度问题。

daydayup0931的博客 289

从自然语言到结构化活动方案:Cyber TPM AI智能活动推荐如何嵌入TPM业务流程

生成的活动方案不应直接等同于最终业务决策。活动结束后,预测数据、实际活动结果以及业务人员的调整信息,可以继续沉淀到TPM体系中。因此,赛博威Cyber TPM AI智能活动推荐的关键并不是单纯“生成文本”,而是让AI建议能够建立在企业业务数据和规则基础之上。之后再将这些信息录入TPM系统,而AI开始进入TPM之后,一个值得关注的变化,是系统开始向“活动方案形成”这一更置的环节延伸。真正有价值的企业AI,不只是能够生成内容,而是能够嵌入原有业务流程、调用企业数据、遵守企业规则,并将结果继续沉淀回业务系统。

CyberwayTech的博客 268
上一篇: 曾经的王,Python 倒下了!!!
下一篇: Claude Code之父自曝:“今年还没亲手写过一行代码”,CC诞生的原因竟然是。。。
菜鸟学Python
博客等级 码龄9年 7560粉丝 571原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值