Qoder CLI 上运行 Qwen3.8-Max:5 个硬核任务实测

图片

近日,Qwen3.8-Max 正式发布,Qoder 全家桶产品同步首发接入。自模型 Preview 阶段起,Qoder CLI 便深度参与了评测及验证工作,见证了模型的快速进化成长。

在正式版发布后,为了验证 Qwen-3.8 Max 在 Qoder CLI 上的效果,我们重新选取了一组高难度的长程任务,在无人工干预的前提下,让 Qoder CLI 自发进行数百次工具调用,自主发现并修复问题,直至完成目标。

本文所选取的5项任务,也交给了 Claude Opus 4.8、GPT-5.6 Sol 和 Claude Fable 5 进行横向对比*(外部模型测试是通过实验方法进行,非 Qoder 正式版本能力,仅用于此次对比测试)*。

在这组评测中,Qoder CLI 不只是模型调用入口,而是承载任务执行的 Agent Harness。它为模型提供一致的工具集、执行环境与反馈闭环,使模型在单轮提示词后自主完成长程执行与迭代验证。在相同的评测条件下,**四个模型均在没有人工追加提示的情况下独立运行至结束并提交产物。**其中部分任务持续数小时,涉及数百次工具调用。比如在《清明上河图》任务中,Qoder CLI 连续自主运行了 4 小时 23 分钟,主动截取约 378 张 图片进行自我迭代。

本次评测的全部材料已开源,可详见文末附录。

01《清明上河图》:从一张古画到能游览的三维世界

如果只是把《清明上河图》铺在网页上,并不难。真正困难的是:不使用原图充当背景,让模型从零搭出一个可以进入、游览和切换视角的三维世界。

💬**题目:**从空白目录开始,根据《清明上河图》高清原图制作一份单文件、可离线运行的真三维长卷。作品包含六个章节和24个固定机位,所有主体均使用程序化实体几何构建,不以图片代替三维场景。重点考察图像理解、空间推理和长时间自主执行能力。

这道题想看的,是模型能否完成三个连续的跨越:

先看懂。《清明上河图》信息密度极高。模型需要从长卷中识别人群、船只、建筑、车马和沿街摊位,还要理解它们之间的关系,而不是只抓住虹桥、城门等少数标志性元素。

**• 再搭出来。**原画只提供二维信息,模型却需要自行推断物体的前后关系、空间尺度和场景布局,把一幅只能观看的画,重建成一个能够移动镜头的三维世界。

**• 最后跑到底。**这不是一次生成就能完成的任务。模型需要在数小时、数百次工具调用中持续检查画面、修改代码、重新渲染,同时避免在漫长的迭代中偏离最初目标。

四个模型都交出了真三维场景,没有一家用图片冒充。按功能交付、三维几何、内容叙事、视觉贴合、工程质量五项各 20 分打分,Claude Fable 5 得 73 分,Claude Opus 4.8 得 72 分,Qwen3.8-Max 得 63 分,GPT-5.6 Sol 得 56 分。耗时分别为 189、72、263 和 47 分钟。

Qwen3.8-Max走了一条与其他三家不同的工程路线:它没有用现成的三维引擎,自己从零写了一个渲染器。它的文件也最小,123 KB,对 Claude Fable 5 的 822 KB 和 Claude Opus 4.8 的 549 KB;渲染效率最高,每帧只需要让显卡绘制约 46 批物体,Claude Fable 5 的场景要画三千到五千七百批。

代价出在画面上。六个章节的场景都偏空,城门口没有车马和集市;地面和天空还出现了矩形补丁一样的颗粒痕迹。这些补丁不是失误,是它主动加的:它花了大量轮次调整画面的颗粒质感,让统计出来的相似度更接近原画。指标确实上去了,肉眼看到的画质反而变差。它也是耗时最长的一家。

Opus 4.8 的画面完成度最高:虹桥上有人群、桥下有船、两岸有摊位,最接近原画里的市井热闹。Claude Fable 5 的三维结构最扎实,但画面同样偏空。GPT-5.6 Sol 的桥体零件明显错位穿插,最后它主动提交了一份"未完成"报告,没有把做不完伪装成做完了。

02用 Rust 从零实现一个高性能内存 KV 存储服务

让模型写代码不算新鲜。这道题的难度来自两件事叠加:Rust 与数据库,两者各自都属于工程上偏难的一类。

💬**题目:**用 Rust 从零实现一个高性能内存 KV 存储服务,采用指定的 QKV 二进制协议和四个命令。核心逻辑必须自行编写,不使用异步运行时、网络框架或第三方存储、缓存、哈希表及内存分配库,也不使用 io_uring,全程离线完成。初始目录仅提供任务书、协议规范和基础测试。

这是一个非常硬核的题目,正常一个高性能的键值数据库,至少要同时具备五项能力:

• 网络层:同时服务大量连接

• 协议解析:容忍数据任意分段到达

• 存储结构:支持多线程同时读写而不出错

• 过期回收:自动清理到期数据

• 过载保护:请求量超出处理能力时自我保护

从结果来看,四个模型都在QoderCLI上完成了任务,平均代码在 860 到 1615 行之间,**且均在一次提示词之后自主产出。**27 条私有测试全部通过,正确性上没有区分度。差距集中在性能上。

图片

图2 极限吞吐实测结果

极限读吞吐依次为 Qwen3.8-Max 11.8M、Claude Opus 4.8 10.5M、GPT-5.6 Sol 4.5M、Claude Fable 5 10.5M ops/s;极限写为 12.2M、9.6M、4.7M 和 8.7M;读写各半为 10.2M、8.8M、4.7M 和 9.1M。

图片

图3 批处理增益对比

吞吐差距的头号原因是写路径批处理。Qwen3.8-Max、Claude Opus 4.8 和 Claude Fable 5 都是一次 read 解析全部命令、响应拼成一整块一次写;GPT-5.6 Sol 在首轮验证中每条命令单独调用一次 write(),libc 绑定里连 writev都没声明。批处理增益(批次 256 吞吐除以批次 1 吞吐)因此是 99x、92x、12x 和 98x,GPT-5.6 Sol 在第2轮验证(v2)引入 writev 后升至 52x。这个指标是全套里最稳的——它是比值,分子分母同机同码,机器快慢被约掉,跨轮吞吐波动 ±55% 时它仍能稳定分档。

图片

图4 六项测试产生三个不同维度的“第一”

延迟与吞吐呈现出不同排名。长程测试中,Claude Opus 4.8 的 p99 延迟最低,为183μs;其后依次为 Claude Fable 5(191μs)、Qwen3.8-Max(217μs)和 GPT-5.6 Sol(241μs)。在16万 QPS 过载测试中,Claude Fable 5 最稳定,p99 为537μs;Qwen3.8-Max 和 GPT-5.6 Sol 分别为582μs和716μs;Claude Opus 4.8 则升至909μs。主要原因是其背压阈值设为16MB,难以约束小响应积压,而 Claude Fable 5 会在积压超过4MB时停用 EPOLLIN,降至64KB后再恢复,形成有效背压。

源码分析也反映出不同取舍。Qwen3.8-Max 使用1024个分片,写扩展能力和极限写性能最佳,领先31%;但自研的 fxhash64 仅用于选择分片,内部 HashMap 仍采用默认 SipHash,直接推高了长程 p99。Claude Fable 5 的实现最为均衡,关键技术点均完整落地,五项测试位列第二,一项位列第一,没有明显短板。

综合结果可分为数量级差距、批处理增益分档,以及“吞吐排名不等于延迟排名”三类。前三名的精确次序差距仅为0.5%至9%,小于跨轮测试方差,不具备统计显著性。吞吐量绝对值也只适用于本次配置:每项任务使用全新容器,服务端配置为4核、3GB内存并断网编译,压测端独占8核;每个网格点重复5次取中位数。跨机器比较必须在同一环境中重新运行全部基线。

六项测试产生了三个维度的领先者:Qwen3.8-Max 在三项吞吐指标和CPU效率上领先,Claude Opus 4.8 在低负载延迟与内存占用上领先,Claude Fable 5 在过载稳定性上领先。不存在单一的绝对最优方案,仅凭一项指标选型容易得出错误结论。

03 4道独立的前端设计题

天气卡

图片

图5 天气卡四模型效果对比

同一句提示词:四种天气、深色背景、可切换。

• Qwen3.8-Max 的 CSS 插画最饱满,温度 32°/14°/18°/−3° 放在卡片角上。

• Claude Opus 4.8 最克制,也是唯一 axe 零严重项的一版,但全文搜不到一个温度数字,8px 高斯模糊后卡片上找不到重点。

• GPT-5.6 Sol 是唯一被设计过的一版,编辑式页头加城市·时间·条件三段元信息,36px 的温度对 10px 的 kicker 是 3.6 倍。

• Claude Fable 5 层级最弱,温度被塞进"18°C · 42 km/h"这行元信息里。

咖啡烘焙落地页

图片

图6 咖啡烘焙落地页四模型效果对比

题目要求滚动进场动画、图片 hover 反馈和一个抓人的 hero,并明确"动效别太吵,克制一点"。

• Qwen3.8-Max 走了极简:浅米色底、"山雾养豆,慢火成香。"大字、线描咖啡豆、一个描边按钮,留白最多。

• Claude Opus 4.8 用深褐色配"把一颗豆子/烘成一段清晨",把"一段清晨"做成橙色斜体强调。

• GPT-5.6 Sol 是唯一画了完整插画场景的——远山剪影层叠、雾气、光晕、带红果的咖啡枝叶。

• Claude Fable 5 与 Claude Opus 4.8 的方向接近,深褐加橙色强调,右侧补了同心圆弧装饰。

程序化行星

图片

图7 程序化行星四模型渲染对比

题目要求程序化生成一颗可自转的行星,带大气和云层,右侧提供地形起伏、海平面、大气浓度三个滑块。

• Qwen3.8-Max 的大气辉光最强,蓝色边缘光和冰盖云层分明。

• Claude Opus 4.8 的行星占满画面但整体偏灰白,大气边界模糊,滑块多给了一个自转速度。

• GPT-5.6 Sol 做成了名为“造星者”的产品界面,行星带经纬网格,右侧参数面板不只有滑块还有实时数值。

• Claude Fable 5 的实现完整但体积小、画面偏暗。

chiptune 同步

四个作品的初始画面十分相似,均以开始按钮为视觉主体,核心内容只有点击后才会呈现。进入播放后,四个模型展现出截然不同的设计方向:

• Qwen3.8-Max 以蓝色核心和环形频谱射线构建抽象视觉;

• Claude Opus 4.8 是唯一提供完整播放控制的作品;

• GPT-5.6 Sol 构建了完整的落日公路场景,页脚计数器会随音乐节拍变化;

• Claude Fable 5 根据音乐转折动态呈现段落标题。

04OpenAlex 数据分析

这道题的难点不在于生成一份形式完整的分析报告,而在于结论能否追溯到原始数据和具体证据。

💬**题目:**基于冻结的 OpenAlex AI Landscape v1 数据集完成端到端分析。数据包括2020至2025年、10个国家的60个“国家—年份”统计单元,去重后的1,198篇论文,以及17篇CC BY论文的290页PDF、分页文本和页面图像。要求在不修改输入数据、不访问外部网络的前提下,直接完成分析并交付结论、证据、脚本、图表、Dashboard和验证记录。

四个模型得出的主要结论基本一致且均无明显错误,真正拉开差距的是证据的可追溯性:每项结论能否准确对应到具体表格、论文和页码。按此标准评分,Qwen3.8-Max 得100分,Claude Fable 5 得94分,Claude Opus 4.8 得89分,GPT-5.6 Sol 得87分。

图片

**图9 “**主题演化”图表四模型对比

四个模型均生成了相同类型的图表,其中一项要求展示页级证据。

• Qwen3.8-Max 将PDF页面直接嵌入图表,逐页标注论文ID、页码和原文引用,并附有5条通过页面校验的补充证据,共形成6条证据链。

• Claude Opus 4.8 以4张卡片展示论文ID、FWCI、引文及关系判断,页面图像则单独放置在Dashboard其他区域,共提供3条页级证据;

• Claude Fable 5 和 GPT-5.6 Sol 分别提供5条和3条证据。

此外,Qwen3.8-Max 对数据边界的处理也最严谨。它明确区分 country_year.csv 的总体统计与 works.csv 中1,198篇论文的分层样本,未将样本结果外推为全球排名,也未将样本主题频次解释为总体份额。在合作、开放获取与高影响力之间,统一使用“相关”而非“因果”表述,并补充了国家内去均值、逐年相关及剔除2025年三组稳健性分析。最终,44项自动验证全部通过;相比之下,GPT-5.6 Sol 完成了两组稳健性分析。

图片

图10 可信洞察评估结果汇总表

可信洞察指数用于直观呈现同题对比结果。在本题中,Qwen3.8-Max 的证据可追溯性和交付完整度最高,但完成时间也最长。

05《指环王》开篇:92 秒程序化叙事动画

四个模型均通过 Qoder CLI 完成任务,生成的92秒动画全程播放正常。按照故事覆盖、视觉构图、动画运镜、运行可靠性和工程易用性五个维度评分,Claude Fable 5 得90分,Qwen3.8-Max 得89分,Claude Opus 4.8 得84分,GPT-5.6 Sol 得68分。

Claude Fable 5 的画面表现最成熟。地下隧道段完整呈现了木质支架、暖色灯光、宝箱和飞舞光点,而其他三个模型在同一时间点的画面接近全黑。主要不足是三维引擎依赖联网加载,离线无法运行,且后半段夜景偏暗。

Qwen3.8-Max 仅落后1分,但在故事覆盖、运行可靠性和工程交付三个维度均为最高分。它是唯一将三维引擎保存到本地、支持离线播放的作品,同时提供本地服务器、检查脚本和验证截图。四个作品中,也只有它清晰呈现了“消息在村庄传开”的情节。不足在于地下场景过暗,开场人物近景遮挡了较大画面。

Claude Opus 4.8 的整体表现最均衡,场景复杂度也最高,约包含3.3万个三角形。GPT-5.6 Sol 仅用139行代码完成了完整时间轴,但人物和环境主要由球体、方块等基础几何组成,视觉表现较为简略。

06总结

这次评测开始前,我们关心的问题是:在单轮提示词驱动下,这些模型能不能独立跑完数小时量级的工程任务。实际上五个任务中,所有模型均独立走完了全程,没有一家中途失控。

真正需要关注的问题是,在没有人规定「好」是什么的空白处,模型只能依靠自己的标准决定做到什么程度才算完成。这一代模型+Harness之间比的,已经不是能不能达到要求,而是在无人要求时,它对自己的要求是什么。

最后是本文全部结论共同的边界:每个任务均为单次运行,小分差不构成排名依据;所有结果产生于 Qoder CLI 这一个 harness 之上,严格来说测的是模型与工具组合的表现,我们会把本次评测相关的全部提示词、产物与评测脚本开源。

07附录

本次评测的全部材料已开源:五个任务的完整提示词、输入数据、最终产物与源码、评测脚本,以及逐项技术报告。

仓库地址:https://github.com/QoderAI/qodercli-bench-qwen3.8

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值