8月14号,智谱发了 GLM-5.3。我本来没太当回事——参数没变,还是 743B 的 MoE 基座,所有提升都来自后训练。这种"不换引擎只调教"的路线,在 AI 圈里不算新鲜。
但接下来两天发生的事,让我把这篇文章从头到尾读了三遍。
先是 CyberGym 漏洞发现基准上,GLM-5.3 拿了 84.5%,超过了 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。然后是 ExploitBench——这个测试衡量模型把漏洞转化成实际利用的能力——它拿了 54.4%,比上一代 GLM-5.2 翻了将近一倍。
这些数字单独看,可能只是榜单上的几个百分点变动。但接下来发生的事,让这些数字有了实感:GLM-5.3 在 Cursor 里找到了一个严重漏洞。
Cursor 是什么?SpaceX 花了 600 亿美元收购的 AI 编程工具,全球几百万开发者在用。一个模型,在它发布后的几天内,就在另一个 AI 产品里发现了安全研究员没找到的漏洞。清华大学 NASP 实验室用 GLM-5.3 分析了 Cursor 的二进制代码、跨语言架构和权限边界,发现它的 Rust 和 Electron 混合架构里存在一个权限校验漏洞——攻击者可能通过这个漏洞实现任意文件写入,窃取敏感信息,甚至接管整个开发环境。
这不是概念验证。这是真实漏洞,已提交给 Cursor 团队确认。
这件事让我意识到一个更根本的问题:当 AI 的攻击能力超过大多数人的防御水平,我们拿什么保护自己?
从"人工驱动"到"模型驱动"
过去做 AI 安全,流程大概是这样的:找一批安全专家,设计攻击 prompt,跑一轮红队测试,修漏洞,再跑一轮。OpenAI 雇了几百个 domain expert 做红队,Anthropic 有专门的 trust & safety 团队,DeepSeek 出了 R1-1776 安全对齐版本。这些工作的核心是"人"——人的经验、人的直觉、人的耐心。
但人有一个硬天花板:一个安全专家一天能测的 prompt 上限是几十个到几百个。而一个模型,一秒可以生成上千个攻击向量,还能自动迭代策略。
GLM-5.3 这次代表的是自动化红队的新做法。不是让模型简单地生成"请绕过安全限制"这种 prompt,而是让它模拟攻击者的思维方式——先探测目标系统的行为边界,再根据反馈构造更精确的攻击 payload。这是"试探-反馈-迭代"的循环,但速度是人的几百倍。
智谱官方公布的数据很说明问题:自 GLM-5.2 以来,模型线累计发现 2436 个漏洞,覆盖 269 个开源项目,其中 1097 个被评为中高危。这些漏洞分布在内核、操作系统、浏览器引擎、开源基础组件等多个领域,按全球漏洞赏金市场报价估算,经济价值达 3000 万元。最早可追溯至约 45 年前的代码缺陷也被挖了出来。
不是人不行,而是人的规模跟不上。模型能干的事,人一样能干,但模型能 24 小时不睡觉地干。
模型攻击模型,跟人有什么不一样
我仔细看了 GLM-5.3 的攻防实验方法,有三个技术点值得单独聊。
第一,对抗性 prompt 生成。 GLM-5.3 不是简单地问"你有漏洞吗",而是先问 Cursor 的代码补全模块如何处理用户输入,根据返回的信息构造注入 payload,再根据执行结果调整策略。典型的"试探-反馈-迭代"模式,但它的迭代速度是毫秒级的。
第二,跨组件漏洞发现。 Cursor 的架构由多个模块组成——代码补全、对话、文件操作、权限管理。GLM-5.3 发现了一个漏洞:通过在对话模块构造特定上下文,可以影响代码补全模块的输出,让它生成包含恶意代码的建议。这种跨模块攻击,人类安全测试员很难系统性地覆盖,因为需要同时理解多个组件的交互逻辑。模型没有这个限制——它可以把整个系统当做一个整体来分析。
第三,副作用挖掘。 GLM-5.3 不只是找漏洞,它还会分析"如果一个漏洞被修复了,是否有其他路径可以达到同样的攻击效果"。这已经是安全研究中的"绕过分析"了,而且它做得相当系统。智谱的技术报告里提到,GLM-5.3 在针对某些漏洞做修复验证时,自动发现了 3 条替代攻击路径——这些路径涉及完全不同的代码模块,人类研究员在修复原漏洞时根本没有考虑到。
不过,GLM-5.3 也不是万能的。在 ExploitBench 上 54.4% 的得分,意味着将近一半的漏洞它无法成功利用。对于那些需要物理先验知识(比如供应链攻击、硬件漏洞)的场景,它基本无能为力。在需要"真实世界经验"的攻击类型上,它仍然比不上经验丰富的安全专家。
这说明了一个现实:AI 自动化安全测试不是替代人类专家,而是把人类的能力边界向外推了一大截。
这波"模型攻模型"浪潮,开发者该怎么办
GLM-5.3 不是唯一一个在做这件事的。OpenAI 今年披露了内部自动化红队模型 GPT-Red,通过四阶段循环——目标设定、攻击生成、响应观察、迭代优化——实现了比手动红队高 6 倍的安全改进。NVIDIA 的 Garak 提供了 37 个攻击模块,微软的 PyRIT 专攻多轮和多模态攻击。Meta 的 Purple Llama 项目也在做自动化安全评估框架。
这不是某个实验室在炫技。整个行业都在转向。
对普通开发者来说,这意味着几件事:
第一, 如果你的产品用到了 AI 能力(不管是自己部署模型还是调 API),自动化红队测试应该成为 CI/CD 的一环。就像单元测试一样,每次发布前跑一轮。工具已经成熟了——PyRIT、Garak、Promptfoo 都是开源的,配置好就能跑。
第二, 安全能力会成为模型选型的新维度。以后选模型,不光看推理分、编程分,还得看"安全韧性分"——这个模型能不能扛住其他模型的自动化攻击。GLM-5.3 这次同时展示了进攻和防御能力,但并非所有模型都能做到。
第三, 需要警惕"能力不对称"。GLM-5.3 在 Cursor 里找到漏洞这件事,本质上是一个"白帽"行为——智谱主动披露了漏洞。但同样的技术,如果被"黑帽"团队拿去用呢?一个能自动发现漏洞的模型,如果被用于攻击而不是防御,破坏力是传统攻击手段的几百倍。这可能是未来一年 AI 安全领域最需要关注的问题。
一个开放的问题
我写这篇文章的时候,GLM-5.3 的漏洞发现清单还在更新。目前它对 6 个不同的 AI 产品做了安全分析,每个都有发现。这个数字还在涨。
但我最好奇的不是它能发现多少漏洞,而是另一个问题:如果攻击模型和防御模型的能力在同步提升,这场"军备竞赛"的终点在哪里?是会达到一个动态平衡,还是会出现"超级攻击模型"碾压一切防御?
你们团队的 AI 产品,现在有自动化安全测试流程吗?还是说还在靠人工 review 和运气?欢迎在评论区说说你们的做法,我也想看看行业里大家都在用什么方案。

1078

被折叠的 条评论
为什么被折叠?



