GLM-5:从Vibe Coding到Agentic Engineering的范式跃迁

GLM-5:从Vibe Coding到Agentic Engineering的范式跃迁

本文将介绍智谱AI与清华大学联合发布的下一代基础模型GLM-5,该模型在推理、编码和智能体能力方面取得重大突破,标志着AI从被动知识库向主动问题解决者的范式转变。

论文标题:GLM-5: from Vibe Coding to Agentic Engineering
来源:arXiv:2602.15763v1 + https://arxiv.org/abs/2602.15763

PS: 整理了LLM、量化投资、机器学习方向的学习资料,关注同名公众号 「 AI极客熊 」 即刻免费解锁

文章核心

研究背景

大语言模型正从被动知识库向主动问题解决者转变,但计算成本和实际适应性(特别是在复杂软件工程中)已成为主要瓶颈。GLM-4.5通过将Agentic、Reasoning和Coding(ARC)能力整合到单一MoE架构中,在多样化基准测试中取得了state-of-the-art结果。然而,随着LLM转型为主动问题解决者,双重挑战日益突出:计算成本高昂以及在现实世界复杂软件工程中的适应性不足。

研究问题

  1. 长上下文推理效率:传统密集注意力机制在128K上下文时计算成本呈 O ( L 2 ) O(L^2) O(L2)增长,使得长时间推理任务变得极其昂贵
  2. 智能体训练效率:同步RL训练在长视距智能体rollout期间会产生大量GPU空闲时间,导致训练吞吐量低下
  3. 长期规划能力:模型在复杂、多步骤的端到端软件工程任务中表现不佳,难以保持长期一致性

主要贡献

  1. DSA架构创新:采用DeepSeek Sparse Attention(DSA)机制,动态分配注意力资源,在保持长上下文理解能力的同时将训练和推理成本降低约1.5-2倍
  2. 异步RL基础设施:设计了全新的异步强化学习框架,解耦生成与训练过程,大幅提升后训练效率,支持大规模智能体轨迹探索
  3. 异步Agent RL算法:开发专用算法使模型能够从多样化、长视距交互中持续学习,显著提升动态环境中的规划和自我修正能力
  4. 全栈国产芯片适配:完成对华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、MetaX和燧原七大主流国产芯片平台的深度优化

方法论精要

GLM-5的训练流程分为预训练、中期训练和后训练三个阶段。预训练阶段使用27万亿token的语料库,优先考虑代码和推理。中期训练阶段将上下文长度从4K逐步扩展到200K,专注于长上下文智能体数据。后训练阶段超越了标准SFT,采用顺序强化学习流程——从Reasoning RL开始,接着是Agentic RL,最后是General RL。关键创新在于整个过程中使用On-Policy Cross-Stage Distillation防止灾难性遗忘。

架构设计

GLM-5扩展到256个专家,将层数减少到80层以最小化专家并行通信开销,产生 744 B 744\text{B} 744B参数模型( 40 B 40\text{B} 40B激活参数),是GLM-4.5( 355 B 355\text{B} 355B总参数、 32 B 32\text{B} 32B激活参数)的两倍规模。在注意力机制方面,GLM-5采用Multi-latent Attention(MLA),通过缩减键值向量匹配Grouped-Query Attention(GQA)的效果,同时提供更优的GPU内存节省和更快的长上下文序列处理速度。

为解决MLA在Muon优化器下性能不如GQA的问题,研究者提出Muon Split方法:将矩阵分割为不同注意力头的小矩阵,并对这些独立矩阵应用矩阵正交化。这种方法使不同注意力头的投影权重能够以不同尺度更新,有效提升了MLA性能以匹配GQA-8的水平。此外,研究者还通过增加头维度从192到256并将注意力头数量减少1/3来优化MLA-256变体,在保持训练计算和参数数量恒定的同时减少解码计算。

DeepSeek Sparse Attention(DSA)

DSA的核心哲学是用动态、细粒度的选择机制替代传统密集 O ( L 2 ) O(L^2) O(L2)注意力。与固定模式(如滑动窗口)不同,DSA"看"内容来决定哪些token是重要的。DSA通过"密集预热和稀疏训练适应"两阶段策略引入:首先进行1000步的预热阶段,每步训练14个长度为202,752 token的序列,最大学习率为 5 × 10 − 3 5 \times 10^{-3} 5×103;然后进行稀疏适应阶段,按照中期训练的数据和超参数进行200B token的训练。

实验表明,DSA在长上下文基准测试中与MLA模型性能接近。DSA将长序列的注意力计算减少了约1.5-2倍,这对于构建推理密集型智能体至关重要,使其能够以一半的GPU成本处理128K上下文。为验证DSA训练的有效性,研究者分别使用相同的SFT数据对DSA和MLA模型进行微调,发现两个模型在训练损失和评估基准上持平。

多Token预测与参数共享

Multi-token prediction(MTP)提升基础模型性能并作为speculative decoding的draft模型。然而在训练中,为预测下一个n个token需要n个MTP层,导致MTP参数和kv cache的内存使用与推测步骤数量呈线性关系增长。DeepSeek-V3使用单个MTP层训练,在推理期间预测下一个2个token,这种训练-推理差异降低了第二个token的接受率。

GLM-5提出在训练期间共享3个MTP层的参数,这使得draft模型的内存成本与DeepSeek-V3保持一致,同时提高了接受率。实验显示,在给定相同推测步骤数( 4 4 4)的情况下,GLM-5的接受长度比DeepSeek-V3.2更长。

异步强化学习框架

GLM-5采用slime作为统一的post-training基础设施,支持大规模端到端强化学习。slime框架提供了三大核心能力:(1)通过高度可定制的rollout接口和基于服务的执行模型扩展任务覆盖范围;(2)通过混合精度训练/rollout、MTP和Prefill-Decode(PD)解耦显著提高吞吐量,特别是在多轮RL工作负载中;(3)通过心跳驱动的rollout容错和路由级服务器生命周期管理提高鲁棒性。

高度可定制的Rollout设计

slime提供了灵活的接口用于实现任务特定的rollout逻辑,包括多轮交互循环、工具调用、环境反馈处理和验证器引导的分支,而无需修改底层基础设施。GLM-5利用这一能力支持广泛的领域和训练范式,包括但不限于reasoning RL、general RL、agentic RL和on-policy distillation,所有这些都在统一的训练栈内完成。

slime通过标准HTTP API暴露其rollout服务器和推理路由器,允许用户像传统推理引擎一样与slime的服务层交互。这将rollout逻辑与训练过程边界解耦:外部agent框架和环境可以直接调用服务器/路由器端点,而优化后端对于短视距单轮训练和长视距多轮轨迹都保持不变。

针对RL Rollout的尾延迟优化

对于RL rollout,优化目标不是聚合吞吐量而是端到端延迟,主要由每一步中最慢(长尾)样本决定。在实践中,单个滞后的轨迹会停滞同步点(如批次完成、缓冲区就绪、训练器更新),并直接决定墙钟进度。GLM-5充分利用slime的面向延迟的服务和调度机制,以最小化中位延迟,更重要的是尾延迟。

通过DP-attention for MLA的多节点推理实现无队列服务。为避免队列延迟,rollout请求即使在突发流量下也必须得到及时服务,这需要充足的KV-cache容量。GLM-5采用多节点推理部署(例如8节点上的EP64和DP64)来配置足够的分布式KV-cache。DP-attention主要引入来防止在不同rank之间复制KV。

通过FP8 rollouts和MTP减少尾延迟。GLM-5使用FP8进行rollout推理以减少每token延迟并缩短长轨迹的完成时间。此外,GLM-5利用slime对Multi-Token Prediction(MTP)的支持,这在RL rollouts典型的小批量解码机制下特别有效。由于尾延迟通常由小批量滞后者(例如罕见的长上下文、复杂的多轮推理、重度工具轨迹)驱动,MTP在长尾上提供不成比例的好处,提高最慢样本的完成时间,从而减少步骤级停滞时间。

PD解耦防止多轮RL中的prefill-decode干扰。在多轮设置中,长前缀prefills很常见(对话历史、工具轨迹、代码上下文)。在DP-attention下,在相同服务资源上混合prefill和decode会创建严重干扰:繁重的prefill可以抢占或中断服务器上正在进行的decodes,阻止其他样本连续进行并急剧恶化尾延迟。GLM-5因此利用slime的Prefill-Decode(PD)解耦。通过在专用资源上运行prefills和decodes,decodes保持稳定和不受干扰,使长视距样本能够持续进行,并显著改善多轮智能体RL中的尾行为。

Rollout鲁棒性:心跳驱动的容错机制

在大规模下,瞬时故障(例如单个服务器崩溃、网络问题或性能降级)是不可避免的。GLM-5利用slime的心跳驱动容错来确保在此类事件下的训练连续性:rollout服务器定期发出由编排层监控的心跳,不健康的服务器被主动终止并从推理路由器中注销。因此,重试会自动路由远离失败或降级的服务器到健康的那些,防止单服务器事件中断rollouts并保持不间断的端到端RL训练。

异步RL训练架构设计

为支持智能体任务的RL,研究者设计了完全异步和解耦的RL基础设施,高效处理长视距智能体rollout并支持跨多样化agent框架的灵活多任务RL训练。采用group-wise policy optimization算法进行RL训练。对于每个问题 x x x,从先前策略 π old \pi_{\text{old}} πold采样 K K K个agent轨迹 { y 1 , . . . , y K } \{y_1,...,y_K\} {y1,...,yK},并使用以下目标优化模型 π θ \pi_\theta πθ

L ( θ ) = E x ∼ D [ 1 K ∑ i = 1 K ( r ( x , y i ) − r ˉ ( x ) ) ] L(\theta) = \mathbb{E}_{x \sim \mathcal{D}}\left[\frac{1}{K} \sum_{i=1}^K (r(x,y_i) - \bar{r}(x))\right] L(θ)=ExD[K1i=1K(r(x,yi)rˉ(x))]

其中 r ˉ ( x ) = 1 K ∑ i = 1 K r ( x , y i ) \bar{r}(x) = \frac{1}{K} \sum_{i=1}^K r(x,y_i) rˉ(x)=K1i=1Kr(x,yi)是采样响应的平均奖励。需要注意的是,只有模型生成的token用于优化,环境反馈在损失计算中被忽略。

由于rollout过程的长尾特性,朴素同步RL训练在rollout阶段引入大量气泡,因为智能体任务的生成严重不平衡,可能导致大量GPU空闲时间。为提高训练吞吐量,研究者采用完全异步训练范式进行Agentic RL以提高GPU利用率和训练效率。

具体而言,将训练引擎和推理引擎解耦到不同的GPU设备上。推理引擎持续生成轨迹。一旦生成的轨迹数量达到预定义阈值,批次被发送到训练引擎以更新模型。为减少策略滞后并保持训练近似on-policy,rollout引擎使用的模型权重定期与训练引擎的权重同步。训练引擎更新模型参数并将新权重推回推理引擎,每 K K K次梯度更新一次。

虽然异步性可以显著提高整体训练效率,但也意味着不同的轨迹可能由不同版本的模型生成,引入严重的离策略问题。由于权重更新考虑不同的优化问题,研究者还在推理引擎的每次权重更新后重置优化器。

基于服务的多任务训练设计

为解决多任务RL中轨迹生成的异构性问题,其中不同任务通常依赖于不同的工具集和任务特定的rollout逻辑,研究者引入基于服务的Multi-Task Rollout Orchestrator用于多任务RL训练。该组件旨在确保slime RL训练框架与多样化下游任务之间的无缝兼容性,通过具有多个注册任务服务的中央编排器实现。

具体而言,每个任务将其自己的rollout和奖励逻辑实现为独立的微服务,并在中央编排器中注册以进行管理和调度。在rollout阶段,中央编排器控制每任务rollout比率和生成速度以实现跨任务的平衡数据收集。关键的是,将所有智能体任务的轨迹标准化为统一的消息列表表示。这支持复杂智能体框架(例如SoftwareEngineering任务)的联合训练,同时还支持异构工作负载的集中式后处理和日志记录。

这种设计将任务特定逻辑与核心训练循环干净地隔离,使其能够与多任务RL训练无缝集成。作为GLM-5训练基础设施的骨干,这个编排器支持超过 1 k 1\text{k} 1k并发rollout,并启用任务采样比率的自动化动态调整以及任务进度的细粒度监控。

异步Agent RL算法

为优化异步训练稳定性,研究者采用多种策略。TITO vs Text-in-Text-out设计确保训练流水线消耗推理引擎产生的精确tokenization和解码token流,避免重新tokenization引入的边界不匹配问题。Direct double-sided importance sampling简化token级重要性采样机制,重用rollout期间生成的对数概率作为直接行为代理,采用双边校准token级掩码策略将信任区域限制在 [ 1 − ϵ ℓ , 1 + ϵ h ] [1-\epsilon_\ell, 1+\epsilon_h] [1ϵ,1+ϵh]范围内。

为过滤掉严重离策略的样本,研究者记录rollout引擎在生成时使用的策略权重版本序列 ( w 0 , . . . , w k ) (w_0,...,w_k) (w0,...,wk),如果最旧的rollout版本过于陈旧(即 w k − w 0 > τ w_k - w_0 \gt \tau wkw0>τ,其中 τ \tau τ是预定义阈值),则丢弃该样本。此外,对于基于分组的采样方法如GRPO,移除失败样本可能导致不完整的分组。此时,如果有效样本数量超过分组大小的一半,则通过重复有效样本来填充分组;否则,丢弃整个分组。

智能体环境扩展

为支持多样化智能体任务的强化学习,研究者构建可验证、可执行的环境,为以代码为中心和内容生成的工作流提供基础反馈。对于智能体编码任务,开发两种环境构建流水线:基于真实世界软件工程问题的环境设置流水线和用于terminal-agent环境的合成流水线。超越编码之外,还引入幻灯片生成环境,其中智能体在结构化HTML上操作,具有可执行渲染和基于布局的验证。

软件工程环境构建流水线基于RepoLaunch框架,从真实世界SWE问题规模化构建可执行环境。该流水线自动分析仓库的安装和依赖设置以构建可执行环境并生成测试命令,然后利用LLM从测试输出生成语言感知的日志解析函数,从而提取Fail-to-Pass(F2P)和Pass-to-Pass(P2P)测试用例。使用此流水线,构建了超过 10 k 10\text{k} 10k个可验证环境,覆盖跨数千个仓库的 9 9 9种编程语言。

长上下文管理策略

对于BrowseComp基准测试,研究者发现性能对judge prompt和judge模型都敏感,开源judge可能引入系统性偏差。为确保一致性和可重现性,使用官方OpenAI评估提示和专有模型o3-mini作为judge来标准化所有基于judge的组件。由于模型在极长上下文(例如超过 100 k 100\text{k} 100ktoken)下性能大幅下降,采用简单的Keep-recent- k k k策略:当交互历史超过阈值 k k k时,早于最近 k k k轮的内容将被折叠以控制上下文长度。

实验中设置 k = 5 k=5 k=5,使GLM-5从 55.3 % 55.3\% 55.3%(w/o keep-recent-k)提升到 62.0 % 62.0\% 62.0%(w/ keep-recent-k)。研究者还发现使用不同的keep recent k k k值或者在上下文长度达到预定义token阈值时触发keep-recent会得到相同结果。基于此,将keep-recent与Discard-all结合形成混合Hierarchical Context Management策略:在使用keep-recent进行推理时,如果总上下文长度超过阈值 T T T,则丢弃整个工具调用历史并以新鲜上下文重新开始,同时继续应用keep-recent策略。

实验洞察

GLM-5在多个基准测试中表现出色,特别是在智能体、推理和编码(ARC)能力方面。在8个智能体、推理和编码基准测试中(Humanity’s Last Exam、SWE-bench Verified、SWE-bench Multilingual、Terminal-Bench 2.0、BrowseComp、MCP-Atlas、 τ 2 \tau^2 τ2-Bench、Vending Bench 2),GLM-5平均比GLM-4.7提升约 20 % 20\% 20%,与Claude Opus 4.5和GPT-5.2(xhigh)相当,优于Gemini 3 Pro。

GLM-5在Artificial Analysis Intelligence Index v4.0上得分50,成为新的开源权重领导者,比GLM-4.7的42分提升8分。这是首次开源权重模型在Artificial Analysis Intelligence Index v4.0上达到50分。在LMArena上,GLM-5再次是Text Arena和Code Arena中的#1开源模型,整体与Claude-Opus-4.5和Gemini-3-pro相当。

推理能力评估

在推理和通用基准测试中,GLM-5在Humanity’s Last Exam(HLE)上取得50.4分(带工具)和30.5分(不带工具),显著优于GLM-4.7的42.8分和24.8分。在HMMT Feb./Nov. 2025基准测试中,GLM-5表现优于Claude Opus 4.5和Gemini 3 Pro。在长上下文推理基准LongBench v2上,GLM-5获得64.5分,仅次于Gemini 3 Pro的68.2分,表现优于Claude Opus 4.5的64.4分。

编码能力评估

在编码基准测试中,GLM-5在SWE-bench Verified上取得77.8分,在SWE-bench Multilingual上取得73.3分,在开源LLM中达到SOTA水平。与专有LLM相比,GLM-5在SWE-bench Verified上表现优于Gemini 3 Pro(76.2分),在SWE-bench Multilingual上也超越了Gemini 3 Pro(65.0分)和GPT-5.2(xhigh)(72.0分)。在Terminal-Bench 2.0上,GLM-5与Claude Opus 4.5表现相当。

在网络安全编码基准CyberGym上,GLM-5取得43.2分,比GLM-4.7的23.5分有显著提升,仅次于Claude Opus 4.5的50.6分。在SWE-rebench 2026年1月的评估中,GLM-5解决率为 42.1 % 42.1\% 42.1%,仅次于Claude Opus 4.6的 52.9 % 52.9\% 52.9%和GPT-5.2(xhigh)的 51.7 % 51.7\% 51.7%

智能体能力评估

在智能体基准测试中,GLM-5在BrowseComp上取得62.0分(无上下文管理)和75.9分(带上下文管理),在前沿LLM中达到SOTA水平。在BrowseComp-ZH上,GLM-5取得72.7分,超越了Claude Opus 4.5的62.4分和Gemini 3 Pro的66.8分。对于三个工具使用智能体任务( τ 2 \tau^2 τ2-Bench、MCP-Atlas和Tool-Decathlon),GLM-5与Claude Opus 4.5表现相当。

GLM-5在Vending-Bench 2上的表现(4,432)进一步展示了其在长时间视距业务任务中的能力,接近Claude Opus 4.5的4,967。在经济场景中,GLM-5在GDPval-AA上表现优于Claude Opus 4.5(1400 vs 1409),仅次于GPT-5.2(xhigh)的1462。

长视距任务评估

研究者使用两个基准测试Vending-Bench 2和CC-Bench-V2来评估GLM-5完成长时间视距任务的能力。Vending-Bench 2是衡量AI模型在长时间视距内运行业务性能的基准测试,模型被要求在模拟环境中运营自动售货机业务一年,并根据最终银行账户余额评分。GLM-5在所有开源模型中排名第一,最终账户余额为$4,432,接近Claude Opus 4.5,展现了强大的长期规划和资源管理能力。

在内部评估套件CC-Bench-V2上,GLM-5在前端、后端和长视距任务上显著优于GLM-4.7,缩小了与Claude Opus 4.5的差距。在前端评估中,GLM-5在React、Vue和HTML三个技术栈上的Check-item Success Rate分别达到 71.0 % 71.0\% 71.0% 77.1 % 77.1\% 77.1% 76.3 % 76.3\% 76.3%,Build Success Rate达到 100 % 100\% 100%(React、Vue、Svelte)和 95 % 95\% 95%(Next.js)。在后端评估中,GLM-5的Pass@1达到 25.8 % 25.8\% 25.8%,与Claude Opus 4.5的 26.9 % 26.9\% 26.9%相当,显著优于GLM-4.7的 19.6 % 19.6\% 19.6%。在长视距评估中,GLM-5在Repo Exploration任务上达到 65.6 % 65.6\% 65.6%,优于Claude Opus 4.5的 64.5 % 64.5\% 64.5%;在Chained Tasks上达到 52.3 % 52.3\% 52.3%,仍低于Claude Opus 4.5的 61.6 % 61.6\% 61.6%

现实世界通用能力评估

除标准化学术基准测试外,研究者还在五个高频用户交互模式相关的现实世界通用能力上评估GLM-5:机器翻译、多语言对话、指令遵循、世界知识和工具调用。对于每种能力,采用内部人工评估、内部自动评估、外部人工评估和外部自动基准测试的组合,确保诊断细粒度和跨模型可比性。

在机器翻译方面,GLM-5在MENT-SNS上达到 1016 1016 1016分,优于GLM-4.7的 993 993 993分。在多语言对话方面,GLM-5在ZMultiTransBench上达到 78.5 78.5 78.5分,优于GLM-4.7的 68 68 68分。在指令遵循方面,GLM-5在IF-badcase上达到 83.2 83.2 83.2分,显著优于GLM-4.7的 61.9 61.9 61.9分。在世界知识方面,GLM-5在SimpleQA Chinese上达到 36.9 36.9 36.9分,优于GLM-4.7的 31.0 31.0 31.0分。在工具调用方面,GLM-5在Toolcall-Badcase上达到 95.8 95.8 95.8分,显著优于GLM-4.7的 60.8 60.8 60.8分。

GLM-5代表了从vibe coding(人类提示)到agentic engineering(AI智能体自主编写代码)的范式转变。通过DSA架构创新、异步RL基础设施和异步Agent RL算法,GLM-5在多个基准测试中达到state-of-the-art水平,特别是在真实世界编码任务中展现出前所未有的能力,超越了以往基线在处理端到端软件工程挑战方面的表现。GLM-5的成功为下一代高效、智能体化通用智能奠定了坚实基础。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值