智谱AI/GLM-4.6-FP8
模型介绍
文件和版本
Pull Requests
讨论
分析

GLM-4.6-FP8

👋 加入我们的 Discord 社区。
📖 查阅 GLM-4.6 技术博客、技术报告(GLM-4.5)以及 智谱AI技术文档。
📍 在 Z.ai API平台使用 GLM-4.6 API 服务。
👉 一键访问 GLM-4.6。

模型介绍

与 GLM-4.5 相比,GLM-4.6 带来了多项关键改进:

  • 更长上下文窗口:上下文窗口从 128K tokens 扩展至 200K tokens,使模型能够处理更复杂的智能体任务。
  • 卓越的编码性能:模型在代码基准测试中取得更高分数,并在 Claude Code、Cline、Roo Code 和 Kilo Code 等实际应用场景中表现更优,包括生成视觉精美的前端页面方面的改进。
  • 高级推理能力:GLM-4.6 在推理性能上有明显提升,并支持推理过程中的工具使用,整体能力更强。
  • 更强大的智能体:GLM-4.6 在工具使用和基于搜索的智能体方面表现更出色,并能更有效地集成到智能体框架中。
  • 优化的写作能力:在风格和可读性上更贴合人类偏好,在角色扮演场景中表现更自然。

我们在涵盖智能体、推理和编码的八个公开基准测试中对 GLM-4.6 进行了评估。结果显示,GLM-4.6 相较于 GLM-4.5 有显著提升,并且与 DeepSeek-V3.1-Terminus 和 Claude Sonnet 4 等国内外领先模型相比也具有竞争优势。

bench

推理

GLM-4.5 与 GLM-4.6 采用相同的推理方法。

更多详细信息可查看我们的 github。

推荐评估参数

对于通用评估,我们建议使用采样温度 1.0。

对于代码相关评估任务(如 LCB),进一步建议设置:

  • top_p = 0.95
  • top_k = 40

评估

  • 工具集成推理相关内容,请参考 此文档。
  • 针对搜索基准测试,我们在思考模式下为搜索工具调用设计了特定格式以支持搜索智能体,详细模板请参考 此文件。