180.7K 1个月前

来自 Z.ai 的强大推理和代理模型,总参数 744B(活跃 40B),专为复杂系统工程和长时效任务而构建。

工具 思考
ollama run glm-5:cloud

应用

Claude Code
Claude Code ollama launch claude --model glm-5:cloud
Codex
Codex ollama launch codex --model glm-5:cloud
OpenCode
OpenCode ollama launch opencode --model glm-5:cloud
OpenClaw
OpenClaw ollama launch openclaw --model glm-5:cloud

1 个模型

glm-5:cloud

198K 上下文窗口 · 文本 · 1个月前

自述文件

GLM-5 是来自 Z.ai 的混合专家(MoE)模型,总参数量为 744B,激活参数量为 40B。它在 GLM-4.5 的 355B 参数基础上进行了扩展,专为复杂的推理、编码和智能体(Agent)任务而设计。

该模型采用深度求索稀疏注意力机制(DSA)以降低部署成本,同时保持长上下文处理能力,并使用一种新型异步强化学习架构进行训练后处理,以提高训练效率。

核心能力

  • 推理与数学:在 AIME 2026 I 上得分 92.7%,在 GPQA-Diamond 上得分 86.0%
  • 编码:在 SWE-bench Verified 上达到 77.8%,在 SWE-bench Multilingual 上达到 73.3%
  • 智能体任务:在 BrowseComp 上得分 62.0,在 Terminal-Bench 2.0 上得分 56.2
  • 长上下文:通过 DSA 优化支持高达 128K+ 的上下文
  • 多语言:支持英语和中文

基准测试

脚注

  • 人类终极考试(HLE)及其他推理任务:我们评估时设置最大生成长度为 131,072 个 token(temperature=1.0, top_p=0.95, max_new_tokens=131072)。默认情况下,我们报告纯文本子集的结果;标记有 * 的结果来自完整数据集。我们使用 GPT-5.2(中等)作为判别模型。对于 HLE-with-tools,我们使用 202,752 个 token 的最大上下文长度。
  • SWE-bench & SWE-bench Multilingual:我们使用 OpenHands 配合定制的指令提示词运行 SWE-bench 套件。设置:temperature=0.7, top_p=0.95, max_new_tokens=16384,上下文窗口为 200K。
  • BrowserComp:在没有上下文管理的情况下,我们保留最近 5 轮的详细信息。在使用上下文管理时,我们采用与 DeepSeek-v3.2 和 Kimi K2.5 相同的丢弃全部(discard-all)策略。
  • Terminal-Bench 2.0 (Terminus 2):我们使用 Terminus 框架进行评估,设置 timeout=2h, temperature=0.7, top_p=1.0, max_new_tokens=8192,上下文窗口为 128K。资源限制上限为 16 个 CPU 和 32 GB 内存。
  • Terminal-Bench 2.0 (Claude Code):我们使用 Claude Code 2.1.14(思维模式,默认努力程度)进行评估,设置 temperature=1.0, top_p=0.95, max_new_tokens=65536。由于生成速度原因,我们取消了挂钟时间限制,但保留了每个任务的 CPU 和内存限制。得分为 5 次运行的平均值。我们修复了由 Claude Code 引起的环境问题,并报告了在已验证的 Terminal-Bench 2.0 数据集上的结果,该数据集解决了模棱两可的指令(详见:https://hugging-face.cn/datasets/zai-org/terminal-bench-2-verified)。
  • CyberGym:我们使用 Claude Code 2.1.18(思维模式,无 Web 工具)进行评估,设置 temperature=1.0, top_p=1.0, max_new_tokens=32000,每个任务超时限制为 250 分钟。结果为 1,507 个任务上的单次运行 Pass@1 指标。
  • MCP-Atlas:所有模型均在思维模式下对 500 个任务的公共子集进行评估,每个任务超时限制为 10 分钟。我们使用 Gemini 3 Pro 作为判别模型。
  • τ²-bench:我们在零售(Retail)和电信(Telecom)领域添加了少量提示词调整,以避免因用户过早终止导致的失败。对于航空(Airline)领域,我们应用了 Claude Opus 4.5 系统卡中提出的领域修复建议。
  • Vending Bench 2:由 Andon Labs 独立进行运行评估。

支持的语言

  • 英语
  • 中文

许可协议

MIT 协议

参考