Modal 上线 GLM-5.1 免费端点并给出自部署方案
Try GLM-5.1, the new frontier of open intelligence, on Modal
Modal 宣布其免费端点已升级为 Z.ai 新发布的 GLM-5.1,此前 GLM-5 是面向长周期智能体和系统工程的开源权重基础模型,采用 MIT 许可。Modal 与 Z.ai 在公开发布前合作测试,并给出在单节点 8 张 B200 上用 SGLang 部署 GLM-5 的可复现代码,内部实测每用户每秒 30 至 75 token。
Modal 与 Z.ai 合作给出 GLM-5 的部署参数和免费端点,读者可据此判断自托管与接入现有编码智能体的成本。
更新 2026-04-07:今天,Z.ai 发布了 GLM-5.1,再次刷新了开放权重智能的最先进水平。我们的免费端点已升级以提供这个新版本。
今天 Z.ai 发布了 GLM-5,这是一个前沿的开放权重基础语言模型,专为长时程智能体和系统工程而设计。
Modal 研究团队在公开发布之前就与 Z.ai 合作,以便我们能在自己的基础设施上试驾该模型。它令人愉悦、聪明且快速。在内部,我们已将其加入我们最喜欢的 AI 前端:Vercel AI SDK、Claude Code、OpenCode 和 OpenClaw。
现在你也可以了:免费试用!
为什么这很重要?
如果你还没注意到,软件工程师已经正式被自动化取代而失业了;我们现在都是提示词工程师了。
嗯,也不完全是。但在过去两个月里,氛围编程发生了一次氛围转变,从 Linus Torvalds(Linux)到 dhh(Ruby on Rails)这些严肃、有品味的资深工程师,都越来越多地拥抱用智能体编程。就连 George Hotz 也称智能体编程“还行”。
缺失的一环是模型质量。每一代新的前沿模型都支持一个新的、更雄心勃勃的应用,从GPT-3 模型的早期标签补全(code-davinci-002 安息)到GPT-3.5/Claude 2 的聊天助手副驾驶,再到GPT-4/Claude 3 的简单应用开发。如今,有了 Claude Opus 4.6 和 GPT 5.3 Codex,前沿模型支持长时程任务,比如复杂系统的开发和改进。如果你不信,就去问问你那位整天泡在网上、对 Claude Code 和 ClawdeBot moltbot OpenClaw 喋喋不休的朋友。
和以往一样,这个新的应用领域是由专有模型开创的——这些模型的权重不在 开源促进会批准的许可证(如 MIT 或 Apache)下提供。但自 DeepSeek 划时代地发布 DeepSeek-R1 以来,开放模型一直没有落后太远。如今,GLM-5 在性能上匹配了上个月发布的专有模型,并以 MIT 许可证提供。
关于上述基准测试及更多细节,请参阅 Z.ai 的博客文章。
我如何运行 GLM-5?
我们曾深入撰文介绍 LLM 推理的性能特征,但这里我们快速梳理一下运行 GLM-5 的核心考量。在八位浮点精度下,GLM-5 重约 700 GB。这比市场上任何单块 GPU 的 HBM 都要大,因此必须部署到多块 GPU 上以避免性能暴跌。像大多数大型模型一样,它在 MLP 块的矩阵乘法中使用专家混合(MoE)稀疏性,以减少对内存带宽的需求。DeepSeek 稀疏注意力的一个变体通过一个轻量级、数据依赖的过滤层(“索引器”)快速过滤掉除几千个过去 token 之外的所有内容,从而控制注意力机制随序列长度呈惩罚性二次方增长的问题。我们最终确定在 MoE 层使用张量并行(采用 DeepSeek 的 DeepGemm 内核),在注意力层使用数据并行(采用 DeepSeek 的 FlashMLA 内核)来运行它。
借助 vLLM 和 SGLang 等高质量开源推理引擎,任何能获得合适硬件的工程师都可以自行托管该模型,并以出色的单用户延迟支持长时程智能体和系统工程任务。我们一直在内部运行该模型,每用户交互速度在每秒 30 到 75 个 token 之间(取决于副本负载和推测器命中率)。
在撰写本文时,让 GLM-5 运行起来需要打几个补丁,我们在此处记录了可复现的部署代码。该代码在我们的云平台上使用 SGLang 在单节点八块 B200 上部署 GLM-5。我们预计后续会快速跟进,以稳定支持并提升性能,包括整合我们在Flash Attention 4 推理优化路径上的工作。
如何使用 GLM-5?
为了支持所有想试用 GLM-5 的人,我们发布了一个端点,你可以将其连接到最喜欢的 AI 前端。而且它是免费的!从现在起直到四月底。你可以在此处生成凭证并开始使用。
使用限制为单个并发请求。token 没有直接限制——请求数才是真正重要的!我们发现这很好地对应了编码智能体的“个人使用”:一个或几个活跃的客户端线程,每个线程可能跨越数千个 token。
这是我们首次在示例自部署代码之外还发布端点。Modal Research 团队在这方面还会有更多动作。
有生产用例?请联系 [email protected] 讨论更高的速率限制,或获取关于在 Modal 上部署你自己的 GLM-5 端点的指导。
下面,我们记录如何将我们的 GLM-5 端点与各种前端框架集成。我们运行的是 OpenAI API 兼容服务器,因此集成路径通常通过你的框架对该 API 的支持来实现。
如何将 GLM-5 与 OpenCode 一起使用?
我们非常喜欢 OpenCode 编码智能体框架。它易于配置、与其他工具广泛兼容,并且高度可扩展。
一旦你为 Modal GLM-5 端点创建了令牌,只需在 opencode.json 配置文件中将 Modal 添加为 provider,如下方示例所示。你可以在此处找到文档。
如果你想扩展你的 OpenCode 智能体,试试将它们部署到 Modal Sandbox 上。你保留 HTTP API 以及易用的 Web 和终端 UI,但获得超快自动扩缩容的云基础设施。这就是为什么 Ramp 用 OpenCode 在 Modal Sandboxes 上构建了他们的 Inspect 后台编码智能体。
如何将 GLM-5 与 OpenClaw 一起使用?
目前最火的智能体框架是 OpenClaw,它广泛地将 LLM API 与工具、知识源和技能集成在一起。如果你觉得 --dangerously-skip-permissions 很吓人,那你还没见过更厉害的呢!
OpenClaw 通过在 openclaw.json 中定义的模型提供者的 api 键的 openai-completions 设置,支持 OpenAI API 兼容的提供者。
从下面的片段中复制 modal 键和值,将其添加到你的 openclaw.json,然后在环境中以 LLM_BACKEND_API_KEY 下的 token 启动 OpenClaw 服务器。或者直接将其粘贴到你的 OpenClaw UI 中,让智能体自己想办法;这更符合其精神。
如何将 GLM-5 与 Claude Code 一起使用?
Claude Code 不像其他前端智能体框架那样开放。它与 Anthropic 的专有后端产品紧密集成。
不过,你可以使用 LiteLLM 网关进行代理,在 Claude Code 客户端与像我们这样兼容 OpenAI API 的端点之间转发请求。我们在这里演示了如何在 Modal 上部署这样的代理。
如何在 Vercel AI SDK 中使用 GLM-5?
Vercel AI SDK 是用于 LLM API 的 JavaScript 应用程序的关键库。例如,OpenCode 通过委托给 Vercel AI SDK 来支持兼容 OpenAI 的 API。
在你为 Modal GLM-5 端点创建令牌后,可以在创建 OpenAICompatible 提供程序时将其作为 apiKey 提供。
在创建 chatModel 时,你还需要包含模型名称:
像任何优秀的全栈 JavaScript 框架一样,Vercel AI SDK 有两个组件:用于逻辑的 Core 库和用于前端的 UI 库。
你可以在这里找到将 Modal 托管的 LLM 与 Vercel AI SDK Core 集成的最小示例。我们在调试 LLM 后端时喜欢使用它,因为你可以保留大量的控制权和可观测性,同时仍然针对一个在 TUI 等更难调试的应用程序中使用的接口进行开发。
你可以在这个示例 React 应用程序中找到将 Modal 托管的 LLM 与 AI SDK 的 UI 元素进行更完整集成的示例。
来源:Modal Blog · modal.com