GLM 5.3 上线 Amazon Bedrock
Introducing GLM 5.3 on Amazon Bedrock
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,目前面向符合条件的企业客户开放。
原文给出了 GLM 5.3 在 Bedrock 上的接入方式、缓存与跨区域推理配置,可据此评估托管部署路径。
编码和智能体工作负载对 AI 模型提出了前所未有的更高要求:重构一个跨越数百个文件的代码仓库,维持数小时不丢失上下文的智能体工作流,并在每一步都借助工具使用来推理复杂的系统问题。以往,要用开放权重模型满足这些需求,就意味着必须自行配置和运维推理基础设施。
来自 Z.ai(智谱 AI)的 GLM 5.3 现已在 Amazon Bedrock 上线。根据 Hugging Face Hub 上发布的信息,GLM 5.3 是一个 753B 参数的混合专家模型,针对编码和长周期智能体任务进行了优化。Z.ai 特别报告称,该模型展现出显著的网络安全能力。在 Amazon Bedrock 上,你现在可以通过全托管 API 使用它,并支持跨区域推理、提示缓存和服务层级。你无需管理任何基础设施。符合条件的的企业客户可以使用 Bedrock 上的 GLM 5.3。
在本文中,我们将向你展示如何使用 OpenAI 兼容 API 在 Amazon Bedrock 上调用 GLM 5.3,并通过提示缓存降低成本和延迟。随后,我们将把该模型投入到一个真实的智能体工作流中:使用 Strix——一个开源 AI 渗透测试智能体——对你自己的应用程序运行一次经授权的安全测试。
与 GLM 5 相比有哪些新变化
GLM 5 于今年早些时候在 Amazon Bedrock 上线。GLM 5.3 延续了同一血脉,并带来了一系列重要提升:
- 更强的编码能力: Z.ai 声称在一系列编码基准测试(包括 DeepSWE、Terminal Bench 3.0 和 FrontierSWE)上具有竞争力。他们还报告称,在其内部编码基准测试上相比 GLM 5.2 提升了 50%。由于改进幅度之大,自 GLM 5.1 发布以来基准测试本身也进行了更新,因此未报告与 GLM 5 的直接对比。
- 涌现出的网络安全能力: 在安全任务上报告的基准测试表现尤为突出,这使该模型天然适合防御性安全工作流。例如,Z.ai 在发布时测得 CyberGym 基准测试中 84.5 的领先分数。
- 更广泛的 Amazon Bedrock 集成: 跨区域推理配置文件、隐式和显式提示缓存,以及 OpenAI 兼容的 Responses 和 Chat Completions API 与 Invoke 和 Converse 之间更好的功能对等性。
关键能力
- 前沿编码与智能体性能。 GLM 5.3 专为复杂系统工程和长周期智能体任务而设计。这些任务包括多步推理、工具增强工作流,以及跨大型代码库的持续上下文。
- 灵活的 API 访问。 你可以通过 OpenAI 兼容的 Responses 和 Chat Completions API,或 Amazon Bedrock 的 Invoke 和 Converse API 调用 GLM 5.3。
- 提示缓存。 GLM 5.3 默认支持隐式(自动)提示缓存,并在 Responses 和 Chat Completions API 上支持显式缓存控制(推荐使用)。对于每轮都重新发送大型系统提示或仓库上下文的智能体工作负载,缓存可同时降低延迟和输入成本。
- 跨区域推理。 GLM 5.3 可通过美国跨区域推理(
us.zai.glm-5.3)和全球跨区域推理(global.zai.glm-5.3)配置文件使用。您将请求发送到您选择的“源”AWS 区域,Amazon Bedrock 会安全地路由每个请求进行处理。有关更多详细信息,请参阅 Amazon Bedrock 用户指南。 - 服务层级。 选择 Flex 可为对时间不太敏感的工作负载优化成本,选择 Priority 可优先处理对延迟敏感的请求,但价格更高,或者选择 Standard 以获得价格与速度之间的默认平衡。
先决条件
对于以下使用示例,您需要:
- 一个有权访问 Amazon Bedrock 的 AWS 账户。
- 调用基础模型和目标推理配置文件所需的 AWS Identity and Access Management (IAM) 权限:
bedrock:InvokeModel、bedrock:InvokeModelWithResponseStream和bedrock:CallWithBearerToken。 - (对于基于代码的演示)Python 3.10 或更高版本。
- (仅对于可选的安全测试演示)安装 Docker 和带有 bedrock extra 的 Strix。
在 Amazon Bedrock 控制台上试用 GLM 5.3
您可以直接在 AWS 管理控制台上开始向 GLM 5.3 发送提示,无需编写代码或安装开发人员工具。要开始使用,请导航到 Amazon Bedrock,然后从左侧边栏菜单中选择 Test > Playground。
在此 playground 界面中,您可以从模型列表中选择 GLM 5.3,并通过聊天 UI 发送您的第一个提示,如下面的屏幕截图所示:
图 1:在 Amazon Bedrock 控制台上与 GLM 5.3 聊天
开始使用 Responses API
在编程方面,您可以通过 bedrock-runtime 端点调用该模型。这支持 OpenAI 兼容的 Responses 和 Chat Completions API,以及适用于 GLM 5.3 的 Amazon Bedrock Invoke 和 Converse API。对于新应用程序,建议使用 OpenAI 兼容的 API,因为它们支持更完整的功能集。
Amazon Bedrock 确实支持为需要它们的 OpenAI 兼容集成生成 API 密钥。但是,我们强烈建议尽可能优先使用短期凭证,而不是长期 API 密钥。
在以下示例中,我们将使用 OpenAI Python SDK 从 Python 调用 Responses API,并使用 aws-bedrock-token-generator 库从您的标准 AWS 命令行界面 (AWS CLI) 凭证生成短期令牌。
- Install the required packages.
pip install -U openai aws-bedrock-token-generator - Save the following code as
bedrock-request.py.from aws_bedrock_token_generator import provide_token from openai import OpenAI region = "us-west-2" # Your source AWS Region client = OpenAI( api_key=provide_token(region=region), base_url=f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1", ) resp = client.responses.create( input="Refactor this Python function to be iterative instead of recursive: ...", model="global.zai.glm-5.3", ) print(resp.output_text) - Run the script, which will display the model’s output.
python bedrock-request.py
使用显式提示缓存优化推理
长时间运行的编码和知识工作流通常会在多个对话轮次中重新发送稳定的上下文,例如系统提示、工具定义或存储库文件。
Amazon Bedrock 上的 GLM 5.3 默认支持隐式提示缓存,这有助于降低共享相同初始提示前缀的重复调用的响应延迟和输入令牌成本。
使用显式提示缓存模式,您可以明确标识可复用的提示前缀,与隐式缓存相比,这可以进一步提高缓存命中率(从而进一步节省延迟和成本)。
要将显式提示缓存与 GLM 5.3 一起使用,如下例所示:
- 在您的请求中通过
prompt_cache_options选择显式缓存模式。 - 在输入内容块上添加一个或多个
prompt_cache_breakpoint标记,以指示可复用提示前缀的结束(包含)。每个断点必须包含至少 1,024 个令牌才有资格进行缓存。
resp = client.responses.create(
model="global.zai.glm-5.3",
# Enable explicit caching mode:
extra_body={"prompt_cache_options": {"mode": "explicit"}},
input=[
{
"type": "message",
"role": "system",
"content": [
{
"type": "input_text",
"text": SYSTEM_PROMPT,
# A long, static system prompt is a great target for caching:
"prompt_cache_breakpoint": {"mode": "explicit"},
},
]
},
{
"type": "message",
"role": "user",
"content": [
{
"type": "input_text",
"text": USER_INPUT,
# Multiple breakpoints can also be defined, for layered cache:
"prompt_cache_breakpoint": {"mode": "explicit"},
},
],
},
],
)
if resp.usage.input_tokens_details.cached_tokens:
print("Hit cache!")有关更多信息,请参阅 Amazon Bedrock 用户指南的提示缓存部分。
示例代理工作负载:使用 Strix 进行授权安全测试
有一类工作负载可以直接受益于 GLM 5.3 的优势,那就是对自有应用程序进行自动化安全测试。Strix 是一个开源 AI 渗透测试代理,它可以动态运行你的代码、发现漏洞,并通过概念验证测试来验证这些漏洞。截至本文撰写时,Strix 文档使用 GLM 5.3 作为其默认模型。你可以将 Strix 配置为在 Amazon Bedrock 上使用 GLM 5.3,而不是第三方推理提供商,这样模型推理就在你的 AWS 账户控制下运行。
只能测试你拥有或已获得明确书面许可进行测试的应用程序。 在大多数司法管辖区,未经授权对你并不拥有的系统进行安全测试是违法的,并且违反 AWS 可接受使用政策。在本演练中,目标是 OWASP Juice Shop,这是一个故意存在漏洞的示例应用程序,在你的机器上本地运行。
如果你希望获得完全托管的持续安全测试,而不仅仅是你自己运行开源代理,AWS Continuum 以托管服务的形式提供按需渗透测试和其他安全分析。这两种方法互为补充:像 Strix 这样的开源代理让你能够针对本地构建进行开发者驱动、人在环中且高度可定制的测试,而 AWS Continuum 则大规模运行托管评估。
运行授权安全测试
- Start the example Juice Shop target application locally.
docker run --rm -p 3000:3000 bkimminich/juice-shop - Configure Strix to use GLM 5.3 on Amazon Bedrock. Strix uses LiteLLM under the hood so (as described in their documentation for Amazon Bedrock) your AWS CLI credentials will be picked up automatically. This means no API key is required, but you might want to set environment variables like
AWS_PROFILEandAWS_REGIONto configure your connection. At the time of writing, LiteLLM does not yet resolvebedrock/global.zai.glm-5.3. Until this is fixed, you can explicitly specify the Converse API route and the inference profile Amazon Resource Name (ARN) as shown in the following snippet:# Fill in the REGION and ACCOUNT_ID placeholders below before running! export STRIX_LLM="bedrock/converse/arn:aws:bedrock:{AWS_REGION}:{AWS_ACCOUNT_ID}:inference-profile/global.zai.glm-5.3" - Run Strix against the local target.
strix --target http://localhost:3000 - 等待根 Strix 代理完成,然后查看发现结果。
Strix 会启动一个子代理团队,绘制威胁面、探索一系列潜在漏洞类别,并尝试用可工作的概念验证来验证每个发现。这有助于最大限度地减少花在分类误报上的时间。一次成功的运行将生成一份报告,其中包括每个发现的严重性、证据和修复指导。
以下视频展示了针对示例应用程序设置和运行 Strix 并探索结果的端到端过程:
图 2:使用 GLM 5.3 和 Strix 运行示例安全测试
清理
在运行 Juice Shop 容器的终端中按 Ctrl+C 停止它,或者运行 docker ps 查找容器 ID,然后用 docker stop <container-id> 停止它。Amazon Bedrock 推理按令牌付费,没有持久资源,因此你的请求完成后不会产生进一步费用。如果你为本演练生成了 Amazon Bedrock API 密钥并且不再需要它,请在 Amazon Bedrock 控制台上将其删除。
可用性
在 Amazon Bedrock 控制台上试用 GLM 5.3,通过 OpenCode 等编码助手使用它(如我们最近关于 Kimi K3 的文章所示),或者通过支持的 API 连接你的自定义应用程序。
有兴趣了解 Amazon Bedrock 如何为你的团队提供支持吗? 联系我们 开始对话。
关于作者

Alex Thewsey
Alex 是 AWS 驻新加坡的 AI 专家解决方案架构师。他专注于开源技术和开放权重模型如何帮助世界各地的客户构建创新的 AI 解决方案并应对 AI 治理挑战。
来源:AWS Machine Learning Blog · aws.amazon.com