LangSmith LLM Gateway 公测:为生产智能体提供运行时管控
LangSmith LLM Gateway: Runtime Controls for Agents
LangChain 宣布 LangSmith LLM Gateway 进入公开测试,作为位于智能体与模型之间的集中治理层,统一执行成本上限、限流、模型回退和敏感数据处理。
LangChain 把成本上限、限流、模型回退和数据脱敏收进一层网关,读者可据此判断生产级智能体的治理方式。
LangSmith LLM Gateway 现已开放公开测试版。
生产环境中的智能体需要对模型调用进行运行时控制,以避免成本超支和中断等不良后果。支出上限、速率限制、模型回退和敏感数据保护都是重要的控制措施,但如果没有合适的工具,工程师就必须针对特定模型提供商在每个智能体内手动编写这些控制逻辑。
这就是我们构建 LangSmith LLM Gateway 的原因。它是位于你的智能体与其调用的模型之间的中央治理层,专为智能体工程团队在生产环境中所需的控制而设计。LLM Gateway 为团队提供一个统一的位置,跨智能体、模型和提供商实施运行时控制,帮助他们一致地治理模型使用,同时避免供应商锁定。

为什么智能体需要集中式治理层
在生产环境中,模型层可能很快成为代价高昂的错误和面向客户中断的根源。以下是实际中的情形:你的模型提供商发生了中断,现在你的客服智能体返回错误,导致客户不满和收入损失。或者你的编码智能体整夜陷入重试循环,到早上它已经发起了 10,000 次 LLM 调用,而你收到了一张四位数的账单。
在这些情况下,事后了解发生了什么是不够的。你需要在违规发生之前就执行策略。但如果控制逻辑嵌入在每个智能体的代码中,每新增一个智能体和模型提供商就会增加一条需要维护的实现路径。模型网关让团队可以一次定义策略,然后跨模型和智能体一致地执行。
LLM Gateway 控制功能
LLM Gateway 提供了团队在智能体进入生产环境时首先需要的控制功能:成本控制、速率限制、模型回退和敏感数据处理。
避免成本超支: LLM Gateway 让你在 LLM 支出成为问题之前,对内部和外部用户的支出进行监控和控制。你可以设置限时上限,并在四个层级跟踪支出:
- 组织层级 — 用于全公司范围的控制
- 工作空间层级 — 让团队保持在支出限额内
- API 密钥层级 — 适用于控制特定项目的支出
- 用户层级 — 用于个人支出控制
当达到上限时,智能体会收到带有明确错误的 402 响应。

限制失控流量:在组织、工作空间、用户和 API 密钥层级应用速率限制,以防止意外滥用或流量峰值压垮提供商限制,并降低其他智能体或团队的可靠性。
针对每个客户的支出和速率限制策略:对于多租户环境和经销商,LLM Gateway 让你无需为客户使用单独的 API 密钥即可实现客户级控制。使用自定义请求头来标识每个最终客户或团队,然后执行单独的支出上限和速率限制,同时通过一个 API 密钥路由所有 LLM 调用。你可以从一个地方更新限额并查看各客户的支出,而无需自己构建和维护该逻辑。
提升智能体可靠性:跨模型和主机定义回退规则,然后对所有应用执行这些规则。当某个提供商宕机、受到速率限制或不可用时,智能体可以路由到另一个模型,而无需在每个应用中编写自定义回退逻辑。
减少敏感数据暴露:在请求到达模型提供商之前,检测、脱敏并替换其中的 PII 和密钥。LLM Gateway 还会对其记录在 LangSmith 中的追踪数据里的敏感信息进行脱敏。目前,此功能仅面向 Enterprise 套餐用户提供。
在 LangSmith 中追踪 LLM Gateway 事件:Gateway 事件会作为元数据记录在 LangSmith 追踪中,因此你可以监控各项管控措施在生产流量中的表现。当某个请求被支出限额、速率限制或其他管控措施拦截时,你可以打开该追踪,查看上下文中的具体情况,并判断是否需要做出调整。
保留模型选择
LLM Gateway 提供单一接口,用于在你的智能体与模型提供商之间路由调用。它支持主流提供商,如 OpenAI、Anthropic 和 Fireworks,也支持使用 OpenAI 或 Anthropic 兼容端点的自定义模型。
LangSmith Gateway 以 BYOK 为先。你可以自带提供商密钥,并使用 LLM Gateway 进行路由、治理和策略管控,而无需为每次 LLM 调用添加额外的埋点。对于希望简化采购流程或更快开始构建智能体的团队,Gateway 还支持由 Fireworks 提供支持的开放模型托管推理,可直接通过 LangSmith 使用 Gateway Credits 访问。Fireworks 为开放模型提供快速、高效的推理,帮助团队通过 LangSmith LLM Gateway 将其投入生产。

我们相信开放权重模型很重要,因为它们让团队对 AI 系统拥有更多控制权。它们让团队能够灵活地针对成本、质量、延迟、隐私和部署需求进行优化,并围绕自身业务的具体情况进行模型调优。Gateway 正是我们让开放模型更易于在生产环境中采用的方式之一。
Open models are already delivering the performance teams need for production AI. The next step is making them easier to adopt in agent workflows, where teams need control over cost, latency, and governance. Fireworks makes open model inference fast, efficient, and reliable at scale, and we’re excited to partner with LangChain on LangSmith LLM Gateway to help teams bring that performance into production.Lin Qiao,Fireworks CEO
团队如何在生产环境中使用 LLM Gateway
团队已经在使用 LLM Gateway 为生产环境中的智能体设置硬性限制和共享管控。一些常见模式包括:需要支出上限的面向公众的智能体,以及需要集中计费、用量追踪和按客户限制的多客户智能体。
LLM Gateway 帮助我们为 Deep Agents 集中了计费和成本追踪,让我们能够了解每个客户的使用情况和限制。集成过程很直接,为我们提供了扩展智能体所需的可观测性。
Sean Rich,Blueberry AI 联合创始人兼 CTO
每个生产环境中的智能体都需要硬性支出上限,尤其是面向公众的智能体,而 LLM Gateway 通过确保成本永远不会超过我们设定的限制,消除了这一风险。现在我们可以和客户坐下来,就支出及其支持的其他策略达成一致,并在几次点击内完成全部配置。
Hylke Sybesma,Friday Digital Agency AI 工程师
开始使用 LLM Gateway
你可以直接通过 API 调用 LLM Gateway,或将其与编码工具(如 Claude Code、Codex 和 Deep Agents Code(dcode))配合使用。
要开始使用,请将你的智能体指向 LangSmith Gateway 端点,使用你的 LangSmith API 密钥进行身份验证,并将你的提供商 API 密钥添加到工作区密钥中。然后,配置你的管控措施,包括回退、速率限制、支出限制和敏感数据处理。更新你的 base_url,其余代码保持不变。
LLM Gateway 的下一步方向
我们从团队最常见的需求出发,为 LLM Gateway 配备了相应的管控功能。接下来,我们将在此基础上继续扩展,提供更多在生产环境中治理模型调用的方式。
- 更广泛的护栏 —— 为代理调用外部模型并与生产系统交互所带来的风险提供更全面的覆盖。
- CI/CD 管控 —— 用于部署提示词和上下文、运行 A/B 测试、管理蓝绿部署和影子部署,以及通过基础设施即代码定义管控的工具。
立即试用
LLM Gateway 现已面向 Plus 和 Enterprise 套餐开放公开测试版。
登录 LangSmith 或注册后,在侧边栏中选择“LLM Gateway”即可开始使用。你可以在我们的文档中找到设置详情。
Enterprise 套餐用户可在此申请访问数据保护管控功能。
来源:LangChain Blog · langchain.com