vLLM Semantic Router v0.3 Themis 发布:语义路由进入有状态生产阶段
vLLM Semantic Router v0.3 Themis: From Signals to Stateful Production Routing
vLLM Semantic Router 发布 v0.3 版本,代号 Themis,将语义路由变为有状态、可观测、面向生产流量的能力。该版本引入统一的 v0.3 配置契约,把信号、投影、决策、算法、模型串成一条可检查的路由链路,并新增会话感知智能体路由(SAAR)、投影机制、Anthropic 协议兼容以及面向运维的 Dashboard。
vLLM Semantic Router v0.3 把语义路由从单点能力收敛为可观测、可回放的生产控制面,读者可据此判断路由层如何落地。
vLLM Semantic Router v0.3,代号 Themis,在这里语义路由变得有状态、可观测,并能为真实 AI 流量投入生产使用。
前两个版本奠定了基础。Iris 让路由决策可组合。Athena 重建了模型基础,并将路由器扩展到记忆、安全、模型选择、长上下文信号处理、OpenClaw 编排和 AMD ROCm 部署。Themis 迈出下一步:它让这些能力更易于操作、更易于检查,也更难以被误用。
自 v0.2.0 以来,项目在路由器核心、CLI、仪表盘、DSL、Kubernetes、协议兼容性、模型选择、安全、回放和发布就绪方面新增了超过 350 次提交。v0.3 的最大价值不在于单个功能,而在于将这些部分汇聚成一个稳定的契约:
信号成为投影,投影供给决策,决策选择算法,算法选择模型。
这一契约现在一致地体现在路由器、CLI、仪表盘、DSL、Helm chart 以及面向运维的部署界面中。

为什么是 Themis?
Themis 代表秩序、规则和判断。这是本次发布的正确象征。
语义路由只有在运维人员能够回答基本问题时,才能在生产中发挥作用:
- 哪些信号被触发?
- 哪个决策被匹配?
- 运行了哪个模型选择算法?
- 选择了哪个模型?
- 哪个安全或回放插件改变了路径?
- 哪个配置版本产生了此行为?
- 同一策略能否在本地、通过仪表盘和在 Kubernetes 中部署,而不会变成三个不同的系统?
Themis 旨在让这些答案变得明确。v0.3 保留了 Athena 的雄心,但围绕运行时、API 表面和运维工作流设置了更强的边界。

v0.3 Themis 有哪些新内容?
1. 规范的 v0.3 配置契约
Themis 最重要的变化是新的规范配置形态:
version: v0.3
listeners: []
providers: {}
routing: {}
global: {}在 v0.3 之前,用户可能会在本地 Docker、仪表盘生成的配置、Helm values、CRD、示例和旧文档中遇到重叠的布局。Themis 使 config.yaml 成为稳态文件,并让系统在各处围绕相同的顶层架构对齐。
这一清理也移除了 vllm-sr init。新流程更简单:
- 在空目录中使用
vllm-sr serve进行仪表盘优先设置 - 直接编写规范的
config.yaml用于 YAML 优先工作流 - 使用
vllm-sr config migrate --config old-config.yaml迁移旧文件 - 使用
vllm-sr config import导入支持的提供商清单
这是一个破坏性变更,但对于 1.0 之前的路由器来说,这是正确的破坏性变更:更少的配置方言、更清晰的所有权,以及更持久的公共契约。
配置路径在边缘处也更加严格。v0.3 对未知 YAML 字段发出警告,保持规范配置加载的测试覆盖,使 Python CLI 模型与现代 Pydantic 配置对齐,并更明确地控制分类器资产。目标很简单:拼写错误和过时的配置形态应在变成静默路由漂移之前被捕获。

2. 信号、投影、决策、算法、模型
Themis 使路由器的思维模型更加明确:
| 层 | 它拥有什么 |
|---|---|
| 信号 | 从请求、响应、工具、语言、领域、上下文、模态、身份或安全分类器中提取证据 |
| 投影 | 将原始证据规范化为策略就绪的概念,如验证、紧迫性、反馈或平衡 |
| 决策 | 将命名的路由策略与优先级和可解释条件进行匹配 |
| 算法 | 在匹配的决策内从候选模型中进行选择 |
| 模型 | 通过选定的后端别名或提供方为请求提供服务 |
这很重要,因为 v0.3 增加了足够多的路由智能,隐式行为不再可接受。路由器现在拥有更丰富的信号族、投影轨迹、高级模型选择算法和响应侧插件。Themis 让这些表面保持可编程,而不会将路由策略变成隐藏的应用程序代码。
当前的信号目录足够广泛,不仅可以描述最新的用户提示,还可以描述安全态势、工具循环、用户角色、多模态意图、对话形态、结构化事件和可重放的知识库证据:
| 信号族 | 它捕获的内容 | 典型用途 |
|---|---|---|
authz | 来自用户或群组上下文的角色和主体绑定 | 高级/管理员路由、策略门控模型 |
complexity | 来自学习或组合信号的推理难度 | 升级困难综合和多步推理 |
context | 估计的上下文窗口需求 | 长上下文路由、成本和延迟决策 |
conversation | 消息和工具循环形态 | 多轮、活跃工具使用、开发者消息、大量非用户上下文 |
domain | 学习或配置的领域标签 | 业务、法律、健康、计算机科学路由 |
embedding | 与候选锚点的语义相似度,包括文本/图像/音频查询模态 | 支持意图、临床意图、多模态请求匹配 |
event | 结构化事件元数据、严重性、操作代码和时间紧迫性 | 事件、支付、审计或运营事件路由 |
fact_check | 请求是否需要事实核查 | 升级法律、医疗或事实性声明 |
jailbreak | 提示注入和越狱证据,包括历史感知扫描 | 安全路由和响应侧护栏 |
kb | 知识库组或标签匹配 | 隐私策略、遏制、前沿推理、本地标准路由 |
keyword | 字面、模糊、BM25 或 n-gram 关键词证据 | 快速路由守卫、紧急关键词、敏感术语 |
language | 检测到的语言及可配置的置信度 | 区域感知路由和多语言模型选择 |
modality | AR、扩散或混合文本/图像执行需求 | 选择纯文本、图像生成或多模态路径 |
pii | 敏感实体策略,包括历史感知扫描 | 脱敏、拒绝/允许决策、隐私路由 |
preference | 用户风格或行为偏好示例 | 简洁回答、详细回答、领域特定风格 |
reask | 重复或改述的用户轮次 | 检测先前轮次中可能的不满 |
structure | 正则表达式、计数、序列或密度特征 | 大量问题、编号工作流、格式密集型提示 |
user_feedback | 用户表示答案有误或需要澄清 | 从不满中恢复或路由到更强的模型 |
投影输出以 type: projection 引用,但它们是派生的路由表面,而不是另一个原始信号族。这种区别很重要:信号提取证据,而投影将证据转化为命名的策略带,如 support_fast、support_balanced 或 support_escalated。
v0.3 的主要新增内容不仅仅是更多的信号名称。该版本使信号可组合:conversation 信号可以检测代理请求形态;event 信号可以路由操作负载;嵌入规则可以查询非文本模态;投影输出可以将嘈杂的证据转化为策略就绪的带。
仪表盘拓扑视图、DSL 编辑器、编译器/反编译器以及运行时指标均已更新,以理解这些 v0.3 接口,而不是静默丢弃或隐藏它们。
策略编写界面也更加强大。路由 DSL 新增了冲突检测、SIGNAL_GROUP、TEST 和 TIER 编写构造、自然语言到 DSL 的流水线、EMIT retention 以及动态工具检索支持。这对生产团队很重要,因为 Themis 策略不仅仅是解析后的 YAML;它们是可审查的路由程序,带有测试、保留输出和更安全的生成路径。

3. 会话感知的智能体路由
Themis 包含了首个生产就绪版本的 会话感知智能体路由(SAAR)。
单轮路由问的是:
哪个模型应该处理这个提示?
智能体路由还必须问:
现在在这个会话内切换模型安全吗?
SAAR 增加了路由器拥有的会话记忆、工具循环周围的硬锁、提供方状态可移植性检查、空闲和决策漂移重置边界、切换经济学以及可重放的诊断。它保留了正常的语义路由器流水线,但用会话连续性规则包裹了模型选择。
这对编码智能体和长周期工具循环尤为重要。工具结果通常应返回给请求该工具的模型。提供方管理的延续 ID 不应发送到不同的物理后端。一个长时间的热会话不应仅仅因为最新的用户消息很短就丢弃前缀局部性。
Themis 将这些约束作为模型选择策略的一部分,而不是要求每个应用重新发现它们。

关键设计选择是 SAAR 不取代语义路由。它在模型选择的最后一英里周围增加了一个有状态守卫:
conversation信号识别多轮形态、活跃工具使用、开发者消息和大量非用户上下文。session_aware选择在考虑质量差距、切换边际、保持偏差、前缀局部性和剩余轮次先验后,评估模型切换是否值得。- 硬锁在活跃工具循环或提供方状态延续期间阻止不安全的切换。
- 路由器拥有的记忆可以检索和存储路由本地的事实、偏好和上下文,而无需暴露单独的会话状态 DSL。
- 重放记录保留了会话保持、切换或重置的原因。
路由器记忆是会话感知选择的有力补充。记忆插件可以在用户或会话范围内保留事实、偏好和检索到的上下文;session_aware 随后可以避免将每一轮视为孤立请求。在实践中,这意味着智能体可以保持有用的连续性,而不必永远将每个请求固定到最昂贵的模型上。
参考策略形态故意采用普通的 YAML:
routing:
signals:
conversation:
- name: active_tool_use
feature:
type: count
source:
type: assistant_tool_cycle
predicate:
gte: 1
decisions:
- name: agentic_session_route
rules:
operator: AND
conditions:
- type: conversation
name: active_tool_use
algorithm:
type: session_aware
session_aware:
base_method: hybrid
tool_loop_hard_lock: true
context_portability_hard_lock: true
prefix_cache_weight: 0.20
handoff_penalty_weight: 1.0
plugins:
- type: memory
configuration:
enabled: true
retrieval_limit: 6
auto_store: true
hybrid_search: true这是 Themis 对智能体工作负载最重要的部分:路由器现在可以推理连续性,而不仅仅是分类。
4. 投影将证据转化为策略
信号是原始证据。投影是 Themis 将这些证据转化为具名、稳定的策略概念的地方。
如果没有投影,复杂策略必须在许多决策中重复低层信号细节:确切的嵌入规则名称、复杂度阈值、上下文边界和知识库分数。有了投影,路由器可以一次计算原始证据,推导出可复用的输出,例如 support_fast 或 support_escalated,并让决策基于该推导概念进行路由。
Themis 支持三种核心投影模式:
partitions从互斥的家族中选择一个胜出者,例如相互竞争的支持意图。scores将声明的信号或知识库指标组合成一个连续值。mappings通过校准阈值将这些值转换为策略区间。
对于需要多个推导输出的策略,v0.3 还增加了 multi_emit 投影映射。这允许单个投影步骤发出多个命名的路由概念,同时仍在重放中保留可追溯性。

一个简洁的示例如下:
routing:
signals:
embeddings:
- name: technical_support
threshold: 0.75
aggregation_method: max
candidates:
- installation guide
- troubleshooting steps
- name: account_management
threshold: 0.72
aggregation_method: any
candidates:
- password reset
- billing information
context:
- name: long_context
min_tokens: 32K
max_tokens: 256K
projections:
partitions:
- name: support_intents
semantics: exclusive
members:
- technical_support
- account_management
default: technical_support
scores:
- name: request_difficulty
method: weighted_sum
inputs:
- type: embedding
name: technical_support
weight: 0.18
value_source: confidence
- type: context
name: long_context
weight: 0.18
mappings:
- name: request_band
source: request_difficulty
method: threshold_bands
outputs:
- name: support_fast
lte: 0.20
- name: support_escalated
gte: 0.45
decisions:
- name: escalated_support_route
rules:
operator: AND
conditions:
- type: projection
name: support_escalated投影轨迹也与重放记录一起存储,因此仪表板不仅可以解释触发了哪个信号,还可以解释是哪个推导出的策略区间导致了最终路由。
5. 协议兼容性成为发布面
v0.3 将路由器的兼容性边界扩展到基本的 OpenAI Chat Completions 之外。
本周期内的协议工作包括:
- 通过内部请求信封实现原生 Anthropic
/v1/messages入口 - 使用 OpenAI SSE 转换的 Anthropic 流式传输
- 自定义 Anthropic 上游路由和工具调用支持
- 针对非流式路径的出站 Anthropic 响应发出
- 从请求路径头进行协议检测
- 会话 ID 镜像和头透传控制
- 解释协议转换何时有损的响应头
- Responses API 工具追踪保真度和与 OpenAI SDK 对齐的消息处理
- OpenAI 推理努力变更修复
- 身份编码的上游响应,以避免透明解压缩带来的意外
- 更强的 Responses API 状态和持久化路径
目标不是让每个提供商看起来完全相同。目标是让转换明确、可观察且足够安全,以便像 auto 这样的逻辑路由模型可以位于多个提供商协议之前,而不会让操作员感到意外。
6. 仪表板成为操作员控制台
Themis 仪表板不仅仅是一个配置编辑器。
v0.3 周期收紧了首次运行设置流程、拓扑图、重放支持的洞察、日志、状态页面、评估流程、认证行为和模型清单界面。操作员可以导入配置文件、验证它、激活它、发送测试提示、检查信号路径、读取路由器日志并验证重放记录,而无需离开仪表板。

值得注意的仪表板改进包括:
- 内置路由模式和缺失模型补全
- 显示匹配信号、投影、决策和模型的拓扑干跑路径
- 通过仪表板代理进行路由器重放和聚合洞察
- 自然语言 DSL 构建器和评估流程修复
- 游乐场中的文件附件
- 当认证服务无法初始化时的认证故障关闭行为
- 具有影子、激活和回滚状态的政策版本生命周期
- 针对用户提供的 fetch/open-web 请求的更安全日志和 URL 脱敏
- 对多语言内容的 UTF-8 安全显示处理
- 更精简的生产路由外壳和更小的后端运行时依赖
- 仪表板感知的模型列表和状态界面
结果是更好的本地和远程运维工作流:首次运行使用设置模式,策略检查使用拓扑,运维使用日志/状态,真实流量使用洞察。
7. CLI 与部署更具可预测性
Themis 还强化了 vllm-sr 作为受支持的操作界面。
CLI 现在具有更清晰的运行时边界和更实用的命令:
vllm-sr serve
vllm-sr serve --algorithm latency_aware
vllm-sr serve --algorithm session_aware
vllm-sr serve --platform amd
vllm-sr serve --platform nvidia
vllm-sr chat
vllm-sr eval
vllm-sr model list
vllm-sr config migrate --config old-config.yaml本地 vllm-sr serve 仍然是基于 Docker 的工作流,支持 Linux、macOS 和 WSL2。AMD ROCm 仍然是发布验证过的 GPU 路径,而 --platform nvidia 为已经配置好 NVIDIA 容器运行时的用户增加了本地 NVIDIA Docker 直通的易用性。原生 Windows Docker 服务现在会被明确拒绝并给出支持提示,而不是在后续以更不明显的方式失败。
CLI 还增加了更好的检查与冒烟测试命令。vllm-sr model list 展示已配置的模型清单,vllm-sr chat 提供一次性补全路径,vllm-sr eval 测试路由器评估端点,VLLM_SR_DNS 允许本地容器在企业或实验室网络需要时加入自定义 DNS 环境。
在 Kubernetes 上,v0.3 对齐了 Helm、发布默认值、OpenShift 部署修复、多个 IntelligentRoute 协调行为、CRD 模态契约、可选的 Gateway API HTTPRoute 入口以及 AgentGateway 安装指南。对于发布操作,Themis 还从模糊的 latest 假设转向明确的制品契约、升级与回滚文档以及发布检查。
8. 安全、重放、记忆与检索更值得信赖
Athena 将其中许多能力引入路由器。Themis 对其进行了加固。
关键的运行时修复与改进现在分为三组:
重放与可观测性
- 路由器重放 PostgreSQL 插入正确性,使仪表盘洞察不会静默保持为空
- 投影追踪与重放记录一起存储,以提高可解释性
- 响应侧越狱与重放路径收紧
存储与检索
- Qdrant 向量搜索提供程序支持
- Valkey 缓存、向量存储和记忆后端支持,包括 TLS 和搜索模块预检查
- Redis 和 Responses API 存储默认值更好地匹配真实的本地和 Kubernetes 部署
- 混合缓存重建预分配减少
- 流式 Redis 语义缓存正确性与有界流式块内存行为
- O(N) 缓存 LRU 读取路径替换为常数时间列表支持的实现
- BM25 和 n-gram 分类缓存以避免放大工作
- 混合 HNSW 入口点传播修复
- 跨重放、缓存、记忆和向量存储路径的共享 Milvus 生命周期处理
运行时与安全加固
- 跨先前用户轮次的历史感知 PII 与越狱信号扫描
- 针对先前模型填充的模型切换门修复
- extproc 后台路径中的 goroutine panic 恢复
- 选择随机性中的并发竞态修复
- 配置回滚版本的路径遍历保护
- 跨 Python、Go、Rust 和前端表面的依赖安全更新
这是发布中不那么引人注目的部分,但这正是 Themis 的用途:在真实流量、长提示、重放存储和运维驱动的配置更改下使系统更安全。
9. 长上下文路由变得更便宜
Themis 增加了三个重要的长上下文控制。
首先,上下文令牌估计现在可以从观察到的响应使用情况中学习在线校准比率,因此当精确分词不可用时,上下文敏感的路由可以得到改善。回退仍然保守,但路由器可以随时间适应真实流量。
其次,原生 mmBERT 嵌入路径现在能够限制内存占用,而不会将长输入变成静默截断问题。#2007 针对长输入内存问题的原生绑定修复以查询块的方式处理注意力,而不是为整个序列物化一个稠密的注意力张量。这使得长上下文信号对路由器保持可用,同时让该绑定在更大的提示下也可用。

第三,提示压缩成为一个命名的配置表面,用于信号提取:
| 配置 | 预期用途 |
|---|---|
default | 用于通用路由的均衡压缩 |
coding | 保留类代码和实现密集的句子 |
medical | 保留临床相关细节 |
security | 保留安全和策略证据 |
multi_turn | 保留对话连续性 |
压缩路径有意限定在信号评估范围内。原始用户提示仍会发送到所选的服务模型,除非决策方拥有的插件明确更改它。这种分离使路由优化不会静默改写用户意图。
10. 硬件后端路径拓宽
Themis 将路由器拥有的模型执行故事扩展到默认本地路径之外。
拓宽后的图谱区分了四条路径:用于服务 vLLM 后端的 NVIDIA CUDA 和 AMD ROCm,用于路由器拥有的分类器和嵌入推理的 Intel OpenVINO,以及用于开发和冒烟测试的 CPU/本地执行。
在 Intel 基础设施上,v0.3 为 Semantic Router 添加了初始的 OpenVINO 绑定。新绑定为 ModernBERT 序列分类、标记分类和嵌入推理提供了原生 C++ 和 Go 集成,并带有基准测试入口点,用于比较 OpenVINO 和 Candle 在分类器和嵌入工作负载上的行为。
这是一个后端和绑定里程碑,而非全面的生产对等声明。它为贡献者和硬件合作伙伴提供了一条具体路径,以在 Intel OpenVINO 上验证 Semantic Router 的内部分类器和嵌入模型,同时保持 Themis 其余部分使用的相同路由契约。

Athena 中引入的 AMD 部署路径也仍然是 v0.3 发布契约的一部分。
参考流程仍然是:
vllm-sr serve --platform amd对于真实的 AMD 部署,项目保留了维护中的 deploy/recipes/balance.yaml 配置,它通过 ROCm vLLM 后端暴露多个服务别名,并将它们通过与 CPU/本地路径相同的信号、投影、决策和模型选择流水线进行路由。
作为发布准备的一部分,Themis 在 AMD ROCm 栈上进行了验证,包括:
- 一个 ROCm vLLM 后端,暴露预期的服务别名
- 使用参考均衡配置进行仪表板设置导入、验证和激活
- 路由器健康和 Envoy OpenAI 兼容的
/v1/models - 针对编码/调试请求的拓扑试运行
- 针对编码、数学和法律提示的直接 Envoy 聊天补全
- 仪表板代理聊天补全
- 路由器重放列表和聚合洞察 API

这条端到端路径很重要,因为 Semantic Router 旨在成为跨异构推理栈的控制平面,而不仅仅是本地开发工具。
11. RouterArena SOTA 刷新
Themis 还带来了一个外部排行榜信号:在本次发布更新所截取的 RouterArena 快照中,vLLM-SR 重回 RouterArena 排行榜第一。
在该公开的 RouterArena 排行榜快照中,vLLM-SR 以 75.4 的加权 Arena Score 位列第一,领先于 Sqwish Router、AgentForge Router、Nadir Router 以及其他已公开的路由器基线。同一快照显示,vLLM-SR 的准确率为 76.0,每 1K 次查询成本为 $0.11,鲁棒性为 73.1。

这不能替代发布测试,但它是对项目方向的一个有用的外部检验。Themis 改进了路由策略、成本感知选择、协议兼容性和运维可追溯性,同时让路由器在独立的路由器基准测试中保持竞争力。
自 v0.2 以来有哪些变化?
从高层来看,v0.2 到 v0.3 的变化如下:
| 领域 | Themis 值 |
|---|---|
| API 与配置 | 跨本地、dashboard、Helm 和 operator 路径的规范 v0.3 契约 |
| 路由器核心 | 更丰富的信号、投影、响应状态、回放、安全性和选择算法 |
| 模型选择 | 会话感知、多因素、延迟感知、RL 驱动、混合以及其他算法界面 |
| 协议 | 更强的 OpenAI 和 Anthropic 兼容性,并具有显式转换行为 |
| Dashboard | 设置、拓扑、状态、日志、洞察、回放、认证和模型清单加固 |
| CLI | 更清晰的 serve 模式、模型检查、chat/eval 命令、配置迁移、平台边界 |
| 部署 | AMD ROCm 路径、OpenVINO 绑定、NVIDIA 本地直通易用性、Helm/OpenShift/Gateway API 修复、发布产物契约 |
| 存储与检索 | Valkey、Qdrant、Redis、Milvus、回放、缓存、内存和向量存储生命周期加固 |
| 可靠性 | 分块 mmBERT 注意力、UTF-8 安全显示处理、安全日志记录、流式缓存正确性、回放正确性、并发修复 |
这就是 Themis 的核心故事:路由器能力更强,但在恰当的地方也受到更多约束。
开始使用
对于 macOS 或 Linux:
curl -fsSL https://vllm-semantic-router.com/install.sh | bash对于手动安装:
pip install vllm-sr==0.3.0
vllm-sr serve如果当前目录不包含 config.yaml,vllm-sr serve 会以设置模式启动 dashboard。对于 YAML 优先的用户,可以直接创建规范的 v0.3 配置,或迁移旧文件:
vllm-sr config migrate --config old-config.yaml
vllm-sr serve --config config.yaml对于 AMD ROCm:
vllm-sr serve --platform amd对于本地 NVIDIA Docker 直通:
vllm-sr serve --platform nvidia对于 Kubernetes:
helm install semantic-router oci://ghcr.io/vllm-project/charts/semantic-router查看项目资源:
- 文档:vllm-semantic-router.com
- GitHub:vllm-project/semantic-router
- 参考 AMD 配置:deploy/recipes/balance.yaml
- 模型:Hugging Face
展望未来:v0.4 Hermes
下一个版本的代号是 Hermes。
Themis 让契约足够稳定,可以投入运营。Hermes 应让路由器更易于改进、更易于评估,并在真实工作负载下更安全地适配。Hermes 的核心目标是自我改进的路由器。这个循环是有意设计的:在 GPU 规模上对路由器性能进行自动研究,通过路由器评估来调优 DSL 配方,然后将经过验证的证据反馈到代码库和编码器模型微调中。最有价值的工作是:
- 以自我改进路由器作为 Hermes 核心目标:打通 GPU 规模性能研究、DSL 配方调优以及代码库加编码器模型微调之间的闭环。每一次生成的变更仍然必须可审查、可重放、可版本化且可安全回滚。
- 以 SAAR 作为智能体路由层:继续收紧模型切换经济性、工具循环连续性、提供商状态可移植性、重放诊断以及路由器记忆集成。
- 以评估作为发布门禁:构建系统级和信号级评估,使每个信号、投影、算法、插件和仪表盘路径都能在发布前针对代表性流量进行重放。
- CLI 优先设计:确保每个 Semantic Router 操作都能通过
vllm-sr闭环,包括配置编写、迁移、服务、检查、评估、重放、策略生命周期、仪表盘导入/导出以及发布冒烟测试。 - 更好的路由器自有模型:提升路由器自身所用模型的准确性和延迟,包括嵌入、分类器、多模态和安全信号模型。
- 更有用的信号:在不把 DSL 变成应用代码的前提下,增加更丰富的请求、响应、工具、模态、身份、新鲜度、延迟、成本和运行时健康信号。
- 运维调试循环:将假设路由、策略重放、评估驱动调优和追踪对比打造为一流的仪表盘工作流。

致谢
从 v0.2.0 到 v0.3.0,Themis 周期包含来自 80+ 贡献者作者身份的超过 350 次提交。感谢每一位审查代码、改进文档、训练模型、加固测试、修复发布阻塞问题并推动路由器走向更稳定生产形态的人。
我们单独感谢来自研究机构和大学的合作者,包括 MBZUAI、McGill University、Mila 和 Rice University,感谢他们在路由器评估、模型研究和 AI 系统方面的贡献与合作。
我们还感谢更广泛的 vLLM、AMD、Intel、Meta、Red Hat、Microsoft、Google、IBM、NVIDIA、Hugging Face、NASA、Nutanix、DaoCloud 和开源社区在运行时系统、模型服务、模型研究和生产 AI 基础设施方面的持续合作。
欢迎来到 Themis:从信号到有状态生产路由。
来源:vLLM Blog · vllm.ai