跳到正文
Baseten Blog·· 5 天前精选AI 评分67

Baseten 用 Claude Code 自动生成推理引擎,单流解码比 vLLM 快 90%

Agentic inference optimization: 50-90% faster engines

AI 导读

Baseten 让 Claude Code 基于 MetaInfer 的技能框架自动生成推理引擎,在单张 B200 上跑 Qwen-3.6-35B-A3B NVFP4,生成的 VibeQwen 单流解码达 1792 TPS,比 vLLM 0.25.1 的 943 TPS 快 90%,首 token 从 28ms 降到 12ms,并发 32 时输出吞吐高 71%。

推荐理由

作者用 Claude Code 复现 MetaInfer 思路,给出两套自建推理引擎相对 vLLM 与参考服务的实测对比,可作为自动化推理优化的参考路径。

来源:Baseten Blog · baseten.co