跳到正文
热点事件持续更新

Google Cloud 为 vLLM 加入原生 TPU 支持

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月7日,Google Developers Blog 发布消息称,Google Cloud 已将原生 TPU 支持集成进开源推理引擎 vLLM,用于长上下文多模态嵌入推理,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 作为目标工程模型。报道称,Google Cloud 已在 AI-Hypercomputer 公共仓库开源官方部署与执行配方。该报道给出的条件与数据包括:当主 TPU 预留容量被完全占用时,服务基础设施会自动回退到次级 GPU spot 或按需池,且不中断进入的推理流量;跨硬件后端的目标质量通过阈值为文本 ≥0.999、多模态输入 ≥0.995,余弦相似度接近 1.0;在 TPU Ironwood 上以 bf16、16K+ 序列长度、TP=4 服务 qwen-3-embedding-8b,吞吐达 83,996 total token/s、5.13 req/s。上述条件与数据均针对该报道所述的具体配置与场景。

AI 根据报道生成 · 5 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. Google Developers Blog
    Google Cloud 为 vLLM 加入原生 TPU 支持,服务 Qwen3 嵌入模型

    Google Cloud 将原生 TPU 支持集成进 vLLM,用于长上下文多模态嵌入推理,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 作为目标工程模型。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。