Moonshot 发布 Kimi K3,Modal 上线首日支持
Kimi K3 by Moonshot now available on Modal
Moonshot 发布 Kimi K3,一个 2.8 万亿参数的多模态模型,具备 1M token 上下文窗口和原生视觉能力。Modal 与 Moonshot、vLLM 合作在发布首日完成支持,在 Modal 上以 460 tokens per second 运行,并提供按 token 计费的 Shared API 和专用 Auto Endpoint。
Moonshot 发布 2.8T 参数开源多模态模型 Kimi K3,Modal 同日给出 460 tokens/s 的部署实测数据,可对照开源前沿模型的落地成本。
今天 Moonshot 发布了 Kimi K3,这是一个 2.8 万亿参数的多模态模型,拥有 1M token 上下文窗口和原生视觉能力。而 Modal 在发布当天就以每秒 460 token 的速度运行它。
我们与 Moonshot 和 vLLM 合作,在零日提供支持,让 K3 在我们的 Shared API 上以基于 token 的定价提供,并作为 Auto Endpoint 提供专用容量,同时还有一个针对 K3 架构调优的定制训练 DFlash 推测器。
立即试用,或继续阅读,了解我们为何认为这个模型及其架构意义重大。
前沿、开放、快速。三者兼得。
Kimi K3 是公共智能指数上最强的开放模型,在由闭源模型主导的排行榜上位列第四。
K3 是一个混合专家 transformer:总参数 2.8T,每个 token 激活 896 个专家中的 16 个,1M token 上下文窗口,以及原生视觉。它是为长时程智能体工作而构建的,Moonshot 在内部对此进行了测试,在开发期间将团队大部分内核优化工作交给了一个早期版本。Kimi Delta Attention 在序列增长时抑制了注意力成本,而 Attention Residuals 让更深的层能够回溯到更早的注意力输出,而不仅仅是下一层,这两者结合起来带来了约 2.5 倍于 K2 的扩展效率。
它没有给你的是一个易于运行的模型,而 Moonshot 也把大量架构工作花在了这个问题上。他们从 SFT 阶段开始就使用 MXFP4 权重和 MXFP8 激活进行量化感知训练,因此该模型可以在广泛的硬件上运行,并且他们重新平衡了专家并行,以在大规模下保持吞吐量。当 KDA 被发现会破坏传统前缀缓存时,他们编写了新的实现,并在发布前贡献给了 vLLM。这是大量不为人知的工作,服务于 Moonshot 之外的人,也正是 3T 级开放模型能够被提供的原因。
对于 Modal 上的端点,我们更进一步,在零日就支持了针对 K3 形态调优的定制 DFlash 推测器。K3 每个任务生成大量 token,这意味着用户等待的大部分时间是解码时间,而推测正是加速解码的手段。
在智能体工作负载上,这是巨大的差异:
- 交互速度提升 360%(从每秒 100 到 460 token)
- 吞吐量提升 88%(每 GPU 从 80 万到 150 万 TPM)
前沿模型需要前沿推测
K3 是我们训练推测器所针对的最大目标。
像 DFlash 这样的定制草稿模型架构可以大幅加速生产推理,尤其是在精心训练的情况下。DFlash 训练主要是一个数据生成问题,因为教师就是目标模型。最终运行使用了 32 个 B300 节点:28 个以 TP8 运行 K3 以生成隐藏状态,4 个针对这些隐藏状态训练草稿模型。
这个草稿器背后有很多设计决策,我们期待在后续文章中分享更多。与此同时,我们已经详细撰写了为什么我们全力投入推测解码。
在 Modal 上运行 Kimi K3
Kimi K3 今天已作为 OpenAI 兼容的 Shared API 提供,面向 Team 和 Enterprise 客户采用基于 token 的定价,或作为任何计划上的专用 Auto Endpoint 提供。
今天就试试,并告诉我们你的想法!
来源:Modal Blog · modal.com