跳到正文
Modal Blog·· 2026-07-15精选AI 评分62

Thinking Machines 的 Inkling 上线 Modal,975B 参数 MoE 支持文本图像音频输入

Inkling by Thinking Machines now available on Modal

AI 导读

Thinking Machines 发布通用多模态模型 Inkling,接受文本、图像和音频输入并输出文本,Modal 提供 Day 0 支持的托管端点与按 token 计费。

推荐理由

原文给出 Inkling 的架构参数与 Modal 上的推理性能数据,读者可据此判断这类稀疏 MoE 模型的部署成本。

正文 · AI 翻译

今天 Thinking Machines 发布了 Inkling,这是一个通用多模态模型,可接受文本、图像和音频输入并生成文本输出。

我们在第一天就与 Thinking Machines 合作提供支持,将 Inkling 作为托管端点提供,采用基于 token 的定价。

立即试用,或继续阅读,了解我们为何认为这个模型及其架构意义重大。

Inkling:伟大事物的开端

Thinking Machines 将这款模型命名为 Inkling,因为它是“一个可能发展成了不起事物的想法的开端”。我们完全赞同。

作为一个混合专家 Transformer,总参数 975B、激活参数 41B、上下文窗口 1M token,并原生支持音频和视觉,Inkling 从一开始就以广度优先而非深度优先进行训练。这使其成为进一步训练的绝佳基础模型。

这也让 Inkling 在设计上就很快。稀疏专家使激活参数保持较低,而其局部注意力布局使计算和内存随序列增长保持平稳。对于 Modal 上的端点,我们更进一步,在第一天就支持了针对该模型形状调优的自定义 DFlash 推测器。

在 8x B200 上的智能体工作负载中,我们实现了每用户每秒 250 token,每 GPU 吞吐量达 2.5M TPM,在同等吞吐量下,交互速度比模型内置的推测路径快 67%。

迈向局部注意力:为前沿注意力模型演进 DFlash 推测

Inkling 独特的架构朝着通过转向局部注意力布局来最大化计算效率的方向发展。每六个注意力层中,五层对近期 token 使用滑动窗口注意力,一层对整个序列使用全注意力。在实践中,通过将模型更多计算偏向近期 token,模型本身实现了更高的效率。

这种加速正在全面发生,前沿开源模型在相同参数规模下不断变得更快:Qwen 3.5 和 3.6 通过 Gated DeltaNet 线性注意力层实现了这一点,而 Inkling 将同样的思路推进得更远、更好,每五个滑动窗口层对应一个全局层。这种加速很棒,但这也意味着推测解码技术也必须变得更快。

与大多数当前开源模型一样,Inkling 包含一个多 token 预测(MTP)头,可用于推测解码的草稿生成。但 MTP 头一次只草拟一个 token,占用 GPU 上更多时间和空间,导致性能触及上限——在我们的基准测试中,将 MTP 推过几个草稿步骤后反而变慢。

DFlash 是 Z Lab 提出的推测解码技术,其设计方式不同。它的块扩散草稿器在一次并行前向传播中生成一整块 token,并以目标模型的特征为条件。在我们于 Hugging Face 上发布的最新草稿模型中,我们做出了与 Inkling 类似的押注,即转向局部注意力。

我们能够以几种方式推进 DFlash,以最大化速度和计算效率(同时不损失准确性):

  1. 全局部注意力。每个草稿器层都使用滑动窗口注意力,完全没有全局注意力。草稿器可以承受这一点,因为它以目标模型的特征为条件获取长程上下文,而草稿生成主要依赖近期 token。
  2. 因果层以获得更好的内核支持。我们将草稿器的层从非因果改为因果,使其在推理时可以在高度优化的注意力内核上运行,例如 trtllm。

我们早期就押注 DFlash,因为我们认识到块扩散草拟的未来潜力:一种随着块增大成本保持平稳的推测器,其架构能够像其目标模型一样快速削减计算量。我们相信,对于兼容模型而言,这是正确的推测架构。我们预计这种模型形态将在开放前沿中持续扩散,我们将不断把 DFlash 推向极限以与之匹配。

立即通过 Modal Auto Endpoints 运行 Inkling

Inkling 今日已可用,作为通过 Modal Auto Endpoints 提供的 OpenAI 兼容共享端点。

今天就试试,并告诉我们你的想法!

来源:Modal Blog · modal.com