跳到正文
Together AI Blog·· 2026-07-15精选AI 评分64

Together AI 上线 Thinking Machines Lab 新模型 Inkling

Together AI brings Thinking Machines Lab’s new model Inkling on day 0

AI 导读

Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 同日在其推理平台上线该模型。Inkling 总参数 975B、每 token 激活 40B,上下文窗口 1M token,接受文本、图像和音频输入并输出文本,支持按任务调节推理投入。

推荐理由

Inkling 的架构细节与可控推理档位一并公开,可据此判断多模态推理模型的工程取舍。

正文 · AI 翻译

今天,Thinking Machines Lab 发布了 Inkling,这是一个全新的多模态混合专家模型,专为 token 高效推理、原生多模态理解和广泛的任务通用性而构建。Together AI 很高兴与 Thinking Machines Lab 团队合作,让开发者能够在我们的推理平台上使用 Inkling。 

Inkling 接受文本、图像和音频输入,并通过统一的解码器架构生成文本输出。它支持可控推理力度,允许开发者根据每个任务的需求调整模型应用的推理量。其后期训练还覆盖了广泛的能力,包括科学推理、编码、智能体工作流、预测和校准预测。

在底层,Inkling 引入了超越传统仅解码器 Transformer 的多项架构创新,包括查询条件相对注意力、贯穿整个模型的短因果卷积,以及带有共享专家汇的混合专家架构。这些组件共同设计,旨在支持强大的推理和多模态能力,同时保持高效的模型执行。大规模高效地提供服务并非易事,而这正是 Together AI 的推理栈所擅长优化的负载类型,因此你可以在生产推理中切实获得该模型的效率提升。在 Together AI 上,Inkling 运行时采用优化的基于 FlashAttention-4 的注意力内核,旨在生产环境中高效支持其查询条件相对注意力机制。

祝贺 Thinking Machines Lab 团队发布。

Inkling 一览

  • Token 高效、可控推理:开发者可以调整推理力度,以针对不同工作负载平衡推理深度、token 用量和延迟。
  • 原生多模态输入:Inkling 通过单一模型接受音频、图像和文本输入并生成文本输出。
  • 广泛的任务通用性:该模型在推理、编码、智能体、预测和校准预测任务上进行了后期训练。
  • 差异化的架构:Inkling 结合了分组查询注意力、学习到的相对位置偏置、短因果卷积和共享汇 MoE 路由。
  • 强劲的初步评估:在其最高评估力度设置下,Inkling 在科学推理、数学、编码、智能体、视觉和音频基准测试中均展现出强劲结果。
  • 已在 Together AI 上线:开发者可以通过无服务器方式访问 Inkling,具有 1M 上下文窗口和 OpenAI 兼容 API。

在具有挑战性的推理任务上表现强劲

对当前 Inkling 检查点的初步评估显示,其在研究生水平的科学推理和竞赛数学方面表现强劲:

这些结果指向 Inkling 的一个决定性特征:通用性。同一个模型在知识密集型推理、数学问题求解、软件工程、基于浏览器的任务、视觉文档理解和音频理解方面均表现强劲。

Inkling 还在预测和校准预测任务上进行了后期训练。这扩展了模型的实用性,使其超越传统问答,适用于表示不确定性并生成良好校准估计非常重要的应用。

‍

为什么在 Together 上运行 Inkling?

Day 0 访问,零配置:Inkling 今日已在 Together AI Serverless 上线。无需等待容量,无需配置基础设施,无需管理 GPU。 

单一端点支持完整多模态输入:由于 Inkling 原生接受文本、图像和音频,你无需单独的流水线或预处理服务,Together AI Serverless 通过单次 API 调用处理全部三种输入类型。这非常强大,因为 Together 的统一解决方案消除了延迟、速度与运营稳定性之间的权衡。

可控的推理投入,无需管理自有基础设施:Inkling 可调节的推理投入设置让你能够按请求权衡深度、延迟和 token 开销。在 Together AI 上,你可以直接通过 API 控制这一旋钮,因此成本和速度的调优发生在请求层面,而非基础设施层面。

‍

面向推理与多模态的新架构

Inkling 是一个仅解码器的混合专家模型,总参数量为 975B,每 token 激活参数为 40B,上下文窗口为 1M tokens。

Inkling 没有使用 RoPE 或绝对位置嵌入,而是通过一种可学习的、以查询为条件的相对偏置,将 token 位置直接融入注意力机制。每个注意力层将传统的查询-键相似度分数与一个基于 token 之间相对距离的额外分数相结合。这为模型提供了一种灵活的机制来表示 token 顺序和邻近上下文。

Inkling 在整个网络中混合使用滑动窗口注意力和完整因果注意力。标准架构采用五个局部注意力层后接一个完整注意力层,使大多数层能够高效地关注近期上下文,同时周期性地整合整个序列的信息。

该模型还引入了 sconv,一种具有四 token 感受野的轻量级逐通道因果卷积。Sconv 在注意力之前应用于键和值流,也应用于注意力和前馈子层的输出。这些短卷积为每一层提供了一种额外机制,无需另一次完整注意力操作的开销即可组合相邻 token 的信息。

Inkling 的前馈层采用带有共享专家汇的混合专家架构。对于每个 token,路由器选择少量路由专家,同时也为共享专家分配权重。与传统的共享专家 MoE 设计不同,Inkling 将共享专家和选定的路由专家一起归一化,使共享路径能够在每个 token 上动态竞争混合权重。

Inkling 还支持图像和音频输入。轻量级嵌入塔将图像块和量化音频特征转换为与文本 token 宽度相同的嵌入。这些嵌入被直接插入模型的输入序列,并由同一个解码器堆栈处理。

统一的文本、图像和音频输入

Inkling 接受三种输入模态:文本、图像、音频。所有三种模态均由同一个解码器堆栈处理,并生成文本作为输出。

轻量级嵌入塔将图像块和量化音频特征转换为与文本 token 嵌入宽度相同的嵌入。这些表示被直接插入模型的输入序列,使语言模型能够对文本、视觉和音频信息进行联合推理。

这种统一设计支持视觉问答、文档分析、音频理解、多模态智能体,以及在同一对话中组合多种输入类型的工作流等应用。

开始在 Together Serverless 上使用 Inkling 构建

Inkling 现已通过 Together AI Serverless 提供。

开发者可以:

  • 使用统一模型构建文本、图像和音频应用
  • 从初步实验扩展到专用生产容量

from together import Together client = Together() response = client.chat.completions.create( model="[INKLING MODEL ID]", messages=[ { "role": "user", "content": "Analyze this problem carefully and provide the answer." } ], # Replace with the final supported API parameter. reasoning_effort="[SUPPORTED VALUE]", ) print(response.choices[0].message.content)

‍

来源:Together AI Blog · together.ai