Together AI 上线 Thinking Machines Lab 新模型 Inkling
Together AI brings Thinking Machines Lab’s new model Inkling on day 0
Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 同日在其推理平台上线该模型。Inkling 总参数 975B、每 token 激活 40B,上下文窗口 1M token,接受文本、图像和音频输入并输出文本,支持按任务调节推理投入。
Inkling 的架构细节与可控推理档位一并公开,可据此判断多模态推理模型的工程取舍。
今天,Thinking Machines Lab 发布了 Inkling,这是一个全新的多模态混合专家模型,专为 token 高效推理、原生多模态理解和广泛的任务通用性而构建。Together AI 很高兴与 Thinking Machines Lab 团队合作,让开发者能够在我们的推理平台上使用 Inkling。
Inkling 接受文本、图像和音频输入,并通过统一的解码器架构生成文本输出。它支持可控推理力度,允许开发者根据每个任务的需求调整模型应用的推理量。其后期训练还覆盖了广泛的能力,包括科学推理、编码、智能体工作流、预测和校准预测。
在底层,Inkling 引入了超越传统仅解码器 Transformer 的多项架构创新,包括查询条件相对注意力、贯穿整个模型的短因果卷积,以及带有共享专家汇的混合专家架构。这些组件共同设计,旨在支持强大的推理和多模态能力,同时保持高效的模型执行。大规模高效地提供服务并非易事,而这正是 Together AI 的推理栈所擅长优化的负载类型,因此你可以在生产推理中切实获得该模型的效率提升。在 Together AI 上,Inkling 运行时采用优化的基于 FlashAttention-4 的注意力内核,旨在生产环境中高效支持其查询条件相对注意力机制。
祝贺 Thinking Machines Lab 团队发布。
Inkling 一览
- Token 高效、可控推理:开发者可以调整推理力度,以针对不同工作负载平衡推理深度、token 用量和延迟。
- 原生多模态输入:Inkling 通过单一模型接受音频、图像和文本输入并生成文本输出。
- 广泛的任务通用性:该模型在推理、编码、智能体、预测和校准预测任务上进行了后期训练。
- 差异化的架构:Inkling 结合了分组查询注意力、学习到的相对位置偏置、短因果卷积和共享汇 MoE 路由。
- 强劲的初步评估:在其最高评估力度设置下,Inkling 在科学推理、数学、编码、智能体、视觉和音频基准测试中均展现出强劲结果。
- 已在 Together AI 上线:开发者可以通过无服务器方式访问 Inkling,具有 1M 上下文窗口和 OpenAI 兼容 API。
在具有挑战性的推理任务上表现强劲
对当前 Inkling 检查点的初步评估显示,其在研究生水平的科学推理和竞赛数学方面表现强劲:

这些结果指向 Inkling 的一个决定性特征:通用性。同一个模型在知识密集型推理、数学问题求解、软件工程、基于浏览器的任务、视觉文档理解和音频理解方面均表现强劲。
Inkling 还在预测和校准预测任务上进行了后期训练。这扩展了模型的实用性,使其超越传统问答,适用于表示不确定性并生成良好校准估计非常重要的应用。
为什么在 Together 上运行 Inkling?
Day 0 访问,零配置:Inkling 今日已在 Together AI Serverless 上线。无需等待容量,无需配置基础设施,无需管理 GPU。
单一端点支持完整多模态输入:由于 Inkling 原生接受文本、图像和音频,你无需单独的流水线或预处理服务,Together AI Serverless 通过单次 API 调用处理全部三种输入类型。这非常强大,因为 Together 的统一解决方案消除了延迟、速度与运营稳定性之间的权衡。
可控的推理投入,无需管理自有基础设施:Inkling 可调节的推理投入设置让你能够按请求权衡深度、延迟和 token 开销。在 Together AI 上,你可以直接通过 API 控制这一旋钮,因此成本和速度的调优发生在请求层面,而非基础设施层面。
面向推理与多模态的新架构
Inkling 是一个仅解码器的混合专家模型,总参数量为 975B,每 token 激活参数为 40B,上下文窗口为 1M tokens。
Inkling 没有使用 RoPE 或绝对位置嵌入,而是通过一种可学习的、以查询为条件的相对偏置,将 token 位置直接融入注意力机制。每个注意力层将传统的查询-键相似度分数与一个基于 token 之间相对距离的额外分数相结合。这为模型提供了一种灵活的机制来表示 token 顺序和邻近上下文。
Inkling 在整个网络中混合使用滑动窗口注意力和完整因果注意力。标准架构采用五个局部注意力层后接一个完整注意力层,使大多数层能够高效地关注近期上下文,同时周期性地整合整个序列的信息。
该模型还引入了 sconv,一种具有四 token 感受野的轻量级逐通道因果卷积。Sconv 在注意力之前应用于键和值流,也应用于注意力和前馈子层的输出。这些短卷积为每一层提供了一种额外机制,无需另一次完整注意力操作的开销即可组合相邻 token 的信息。
Inkling 的前馈层采用带有共享专家汇的混合专家架构。对于每个 token,路由器选择少量路由专家,同时也为共享专家分配权重。与传统的共享专家 MoE 设计不同,Inkling 将共享专家和选定的路由专家一起归一化,使共享路径能够在每个 token 上动态竞争混合权重。
Inkling 还支持图像和音频输入。轻量级嵌入塔将图像块和量化音频特征转换为与文本 token 宽度相同的嵌入。这些嵌入被直接插入模型的输入序列,并由同一个解码器堆栈处理。
统一的文本、图像和音频输入
Inkling 接受三种输入模态:文本、图像、音频。所有三种模态均由同一个解码器堆栈处理,并生成文本作为输出。
轻量级嵌入塔将图像块和量化音频特征转换为与文本 token 嵌入宽度相同的嵌入。这些表示被直接插入模型的输入序列,使语言模型能够对文本、视觉和音频信息进行联合推理。
这种统一设计支持视觉问答、文档分析、音频理解、多模态智能体,以及在同一对话中组合多种输入类型的工作流等应用。
开始在 Together Serverless 上使用 Inkling 构建
Inkling 现已通过 Together AI Serverless 提供。
开发者可以:
- 使用统一模型构建文本、图像和音频应用
- 从初步实验扩展到专用生产容量
from together import Together client = Together() response = client.chat.completions.create( model="[INKLING MODEL ID]", messages=[ { "role": "user", "content": "Analyze this problem carefully and provide the answer." } ], # Replace with the final supported API parameter. reasoning_effort="[SUPPORTED VALUE]", ) print(response.choices[0].message.content)
来源:Together AI Blog · together.ai