Together AI 微调服务新增工具调用、推理与视觉支持
Together AI expands fine-tuning service with tool calling, reasoning, and vision support
Together AI 扩展 Together Fine-Tuning,原生支持工具调用、推理和视觉语言模型(VLM)微调。
官方披露微调服务新增工具调用、推理与视觉三类能力,并给出吞吐与数据规模的具体数字,便于团队评估后训练工作流。
随着 AI 团队从单轮提示转向高级多轮工作流,可靠性问题会在可预测的环节出现:工具调用与 schema 不匹配、推理在长时间交互中逐渐退化,以及模型遗漏特定领域的视觉信号。修复这些问题通常需要后训练,但这一流程往往支离破碎、迭代缓慢且难以规划。
今天,AI 原生云 Together AI 正在扩展 Together Fine-Tuning,原生支持工具调用、推理和视觉语言模型(VLM)微调。为支持前沿规模的后训练,我们还升级了训练栈,以更高效地处理 100B+ 参数模型,吞吐量最高提升 6 倍。此外,我们现在支持对最大 100GB 的数据集进行微调。最后,我们现在在训练前提供任务成本估算,并在训练期间提供预计完成时间,以便团队更好地规划实验。
“Together AI 在微调和推理方面所做的,正如 Vercel 之于基于 LLM 的应用——它移除了基础设施层,让我们可以专注于产品。我们通过简单的 API 调用微调和部署客户专属模型。这让我们现有的团队从每周迭代变为每日迭代,成本降低 2–3 倍,准确率从 77% 提升到 87%。”— Lamara De Brouwer,XY.AI Labs 联合创始人兼 CTO
工具调用微调
工具调用对许多现代智能体用例至关重要。然而,开箱即用的模型往往在工具调用上表现不佳:幻觉参数、选择错误的函数,或无法遵循多步序列。在工具调用工作流中,即使是很小的不一致也可能级联导致下游故障。
我们的微调服务现在为可靠、生产级工具调用提供端到端解决方案,覆盖从微调到推理的全流程。可以使用 OpenAI 兼容的 schema 将工具调用包含在训练数据中。函数在顶层 tools 数组中定义,我们的服务会验证每个 tool_calls 条目都与已声明的工具匹配,确保训练开始前数据结构正确。
在推理时,我们显著提升了工具调用的可靠性,以确保工具调用微调的收益能转化为生产性能。增强的解析和验证在广泛的真实用例中提升了正确性,并得到由社区贡献和内部研究共同整理的推理工具调用数据集的支持。
工具调用微调适用于来自 Qwen、Moonshot AI 和 Z.AI 的模型。请参阅工具调用文档开始使用。要查看代码中的工具调用功能示例,请查看我们的cookbook。
推理微调
推理模型在生成最终答案之前会生成中间思考轨迹,从而实现逐步推理。然而,推理格式在不同模型之间并未标准化,这给推理微调过程带来了复杂性。
Together Fine-tuning 现在支持使用 assistant 消息中的 reasoning 或 reasoning_content 字段,直接基于思考轨迹进行微调。这让你可以基于特定领域的推理模式训练模型,同时保持轨迹结构化和可复现。与工具调用一样,我们改进了推理,以确保微调后的能力转化为可靠的下游性能。
Qwen 和 Z.AI 的模型现已支持推理微调。请查看我们的文档页面了解支持的模型和详细信息。如需推理微调的端到端代码演示,请查看我们的 cookbook
视觉语言模型微调
许多 AI 工作流需要能够解读图像输入的模型。对于医学影像和电子商务等特定领域任务,视觉语言模型(VLM)可能需要学习新的视觉模式才能有效发挥作用。
Together 微调服务现已支持视觉语言模型的微调。视觉训练数据通过包含 base64 编码图像的消息内容数组以内联方式提供。微调任务支持混合数据集,允许在同一次运行中同时包含图文示例和纯文本示例。
默认情况下,我们会冻结视觉编码器,仅更新语言层。设置 train_vision=true 可启用联合训练,允许同时更新视觉编码器和语言层。
Qwen、Google 和 Meta 的模型现已支持 VLM 微调。请查看视觉语言文档了解支持的列表和使用详情。你也可以查看我们的 cookbook,在此处了解视觉语言微调。
大模型微调
随着开放模型规模的增长和上下文窗口的扩大,底层训练基础设施也必须跟上步伐。万亿参数模型无法容纳在单个节点上,因此需要跨多台机器进行细致的通信和内存管理。即使在长达数小时的训练过程中出现单个硬件故障,也可能导致进度丢失,而实现所有优化和容错保障可能是一项巨大的投入。
Together 微调现已支持最新开放权重模型的微调。提交训练任务,我们会在底层处理所有必要的优化。新增可微调模型包括:
- Qwen 3.5-397B-A17B
- Qwen 3.5-122B-A10B
- Qwen 3.5-35B-A3B
- Qwen 3.5-35B-A3B-Base
- Kimi K2.5
- Kimi K2(Instruct、Thinking)
- GLM-4.7
- GLM-4.6
在我们的文档中查看支持模型的完整列表及其上下文长度。
训练加速
在本次更新中,我们继续聚焦训练栈中影响最大的优化机会。具体来说,我们针对的是混合专家架构,因为它们代表了过去一年中绝大多数最强模型的发布。为了加速其训练,我们集成了 SonicMoE 的一个变体——一种 I/O 和 tile 感知的优化内核,可将内存操作与计算重叠。在训练工作负载中使用这些内核,显著减少了训练期间的激活内存占用,并最大限度地减少了无效计算。
我们还为损失计算引入了自定义 CUDA 内核,并消除了训练循环中若干导致不必要停顿的 GPU 到 CPU 同步点,显著提升了整体流水线效率。
因此,每个模型的吞吐量至少提升了 2 倍,而像 Kimi-K2 这样更大的模型提升超过 6 倍。更快的训练意味着每天可以进行更多实验,并缩短投产时间。

价格与时间估算
Together 微调现在可在任务执行前通过 UI 或 CLI 估算训练成本。这种价格透明度可避免预算意外。
成本估算:在启动前查看预估任务价格,以便在产生成本之前了解训练费用。

时间预估:通过实时进度条跟踪预估完成时间,该时间会随任务运行动态更新。

开始使用
→ Cookbook 链接:
→ 阅读微调 文档
来源:Together AI Blog · together.ai