跳到正文
Together AI Blog·· 2026-04-29精选AI 评分62

DeepSeek-V4 Pro 上线 Together AI,支持 512K 上下文与三档推理模式

DeepSeek-V4 Pro now available on Together AI

AI 导读

DeepSeek-V4 Pro 已在 Together AI 上线,Serverless Inference 提供 512K token 上下文,专用基础设施可扩展到模型级的 1M token。

推荐理由

原文给出 DeepSeek-V4 Pro 在 Together AI 上的上下文、推理档位与缓存定价,读者可据此判断长上下文工作负载的部署与成本取舍。

正文 · AI 翻译

长上下文推理改变了团队对模型的期待。整个代码仓库、大型文档集、长智能体轨迹和工具输出都可以放入模型的工作上下文中,而不必被压缩成脆弱的摘要。但能够利用如此多上下文的模型也最难服务:一个具有百万 token 上下文的 1.6T 参数 MoE,并不是大多数团队愿意自行部署、调优和运维的。

DeepSeek-V4 Pro 现已在 Together AI(AI 原生云)上线,团队可以从 512K 上下文的 Serverless Inference 起步,再迁移到专用基础设施以获得完整的 1M 上下文、预留容量和生产级控制。DeepSeek-V4 Flash 即将推出,为团队提供另一个 V4 选项,适用于速度和成本比最大推理深度更重要的场景。

概览

规格 值
模型 Together AI 上的 DeepSeek V4 Pro
端点 deepseek-ai/DeepSeek-V4-Pro
架构 1.6T 参数 MoE
激活参数 49B
Together AI 上的上下文 512K tokens
模型级上下文 1M tokens
推理模式 Non-Think、Think High、Think Max
部署方式 Serverless、月度预留
输入价格 $2.10 / 1M tokens
缓存输入价格 $0.20 / 1M tokens
输出价格 $4.40 / 1M tokens
最适用场景 代码智能体、文档智能、长上下文智能体、研究综合

为长上下文推理而构建

DeepSeek V4 Pro 专为模型需要基于远超简短提示进行推理的场景而构建:大型代码仓库、长篇技术文档、密集检索包、工具调用历史和研究语料库。

DeepSeek V4 Pro 在模型层面支持百万 token 上下文;在 Together AI 上,它目前提供 512K token 的上下文窗口。这一区别很重要,因为模型能力与部署服务配置并不总是同一回事。Together AI 推出 DeepSeek V4 Pro 时采用的上下文窗口专为可靠的生产服务而设计,同时仍为团队留出足够空间以应对严肃的长上下文工作负载。

架构也很重要,因为长上下文不仅仅是一项产品规格。随着上下文增长,服务成本、内存压力、KV 缓存使用、延迟和并发都会成为系统设计的一部分。DeepSeek V4 Pro 采用混合注意力机制,结合了压缩稀疏注意力和重度压缩注意力,DeepSeek 报告称在百万 token 上下文下,其单 token 推理 FLOPs 为 DeepSeek V3.2 的 27%,KV 缓存为 10%。

按工作负载选择推理力度

DeepSeek V4 Pro 支持三种推理模式,因此团队可以根据任务难度匹配推理深度,而不是对所有请求一视同仁。

模式 适用场景 权衡
Non-Think 提取、分类、简单问答、常规响应 低复杂度任务的最快路径
Think High 代码规划、文档分析、多步推理 为复杂工作提供更深的推理
Think Max 困难调试、深度研究综合、智能体决策点 最大推理力度;预计延迟和 token 用量更高

文档助手可能会对简单提取使用 Non-Think,对跨策略冲突分析使用 Think High,只有在模型需要推理一个困难决策时才使用 Think Max。代码智能体可能会使用 Think High 来规划迁移,使用 Think Max 来调试一个微妙的跨服务故障。

DeepSeek 报告了在编码、推理、长上下文和智能体任务上的基准测试结果,包括 93.5% LiveCodeBench、90.1% GPQA Diamond、80.6% SWE-bench Verified、83.5% MRCR 1M 和 62.0% CorpusQA 1M。

通过缓存输入定价,让重复的长上下文查询更便宜

长上下文系统通常会在多个问题之间复用同一份大型上下文:一个仓库快照、一组文档、一个策略归档、一份检索负载或一条长智能体轨迹。缓存输入定价让这些重复工作负载更加实用。

DeepSeek V4 Pro 的定价为 \$2.10 / 1M 输入 token,缓存输入为 \$0.20 / 1M token,输出为 \$4.40 / 1M token。这意味着复用上下文的成本降低 90%,当请求中昂贵的部分是一段稳定的文本、并在后续分析中被反复复用时,这一点尤为重要。

示例模式:

  1. 加载一段大型稳定上下文,例如 300K token 的仓库摘要、合同集或策略归档。
  2. 针对同一上下文提出多个后续问题。
  3. 在适用的情况下使用缓存输入定价,大幅降低重复分析的成本。

工作负载模式

代码智能体

当智能体需要跨仓库片段、问题轨迹、内部文档、先前工具调用和拟议补丁进行推理时,使用 DeepSeek V4 Pro。Think High 或 Think Max 在规划变更、调试故障或解决跨文件依赖时最有用。

文档智能

将长上下文用于需要在一次请求中比较的合同、策略集、技术手册或研究合集。Non-Think 可以处理提取和简单问答;Think High 更适合冲突分析、解释和综合。

长上下文智能体轨迹

使用 DeepSeek V4 Pro 检查较长的工具调用历史、中间结果和执行轨迹。更高的推理模式在决策点最有用:当智能体需要决定是继续、调用另一个工具、修改计划还是停止时。

研究综合

将 DeepSeek V4 Pro 用于结合论文、笔记、基准报告、检索文档和先前分析的工作流。当同一组证据在多个问题中被复用时,缓存输入定价尤其有用。

从无服务器开始,再转向预留容量

DeepSeek V4 Pro 可在 Together AI Serverless Inference 和 Monthly Reserved 基础设施上使用。Serverless 是评估、开发和可变流量的合适起点。Monthly Reserved 更适合更稳定的生产需求,即团队需要更可预测的容量和成本控制。

对于长上下文工作负载,部署路径很重要。团队不仅是在选择模型;他们还在选择随着上下文规模增长如何管理吞吐量、并发、延迟、KV 缓存压力和成本。Together AI 为团队提供了一条从评估到生产的路径,而无需自行搭建服务栈。

立即试用

DeepSeek-V4 Pro 现已在 Together AI Serverless Inference 和 Dedicated Endpoints 上提供。

    
from together import Together

client = Together()

stream = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V4-Pro",
    messages=[
        {
            "role": "user",
            "content": "Prove that the square root of 2 is irrational.",
        }
    ],
    stream=True,
)

for chunk in stream:
    if not chunk.choices:
        continue
    delta = chunk.choices[0].delta

    if hasattr(delta, "reasoning") and delta.reasoning:
        print(delta.reasoning, end="", flush=True)
    if hasattr(delta, "content") and delta.content:
        print(delta.content, end="", flush=True)

    

从 Serverless Inference 开始进行开发和评估。对于需要完整 1M 上下文、预留容量、工作负载隔离或更可预测吞吐量的生产工作负载,请联系销售,在 Together AI Dedicated Inference 上部署 DeepSeek-V4 Pro。

开始使用

→ 按照我们的 DeepSeek-V4 快速入门,几分钟内即可上手运行

→ 查看 DeepSeek-V4 Pro 模型页面

→ 在 Playground 中试用 DeepSeek-V4 Pro

→ 联系销售 获取专用推理部署和批量定价

‍

来源:Together AI Blog · together.ai