DeepSeek-V4 Pro 上线 Together AI,支持 512K 上下文与三档推理模式
DeepSeek-V4 Pro now available on Together AI
DeepSeek-V4 Pro 已在 Together AI 上线,Serverless Inference 提供 512K token 上下文,专用基础设施可扩展到模型级的 1M token。
原文给出 DeepSeek-V4 Pro 在 Together AI 上的上下文、推理档位与缓存定价,读者可据此判断长上下文工作负载的部署与成本取舍。
长上下文推理改变了团队对模型的期待。整个代码仓库、大型文档集、长智能体轨迹和工具输出都可以放入模型的工作上下文中,而不必被压缩成脆弱的摘要。但能够利用如此多上下文的模型也最难服务:一个具有百万 token 上下文的 1.6T 参数 MoE,并不是大多数团队愿意自行部署、调优和运维的。
DeepSeek-V4 Pro 现已在 Together AI(AI 原生云)上线,团队可以从 512K 上下文的 Serverless Inference 起步,再迁移到专用基础设施以获得完整的 1M 上下文、预留容量和生产级控制。DeepSeek-V4 Flash 即将推出,为团队提供另一个 V4 选项,适用于速度和成本比最大推理深度更重要的场景。
概览
| 规格 | 值 |
|---|---|
| 模型 | Together AI 上的 DeepSeek V4 Pro |
| 端点 | deepseek-ai/DeepSeek-V4-Pro |
| 架构 | 1.6T 参数 MoE |
| 激活参数 | 49B |
| Together AI 上的上下文 | 512K tokens |
| 模型级上下文 | 1M tokens |
| 推理模式 | Non-Think、Think High、Think Max |
| 部署方式 | Serverless、月度预留 |
| 输入价格 | $2.10 / 1M tokens |
| 缓存输入价格 | $0.20 / 1M tokens |
| 输出价格 | $4.40 / 1M tokens |
| 最适用场景 | 代码智能体、文档智能、长上下文智能体、研究综合 |
为长上下文推理而构建
DeepSeek V4 Pro 专为模型需要基于远超简短提示进行推理的场景而构建:大型代码仓库、长篇技术文档、密集检索包、工具调用历史和研究语料库。
DeepSeek V4 Pro 在模型层面支持百万 token 上下文;在 Together AI 上,它目前提供 512K token 的上下文窗口。这一区别很重要,因为模型能力与部署服务配置并不总是同一回事。Together AI 推出 DeepSeek V4 Pro 时采用的上下文窗口专为可靠的生产服务而设计,同时仍为团队留出足够空间以应对严肃的长上下文工作负载。
架构也很重要,因为长上下文不仅仅是一项产品规格。随着上下文增长,服务成本、内存压力、KV 缓存使用、延迟和并发都会成为系统设计的一部分。DeepSeek V4 Pro 采用混合注意力机制,结合了压缩稀疏注意力和重度压缩注意力,DeepSeek 报告称在百万 token 上下文下,其单 token 推理 FLOPs 为 DeepSeek V3.2 的 27%,KV 缓存为 10%。
按工作负载选择推理力度
DeepSeek V4 Pro 支持三种推理模式,因此团队可以根据任务难度匹配推理深度,而不是对所有请求一视同仁。
| 模式 | 适用场景 | 权衡 |
|---|---|---|
| Non-Think | 提取、分类、简单问答、常规响应 | 低复杂度任务的最快路径 |
| Think High | 代码规划、文档分析、多步推理 | 为复杂工作提供更深的推理 |
| Think Max | 困难调试、深度研究综合、智能体决策点 | 最大推理力度;预计延迟和 token 用量更高 |
文档助手可能会对简单提取使用 Non-Think,对跨策略冲突分析使用 Think High,只有在模型需要推理一个困难决策时才使用 Think Max。代码智能体可能会使用 Think High 来规划迁移,使用 Think Max 来调试一个微妙的跨服务故障。
DeepSeek 报告了在编码、推理、长上下文和智能体任务上的基准测试结果,包括 93.5% LiveCodeBench、90.1% GPQA Diamond、80.6% SWE-bench Verified、83.5% MRCR 1M 和 62.0% CorpusQA 1M。
通过缓存输入定价,让重复的长上下文查询更便宜
长上下文系统通常会在多个问题之间复用同一份大型上下文:一个仓库快照、一组文档、一个策略归档、一份检索负载或一条长智能体轨迹。缓存输入定价让这些重复工作负载更加实用。
DeepSeek V4 Pro 的定价为 \$2.10 / 1M 输入 token,缓存输入为 \$0.20 / 1M token,输出为 \$4.40 / 1M token。这意味着复用上下文的成本降低 90%,当请求中昂贵的部分是一段稳定的文本、并在后续分析中被反复复用时,这一点尤为重要。
示例模式:
- 加载一段大型稳定上下文,例如 300K token 的仓库摘要、合同集或策略归档。
- 针对同一上下文提出多个后续问题。
- 在适用的情况下使用缓存输入定价,大幅降低重复分析的成本。
工作负载模式
代码智能体
当智能体需要跨仓库片段、问题轨迹、内部文档、先前工具调用和拟议补丁进行推理时,使用 DeepSeek V4 Pro。Think High 或 Think Max 在规划变更、调试故障或解决跨文件依赖时最有用。
文档智能
将长上下文用于需要在一次请求中比较的合同、策略集、技术手册或研究合集。Non-Think 可以处理提取和简单问答;Think High 更适合冲突分析、解释和综合。
长上下文智能体轨迹
使用 DeepSeek V4 Pro 检查较长的工具调用历史、中间结果和执行轨迹。更高的推理模式在决策点最有用:当智能体需要决定是继续、调用另一个工具、修改计划还是停止时。
研究综合
将 DeepSeek V4 Pro 用于结合论文、笔记、基准报告、检索文档和先前分析的工作流。当同一组证据在多个问题中被复用时,缓存输入定价尤其有用。
从无服务器开始,再转向预留容量
DeepSeek V4 Pro 可在 Together AI Serverless Inference 和 Monthly Reserved 基础设施上使用。Serverless 是评估、开发和可变流量的合适起点。Monthly Reserved 更适合更稳定的生产需求,即团队需要更可预测的容量和成本控制。
对于长上下文工作负载,部署路径很重要。团队不仅是在选择模型;他们还在选择随着上下文规模增长如何管理吞吐量、并发、延迟、KV 缓存压力和成本。Together AI 为团队提供了一条从评估到生产的路径,而无需自行搭建服务栈。
立即试用
DeepSeek-V4 Pro 现已在 Together AI Serverless Inference 和 Dedicated Endpoints 上提供。
from together import Together
client = Together()
stream = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V4-Pro",
messages=[
{
"role": "user",
"content": "Prove that the square root of 2 is irrational.",
}
],
stream=True,
)
for chunk in stream:
if not chunk.choices:
continue
delta = chunk.choices[0].delta
if hasattr(delta, "reasoning") and delta.reasoning:
print(delta.reasoning, end="", flush=True)
if hasattr(delta, "content") and delta.content:
print(delta.content, end="", flush=True)
从 Serverless Inference 开始进行开发和评估。对于需要完整 1M 上下文、预留容量、工作负载隔离或更可预测吞吐量的生产工作负载,请联系销售,在 Together AI Dedicated Inference 上部署 DeepSeek-V4 Pro。
开始使用
→ 按照我们的 DeepSeek-V4 快速入门,几分钟内即可上手运行
→ 查看 DeepSeek-V4 Pro 模型页面
→ 在 Playground 中试用 DeepSeek-V4 Pro
→ 联系销售 获取专用推理部署和批量定价
来源:Together AI Blog · together.ai