腾讯发布开源 Hy4 preview 模型,770B 参数、100 万 token 上下文
Tencent released open-source Hy4 preview model
腾讯发布开源 Hy4 preview,总参数 770B、激活参数 49B,上下文窗口达 100 万 token,官方称这是其目前能力最强的模型,也是其测得的最大代际提升。
腾讯开源 770B 参数旗舰模型,给出百万 token 上下文与 API 价格,可对照其内部盲测结果判断定位。
腾讯发布了 Hy4 preview,这是一款拥有 7700 亿参数的旗舰模型,激活参数为 490 亿,上下文窗口达一百万 token。该公司称这是其迄今为止能力最强的模型,并表示它带来了其测量到的最大代际提升。此次开源发布面向长周期软件工程、文档密集型办公工作、游戏开发和科学研究。
我们将 Hy4-preview 从 1.5TB 压缩到约 200GiB 的 GGUF,它依然运行良好!
认识一下 MIX-STQ1_0。诀窍不只是往低位走,而是决定在哪里走:校准数据为每一层挑选位宽,有些低至 1.31 位的 STQ1_0,有些高至 2.06 位的 IQ2_XXS。同样的预算,更低的…… https://t.co/HItkQ1TSxA pic.twitter.com/xK8d3BH5br
— Tencent Hy (@TencentHunyuan) August 29, 2026
对于软件项目,Hy4 preview 旨在理解、规划、调试和验证跨长时间会话的工作,并额外关注前端输出的视觉质量。它还能将零散文件转化为文档、电子表格和演示文稿,包括涉及数据分析、方程和财务模型的工作。腾讯表示,该模型可以仅凭一个提示构建可玩的原型,并在游戏引擎中通过多轮对话持续完善复杂项目。其研究范围涵盖 AI、凝聚态物理和纯数学。
在一项测试中,Hy4 preview 并行管理了多个 Codex 会话,并随着结果的出现改变其研究方向。腾讯称,在一项小模型后训练任务中,它协调了多个评估目标的工作,并在全部八个基准测试中击败了独立工作的 Codex。该公司将此作为证据,表明该模型能够判断研究方向、组织实验,并在复杂的研发工作中迭代。
0:00
/0:11

一项内部盲测比较中,163 位腾讯专家对 203 项工程任务的输出进行了评分。Hy4 preview 平均得分 2.99,略高于 GLM 5.3(2.92)和 Kimi K3(2.94)。对阵 GLM 5.3 时,它取得 46.8% 胜、12.8% 平、40.4% 负。对阵 Kimi K3 时,它取得 51.2% 胜、7.9% 平、40.9% 负。
腾讯构建 Hy4 preview 时,训练数据的形态围绕其软件工程师、游戏开发者、财务分析师和安全专家所执行的工作。它继续与 CodeBuddy 和 WorkBuddy 共同设计该模型,同时可通过腾讯云、OpenRouter、元宝、ima 和公共代码仓库获取访问。每百万 token 的 API 定价为:缓存输入 0.042 美元,输入 0.834 美元,输出 2.501 美元。腾讯将 Hy4 preview 描述为早期版本,并承认它在复杂任务上可能推理时间超出所需,并过度验证自己的工作。
来源:TestingCatalog · testingcatalog.com