跳到正文
TestingCatalog· Nero Soares ·· 2026-08-19精选AI 评分80

Ornith-1.5 开源模型发布,含 397B、35B 与 9B 三个规模

Ornith-1.5 open models launch in 397B, 35B, and 9 B sizes.

AI 导读

Ornith 发布 Ornith-1.5 系列开源模型,包含 397B MoE 旗舰、35B MoE(每 token 激活 3B 参数)和 9B 稠密模型,9B 还附带面向 iPhone 和 Android 的量化 Mobile 版本。

推荐理由

Ornith-1.5 把脚手架变成可学习对象并自生成训练任务,读者可据此了解开源模型自我改进闭环的一种实现路径。

正文 · AI 翻译

Ornith 发布了 Ornith-1.5,这是一个开放模型系列,将 Ornith-1.0 的自脚手架框架扩展为一个闭环的自我改进循环。上一代是在一组人工精选的固定任务周围编写脚手架,而 Ornith-1.5 则自行提出任务,为每个任务生成特定于该任务的脚手架,并产出用于强化学习的解决方案 rollout。此次发布涵盖三种规模:397B 的混合专家旗舰模型、每 token 激活 3B 参数的 35B 混合专家模型,以及随附适用于 iPhone 和 Android 的量化 Mobile 版本的 9B 稠密模型。

每个训练周期分三个阶段运行。给定一个环境或代码库、关于任务类型的高层指令,以及模型自身已解决问题的历史,系统会提出逐步加难、超出其已处理范围的任务。随后它生成或优化一个涵盖指令、工具、分解策略和编排的脚手架,并基于两者产出一个 rollout。奖励会反向传播贯穿全部三个阶段,因此系统能同时学会编写更好的解决方案、更有用的训练任务和更可靠的评估框架。任务奖励由三个信号相乘得出:任务与脚手架是否构成一个有效且可验证的环境、难度是否接近当前能力前沿,以及任务相对于已生成的工作是否新颖。前沿难度以 0.2 的经验成功率为目标,因此一旦模型开始稳定地解决某个任务,该任务对生成器就失去价值。有效性作为硬性门槛,会将格式错误的任务归零,三个阶段均使用 GRPO 进行优化。

在公司公布的表格中,对五次独立运行取平均,Ornith-1.5-397B 在 Terminal-Bench 2.1 上得分 85.1,在 DeepSWE 上得分 56.0,Ornith 报告称这与 Claude Opus 4.8 的 85.0 和 59.0 相当,并在同等规模下领先于 GLM-5.2 和 DeepSeek-V4-Flash-0731。35B 在每 token 激活 3B 参数的情况下,在 Terminal-Bench 2.1 和 SWE-Bench Verified 上分别达到 68.5 和 79.0,而 9B 达到 47.0 和 70.6,公司将其置于 Gemma 4-31B 和 Qwen 3.6-35B 之上。覆盖范围从编码延伸到推理和智能体工作,在旗舰规模下 GPQA Diamond 得分 92.8,BrowseComp 得分 86.6。

Ornith 是 DeepReinforce 的模型系列,该研究团队于 2026 年 6 月以 MIT 许可证发布了 Ornith-1.0,涵盖 9B 稠密、31B 稠密、35B MoE 和 397B MoE 变体,权重托管在 Hugging Face 上。该版本是在 Gemma 4 和 Qwen 3.5 检查点上进行后训练的,并引入了将脚手架视为与策略共同演化的可学习对象这一理念。DeepReinforce 此前曾公开发表过强化学习优化研究,包括 CUDA-L1 和 IterX 智能体循环,而奖励黑客一直是这些工作中持续关注的问题。Ornith-1.5 将这种防御带入任务生成中,其中不可验证的任务不会获得任何收益。

HuggingFace:https://huggingface.co/collections/ornith-ai/ornith-15

来源:TestingCatalog · testingcatalog.com