Apodex 发布 Apodex 1.1 Deep Discover 模型
Apodex launches Apodex v1.1 Deep Discover model
Apodex 发布 Apodex 1.1 模型家族,主打直接完成工作而非描述工作,可自行打开表格、PDF、数据集并编写运行分析代码,返回表格、图表和脚本。旗舰版为 397B 参数、260K 上下文窗口,另有 35B 开源权重版本 Apodex 1.1 mini,两者目前在 Apodex API 平台免费调用,标价分别为每百万输入 token 0.30 美元和 0.10 美元。
Apodex 1.1 把长任务拆成异步智能体团队并支持中途重规划,读者可据此判断多智能体协作的工程路径。
Apodex 发布了 Apodex 1.1,这是一个旨在完成工作而非描述工作的模型家族。上一代产品读取网页并返回书面答案。这一代则直接打开文件——电子表格、PDF、数据集——选择方法,编写并运行分析代码,然后交回它生成的表格、图表和脚本,且数据可追溯至来源。它于 8 月 24 日上线。
0:00
/0:27

它针对的问题是长任务中途崩溃所带来的成本。一个智能体在第四十步遇到缺失值或假设失败时,要么停止,要么返回含糊的结果,而此前花费的数小时又要重新来过。Apodex 将其解决方案称为 Adaptive Recovery,即系统会解释它正在做出的调整并继续执行。其背后有两个训练方向。Environment Scaling 拓宽了模型学习时所处的文件、搜索和代码环境,而 Agentic Coordination Scaling 则教会它拆分任务。两者都在一个名为 AgentOS 的运行时上执行,该运行时负责整个任务的工具调用、文件状态和进度。

其核心能力是 Deep Discover,在该模式下,模型无需被告知如何操作,就能组建 Apodex 所称的 Agent Team,自行决定任务是否拆分、运行多少个子智能体以及何时合并。该团队是异步的,因此每个分支在完成时即向共享任务状态报告,而非等到最后,主任务实时吸收发现,同时一个实时任务板承载计划、步骤和异常。在运行中途添加文件或更改需求时,仍有效的中间结果会被保留,仅重新规划受影响的部分。随后一个名为 Statement Review 的步骤会根据来源、数据和计算来核查结论,并标记出冲突之处。
在 Apodex 发布并通过其自有测试框架运行的基准测试中,Agent Team 配置在 APEX-Agents 上得分 38.5(1.0 得分为 16.5),在 FrontierScience-Research 上得分 63.3(28.3)。在网络产品上进行的一次查询中,单个 Deep Discover 任务运行了 395 步,跨越 28 个来源,返回了一份 31 KB 的报告,审核者在交付前核查了 51 项声明。旗舰模型是一个 397B 模型,具有 260K 上下文窗口,而一个 35B 开放权重同类模型 Apodex 1.1 mini 则搭载了相同的协调层。目前两者均可在 Apodex API 平台上免费调用,标价分别为每百万输入 token 0.30 美元和 0.10 美元。Deep Discover 位于一个名为 Apodex Frontier 的预览计划之后,而 Deep Research 和 Deep Solve 层级则向所有人开放。
Apodex 于 6 月发布了 1.0,同时推出了 AgentHarness,这是一个仅限于单智能体循环的评估测试框架。随 1.1 以 Apache 2.0 许可发布的 FrontierAgent 取代了它,提供了一个覆盖两种模式的运行时和终端界面,在 macOS 和 Linux 上只需一条命令即可启动。Apodex 还维护着 TRACES,一个面向发现型 AI 的基准测试,并表示 Apodex 2.0 的预训练正在进行中,专为其所称的 Heavy-Duty Solver 打造。
在 GitHub 上为 FrontierAgent 加星,在 Hugging Face 上查看开放权重,或测试 API 平台。
来源:TestingCatalog · testingcatalog.com