ARC Prize 公布 Grok 4.7 三项基准成绩
先了解这件事
2026年10月7日,ARC Prize 在 X 上公布 SpaceXAI 的 Grok 4.7 在 ARC-AGI 三项基准上的验证成绩。ARC-AGI-2 最佳得分 61.4%,单任务成本 2.01 美元;对比 Grok 4.6 为 67.1%、0.76 美元,在输入输出 token 定价相同的情况下单任务成本上升 166%。ARC-AGI-1 为 90.2%(0.64 美元/任务),高于 Grok 4.6;ARC-AGI-3 在标准 harness 下为 1.8%(2.7 千美元),在 provider adapter harness 下为 10.0%(4.8 千美元),均低于 Grok 4.6。ARC Prize 指出,Grok 4.7 在 ARC-AGI-2 semi-private 任务的中、高、xhigh 推理档位平均推理 token 用量均高于 Grok 4.6,导致每任务成本上升:每次测试对尝试,medium 多 136%、high 多 125%、xhigh 多 173%,low 少 27%。其推理 token 用量与公开得分相关:low 档平均每次尝试 10k token、得分 25%,medium 至 xhigh 为 86k 至 120k token、得分 57.5% 至 60%。完整结果见 arcprize.org/results/xai-grok-4-7。
AI 根据报道生成 · 50 分钟前更新
报道时间线
沿着报道,了解事件的不同侧面。
- ARC PrizeARC Prize 公布 Grok 4.7 测试结果
@SpaceXAI - 排行榜:https://arcprize.org/leaderboard - 复现公开结果:https://github.com/arcprize/arc-agi-benchmarking - 测试政策:https://arcprize.org/policy - Grok 4.7 完整结果:https://arcprize.org/results/xai-grok-4-7
- ARC PrizeGrok 4.7 推理 token 用量与 ARC-AGI-2 得分相关
@SpaceXAI Grok 4.7 的推理 token 用量与其 ARC-AGI-2 公开得分相关:low 档平均每次测试对尝试用 10k token,得分 25%;而 medium 到 xhigh 档为 86k 到 120k token,得分 57.5% 到 60%。low 档更低的 token 用量可能有助于解释其更低的得分。
- ARC PrizeGrok 4.7 在 ARC-AGI-2 上推理 token 用量高于 4.6
Grok 4.7 在 ARC-AGI-2 semi-private 任务的中、高、xhigh 推理档位上,平均推理 token 用量均高于 Grok 4.6,导致每任务成本上升。
- ARC PrizeARC Prize 评测:Grok 4.7 在 ARC-AGI-2 得分 61.4%,单任务成本高于 Grok 4.6
ARC Prize 公布 xAI Grok 4.7 在 ARC-AGI-2 上的最佳得分为 61.4%,单任务成本 2.01 美元;Grok 4.6 为 67.1%,单任务成本 0.76 美元。在输入与输出 token 定价相同的情况下,Grok 4.7 的单任务成本上升 166%。完整结果见 https://arcprize.org/results/xai-grok-4-7。
- ARC PrizeGrok 4.7 在 ARC-AGI-3 的两种测试框架得分
@SpaceXAI 在 ARC-AGI-3 上,Grok 4.7 在标准测试框架中得分 1.8%(对比 Grok 4.7 的 2.1%),该框架允许模型在轮次之间保留笔记;在新的 provider adapter 测试框架中得分 10.0%,该框架保留不透明推理并启用自动压缩。
- ARC PrizeARC Prize 公布 Grok 4.7 在 ARC-AGI 三项基准上的成绩
ARC Prize 公布 SpaceXAI 的 Grok 4.7 在 ARC-AGI 上的验证成绩:ARC-AGI-3 为 1.8%(标准 harness,$2.7k)和 10.0%(provider adapter harness,$4.8k),ARC-AGI-2 为 61.4%($2.01/task),ARC-AGI-1 为 90.2%($0.64/task)。ARC Prize 指出,Grok 4.7 在 ARC-AGI-1 上高于 Grok 4.6,但在 ARC-AGI-2 和 ARC-AGI-3 上低于 Grok 4.6。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。