VA-Bench 提出具身空间智能评测基准
热点事件持续更新
VA-Bench 提出具身空间智能评测基准
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
2026年10月5日,机器之心报道,VA-Bench 作者团队提出并发布 VA-Bench(Vision-Action Benchmark,视觉-动作空间智能基准),将空间智能放入「观察→推理→行动→修正」的完整闭环。据该报道,测试前模型观看成功示范视频以理解任务,但不会获得物体坐标、专家轨迹或精确动作参数;测试中模型可主动切换视角,但会消耗交互步数,需在继续观察与开始行动之间取舍。该基准用 14 类机器人操作任务、280 个基础场景测试 12 个多模态模型,发现目标识别与定位(TL)可达 100%、操作语义理解(MS)达 99.6%—100%,但 Qwen3.8-max、Opus-5、GPT-5.6-sol 完整任务成功率仅 53.93%、52.86%、51.55%,报道称这测出大模型空间智能的「执行断层」:看懂不等于做对。目前进展为基准发布与首轮评测结果公布。
AI 根据报道生成 · 4 小时前更新
最新进展10月5日 11:43
VA-Bench 测出大模型空间智能的执行断层:看懂不等于做对报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- 机器之心VA-Bench 测出大模型空间智能的执行断层:看懂不等于做对
机器之心报道,VA-Bench 用 14 类机器人操作任务、280 个基础场景测试 12 个多模态模型,发现目标识别与定位(TL)可达 100%、操作语义理解(MS)达 99.6%—100%,但 Qwen3.8-max、Opus-5、GPT-5.6-sol 完整任务成功率仅 53.93%、52.86%、51.55%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。