跳到正文
热点事件持续更新

VA-Bench 提出具身空间智能评测基准

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026年10月5日,机器之心报道,VA-Bench 作者团队提出并发布 VA-Bench(Vision-Action Benchmark,视觉-动作空间智能基准),将空间智能放入「观察→推理→行动→修正」的完整闭环。据该报道,测试前模型观看成功示范视频以理解任务,但不会获得物体坐标、专家轨迹或精确动作参数;测试中模型可主动切换视角,但会消耗交互步数,需在继续观察与开始行动之间取舍。该基准用 14 类机器人操作任务、280 个基础场景测试 12 个多模态模型,发现目标识别与定位(TL)可达 100%、操作语义理解(MS)达 99.6%—100%,但 Qwen3.8-max、Opus-5、GPT-5.6-sol 完整任务成功率仅 53.93%、52.86%、51.55%,报道称这测出大模型空间智能的「执行断层」:看懂不等于做对。目前进展为基准发布与首轮评测结果公布。

AI 根据报道生成 · 4 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. 机器之心
    VA-Bench 测出大模型空间智能的执行断层:看懂不等于做对

    机器之心报道,VA-Bench 用 14 类机器人操作任务、280 个基础场景测试 12 个多模态模型,发现目标识别与定位(TL)可达 100%、操作语义理解(MS)达 99.6%—100%,但 Qwen3.8-max、Opus-5、GPT-5.6-sol 完整任务成功率仅 53.93%、52.86%、51.55%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。