跳到正文
机器之心·· 6 小时前AI 评分47

VA-Bench 测出大模型空间智能的执行断层:看懂不等于做对

看懂不等于做对:VA-Bench测出大模型空间智能的执行断层

AI 导读

机器之心报道,VA-Bench 用 14 类机器人操作任务、280 个基础场景测试 12 个多模态模型,发现目标识别与定位(TL)可达 100%、操作语义理解(MS)达 99.6%—100%,但 Qwen3.8-max、Opus-5、GPT-5.6-sol 完整任务成功率仅 53.93%、52.86%、51.55%。

来源:机器之心 · mp.weixin.qq.com