跳到正文
热点事件持续更新

AgentForesight在线审计多智能体失败预警研究

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月,机器之心报道,罗格斯大学、得克萨斯大学奥斯汀分校和普渡大学的研究团队在 NeurIPS 2026 论文中提出 AgentForesight,用 7B 模型在多智能体任务运行中持续审计,在关键错误扩散前发出预警。团队同时发布 AFTraj-2K 数据集,包含 2,272 条标注轨迹,其中 1,158 条为经过验证的成功轨迹、1,114 条为失败轨迹;评估在 AFTraj-2K 的 332 条留出测试轨迹上进行。报道称,在 AFTraj-2K 测试集上,该方法对失败轨迹的关键错误步骤识别指标 Exact-F1 达到 66.44,比最强通用模型基线高 19.88 分,对成功轨迹误报率为 2.37%。在未参与训练的外部 Who&When 基准上,AgentForesight-7B 的关键步骤与责任 Agent 识别准确率分别为 57.69% 和 73.08%,ASS 为 1.62,报道称均为论文所列对比模型中的最佳结果。目前进展为论文与数据集发布及基准评测结果公布。

AI 根据报道生成 · 57 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月10日
  1. 机器之心
    NeurIPS 2026 论文提出 AgentForesight:7B 模型在线审计多智能体任务

    罗格斯大学、得克萨斯大学奥斯汀分校和普渡大学的研究团队提出 AgentForesight,用 7B 模型在多智能体任务运行中持续审计,在关键错误扩散前发出预警。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。