Harvey LAB-AA v1.1 加入幻觉检查
先了解这件事
2026年10月8日至9日,Artificial Analysis 与 Harvey 合作发布 Harvey LAB-AA v1.1,为法律智能体基准 LAB 的评分方法加入幻觉检查。据10月8日报道,新版本将幻觉分为与源材料矛盾、编造源内容、无依据断言三类,并区分重大与轻微;只有重大幻觉影响评分,出现一个或多个重大幻觉会使任务在“幻觉门控全通过率”中得零分。无可用提交的任务记零分,且不纳入审计,也不计入每任务幻觉统计。幻觉检查两轮均使用 GPT-6 Sol (high),与三人评审组相互独立;该子集对比不改变使用同一模型作为幻觉检查器的完整 120 项任务排行榜。10月9日后续报道补充:新指标 Hallucination-Gated All-Pass Rate 要求交付物满足全部评分标准且不含实质性幻觉;轻微幻觉单独报告、不影响主分;评分标准改由 GPT-6 Sol、Grok 4.7 和 Claude Opus 5.5 三人评审组评定,取代 v1.0 的单一评审;v1.1 还运行在 Harvey 最新私有数据集上。同一批报道称,Artificial Analysis 在固定 20 个任务、8 个模型的同一批交付物上对比六款幻觉检查器,最终选用 GPT-6 Sol (high) 用于生产;该对比仅显示检查器行为差异,计数本身不能确立准确性,也不能排除自我偏好。报道还提到,在 Harvey 开展的人类偏好研究中,人类专家将幻觉列为在两条同样全面的回答之间做选择的主要决定因素。
AI 根据报道生成 · 2 小时前更新
事件进展
3 个进展
- 10月9日 02:33 · 1 篇报道发布Harvey LAB-AA法律Agent评测基准Artificial Analysis:Harvey LAB-AA 法律智能体评测发布
- 10月9日 02:33 · 1 篇报道Artificial Analysis 比较六种幻觉检查器Artificial Analysis:Artificial Analysis 对比六款模型幻觉检查器并选用 GPT-6 Sol
- 10月8日 08:00 · 3 篇报道发布Harvey LAB-AA v1.1幻觉检查基准Artificial Analysis:Artificial Analysis 与 Harvey 发布 Harvey LAB-AA v1.1 法律智能体基准
报道时间线
沿着报道,了解事件的不同侧面。
- Artificial AnalysisHarvey LAB-AA 法律智能体评测发布
Harvey LAB-AA 使用 @harvey 的 LAB 数据集,并与 Harvey 合作构建。 查看完整结果:https://artificialanalysis.ai/evaluations/harvey-lab-aa 查看 Harvey 对评测及人类专家偏好的评论: https://www.harvey.ai/blog/introducing-harveys-legal-agent-benchmark https://www.harvey.ai/blog/augmenting-human-preference-in-complex-domains
- Artificial AnalysisHarvey 联手 Artificial Analysis 推出幻觉评分流程 v1.1
Artificial Analysis 发布幻觉评分流程 v1.1,用 GPT-6 Sol (high) 两阶段检测法律任务中的幻觉,将幻觉分为矛盾源材料、捏造源内容、无据断言三类,并区分实质性幻觉与轻微幻觉。
- Artificial AnalysisArtificial Analysis 对比六款模型幻觉检查器并选用 GPT-6 Sol
Artificial Analysis 在固定 20 个任务、8 个模型的同一批交付物上对比了六款幻觉检查器,采用两阶段检查,涉及 GPT-6 Sol(high)。
- Artificial AnalysisArtificial Analysis 与 Harvey 发布 Harvey LAB-AA v1.1 法律智能体基准
Artificial Analysis 与 Harvey 联合发布 Harvey LAB-AA v1.1,为法律智能体基准 LAB 的评分方法加入幻觉检查,新指标 Hallucination-Gated All-Pass Rate 要求任务交付物满足全部评分标准且不含实质性幻觉。
- Artificial Analysis ArticlesHarvey LAB-AA v1.1 发布:为智能体法律工作加入幻觉检查
Artificial Analysis 发布 Harvey LAB-AA v1.1,在原有评分基础上加入幻觉检查,将幻觉分为矛盾源材料、编造源内容和无依据断言三类,并区分重大与轻微,只有重大幻觉会触发任务零分。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。