Artificial Analysis公布模型幻觉门控排名与成本对比
先了解这件事
2026年10月9日,Artificial Analysis在X平台公布多款模型在幻觉门控(Hallucination Gating)下的全通过率与每任务成本对比。其称,引入幻觉门控后排名发生变化:Muse Spark 1.3 (max) 在门控前以26.7%居首,计入幻觉后降至8.9%,Grok 4.7 (xhigh) 以9.4%升至榜首。在 Hallucination-Gated All-Pass Rate 高于0%的模型中,GPT-6 Luna (max)、GPT-6.1 Sol (max)、Muse Spark 1.3 (max) 和 Grok 4.7 (xhigh) 构成得分与每任务成本的帕累托前沿。成本方面,Grok 4.7 (xhigh) 每任务约9.50美元领先,Muse Spark 1.3 (max) 约4.20美元居次,三款 Claude 模型约18至22美元;GPT-6 Luna (max) 最便宜,约0.22美元,得分3.3%。上述数字与排名均来自 Artificial Analysis 的公布内容。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- Artificial AnalysisArtificial Analysis 评测多模型幻觉与成本
在 Hallucination-Gated All-Pass Rate 高于 0% 的模型中,有四款在得分与每任务成本之间构成了帕累托前沿:GPT-6 Luna (max)、GPT-6.1 Sol (max)、Muse Spark 1.3 (max) 和 Grok 4.7 (xhigh)。Grok 4.7 (xhigh) 以每任务约 $9.50 领先,Muse Spark 1.3 (max) 以约 $4.20 位居第二,而三款 Claude 模型每任务成本约 $18 至 $22。GPT-6 Luna (max) 最便宜,每任务约 $0.22,得分 3.3%。
- Artificial Analysis幻觉门控重塑模型排名:Grok 4.7 登顶
引入幻觉门控后,Muse Spark 1.3 (max) 从 26.7% 降至 8.9%,Grok 4.7 (xhigh) 以 9.4% 升至榜首。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。