跳到正文
热点事件持续更新

Artificial Analysis公布模型幻觉门控排名与成本对比

2 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月9日,Artificial Analysis在X平台公布多款模型在幻觉门控(Hallucination Gating)下的全通过率与每任务成本对比。其称,引入幻觉门控后排名发生变化:Muse Spark 1.3 (max) 在门控前以26.7%居首,计入幻觉后降至8.9%,Grok 4.7 (xhigh) 以9.4%升至榜首。在 Hallucination-Gated All-Pass Rate 高于0%的模型中,GPT-6 Luna (max)、GPT-6.1 Sol (max)、Muse Spark 1.3 (max) 和 Grok 4.7 (xhigh) 构成得分与每任务成本的帕累托前沿。成本方面,Grok 4.7 (xhigh) 每任务约9.50美元领先,Muse Spark 1.3 (max) 约4.20美元居次,三款 Claude 模型约18至22美元;GPT-6 Luna (max) 最便宜,约0.22美元,得分3.3%。上述数字与排名均来自 Artificial Analysis 的公布内容。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. Artificial Analysis
    Artificial Analysis 评测多模型幻觉与成本

    在 Hallucination-Gated All-Pass Rate 高于 0% 的模型中,有四款在得分与每任务成本之间构成了帕累托前沿:GPT-6 Luna (max)、GPT-6.1 Sol (max)、Muse Spark 1.3 (max) 和 Grok 4.7 (xhigh)。Grok 4.7 (xhigh) 以每任务约 $9.50 领先,Muse Spark 1.3 (max) 以约 $4.20 位居第二,而三款 Claude 模型每任务成本约 $18 至 $22。GPT-6 Luna (max) 最便宜,每任务约 $0.22,得分 3.3%。

  2. Artificial Analysis
    幻觉门控重塑模型排名:Grok 4.7 登顶

    引入幻觉门控后,Muse Spark 1.3 (max) 从 26.7% 降至 8.9%,Grok 4.7 (xhigh) 以 9.4% 升至榜首。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。

关联事件