跳到正文
Artificial Analysis· @ArtificialAnlys · X·· 2 小时前精选AI 评分66
AI 导读

蚂蚁 Ling AGI 发布 Ling 3.1 Flash 推理模型,560B 总参数、25B 激活参数、1M token 上下文窗口,在 Artificial Analysis Intelligence Index v4.3 上得分 41,较 8 月发布的 Ling 3.0 Flash 的 20 分大幅提升。

推荐理由

第三方评测机构给出 Ling 3.1 Flash 的完整跑分与定价,可与同档 Flash 模型横向比较。

正文 · AI 翻译

Ling 3.1 Flash 在智能水平上较其前代大幅提升,在 Artificial Analysis Intelligence Index 上得分 41,其中 agentic 能力提升尤为显著

@AntLingAGI 发布了 Ling 3.1 Flash,这是一款推理模型,总参数 560B,激活参数 25B,上下文窗口 1M token。它在 Artificial Analysis Intelligence Index v4.3 上得分 41,高于 8 月发布的 Ling 3.0 Flash 的 20 分。Ling 3.1 Flash 预计将开放权重,蚂蚁集团将很快发布权重。

关键结果:

➤ Ling 3.1 Flash 较其前代提升了 agentic 能力。其 GDPval-AA v2 Elo 为 1,622,AA-Briefcase Elo 为 1,400,可与 GLM-5.3-Flash、Gemini 3.8 Flash (high) 和 DeepSeek V4.1 Flash (Max) 等同级模型相媲美。Ling 3.1 Flash 在 AutomationBench-AA(62%)和 Terminal-Bench v4.0(33%)上也显示出显著提升。

➤ Ling 3.1 Flash 在 AA-Omniscience 上得分 +2,较 Ling 3.0 Flash(-18)提升了 22 分。与其前代相比,在相近的尝试率下(56% 至 58%),其准确率从 18% 升至 29%,而幻觉率从 44% 降至 38%,表明这一提升主要来自知道得更多,而非更多地弃答。作为对比,DeepSeek V4.1 Flash (Max) 的幻觉率为 97%。

➤ Ling 3.1 Flash 是比其前代更大的模型,定价也相应更高,但 token 效率更高。其总参数为 560B、激活参数为 25B,高于 Ling 3.0 Flash 的 124B 和 5.1B,定价为每 1M 输入 / 输出 token $0.30 / $0.90,高于 $0.075 / $0.22。它运行 Intelligence Index 使用了 218M 输出 token,比 Ling 3.0 Flash(261M)少 16%。

➤ Ling 3.1 Flash 的每任务成本高于部分同级模型,但仍处于最具吸引力的象限。Ling 3.1 Flash 每任务成本为 $0.99,远高于 GLM-5.3-Flash($0.42)和 DeepSeek V4.1 Flash (Max, $0.32),但低于 Gemini 3.8 Flash (High) 的 $1.24。

其他模型细节:

➤ 规模:总参数 560B,激活参数 25B

➤ 上下文窗口:1M token

➤ 定价:每 1M 输入 token $0.30,每 1M 输出 token $0.90,缓存输入为每 1M $0.06(80% 折扣)

➤ 可用性:可通过 Novita AI 访问,权重即将发布

来源:Artificial Analysis · x.com