Qwen3.8 27B 英文单词加法基准测试
热点事件持续更新
Qwen3.8 27B 英文单词加法基准测试
1 篇报道1 个报道来源20 小时前更新
先了解这件事
AI 综述
2026年10月5日,Simon Willison 公布了对本地 Qwen3.8-27B-Q4_K_M.gguf 模型的一项基准测试,考察其能否仅用英文单词完成正整数加法并给出精确结果。测试使用 5,070 个禁用推理的案例,以及一组 169 个启用中等推理的配对案例。禁用推理时,模型数值准确率为 23.57%,格式合规率 96.17%;一至三位数操作数准确率为 97.04%,十至十三位数骤降至 6.44%。随后启用推理重跑,由于每对耗时更长,每个方格只跑一个样本,热力图每格非 100% 即 0%;169 次尝试中答对 167 次。Willison 表示这些是一次性样本,相信再次运行会得到不同结果。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 07:34
Qwen3.8 27B 用英文单词做加法的基准测试报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Simon WillisonQwen3.8 27B 用英文单词做加法的基准测试
本地 Qwen3.8-27B-Q4_K_M.gguf 在禁用推理时用英文单词做加法仅得 23.57% 数值准确率,格式合规率 96.17%,一至三位数操作数准确率 97.04%,十至十三位数骤降至 6.44%。启用推理后 169 次配对测试中答对 167 次,但每次仅跑一个样本。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。