Nonobench数织基准评测49个LLM
热点事件观察中
Nonobench数织基准评测49个LLM
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年10月4日,Reddit r/MachineLearning 用户 /u/mauricekleine 发布并开源了基准 Nonobench,用于衡量大语言模型(LLM)解数织(nonogram/picross)谜题的能力。据该报道,评测覆盖 49 个 LLM,共 130 个变体(含不同推理强度档位),尽可能通过 OpenRouter 并固定到各实验室自有端点运行。测试条件为:模型只拿到一次行列线索,须返回完整网格;不使用工具,每题仅一次尝试。报道同时说明,由于每题只尝试一次,单个结果存在噪声,因此给出了 95% 置信区间。目前进展停留在基准发布与结果公布阶段,报道未提及后续更新或第三方复现情况。
AI 根据报道生成 · 58 分钟前更新
最新进展10月4日 15:57
Nonobench:49 个 LLM 解数织谜题的开放基准,公开且开源报道时间线
沿着报道,了解事件的不同侧面。
10月4日
- r/MachineLearningNonobench:49 个 LLM 解数织谜题的开放基准,公开且开源
Nonobench 是一个公开开源的基准,用数织(picross)谜题测试 49 个 LLM:模型只拿到一次行列线索,须在无工具、每题仅一次尝试的条件下返回完整网格。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。