跳到正文
热点事件观察中

Nonobench数织基准评测49个LLM

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年10月4日,Reddit r/MachineLearning 用户 /u/mauricekleine 发布并开源了基准 Nonobench,用于衡量大语言模型(LLM)解数织(nonogram/picross)谜题的能力。据该报道,评测覆盖 49 个 LLM,共 130 个变体(含不同推理强度档位),尽可能通过 OpenRouter 并固定到各实验室自有端点运行。测试条件为:模型只拿到一次行列线索,须返回完整网格;不使用工具,每题仅一次尝试。报道同时说明,由于每题只尝试一次,单个结果存在噪声,因此给出了 95% 置信区间。目前进展停留在基准发布与结果公布阶段,报道未提及后续更新或第三方复现情况。

AI 根据报道生成 · 58 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月4日
  1. r/MachineLearning
    Nonobench:49 个 LLM 解数织谜题的开放基准,公开且开源

    Nonobench 是一个公开开源的基准,用数织(picross)谜题测试 49 个 LLM:模型只拿到一次行列线索,须在无工具、每题仅一次尝试的条件下返回完整网格。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。