前沿模型幽默能力人类盲评研究
热点事件持续更新
前沿模型幽默能力人类盲评研究
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
2026年10月6日,一项针对前沿AI模型生成原创笑话能力的人类盲评研究结果被发布。该研究由ilreb(Lossfunk)开展,目的是检验大语言模型能否产出原创且好笑的笑话。研究共收集62名受访者的评分,每人需在10分钟会话内对48个笑话进行评分。分析排除了183名未完成在线问卷的受访者,其笑声率为3.7%,而完成在线问卷者的笑声率为10.6%。结果显示,OpenAI与Anthropic的六款模型形成两个梯队:GPT-6 Astra、Fable 5.1和Opus 4.5组成最强梯队,GPT-5 mini、GPT-5.2和Haiku 4.5组成较弱梯队。研究代码与报告已在GitHub(paraschopra/jokes-verifiable)公开。
AI 根据报道生成 · 55 分钟前更新
最新进展10月6日 23:56
前沿 AI 模型有多好笑?GPT-6 Astra、Fable 5.1 与 Opus 4.5 笑话生成对比研究报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- Hacker News · AI前沿 AI 模型有多好笑?GPT-6 Astra、Fable 5.1 与 Opus 4.5 笑话生成对比研究
一项针对 OpenAI 与 Anthropic 六款模型的笑话生成盲评研究显示,GPT-6 Astra、Fable 5.1 和 Opus 4.5 组成最强梯队,GPT-5 mini、GPT-5.2 和 Haiku 4.5 组成较弱梯队。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。