跳到正文
热点事件持续更新

英国AI安全研究院发布HiBayES贝叶斯GLM评测框架

2 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月7日,英国AI安全研究院(UK AI Security Institute)在其博客发布一篇新论文,提出使用贝叶斯广义线性模型(GLM)评估LLM自动评分器(autograder / LLMs-as-judge),使研究者在用自动评分器做模型评测的同时评估其质量。据该院博客,论文讨论的所有统计模型均已作为开源包发布在GitHub上,论文中展示的全部模型以及所有示例的可复现notebook也一并公开在GitHub。同日该院博客的后续报道称,该论文提出的是HiBayES——一个基于分层贝叶斯广义线性模型(GLM)的统计建模框架,用于应对LLM评测数据的分层嵌套结构、小样本和输出随机性;该框架为AI领域研究者与实践者提供即用型软件包及实现多层贝叶斯GLM的分步指导,论文及博客中报告的全部LLM结果均基于使用该院评测框架Inspect在公开基准上获取的数据。两篇报道均未提及适用地域、收费或额度限制,也未给出与其他评估方法的对比结果。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. UK AI Security Institute Blog
    英国 AI 安全研究所提出 HiBayES 分层贝叶斯建模框架改进 LLM 评测

    英国 AI 安全研究所发布论文提出 HiBayES,一个基于分层贝叶斯广义线性模型(GLM)的统计建模框架,用于应对 LLM 评测数据的分层嵌套结构、小样本和输出随机性。

  2. UK AI Security Institute Blog
    英国 AI 安全研究院提出评估自动评分器的贝叶斯 GLM 统计框架

    英国 AI 安全研究院(UK AI Security Institute)在一篇新论文中提出用贝叶斯广义线性模型(GLM)评估 LLM 自动评分器(autograder / LLMs-as-judge),让研究者在用自动评分器做模型评测的同时评估其质量。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。