跳到正文
UK AI Security Institute Blog·· 16 小时前精选AI 评分62

AISI 开源 Transect,让大规模智能体评测更易理解

Transect: Making large-scale agentic evaluations easier to understand

AI 导读

英国 AI 安全研究所(AISI)在 Meridian Labs 支持下发布开源 Python 包 Transect,基于 Inspect Scout 构建,把智能体评测转录转化为一份交互式报告。

推荐理由

AISI 开源了把智能体评测长转录压缩成可交互时间线的工具,读者可了解其如何让多智能体协作过程可核查。

正文 · AI 翻译

随着前沿 AI 模型能力不断增强,稳健的评估也必须跟上步伐。智能体在评估过程中采取的行动也变得越来越广泛:它们编写代码、运行实验,并相互协作以完成复杂任务。在长时间评估中,智能体会尝试多种策略、遭遇错误,并将工作委派给其他智能体。 

最终的评估分数几乎无法揭示这些过程——智能体尝试了哪些方法、在哪里卡住,或者测试设置如何影响了它们的工作。评估会生成记录,其中记录了智能体的消息、工具调用和工具响应。从冗长的记录中重建所发生的事情可能需要大量时间和领域专业知识。

大型语言模型(LLM)可以帮助对这些记录进行分段、分类和解读(即所谓的LLM-as-judges,或在 Inspect Scout 术语中称为评判扫描器),但它们的判断可能是错误或误导性的。因此,审查者需要检查支持性的记录段落,以及自动分析是如何产生的。

为了解决这些问题,在 Meridian Labs 的支持下,我们发布了 Transect,这是一个基于 Inspect Scout 构建的开源 Python 包。它将智能体评估记录的复杂性转化为一份交互式报告。审查者可以跟踪评估运行的过程,一起检查各种信号(如 token 使用量或子智能体活动),并导航到相关的记录段落以核验其解读。

AISI 的使命不仅是评估前沿模型能做什么、如何表现,并测试针对有害行为的防护措施,还要创新更好、更优秀的工具、方法和框架,以确保评估始终符合目的——并在力所能及之处分享解决方案,以惠及更广泛的评估者社区。

Transect 的功能

要分析一次运行,用户需向 Transect 提供评估记录、任务上下文,以及希望 Transect 区分的活动类别或智能体行为(如实验设计、编码或数据分析)。任务上下文和类别可在同一评估的多次运行中重复使用。

图 1. Transect 报告示意图。活动标签和 token 信息共享同一轮次轴。在报告中,选择一段已标注的活动会显示其分类详情以及指向记录的链接。

随后,Transect 会生成一份报告,将活动标签、token 使用量和记录的事件放在共享时间线上,以便审查者一起查看。审查者可以跟踪智能体从运行实验到撰写论文的转变,查看附近的子智能体启动或人类消息,并打开相关的记录段落。在记录 token 使用量的地方,这些标签让审查者能够检查它如何在不同活动之间分布。报告底层的表格可以导出以供进一步分析。

时间线以轮次为索引。每个轮次是一次记录的智能体输出,可能包含文本、工具调用或两者兼有。

Transect 直接从记录文本中提取所记录的事件,例如人类消息和子代理启动。它使用用户选择的 LLM 作为评判者,用用户的类别来标记活动片段。它还可以根据子代理的委派指令对其进行分类;这些标签描述的是它们被要求做什么,而不一定是它们实际做了什么。

跨代理追踪工作

当多个代理共同开展一个研究项目时,它们如何协作并在彼此之间传递工作?在一项开放式 AI 研究的一次运行中,一个代理被要求开展一个研究项目并撰写一篇论文。 该代理有六个日历日、充足的计算资源,以及将任务委派给子代理的能力。

为了跨这些代理追踪工作,我们使用 Transect 进行了一项定制分析。图 2 由该分析生成,追踪了这次运行中的四份文档:研究计划、基线代码、实验草稿,以及研究代理进行的一次盲审。弧线将某个代理对话或任务中的一次“写入”连接到另一个代理对话或任务中稍后的一次“读取”。

图 2。一次研究运行中记录的活动与共享文件访问。上方的条形表示每个对话或任务从首次到末次记录活动的跨度。 在每份文档所在的行上,空心符号标记“写入”,实心符号标记“读取”。每条曲线将某个对话或任务中的一次写入连接到另一个对话或任务中对同一文件的稍后一次读取。颜色和形状区分委派任务、计划任务,以及主对话和聊天对话。水平位置遵循日志中记录的顺序,而非经过的时间;条形并不表示连续或同时发生的活动。代理读取某个文件并不一定意味着它影响了其后续行为。

图 2 显示,子代理最初在研究计划上协作,随后在实现该研究计划所需的代码库上协作。一旦实验开始进行,子代理便在实验设计以及这些实验所产生的数据上密切协作。将这些访问追溯回记录文本,使评审者能够调查主代理如何委派工作,以及它在任务执行期间是否与子代理进行了沟通。

随着评估需要更多代理通过共享文件系统和产物进行同步和异步交互,理解多代理协作模式正变得越来越重要。Transect 使评估者能够直接映射这些多代理交互,并将其与记录文本中的其他事件(例如人类干预,或运行过程中进展或行为的变化)共同解读。

可信度、灵活性与可扩展性

我们在设计 Transect 时优先考虑三点:可信度、灵活性与可扩展性。

可信度意味着让分析的基础和局限可被审查。Transect 将模型生成的标签链接到记录文本,并记录它们是如何产生的。当一项分析使用重复判断或多个评判模型时,评审者可以看到这些判断在何处存在分歧。一致并不证明某个标签是正确的,但分歧有助于引导更仔细的检查。

Transect 会保存活动标签和各个模型的判断结果,因此审查者可以重新打开一次分析,而无需发起新的模型调用。重新运行同一分析还需要保留转录文本、类别定义、设置、自定义分析代码和软件版本。即使这些内容保持不变,新的模型判断也可能有所不同。

灵活性意味着让分析适应任务。 用户可以通过更改任务上下文和活动类别,或添加自定义分析(如上述共享文件分析),使 Transect 适应新的评估。

可扩展性意味着扩展分析,同时保留核查其发现的手段。一旦针对某类任务完成配置,Transect 就能将同样的方法应用于更多运行并生成其报告。用户可以添加自定义分类,并使用相同的工具进行重复判断、对不确定标签的可选模型审查,以及记录标签是如何产生的。

负责任地扩展监督

AISI 对今年早些时候安全事件的回应——当时智能体在一次评估中采取了未经批准的行动——说明了详细审查智能体活动的好处。系统性的转录审查帮助我们识别了智能体的行动并调查了其后果。AISI 关于评估中作弊行为的研究同样表明,为什么必须通过考察智能体如何通过评估来调查表面上的成功。

对于事件调查,Transect 可以围绕一个意外事件来组织记录的行动和委派的工作。让记录的行为更易于检查,是保持智能体可观测性的一项贡献。可靠的结论仍然取决于评估设计和专家的人工判断。

随着智能体在更长的任务中更加自主地工作并与其他智能体协调,评估转录可能达到数十亿个 token,超出人类专家能够完整审查的范围。维持监督需要工具和方法来理解这些活动、考察表现背后的技能、追踪能力变化并调查不安全行为。这些方法必须保留核查其结论所需的证据和分析记录。

公开推出 Transect 是 AISI 更广泛使命的一部分,即不仅要评估前沿模型,还要构建并分享使评估保持适用性的方法。我们希望更广泛的社区能够使用它、对它进行压力测试并改进它。 

Transect 软件包可供使用,我们的配套论文更详细地描述了该方法与案例研究。

‍

来源:UK AI Security Institute Blog · aisi.gov.uk