跳到正文
热点事件持续更新

AISI发布自主网络能力时间跨度评测

4 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月7日,英国AI安全研究院(AISI)发布博客,公布对Claude Mythos Preview与OpenAI GPT-5.5早期检查点的自主网络能力评测结果。AISI估算,前沿模型在窄口径网络任务上达到80%成功率的任务时长自2024年底以来每4.7个月翻一倍,较其2025年11月估计的8个月明显加快。评测中,AISI将每个任务限制在250万token以保证跨时间可比,网络任务套件最长任务为12小时;若无该token上限,成功率过高以致无法计算时间跨度。在专家级任务上,Claude Mythos Preview成功率73%,并成为首个完整通关32步企业网络攻击模拟The Last Ones的模型,10次尝试成功3次,平均完成22步,高于Claude Opus 4.6的16步;GPT-5.5早期检查点专家级任务平均通过率71.4%(±8.0%),高于Claude Mythos Preview的68.6%、GPT-5.4的52.4%和Opus 4.7的48.6%,在TLO上10次尝试成功2次,但未能解决Cooling Tower,目前无模型解决。AISI说明,网络靶场实验使用最高1亿token预算,模型性能在该上限内仍持续提升;上述测试为受控研究环境下的能力评估,不一定反映普通公众用户可获得的GPT-5.5能力。

AI 根据报道生成 · 4 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. UK AI Security Institute Blog
    英国 AI 安全研究院发布 2025 年度回顾

    英国 AI 安全研究院(AISI)发布 2025 年度回顾,列出十项工作成果,包括发布英国政府首份《前沿 AI 趋势报告》,基于两年测试数据呈现前沿模型在网络安全、生物、化学和软件工程上的能力增长与防护措施改善。

  2. UK AI Security Institute Blog
    英国 AISI 评测 Claude Mythos Preview 的网络安全能力

    英国 AI 安全研究院(AISI)对 Anthropic 的 Claude Mythos Preview 开展网络安全能力评测,结果显示其在专家级 CTF 任务上成功率为 73%,并成为首个完整通关 32 步企业网络攻击模拟 The Last Ones 的模型,10 次尝试中成功 3 次,平均完成 22 步,高于 Claude Opus 4.6 的 16 步。

  3. UK AI Security Institute Blog
    英国 AISI 评测 OpenAI GPT-5.5 的网络攻防能力

    英国 AI 安全研究院(AISI)发布对 OpenAI GPT-5.5 早期检查点的网络能力评测,结果显示它在 Expert 级网络任务上平均通过率 71.4%(±8.0%),高于 Claude Mythos Preview 的 68.6%、GPT-5.4 的 52.4% 和 Opus 4.7 的 48.6%,可能是其测试过的最强模型。

  4. UK AI Security Institute Blog
    AISI:自主 AI 网络攻击能力进步有多快

    英国 AI 安全研究院(AISI)发布博客,估算前沿模型在窄口径网络任务上达到 80% 成功率的任务时长自 2024 年底以来每 4.7 个月翻一倍,较其 2025 年 11 月估计的 8 个月明显加快。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。