AISI发布自主网络能力时间跨度评测
先了解这件事
2026年10月7日,英国AI安全研究院(AISI)发布博客,公布对Claude Mythos Preview与OpenAI GPT-5.5早期检查点的自主网络能力评测结果。AISI估算,前沿模型在窄口径网络任务上达到80%成功率的任务时长自2024年底以来每4.7个月翻一倍,较其2025年11月估计的8个月明显加快。评测中,AISI将每个任务限制在250万token以保证跨时间可比,网络任务套件最长任务为12小时;若无该token上限,成功率过高以致无法计算时间跨度。在专家级任务上,Claude Mythos Preview成功率73%,并成为首个完整通关32步企业网络攻击模拟The Last Ones的模型,10次尝试成功3次,平均完成22步,高于Claude Opus 4.6的16步;GPT-5.5早期检查点专家级任务平均通过率71.4%(±8.0%),高于Claude Mythos Preview的68.6%、GPT-5.4的52.4%和Opus 4.7的48.6%,在TLO上10次尝试成功2次,但未能解决Cooling Tower,目前无模型解决。AISI说明,网络靶场实验使用最高1亿token预算,模型性能在该上限内仍持续提升;上述测试为受控研究环境下的能力评估,不一定反映普通公众用户可获得的GPT-5.5能力。
AI 根据报道生成 · 4 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- UK AI Security Institute Blog英国 AI 安全研究院发布 2025 年度回顾
英国 AI 安全研究院(AISI)发布 2025 年度回顾,列出十项工作成果,包括发布英国政府首份《前沿 AI 趋势报告》,基于两年测试数据呈现前沿模型在网络安全、生物、化学和软件工程上的能力增长与防护措施改善。
- UK AI Security Institute Blog英国 AISI 评测 Claude Mythos Preview 的网络安全能力
英国 AI 安全研究院(AISI)对 Anthropic 的 Claude Mythos Preview 开展网络安全能力评测,结果显示其在专家级 CTF 任务上成功率为 73%,并成为首个完整通关 32 步企业网络攻击模拟 The Last Ones 的模型,10 次尝试中成功 3 次,平均完成 22 步,高于 Claude Opus 4.6 的 16 步。
- UK AI Security Institute Blog英国 AISI 评测 OpenAI GPT-5.5 的网络攻防能力
英国 AI 安全研究院(AISI)发布对 OpenAI GPT-5.5 早期检查点的网络能力评测,结果显示它在 Expert 级网络任务上平均通过率 71.4%(±8.0%),高于 Claude Mythos Preview 的 68.6%、GPT-5.4 的 52.4% 和 Opus 4.7 的 48.6%,可能是其测试过的最强模型。
- UK AI Security Institute BlogAISI:自主 AI 网络攻击能力进步有多快
英国 AI 安全研究院(AISI)发布博客,估算前沿模型在窄口径网络任务上达到 80% 成功率的任务时长自 2024 年底以来每 4.7 个月翻一倍,较其 2025 年 11 月估计的 8 个月明显加快。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。