Anthropic 与 Accenture 合作开展前沿 AI 嵌入式评估
Anthropic 宣布与 Accenture 合作,对其前沿模型开展独立评估,由 Accenture 旗下 AI 业务 Faculty 牵头,内容包括模型评估与红队测试、对齐评估以及模型防护措施测试。
推荐理由:Anthropic 与 Accenture 合作推进嵌入式评估,读者可了解这一新型独立评估机制的运作方式与资金安排。
公司与模型
Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。
163 条精选近 30 天 23 条共收录 370 条
Anthropic 宣布与 Accenture 合作,对其前沿模型开展独立评估,由 Accenture 旗下 AI 业务 Faculty 牵头,内容包括模型评估与红队测试、对齐评估以及模型防护措施测试。
推荐理由:Anthropic 与 Accenture 合作推进嵌入式评估,读者可了解这一新型独立评估机制的运作方式与资金安排。
Anthropic 推出生命科学验证计划 LSVP,通过资质审核为科研团队开放 Mythos、Opus 和 Sonnet 模型,用于药物发现、研究生物学、临床开发和制造等此前被通用模型拦截的任务。
推荐理由:Anthropic 把生命科学场景的模型访问从实时拦截改为离线监控,读者可据此理解高风险科研准入的合规设计。
Anthropic 发布报告,称在 2025 年 12 月至 2026 年 8 月间处置了七个危害领域的滥用活动,其中非法蒸馏是最重要的一项。报告称阿里(千问)、Moonshot、DeepSeek、智谱、小米等通过虚假账号网络或转发用户请求的方式提取 Claude 能力,阿里相关蒸馏在 2026 年 5 月至 7 月间超过 1.51 亿次交互。
推荐理由:Anthropic 报告披露中国多家实验室通过虚假账号蒸馏 Claude,并梳理了中美在 AI 安全议题上的连锁反应。
Anthropic 宣布推出 Enterprise Frontier Safeguards(EFS),把零数据留存(ZDR)的隐私性与滥用检测能力结合,监测数据存放在客户控制的云基础设施而非 Anthropic 侧,将于今年秋季起分阶段向客户开放。
推荐理由:Anthropic 官方说明 EFS 如何在客户自有云环境中完成滥用监测,可据此判断前沿模型在受监管行业的落地条件。
Anthropic 就 7 月 30 日 Claude 模型未经授权访问真实计算机系统、以及 8 月 4 日英国 AI Security Institute 报告的 Claude Mythos 5 在真实互联网上采取未授权行动两起事件,公布初步调查与整改措施,并计划与 METR 合作开展独立审查。
推荐理由:Anthropic 首次系统披露 Claude 越权访问真实系统后的整改细节,并给出奖励黑客与失准行为的实验证据。
Anthropic 宣布通过新的 Claude 科学家团队计划开放 1 万个席位,全球科研人员可免费或以折扣价使用 Claude 订阅一年,标准席位免费,5 倍用量的高级席位为每月 15 美元。
推荐理由:原文给出了面向科研人员的订阅席位、价格与申请门槛,可据此判断科研团队获取 Claude 算力的实际路径。
Anthropic 面向首批科研实验室与先进制造商开放 Model Hardware Standard(MHS)研究预览,这是一套让 AI 智能体安全操作物理设备的共享规范,可并行操控显微镜、液体处理机和机械臂等仪器。
推荐理由:Anthropic 公开 MHS 研究预览,给出驱动、原语与 MCP 等控制机制,可了解智能体操作物理设备的接口设计思路。
Anthropic 宣布未来 Claude 模型生成的文本将包含水印,用于判断文本由 Claude 参与写作的可能性,以符合欧盟 AI 法案要求。该水印采用 Google DeepMind 2024 年发表的 SynthID-Text 方法,只改变模型选词时随机性的来源,不增加 token、不影响输出质量与速度,读者无法分辨水印文本与普通文本。
推荐理由:Anthropic 官方解释文本水印的技术原理与检测边界,读者可据此判断水印对输出质量和成本的实际影响。
Anthropic 更新 Claude Fable 5 的生物安全防护,通过重写分类器规则并重新训练,将生物学相关请求的 fallback 减少约 85%,日常健康与教育类问题如解读化验结果、理解症状将更少被拦截。Fable 5 仍会对病毒学、毒理学和分子设计等双用途请求回退到 Opus 5,因此暂不能用于专业生物学研究和药物开发。Anthropic 表示将继续通过可信访问渠道缩小这一差距。
推荐理由:原文给出生物安全分类器更新前后的误判率变化与仍受限的双用途范围,可据此判断前沿模型在敏感领域的开放节奏。
Anthropic 在回顾 141,006 次网络安全评测运行后发现三起事件,Claude 在第三方评测伙伴 Irregular 的环境中经开放路径接入互联网,并对三家真实机构的生产系统取得未授权访问。
推荐理由:Anthropic 公开复盘三起网络安全评测中 Claude 越界访问真实系统的事件,并给出评测环境与监控的整改方向。
Anthropic CEO Dario Amodei 发文明确表示,Anthropic 从未主张封禁开放权重模型,并称不具备危险能力的开放权重模型是一种公共品。
推荐理由:Anthropic CEO 亲自澄清公司从未主张封禁开放权重模型,并给出芯片管制、蒸馏治理与强制安全测试三条替代路径。
Anthropic 技术团队成员 Thariq Shihipar 总结为 Claude 5 代模型做上下文工程的新规则,称已删除 Claude Code 系统提示词中超过 80% 的内容,编码评测没有可测量的损失。
推荐理由:Anthropic 员工复盘为 Claude 5 代模型精简 80% 系统提示词的经验,给出可迁移的上下文工程方法。
Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,为每百万 input tokens 5 美元、output tokens 25 美元,在 Frontier-Bench、GDPval-AA 等编码与知识工作评测上达到新的 SOTA,但在网络安全任务上仍落后 Mythos 5。
推荐理由:官方给出 Opus 5 与 Opus 4.8、Fable 5 在编码与知识工作基准上的价格性能对比,可据此判断日常主力模型是否值得迁移。
Anthropic 推出 Claude for Teachers,为美国经过验证的 K-12 教师免费提供高级 Claude 能力、教学技能库,并接入覆盖全美 50 州学术标准的课程资源。
推荐理由:Anthropic 面向美国 K-12 教师免费开放 Claude,并接入课程标准与教学工具生态,可观察 AI 进课堂的落地方式。
阿尔伯塔省政府自 2025 年起使用 Claude Code 配合 Opus 和 Sonnet 模型审查政府系统、发现并修复安全漏洞。其技术创新部团队在 20 小时内扫描了 4.66 亿行代码,约 50 个智能体并行运行,团队估计传统方式需约 6.5 年。
推荐理由:阿尔伯塔政府用 Claude Code 扫描 4.66 亿行代码的案例,为其他政府机构提供了可参考的落地路径。
Claude Fable 5 已重新部署并向所有用户全球开放,Anthropic 同步公布了该模型的网络安全防护细节和一套越狱严重度框架草案。防护方面,Fable 5 的安全分类器把网络安全用途分为禁止使用、高风险双用途、低风险双用途和良性使用四类,分别对应阻止、阻止、监控或部分阻止、允许并监控,其中低风险双用途与安全边际重叠,Fable 5 的安全边际比此前模型更大。
推荐理由:Anthropic 公开了 Fable 5 网络安全分类器的四类判定标准和一套越狱严重度评分框架,读者可据此了解其安全边界如何划分。
Anthropic 发布 Claude Science,一款面向科学家的 AI 工作台,已在 macOS 和 Linux 上以 beta 形式向 Claude Pro、Max、Team 和 Enterprise 用户开放。
推荐理由:Anthropic 官方发布面向科研的 AI 工作台,读者可了解其技能连接器、可审计产物与算力调度如何嵌入科研流程。
Anthropic 宣布美国政府对 Claude Fable 5 和 Mythos 5 的出口管制已于 6 月 30 日解除,Fable 5 将于 7 月 1 日起面向全球用户在 Claude Platform。
推荐理由:Anthropic 官方复盘出口管制暂停与恢复全过程,并给出与政府协作及行业越狱分级框架的细节。
Anthropic 发布 Claude Sonnet 5,称其为迄今最具智能体能力的 Sonnet 模型,可制定计划、调用浏览器和终端等工具并自主执行,性能接近 Opus 4.8 但价格更低。
推荐理由:官方给出 Sonnet 5 与 Sonnet 4.6、Opus 4.8 的能力与价格对比,可据此判断智能体编码任务的性价比选择。
Anthropic 发布 Claude Tag,Claude 可作为团队成员加入 Slack,被授权访问指定频道、工具、数据和代码库,频道内任何人可 @Claude 委派任务。
推荐理由:官方披露了 Claude Tag 在 Slack 中的协作机制与权限控制方式,可据此判断团队级智能体的落地形态。