Dario Amodei 在 AI 安全峰会讲解 Anthropic 负责任扩展政策
Anthropic CEO Dario Amodei 在 AI 安全峰会上介绍公司的负责任扩展政策(RSP),该政策于 9 月发布,是首个由主要 AI 公司发布的此类政策。
推荐理由:Anthropic CEO 在 AI 安全峰会上系统讲解 RSP 的分级逻辑与落地经验,可了解前沿实验室如何把安全承诺写进产品与研究流程。
公司与模型
Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。
195 条精选近 30 天 44 条共收录 641 条
Anthropic CEO Dario Amodei 在 AI 安全峰会上介绍公司的负责任扩展政策(RSP),该政策于 9 月发布,是首个由主要 AI 公司发布的此类政策。
推荐理由:Anthropic CEO 在 AI 安全峰会上系统讲解 RSP 的分级逻辑与落地经验,可了解前沿实验室如何把安全承诺写进产品与研究流程。
Anthropic 宣布亚马逊将向其投资最高 40 亿美元,AWS 将成为其关键任务负载的主要云服务商,并提供 AWS Trainium 和 Inferentia 芯片用于模型训练与部署。
推荐理由:Anthropic 官方披露亚马逊最高 40 亿美元投资与 AWS 成为主要云服务商的安排,可了解双方在算力与 Bedrock 上的绑定关系。
Anthropic 发布针对 Claude 10 万 token 长上下文窗口的提示工程实验,测试两种提升长文档召回的方法:先抽取与问题相关的引用再作答,以及在提示中补充文档其他部分正确问答的示例。
推荐理由:Anthropic 用可复现实验量化了长上下文问答中引用摘录与示例提示的效果,方法可直接迁移到自家文档问答。
Anthropic 发布负责任扩展政策(RSP),提出参照美国政府生物安全等级设计的 AI Safety Levels(ASL)框架,按模型潜在灾难性风险高低要求相应的安全、安保与运营标准。
推荐理由:Anthropic 首次公开其分级安全框架,读者可了解前沿实验室如何把灾难性风险纳入发布流程。
Anthropic 为 Claude.ai 聊天体验推出付费订阅 Claude Pro,目前在美国和英国上线。订阅者每月支付 20 美元或 18 英镑,可获得最新模型 Claude 2 的 5 倍使用额度,用于总结研究论文、查询合同和迭代编码项目等任务。
推荐理由:官方给出 Claude Pro 的定价与用量倍数,读者可据此判断订阅方案与免费版的差异。
Anthropic 通过 API 发布 Claude Instant 1.2,这是其更快、更低价但仍具能力的模型版本,融合了 Claude 2 在真实场景中的优势,在数学、编码、推理和安全方面有明显提升。
推荐理由:官方给出 Claude Instant 1.2 在数学、编码与安全上的具体基准对比,可据此判断轻量模型的性价比变化。
Anthropic 发布前沿威胁红队(frontier threats red teaming)研究,介绍其与生物安全专家合作评估模型输出有害生物信息能力的做法与发现。
推荐理由:Anthropic 公开了前沿威胁红队的方法与生物风险实测结论,并给出训练与分类器层面的缓解方向。
Anthropic 发布新模型 Claude 2,可通过 API 使用,并在美国与英国上线 claude.ai 公开测试网站。Claude 2 在编码、数学和推理上较前代提升,Bar 考试多选题得分从 Claude 1.3 的 73.0% 升至 76.5%,Codex HumanEval 从 56.0% 升至 71.2%,GSM8k 从 85.2% 升至 88.0%。
推荐理由:官方给出 Claude 2 在 Bar、GRE、HumanEval 等基准上的具体分数与 100K token 上下文,便于对照前代判断能力提升幅度。
Anthropic 宣布完成 4.5 亿美元 C 轮融资,由 Spark Capital 领投,Google、Salesforce Ventures、Sound Ventures、Zoom Ventures 等参投。
推荐理由:官方披露 C 轮融资规模、投资方与资金用途,可了解 Anthropic 早期在 Claude 产品与 AI 安全研究上的投入方向。
Anthropic 宣布将 Claude 的上下文窗口从 9K 扩展到 100K tokens,约合 7.5 万词,可一次提交数百页材料进行分析,对话可持续数小时甚至数天。官方称处理 10 万 tokens 文本不到一分钟,并举例把《了不起的盖茨比》全文(72K tokens)载入 Claude-Instant 并改动一行,模型 22 秒内找出差异。100K 上下文窗口现已在 API 中提供。
推荐理由:官方给出上下文窗口从 9K 扩到 100K 的具体数字与实测案例,可据此判断长文档处理场景的可用性。
Anthropic 发布 Claude 的宪法全文,说明 Constitutional AI 用一组明文原则替代大规模人类反馈来塑造模型行为。训练分两阶段:先让模型依据原则自我批评和修改回答,再用基于原则的 AI 反馈做强化学习,官方称其在无害性上未使用人类数据,并称 Constitutional RL 在有用性与无害性上相对 RLHF 取得帕累托改进。
推荐理由:Anthropic 公开 Claude 宪法全文与 Constitutional AI 的两阶段训练流程,可了解模型价值观如何被显式写入并可调整。
Anthropic 结束与 Notion、Quora、DuckDuckGo 等伙伴的封闭 alpha 测试,正式发布 AI 助手 Claude,可通过聊天界面和开发者控制台 API 使用。
推荐理由:Anthropic 官方发布 Claude 与 Claude Instant 两个版本,并给出 Notion、Quora、DuckDuckGo 等早期合作方的使用反馈。
Anthropic 发布文章系统阐述其对 AI 安全的核心观点,认为 AI 影响可能堪比工业与科学革命,并可能在未来十年内到来。文章称算力投入以每年 10 倍增长,规模定律表明更多算力带来能力普遍提升,因此快速进展可能持续而非停滞。
推荐理由:Anthropic 官方系统阐述其对 AI 安全风险的判断与研究方向,可了解其安全策略背后的推理框架。
Anthropic 宣布完成 5.8 亿美元 B 轮融资,由 FTX CEO Sam Bankman-Fried 领投,Caroline Ellison、Jaan Tallinn 等参与。
推荐理由:官方披露 B 轮融资规模与资金用途,可了解 Anthropic 早期在可解释性与对齐方向的研究布局。
AI 安全与研究公司 Anthropic 完成 1.24 亿美元 A 轮融资,由 Skype 联合创始人 Jaan Tallinn 领投,Eric Schmidt、Dustin Moskovitz 等参投。资金将用于推进研究路线图,开发可引导、可解释、稳健的大规模 AI 系统原型,公司由 Dario Amodei 任 CEO、Daniela Amodei 任总裁。
推荐理由:Anthropic 早期融资与研究方向的一手说明,可看到其安全与可解释性路线的起点。