OpenAI 称已阻断与国家关联威胁行为者对 AI 的恶意使用
OpenAI 发布公告,称已阻断国家关联威胁行为者对 AI 的恶意使用。原文正文未能抓取,具体处置对象与措施暂无法确认。
技术方向
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
144 条精选近 30 天 25 条共收录 593 条
OpenAI 发布公告,称已阻断国家关联威胁行为者对 AI 的恶意使用。原文正文未能抓取,具体处置对象与措施暂无法确认。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展的合成数据生成。
推荐理由:Hugging Face 公开了用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可据此复现或改造对齐流程。
Anthropic 发文总结上周三项 AI 政策事件:美国政府发布逾 100 页的 AI 行政令,G7 推出《先进 AI 系统开发组织行为准则》,英国在 Bletchley Park 举办首届 AI 安全峰会并发布 Bletchley Declaration。
推荐理由:Anthropic 官方梳理美国行政令、G7 行为准则与 Bletchley 峰会三项政策动作,并说明其自身立场与参与方式。
Anthropic CEO Dario Amodei 在 AI 安全峰会上介绍公司的负责任扩展政策(RSP),该政策于 9 月发布,是首个由主要 AI 公司发布的此类政策。
推荐理由:Anthropic CEO 在 AI 安全峰会上系统讲解 RSP 的分级逻辑与落地经验,可了解前沿实验室如何把安全承诺写进产品与研究流程。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与风险方面的评估情况。原文正文未能抓取,仅标题可用。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型的能力与安全评估情况。原文正文未能抓取,仅标题可用。
Anthropic 发布负责任扩展政策(RSP),提出参照美国政府生物安全等级设计的 AI Safety Levels(ASL)框架,按模型潜在灾难性风险高低要求相应的安全、安保与运营标准。
推荐理由:Anthropic 首次公开其分级安全框架,读者可了解前沿实验室如何把灾难性风险纳入发布流程。
Anthropic 通过 API 发布 Claude Instant 1.2,这是其更快、更低价但仍具能力的模型版本,融合了 Claude 2 在真实场景中的优势,在数学、编码、推理和安全方面有明显提升。
推荐理由:官方给出 Claude Instant 1.2 在数学、编码与安全上的具体基准对比,可据此判断轻量模型的性价比变化。
Anthropic 发布前沿威胁红队(frontier threats red teaming)研究,介绍其与生物安全专家合作评估模型输出有害生物信息能力的做法与发现。
推荐理由:Anthropic 公开了前沿威胁红队的方法与生物风险实测结论,并给出训练与分类器层面的缓解方向。
Anthropic 发布新模型 Claude 2,可通过 API 使用,并在美国与英国上线 claude.ai 公开测试网站。Claude 2 在编码、数学和推理上较前代提升,Bar 考试多选题得分从 Claude 1.3 的 73.0% 升至 76.5%,Codex HumanEval 从 56.0% 升至 71.2%,GSM8k 从 85.2% 升至 88.0%。
推荐理由:官方给出 Claude 2 在 Bar、GRE、HumanEval 等基准上的具体分数与 100K token 上下文,便于对照前代判断能力提升幅度。
OpenAI 训练了一个模型,通过奖励每一步正确的推理过程(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督不仅提升了性能,还带来对齐收益:直接训练模型产出被人类认可的思维链。
推荐理由:OpenAI 用过程监督替代结果监督训练数学推理模型,读者可了解这一训练思路及其对齐收益。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的关键安全漏洞,并已修复规范格式不精确和允许 polyglot 文件的验证缺失问题。
推荐理由:Hugging Face 联合 EleutherAI、Stability AI 公开 safetensors 外部安全审计结果,读者可了解该格式为何被推向默认。
Anthropic 发布 Claude 的宪法全文,说明 Constitutional AI 用一组明文原则替代大规模人类反馈来塑造模型行为。训练分两阶段:先让模型依据原则自我批评和修改回答,再用基于原则的 AI 反馈做强化学习,官方称其在无害性上未使用人类数据,并称 Constitutional RL 在有用性与无害性上相对 RLHF 取得帕累托改进。
推荐理由:Anthropic 公开 Claude 宪法全文与 Constitutional AI 的两阶段训练流程,可了解模型价值观如何被显式写入并可调整。
Anthropic 发布文章系统阐述其对 AI 安全的核心观点,认为 AI 影响可能堪比工业与科学革命,并可能在未来十年内到来。文章称算力投入以每年 10 倍增长,规模定律表明更多算力带来能力普遍提升,因此快速进展可能持续而非停滞。
推荐理由:Anthropic 官方系统阐述其对 AI 安全风险的判断与研究方向,可了解其安全策略背后的推理框架。
OpenAI 发布《Planning for AGI and beyond》,阐述其使命是确保通用人工智能(比人类更聪明的 AI 系统)造福全人类。
推荐理由:OpenAI 官方阐述 AGI 使命与长期规划,可了解其对通用人工智能安全与治理的基本立场。
OpenAI 发文说明 ChatGPT 的行为是如何被塑造的,并介绍其改进该行为的计划,包括允许更多用户自定义,以及在相关决策中引入更多公众意见。
推荐理由:OpenAI 说明 ChatGPT 行为如何被塑造,并给出用户自定义与公众参与决策的改进方向。
OpenAI 发布一款经过训练的分类器,用于区分 AI 生成文本与人类写作文本。
推荐理由:OpenAI 官方发布区分 AI 与人类写作的分类器,可了解其早期检测思路与官方定位。
Hugging Face 博客梳理了让对话智能体变得有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF)。
推荐理由:梳理 IFT、SFT、CoT 与 RLHF 在对话智能体中的作用,并对比多家早期聊天机器人的训练与评测差异。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还发现,模型规模越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升。
推荐理由:OpenAI 训练批评写作模型辅助人类发现摘要缺陷,为 AI 监督 AI 提供了一种可参考的思路。
Anthropic 宣布完成 5.8 亿美元 B 轮融资,由 FTX CEO Sam Bankman-Fried 领投,Caroline Ellison、Jaan Tallinn 等参与。
推荐理由:官方披露 B 轮融资规模与资金用途,可了解 Anthropic 早期在可解释性与对齐方向的研究布局。