OpenAI 宣布启动漏洞赏金计划
OpenAI 宣布推出漏洞赏金计划,邀请外界帮助发现其技术与服务中的安全漏洞,以打造安全、可靠、可信的 AI。该计划是 OpenAI 开发安全且先进 AI 承诺的一部分。
OpenAI 宣布推出漏洞赏金计划,邀请外界帮助发现其技术与服务中的安全漏洞,以打造安全、可靠、可信的 AI。该计划是 OpenAI 开发安全且先进 AI 承诺的一部分。
OpenAI 阐述了其确保 AI 系统安全构建、部署和使用的方法,称这是其使命的关键。
Hugging Face 发布《伦理与社会通讯 #3》,阐述其在开放 ML 中兼顾伦理的做法。平台推出 6 个伦理标签(严谨、知情同意、社会意识、可持续、包容、探究)帮助用户发现伦理相关项目,并上线举报功能,让社区标记违反内容准则的模型、数据集或 Space。此外还通过模型卡记录社会影响与偏见、推广 Open RAIL 许可证、监控讨论区等方式降低开放发布带来的风险。
Hugging Face 为 Diffusers 库发布伦理框架,用于指导维护者处理社区贡献时的技术决策,并承诺随时间与社区反馈持续调整。准则涵盖透明、一致、简洁、可访问、可复现与责任六项价值观,同时列出 Community tab、Tag 标记、偏见探索与评估等安全功能,以及 Safe Stable Diffusion、Hub 分阶段发布和 OpenRAILs 许可等部署安全机制。
OpenAI 发布《Planning for AGI and beyond》,阐述其使命是确保通用人工智能(比人类更聪明的 AI 系统)造福全人类。
推荐理由:OpenAI 官方阐述 AGI 使命与长期规划,可了解其对通用人工智能安全与治理的基本立场。
红队测试通过构造自然语言提示词诱导大语言模型暴露有害输出,与对抗攻击不同,其提示词对人类可读。GPT3 早期版本曾表现出性别歧视与针对穆斯林的偏见,微软 Tay 和 Bing 的 Sydney 是缺乏红队评估导致灾难性后果的真实案例。
OpenAI 发文说明 ChatGPT 的行为是如何被塑造的,并介绍其改进该行为的计划,包括允许更多用户自定义,以及在相关决策中引入更多公众意见。
推荐理由:OpenAI 说明 ChatGPT 行为如何被塑造,并给出用户自定义与公众参与决策的改进方向。
OpenAI 发布一款经过训练的分类器,用于区分 AI 生成文本与人类写作文本。
推荐理由:OpenAI 官方发布区分 AI 与人类写作的分类器,可了解其早期检测思路与官方定位。
Hugging Face 博客梳理了让对话智能体变得有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF)。
推荐理由:梳理 IFT、SFT、CoT 与 RLHF 在对话智能体中的作用,并对比多家早期聊天机器人的训练与评测差异。
OpenAI 联合乔治城大学安全与新兴技术中心及斯坦福互联网观测站,研究大语言模型被用于虚假信息宣传的潜在风险,并发布了一份基于一年多研究的联合报告。报告梳理了语言模型若被用于放大虚假信息宣传对信息环境构成的威胁,并提出了分析潜在缓解措施的框架。
Hugging Face 伦理与社会团队发布第二期通讯,讨论机器学习中的偏见问题,指出偏见普遍且复杂,单一技术手段难以有效解决。文章强调 ML 模型作为社会技术系统会放大社会趋势,需结合部署场景持续监测,并介绍了团队开发的偏见分析工具,覆盖任务定义、数据集整理和模型训练各阶段。
Hugging Face 为 🤗 Evaluate 库新增偏见评估指标,可对 GPT-2、BLOOM 等因果语言模型进行基于提示词的偏见检测。工作流分两步:用 🤗 Datasets 上的预设提示词生成文本,再用 🤗 Evaluate 的指标打分,覆盖 Toxicity、Polarity、Hurtfulness 三类任务。
Hugging Face 发布首期 Ethics and Society 通讯,计划按季节在春分、秋分、夏至、冬至发布,由公司内部跨部门开放小组“Ethics and Society regulars”以平等身份共同编写。该通讯围绕协作、责任与透明等原则,分享 Hugging Face 在机器学习伦理落地方面的思考与项目实践,并明确不设统一价值观清单,而是持续输出项目层面的具体讨论。
RAIL Initiative 推出、Hugging Face 支持的 OpenRAIL 是一类 AI 专用许可,允许免版税获取、下游使用与再分发,同时嵌入针对特定关键场景的用途限制。它借鉴 BigScience、开源与 Creative Commons 的做法,试图在广泛开放与防范有害使用之间划出界线,并赋予许可方在模型被滥用时的执行能力。
OpenAI 正在提升 AI 系统从人类反馈中学习、以及协助人类评估 AI 的能力。其目标是构建一个足够对齐的 AI 系统,进而帮助解决其余所有对齐问题。
OpenAI 为 DALL·E 2 部署了一项新技术,使其生成的人物图像能更准确地反映世界人口的多样性,以减少偏见并提升安全性。
OpenAI 为向大众开放 DALL·E 2,在预训练阶段采取多种缓解措施以降低强大图像生成模型带来的风险。这些防护机制用于防止生成图像违反其内容政策。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还发现,模型规模越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升。
推荐理由:OpenAI 训练批评写作模型辅助人类发现摘要缺陷,为 AI 监督 AI 提供了一种可参考的思路。
Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期的起点。章程列出了内容政策中要防止的滥用场景,包括生成虚假信息、生成个人身份信息以及在医疗、法律、金融等高风险领域的不谨慎使用。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项项目价值观,并承认这些价值观之间可能存在冲突,需逐案权衡。
Hugging Face 研究科学家 Sasha Luccioni 在播客中介绍其工作:她担任 Big Science 碳足迹工作组联合主席,研究语言模型训练的环境影响,包括 GPU 小时之外的制造与人员投入成本,并参与数据治理与多语言工作。她此前曾与 Yoshua Bengio 合作开展 AI for climate change 项目,并联合创立 Climate Change AI。
OpenAI 探讨 Goodhart 定律在 AI 目标优化中的影响:当一个度量指标变成目标时,它就不再是好的度量。该定律源自经济学,但在 OpenAI 优化难以或高成本衡量的目标时同样适用。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾任 Google 伦理 AI 团队创始人兼联合负责人,现于 Hugging Face 负责伦理 AI 研究协议与包容性招聘。她因在微软 Seeing AI 项目中目睹模型将爆炸场景描述为"美丽景色"而转向伦理 AI,并指出 ML 团队普遍缺乏对偏见概念的认知与沟通词汇。
OpenAI 分享了在已部署模型安全与滥用问题上的最新思考,旨在帮助其他 AI 开发者应对同类问题。
OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,采用其对齐研究中的技术并引入人类参与训练。这些模型现已作为 OpenAI API 的默认语言模型部署。
推荐理由:OpenAI 官方说明 InstructGPT 的指令跟随与对齐改进,并交代其已成为 API 默认模型。
OpenAI 参与发布了一份由 30 家机构、58 位作者共同撰写的多利益相关方报告,提出 10 项机制以提升 AI 系统相关声明的可验证性。开发者可借助这些工具证明 AI 系统安全、可靠、公平或保护隐私,用户、政策制定者与公民社会也可据此评估 AI 开发过程。
OpenAI 发布 Safety Gym,一套用于衡量强化学习智能体在训练中遵守安全约束进展的环境与工具。该套件面向安全约束下的强化学习智能体评测,提供相应环境和工具支持。
OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何影响模型行为,也暴露了标注偏好与研究者预期的偏差。
OpenAI 开发出一种方法,用于评估神经网络分类器能否可靠抵御训练中未见的对抗攻击,并提出新指标 UAR(Unforeseen Attack Robustness),可衡量单一模型面对未预期攻击时的鲁棒性。该方法同时指出,需要在更多样化的未见攻击范围内衡量模型表现。
OpenAI 发布政策研究论文,提出四项可立即用于提升 AI 安全规范长期行业合作可能性的策略:沟通风险与收益、技术协作、提高透明度、激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能引发集体行动问题,导致 AI 公司对安全投入不足。
OpenAI 发布论文指出,长期 AI 安全研究需要社会科学家参与,以确保 AI 对齐算法在涉及真实人类时能够奏效。论文认为,要让先进 AI 系统与人类价值观正确对齐,必须解决人类理性、情绪与偏见等心理学层面的诸多不确定性,OpenAI 计划全职招聘社会科学家推进这一方向。
OpenAI 提出一种名为 iterated amplification 的 AI 安全技术,通过将复杂任务分解为更简单的子任务来指定超出人类规模的行为与目标,而非依赖标注数据或奖励函数。该想法仍处于早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它可能成为可扩展的 AI 安全方案。
OpenAI 提出一种 AI 安全技术,训练智能体就话题相互辩论,由人类判断胜负。该方法旨在借助辩论提升 AI 系统的安全性。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
推荐理由:OpenAI 联合多家机构用近一年时间梳理 AI 被恶意利用的可能路径与防范思路,可作为 AI 安全治理早期讨论的参照。
OpenAI 开源了 RL-Teacher,一种通过偶发人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术旨在推进安全 AI 系统,也适用于奖励难以明确指定的强化学习问题。
OpenAI 造出能从不同尺度和视角稳定欺骗神经网络分类器的对抗图像,直接挑战了上周"自动驾驶汽车因多尺度、多角度取像而难以被恶意欺骗"的说法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要的目标。OpenAI 称,构建安全 AI 系统的一步是免去人类手写目标函数,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。
对抗样本是攻击者刻意设计、能让机器学习模型出错的输入,相当于给机器看的视错觉。OpenAI 展示了对抗样本如何跨不同媒介生效,并讨论了为何防御这类攻击十分困难。
OpenAI 与 Berkeley、Stanford 研究人员共同合著了由 Google Brain 主导的论文《Concrete Problems in AI Safety》,该论文探讨了确保现代机器学习系统按预期运行的诸多研究问题。