Hugging Face 发布 AI Secure LLM Safety Leaderboard
Hugging Face 推出 LLM Safety Leaderboard,基于 DecodingTrust 的 red-teaming 方法对 LLM 安全性进行评估,该平台曾获 NeurIPS 2023 杰出论文奖。
Hugging Face 推出 LLM Safety Leaderboard,基于 DecodingTrust 的 red-teaming 方法对 LLM 安全性进行评估,该平台曾获 NeurIPS 2023 杰出论文奖。
OpenAI 为 10 支来自全球的团队提供资助,用于设计集体治理 AI 的想法与工具。OpenAI 总结了这些团队的创新做法与自身经验,并呼吁研究人员和工程师加入后续工作。
OpenAI 推出总额 1000 万美元的 Superalignment Fast Grants,资助超人类 AI 系统对齐与安全的技术研究。研究方向包括弱到强泛化、可解释性和可扩展监督等。
OpenAI 提出"弱到强泛化"这一超级对齐新研究方向,探索能否利用深度学习的泛化特性,用弱监督者控制更强的模型,并给出了初步的积极结果。
OpenAI 正在构建应对灾难性风险的前沿准备工作方法,包括组建 Preparedness 团队并发起一项挑战赛,以支持高能力 AI 系统的安全。
OpenAI 联合 Anthropic、Google 和 Microsoft 宣布 Frontier Model Forum 新任执行董事,并设立 1000 万美元 AI 安全基金。该论坛由上述四家公司共同推进,此次更新聚焦于治理层人事与安全资金投入。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与风险方面的评估情况。原文正文未能抓取,仅标题可用。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型的能力与安全评估情况。原文正文未能抓取,仅标题可用。
OpenAI 宣布公开招募 Red Teaming Network 成员,邀请各领域专家参与,以提升其模型的安全性。
OpenAI 将 GPT-4 用于内容政策制定和内容审核决策,可实现更一致的标注、更快的政策优化反馈循环,并减少人工审核员的参与。
OpenAI 联合组建新的行业机构 Frontier Model Forum,旨在推动前沿 AI 系统的安全与负责任开发。该论坛将推进 AI 安全研究、制定最佳实践与标准,并促进政策制定者与行业间的信息共享。
Hugging Face 发布《伦理与社会通讯》第 4 期,聚焦文本到图像模型的偏见问题,指出训练数据、预训练数据过滤、推理、模型潜在空间及事后过滤等环节均可能引入偏见。
OpenAI 启动网络安全资助计划,通过资助及其他支持方式,推动防御方开发 AI 驱动的网络安全能力。
OpenAI 训练了一个模型,通过奖励每一步正确的推理过程(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督不仅提升了性能,还带来对齐收益:直接训练模型产出被人类认可的思维链。
推荐理由:OpenAI 用过程监督替代结果监督训练数学推理模型,读者可了解这一训练思路及其对齐收益。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的关键安全漏洞,并已修复规范格式不精确和允许 polyglot 文件的验证缺失问题。
推荐理由:Hugging Face 联合 EleutherAI、Stability AI 公开 safetensors 外部安全审计结果,读者可了解该格式为何被推向默认。
OpenAI 发文呼吁现在就开始思考超级智能的治理问题,即未来能力远超 AGI 的 AI 系统。文章指出当下正是着手考虑这一议题的好时机。
OpenAI 宣布推出漏洞赏金计划,邀请外界帮助发现其技术与服务中的安全漏洞,以打造安全、可靠、可信的 AI。该计划是 OpenAI 开发安全且先进 AI 承诺的一部分。
OpenAI 阐述了其确保 AI 系统安全构建、部署和使用的方法,称这是其使命的关键。
Hugging Face 发布《伦理与社会通讯 #3》,阐述其在开放 ML 中兼顾伦理的做法。平台推出 6 个伦理标签(严谨、知情同意、社会意识、可持续、包容、探究)帮助用户发现伦理相关项目,并上线举报功能,让社区标记违反内容准则的模型、数据集或 Space。此外还通过模型卡记录社会影响与偏见、推广 Open RAIL 许可证、监控讨论区等方式降低开放发布带来的风险。
Hugging Face 为 Diffusers 库发布伦理框架,用于指导维护者处理社区贡献时的技术决策,并承诺随时间与社区反馈持续调整。准则涵盖透明、一致、简洁、可访问、可复现与责任六项价值观,同时列出 Community tab、Tag 标记、偏见探索与评估等安全功能,以及 Safe Stable Diffusion、Hub 分阶段发布和 OpenRAILs 许可等部署安全机制。
OpenAI 发布《Planning for AGI and beyond》,阐述其使命是确保通用人工智能(比人类更聪明的 AI 系统)造福全人类。
推荐理由:OpenAI 官方阐述 AGI 使命与长期规划,可了解其对通用人工智能安全与治理的基本立场。
红队测试通过构造自然语言提示词诱导大语言模型暴露有害输出,与对抗攻击不同,其提示词对人类可读。GPT3 早期版本曾表现出性别歧视与针对穆斯林的偏见,微软 Tay 和 Bing 的 Sydney 是缺乏红队评估导致灾难性后果的真实案例。
OpenAI 发文说明 ChatGPT 的行为是如何被塑造的,并介绍其改进该行为的计划,包括允许更多用户自定义,以及在相关决策中引入更多公众意见。
推荐理由:OpenAI 说明 ChatGPT 行为如何被塑造,并给出用户自定义与公众参与决策的改进方向。
OpenAI 发布一款经过训练的分类器,用于区分 AI 生成文本与人类写作文本。
推荐理由:OpenAI 官方发布区分 AI 与人类写作的分类器,可了解其早期检测思路与官方定位。
Hugging Face 博客梳理了让对话智能体变得有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF)。
推荐理由:梳理 IFT、SFT、CoT 与 RLHF 在对话智能体中的作用,并对比多家早期聊天机器人的训练与评测差异。
OpenAI 联合乔治城大学安全与新兴技术中心及斯坦福互联网观测站,研究大语言模型被用于虚假信息宣传的潜在风险,并发布了一份基于一年多研究的联合报告。报告梳理了语言模型若被用于放大虚假信息宣传对信息环境构成的威胁,并提出了分析潜在缓解措施的框架。
Hugging Face 伦理与社会团队发布第二期通讯,讨论机器学习中的偏见问题,指出偏见普遍且复杂,单一技术手段难以有效解决。文章强调 ML 模型作为社会技术系统会放大社会趋势,需结合部署场景持续监测,并介绍了团队开发的偏见分析工具,覆盖任务定义、数据集整理和模型训练各阶段。
Hugging Face 为 🤗 Evaluate 库新增偏见评估指标,可对 GPT-2、BLOOM 等因果语言模型进行基于提示词的偏见检测。工作流分两步:用 🤗 Datasets 上的预设提示词生成文本,再用 🤗 Evaluate 的指标打分,覆盖 Toxicity、Polarity、Hurtfulness 三类任务。
Hugging Face 发布首期 Ethics and Society 通讯,计划按季节在春分、秋分、夏至、冬至发布,由公司内部跨部门开放小组“Ethics and Society regulars”以平等身份共同编写。该通讯围绕协作、责任与透明等原则,分享 Hugging Face 在机器学习伦理落地方面的思考与项目实践,并明确不设统一价值观清单,而是持续输出项目层面的具体讨论。
RAIL Initiative 推出、Hugging Face 支持的 OpenRAIL 是一类 AI 专用许可,允许免版税获取、下游使用与再分发,同时嵌入针对特定关键场景的用途限制。它借鉴 BigScience、开源与 Creative Commons 的做法,试图在广泛开放与防范有害使用之间划出界线,并赋予许可方在模型被滥用时的执行能力。
OpenAI 正在提升 AI 系统从人类反馈中学习、以及协助人类评估 AI 的能力。其目标是构建一个足够对齐的 AI 系统,进而帮助解决其余所有对齐问题。
OpenAI 为 DALL·E 2 部署了一项新技术,使其生成的人物图像能更准确地反映世界人口的多样性,以减少偏见并提升安全性。
OpenAI 为向大众开放 DALL·E 2,在预训练阶段采取多种缓解措施以降低强大图像生成模型带来的风险。这些防护机制用于防止生成图像违反其内容政策。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还发现,模型规模越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升。
推荐理由:OpenAI 训练批评写作模型辅助人类发现摘要缺陷,为 AI 监督 AI 提供了一种可参考的思路。
Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期的起点。章程列出了内容政策中要防止的滥用场景,包括生成虚假信息、生成个人身份信息以及在医疗、法律、金融等高风险领域的不谨慎使用。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项项目价值观,并承认这些价值观之间可能存在冲突,需逐案权衡。
Hugging Face 研究科学家 Sasha Luccioni 在播客中介绍其工作:她担任 Big Science 碳足迹工作组联合主席,研究语言模型训练的环境影响,包括 GPU 小时之外的制造与人员投入成本,并参与数据治理与多语言工作。她此前曾与 Yoshua Bengio 合作开展 AI for climate change 项目,并联合创立 Climate Change AI。
OpenAI 探讨 Goodhart 定律在 AI 目标优化中的影响:当一个度量指标变成目标时,它就不再是好的度量。该定律源自经济学,但在 OpenAI 优化难以或高成本衡量的目标时同样适用。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾任 Google 伦理 AI 团队创始人兼联合负责人,现于 Hugging Face 负责伦理 AI 研究协议与包容性招聘。她因在微软 Seeing AI 项目中目睹模型将爆炸场景描述为"美丽景色"而转向伦理 AI,并指出 ML 团队普遍缺乏对偏见概念的认知与沟通词汇。
OpenAI 分享了在已部署模型安全与滥用问题上的最新思考,旨在帮助其他 AI 开发者应对同类问题。
OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,采用其对齐研究中的技术并引入人类参与训练。这些模型现已作为 OpenAI API 的默认语言模型部署。
推荐理由:OpenAI 官方说明 InstructGPT 的指令跟随与对齐改进,并交代其已成为 API 默认模型。