OpenAI 通过网络安全资助计划赋能防御者
OpenAI 公布网络安全资助计划,聚焦创新研究与 AI 在网络安全领域的整合。
OpenAI 公布网络安全资助计划,聚焦创新研究与 AI 在网络安全领域的整合。
OpenAI 提出一套整体性方法,用于构建面向真实世界内容审核的鲁棒自然语言分类系统。该方法针对不良内容检测,强调在真实场景中兼顾系统的稳健性与实用性。
OpenAI 发文详解其文本转语音模型 Voice Engine 的技术原理,并介绍相关安全研究。
OpenAI 利用可扩展的稀疏自编码器新技术,自动在 GPT-4 的计算过程中识别出 1600 万个模式。该方法旨在从模型内部提取可理解的概念。
Hugging Face 称本周早些时候发现其 Spaces 平台遭未授权访问,怀疑部分 Spaces secrets 可能被读取,已撤销其中涉及的若干 HF token 并邮件通知相关用户。
OpenAI 已终止与隐蔽影响力行动相关的账号,并称这些行动未借助其服务获得显著受众增长。
Meta 发布 CyberSecEval 2,用于评估 LLM 生成不安全代码、协助网络攻击、被提示词注入操纵以及滥用代码解释器的风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。测试还显示提示词注入仍是未解决问题,LLM 目前难以可靠完成端到端漏洞利用。
OpenAI 阐述了其安全实践的核心立场:通用人工智能有潜力惠及生活方方面面,因此必须以负责任的方式开发和部署。
OpenAI 推出新技术,帮助研究人员识别由其工具生成的内容,同时加入内容来源与真实性联盟(C2PA)指导委员会,以推动行业标准建设。
OpenAI 封禁了与伊朗背景行动"IUVM"相关的账号,该行动利用 AI 生成并翻译亲伊朗、反以色列和反美的网站内容。
OpenAI 封禁了一批与一项此前未报告的俄罗斯来源操作相关的账号,该操作被其命名为“Bad Grammar”。这些账号利用 AI 生成英语和俄语的 Telegram 评论,涉及乌克兰、摩尔多瓦、波罗的海地区及美国政治话题。
推荐理由:OpenAI 披露一起此前未报告的俄罗斯相关账号操作,可了解平台如何界定并处置这类滥用行为。
OpenAI 封禁了与俄罗斯来源行动"Doppelganger"相关的账号,该行动利用 AI 生成反乌克兰的社交媒体评论、翻译和网站文案,覆盖多种语言。
OpenAI 封禁了一批与源自中国的"Spamouflage"行动关联的账号,该行动利用 AI 研究社交媒体活动、生成帖文并调试一个此前未被报道的网站。
OpenAI 封禁了一批与一个此前未被报道、源自以色列的影响力运营相关的账号,该运营被其命名为 Zero Zeno。这些账号使用 AI 生成反哈马斯、反卡塔尔、亲以色列、反印度人民党以及亲以色列总工会的内容。
OpenAI 提出"指令层级"方法,通过训练让 LLM 优先执行特权指令,以抵御提示词注入、越狱等攻击。当前 LLM 易被对抗性提示词覆盖原始指令,该方法旨在解决这一安全问题。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台安全短板,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。
OpenAI 分享了 Voice Engine 小规模预览的经验教训,该模型可用于创建自定义语音。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试套取虚构银行 XYZ001 客户的敏感信息,再投票选出隐私保护更强的模型。
Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印与生成后添加水印两种主要方法,前者需访问模型但更稳健,后者可适用于闭源模型。文章还梳理了 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案,并讨论了水印开放与闭源的利弊。
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,系统测试前沿模型在高质量人类越狱攻击下的鲁棒性。该基准整合 AdvBench、AART、Beavertails、Do Not Answer 等红队数据集,用 LlamaGuard 与 GPT-4 判定回答是否安全,并按伤害与暴力、犯罪、隐私等违规类别细分评分。
OpenAI 发布公告,称已阻断国家关联威胁行为者对 AI 的恶意使用。原文正文未能抓取,具体处置对象与措施暂无法确认。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展的合成数据生成。
推荐理由:Hugging Face 公开了用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可据此复现或改造对齐流程。
OpenAI 正在构建一套评估框架,用于衡量大语言模型可能协助制造生物威胁的风险。在包含生物学专家和学生的评估中,GPT-4 对生物威胁创建准确率的提升最多为轻微程度。OpenAI 表示这一提升幅度尚不足以得出定论,但可作为后续研究与社区讨论的起点。
Hugging Face 推出 Hallucinations Leaderboard,通过 in-context learning 在 NQ Open、TriviaQA、TruthfulQA、XSum、CNN/DM、RACE、SQuADv2、FEVER、HaluEval 等基准上评测大语言模型的幻觉表现。
Hugging Face 推出 LLM Safety Leaderboard,基于 DecodingTrust 的 red-teaming 方法对 LLM 安全性进行评估,该平台曾获 NeurIPS 2023 杰出论文奖。
OpenAI 为 10 支来自全球的团队提供资助,用于设计集体治理 AI 的想法与工具。OpenAI 总结了这些团队的创新做法与自身经验,并呼吁研究人员和工程师加入后续工作。
OpenAI 推出总额 1000 万美元的 Superalignment Fast Grants,资助超人类 AI 系统对齐与安全的技术研究。研究方向包括弱到强泛化、可解释性和可扩展监督等。
OpenAI 提出"弱到强泛化"这一超级对齐新研究方向,探索能否利用深度学习的泛化特性,用弱监督者控制更强的模型,并给出了初步的积极结果。
OpenAI 正在构建应对灾难性风险的前沿准备工作方法,包括组建 Preparedness 团队并发起一项挑战赛,以支持高能力 AI 系统的安全。
OpenAI 联合 Anthropic、Google 和 Microsoft 宣布 Frontier Model Forum 新任执行董事,并设立 1000 万美元 AI 安全基金。该论坛由上述四家公司共同推进,此次更新聚焦于治理层人事与安全资金投入。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与风险方面的评估情况。原文正文未能抓取,仅标题可用。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型的能力与安全评估情况。原文正文未能抓取,仅标题可用。
OpenAI 宣布公开招募 Red Teaming Network 成员,邀请各领域专家参与,以提升其模型的安全性。
OpenAI 将 GPT-4 用于内容政策制定和内容审核决策,可实现更一致的标注、更快的政策优化反馈循环,并减少人工审核员的参与。
OpenAI 联合组建新的行业机构 Frontier Model Forum,旨在推动前沿 AI 系统的安全与负责任开发。该论坛将推进 AI 安全研究、制定最佳实践与标准,并促进政策制定者与行业间的信息共享。
Hugging Face 发布《伦理与社会通讯》第 4 期,聚焦文本到图像模型的偏见问题,指出训练数据、预训练数据过滤、推理、模型潜在空间及事后过滤等环节均可能引入偏见。
OpenAI 启动网络安全资助计划,通过资助及其他支持方式,推动防御方开发 AI 驱动的网络安全能力。
OpenAI 训练了一个模型,通过奖励每一步正确的推理过程(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督不仅提升了性能,还带来对齐收益:直接训练模型产出被人类认可的思维链。
推荐理由:OpenAI 用过程监督替代结果监督训练数学推理模型,读者可了解这一训练思路及其对齐收益。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的关键安全漏洞,并已修复规范格式不精确和允许 polyglot 文件的验证缺失问题。
推荐理由:Hugging Face 联合 EleutherAI、Stability AI 公开 safetensors 外部安全审计结果,读者可了解该格式为何被推向默认。
OpenAI 发文呼吁现在就开始思考超级智能的治理问题,即未来能力远超 AGI 的 AI 系统。文章指出当下正是着手考虑这一议题的好时机。