OpenAI 封禁俄罗斯"Stop News"影响力账号
OpenAI 封禁了一批源自俄罗斯的"Stop News"账号,这些账号利用 AI 生成多语言文章和帖子,针对乌克兰及西方国家开展影响力活动。
OpenAI 封禁了一批源自俄罗斯的"Stop News"账号,这些账号利用 AI 生成多语言文章和帖子,针对乌克兰及西方国家开展影响力活动。
OpenAI 封禁了一批账号,这些账号使用 AI 生成针对一家俄罗斯反腐基金会及相关人物的批评评论。
OpenAI 封禁了名为“A2Z”的账号网络,这些账号利用 AI 在多个平台生成涉及选举、乌克兰和政治的多语言影响力内容。
OpenAI 封禁了一批疑似属于 CyberAv3ngers 的账号,这些账号利用 AI 研究工业控制系统、默认凭据和攻击目标。该组织被指与伊朗有关联。
OpenAI 封禁了一批疑似属于中国关联黑客组织 SweetSpecter 的账号,该组织利用 AI 研究漏洞、编写代码并支持鱼叉式钓鱼攻击。
OpenAI 封禁了一批源自卢旺达的账号,这些账号在该国选举前使用 AI 生成党派性评论内容。
OpenAI 发布安全与安保实践更新。原文未披露具体措施、模型版本或数据细节。
Zico Kolter 加入 OpenAI 董事会,并将同时加入安全与安保委员会。OpenAI 表示,此举旨在以 AI 安全与对齐领域的专业能力强化公司治理。
OpenAI 发布 GPT-4o 系统卡,用于说明该模型在安全与风险方面的评估情况。原文正文未能抓取,仅标题可用。
Hugging Face 梳理了截至 2024 年 8 月 6 日 Hub 上的安全功能:面向所有用户的细粒度 token、2FA、commit 签名、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化安全扫描。Enterprise Hub 用户还可使用 SAML 2.0 与 OIDC 协议的 SSO、Resource Groups 等高级控制。
Google 在 Gemma 2 发布一个月后扩充模型阵容,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版),适合端侧使用,并可与 Gemma 2 27B 搭配做辅助生成,官方称可获得最高 3 倍加速且不损失质量。
推荐理由:Gemma 2 新增 2B 小模型与安全分类器、可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
OpenAI 开发并应用了基于规则奖励(RBRs)的新方法,让模型在无需大量人工数据采集的情况下对齐到安全行为。该方法旨在提升模型的安全表现,减少对人工标注数据的依赖。
OpenAI 提出用证明者-验证者博弈提升语言模型输出的可读性,让 AI 给出的解答更清晰、更易被验证,对人和机器都更可信。
OpenAI 与洛斯阿拉莫斯国家实验室达成研究合作,共同开发安全评估方法,用于评估和衡量前沿模型相关的生物能力与风险。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,用户可查看数据集 PII 含量报告,以便在训练前决定是否进一步过滤。该功能面向含 PII 的标注数据集和大规模预训练数据集,后者虽经过滤仍可能残留少量敏感信息。数据集所有者也可用报告验证发布前的 PII 过滤流程。
OpenAI 推出基于 GPT-4 的 CriticGPT,用于对 ChatGPT 的回答撰写批评意见,帮助人类训练师在 RLHF 过程中发现错误。
OpenAI 公布网络安全资助计划,聚焦创新研究与 AI 在网络安全领域的整合。
OpenAI 提出一套整体性方法,用于构建面向真实世界内容审核的鲁棒自然语言分类系统。该方法针对不良内容检测,强调在真实场景中兼顾系统的稳健性与实用性。
OpenAI 发文详解其文本转语音模型 Voice Engine 的技术原理,并介绍相关安全研究。
OpenAI 利用可扩展的稀疏自编码器新技术,自动在 GPT-4 的计算过程中识别出 1600 万个模式。该方法旨在从模型内部提取可理解的概念。
Hugging Face 称本周早些时候发现其 Spaces 平台遭未授权访问,怀疑部分 Spaces secrets 可能被读取,已撤销其中涉及的若干 HF token 并邮件通知相关用户。
OpenAI 已终止与隐蔽影响力行动相关的账号,并称这些行动未借助其服务获得显著受众增长。
Meta 发布 CyberSecEval 2,用于评估 LLM 生成不安全代码、协助网络攻击、被提示词注入操纵以及滥用代码解释器的风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。测试还显示提示词注入仍是未解决问题,LLM 目前难以可靠完成端到端漏洞利用。
OpenAI 阐述了其安全实践的核心立场:通用人工智能有潜力惠及生活方方面面,因此必须以负责任的方式开发和部署。
OpenAI 推出新技术,帮助研究人员识别由其工具生成的内容,同时加入内容来源与真实性联盟(C2PA)指导委员会,以推动行业标准建设。
OpenAI 封禁了与伊朗背景行动"IUVM"相关的账号,该行动利用 AI 生成并翻译亲伊朗、反以色列和反美的网站内容。
OpenAI 封禁了一批与一项此前未报告的俄罗斯来源操作相关的账号,该操作被其命名为“Bad Grammar”。这些账号利用 AI 生成英语和俄语的 Telegram 评论,涉及乌克兰、摩尔多瓦、波罗的海地区及美国政治话题。
推荐理由:OpenAI 披露一起此前未报告的俄罗斯相关账号操作,可了解平台如何界定并处置这类滥用行为。
OpenAI 封禁了与俄罗斯来源行动"Doppelganger"相关的账号,该行动利用 AI 生成反乌克兰的社交媒体评论、翻译和网站文案,覆盖多种语言。
OpenAI 封禁了一批与源自中国的"Spamouflage"行动关联的账号,该行动利用 AI 研究社交媒体活动、生成帖文并调试一个此前未被报道的网站。
OpenAI 封禁了一批与一个此前未被报道、源自以色列的影响力运营相关的账号,该运营被其命名为 Zero Zeno。这些账号使用 AI 生成反哈马斯、反卡塔尔、亲以色列、反印度人民党以及亲以色列总工会的内容。
OpenAI 提出"指令层级"方法,通过训练让 LLM 优先执行特权指令,以抵御提示词注入、越狱等攻击。当前 LLM 易被对抗性提示词覆盖原始指令,该方法旨在解决这一安全问题。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台安全短板,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。
OpenAI 分享了 Voice Engine 小规模预览的经验教训,该模型可用于创建自定义语音。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试套取虚构银行 XYZ001 客户的敏感信息,再投票选出隐私保护更强的模型。
Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印与生成后添加水印两种主要方法,前者需访问模型但更稳健,后者可适用于闭源模型。文章还梳理了 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案,并讨论了水印开放与闭源的利弊。
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,系统测试前沿模型在高质量人类越狱攻击下的鲁棒性。该基准整合 AdvBench、AART、Beavertails、Do Not Answer 等红队数据集,用 LlamaGuard 与 GPT-4 判定回答是否安全,并按伤害与暴力、犯罪、隐私等违规类别细分评分。
OpenAI 发布公告,称已阻断国家关联威胁行为者对 AI 的恶意使用。原文正文未能抓取,具体处置对象与措施暂无法确认。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展的合成数据生成。
推荐理由:Hugging Face 公开了用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可据此复现或改造对齐流程。
OpenAI 正在构建一套评估框架,用于衡量大语言模型可能协助制造生物威胁的风险。在包含生物学专家和学生的评估中,GPT-4 对生物威胁创建准确率的提升最多为轻微程度。OpenAI 表示这一提升幅度尚不足以得出定论,但可作为后续研究与社区讨论的起点。
Hugging Face 推出 Hallucinations Leaderboard,通过 in-context learning 在 NQ Open、TriviaQA、TruthfulQA、XSum、CNN/DM、RACE、SQuADv2、FEVER、HaluEval 等基准上评测大语言模型的幻觉表现。