跳到正文
6月20日周四
6月8日周六
6月6日周四
5月31日周五
5月30日周四
5月24日周五
  1. Hugging Face Blog47

    Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架

    Meta 发布 CyberSecEval 2,用于评估 LLM 生成不安全代码、协助网络攻击、被提示词注入操纵以及滥用代码解释器的风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。测试还显示提示词注入仍是未解决问题,LLM 目前难以可靠完成端到端漏洞利用。

5月21日周二
5月7日周二
5月1日周三
  1. OpenAI News62

    OpenAI 封禁与俄罗斯相关操作“Bad Grammar”关联的账号

    OpenAI 封禁了一批与一项此前未报告的俄罗斯来源操作相关的账号,该操作被其命名为“Bad Grammar”。这些账号利用 AI 生成英语和俄语的 Telegram 评论,涉及乌克兰、摩尔多瓦、波罗的海地区及美国政治话题。

    推荐理由:OpenAI 披露一起此前未报告的俄罗斯相关账号操作,可了解平台如何界定并处置这类滥用行为。

4月20日周六
4月4日周四
  1. Hugging Face Blog40

    Hugging Face 与 Wiz Research 合作提升 AI 安全

    Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台安全短板,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。

3月29日周五
3月21日周四
2月26日周一
  1. Hugging Face Blog40

    Hugging Face 详解 AI 水印:工具与技术

    Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印与生成后添加水印两种主要方法,前者需访问模型但更稳健,后者可适用于闭源模型。文章还梳理了 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案,并讨论了水印开放与闭源的利弊。

2月23日周五
  1. Hugging Face Blog38

    Hugging Face 与 Haize Labs 推出红队抵抗排行榜

    Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,系统测试前沿模型在高质量人类越狱攻击下的鲁棒性。该基准整合 AdvBench、AART、Beavertails、Do Not Answer 等红队数据集,用 LlamaGuard 与 GPT-4 判定回答是否安全,并按伤害与暴力、犯罪、隐私等违规类别细分评分。

2月14日周三
2月1日周四
  1. Hugging Face Blog62

    Hugging Face 发布开源模型 Constitutional AI 完整配方

    Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展的合成数据生成。

    推荐理由:Hugging Face 公开了用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可据此复现或改造对齐流程。

1月31日周三
1月29日周一
1月26日周五
1月16日周二
12月14日周四
10月26日周四
10月25日周三
10月3日周二
9月25日周一
9月19日周二
8月15日周二
7月26日周三
6月26日周一
6月1日周四
5月31日周三
  1. OpenAI News65

    OpenAI 用过程监督提升数学推理能力

    OpenAI 训练了一个模型,通过奖励每一步正确的推理过程(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督不仅提升了性能,还带来对齐收益:直接训练模型产出被人类认可的思维链。

    推荐理由:OpenAI 用过程监督替代结果监督训练数学推理模型,读者可了解这一训练思路及其对齐收益。

5月23日周二
  1. Hugging Face Blog60

    Hugging Face 公布 safetensors 安全审计结果并推动其成为默认格式

    Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的关键安全漏洞,并已修复规范格式不精确和允许 polyglot 文件的验证缺失问题。

    推荐理由:Hugging Face 联合 EleutherAI、Stability AI 公开 safetensors 外部安全审计结果,读者可了解该格式为何被推向默认。

5月22日周一