跳到正文
4月11日周二
4月5日周三
3月30日周四
  1. Hugging Face Blog28

    Hugging Face 伦理与社会通讯 #3:Hugging Face 的伦理开放性

    Hugging Face 发布《伦理与社会通讯 #3》,阐述其在开放 ML 中兼顾伦理的做法。平台推出 6 个伦理标签(严谨、知情同意、社会意识、可持续、包容、探究)帮助用户发现伦理相关项目,并上线举报功能,让社区标记违反内容准则的模型、数据集或 Space。此外还通过模型卡记录社会影响与偏见、推广 Open RAIL 许可证、监控讨论区等方式降低开放发布带来的风险。

3月2日周四
  1. Hugging Face Blog22

    Hugging Face 发布 Diffusers 库开发伦理准则

    Hugging Face 为 Diffusers 库发布伦理框架,用于指导维护者处理社区贡献时的技术决策,并承诺随时间与社区反馈持续调整。准则涵盖透明、一致、简洁、可访问、可复现与责任六项价值观,同时列出 Community tab、Tag 标记、偏见探索与评估等安全功能,以及 Safe Stable Diffusion、Hub 分阶段发布和 OpenRAILs 许可等部署安全机制。

2月24日周五
2月16日周四
1月31日周二
1月24日周二
1月11日周三
  1. OpenAI News40

    OpenAI 与乔治城大学、斯坦福互联网观测站联合研究:语言模型如何被用于虚假信息宣传及如何降低风险

    OpenAI 联合乔治城大学安全与新兴技术中心及斯坦福互联网观测站,研究大语言模型被用于虚假信息宣传的潜在风险,并发布了一份基于一年多研究的联合报告。报告梳理了语言模型若被用于放大虚假信息宣传对信息环境构成的威胁,并提出了分析潜在缓解措施的框架。

12月15日周四
  1. Hugging Face Blog41

    Hugging Face 谈机器学习中的偏见:伦理与社会通讯第2期

    Hugging Face 伦理与社会团队发布第二期通讯,讨论机器学习中的偏见问题,指出偏见普遍且复杂,单一技术手段难以有效解决。文章强调 ML 模型作为社会技术系统会放大社会趋势,需结合部署场景持续监测,并介绍了团队开发的偏见分析工具,覆盖任务定义、数据集整理和模型训练各阶段。

10月24日周一
9月22日周四
  1. Hugging Face Blog18

    Hugging Face 推出 Ethics and Society 季度通讯

    Hugging Face 发布首期 Ethics and Society 通讯,计划按季节在春分、秋分、夏至、冬至发布,由公司内部跨部门开放小组“Ethics and Society regulars”以平等身份共同编写。该通讯围绕协作、责任与透明等原则,分享 Hugging Face 在机器学习伦理落地方面的思考与项目实践,并明确不设统一价值观清单,而是持续输出项目层面的具体讨论。

8月31日周三
  1. Hugging Face Blog40

    Hugging Face 支持的 OpenRAIL:面向开放且负责任 AI 的许可框架

    RAIL Initiative 推出、Hugging Face 支持的 OpenRAIL 是一类 AI 专用许可,允许免版税获取、下游使用与再分发,同时嵌入针对特定关键场景的用途限制。它借鉴 BigScience、开源与 Creative Commons 的做法,试图在广泛开放与防范有害使用之间划出界线,并赋予许可方在模型被滥用时的执行能力。

8月24日周三
7月18日周一
6月28日周二
6月13日周一
  1. OpenAI News62

    OpenAI 训练批评写作模型帮助人类发现摘要缺陷

    OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还发现,模型规模越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升。

    推荐理由:OpenAI 训练批评写作模型辅助人类发现摘要缺陷,为 AI 监督 AI 提供了一种可参考的思路。

5月19日周四
  1. Hugging Face Blog18

    Hugging Face 多模态学习团队发布伦理章程,将伦理原则置于研究生命周期核心

    Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期的起点。章程列出了内容政策中要防止的滥用场景,包括生成虚假信息、生成个人身份信息以及在医疗、法律、金融等高风险领域的不谨慎使用。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项项目价值观,并承认这些价值观之间可能存在冲突,需逐案权衡。

5月17日周二
  1. Hugging Face Blog15

    Hugging Face 机器学习专家 Sasha Luccioni:测量 AI 碳足迹与 Big Science 数据治理

    Hugging Face 研究科学家 Sasha Luccioni 在播客中介绍其工作:她担任 Big Science 碳足迹工作组联合主席,研究语言模型训练的环境影响,包括 GPU 小时之外的制造与人员投入成本,并参与数据治理与多语言工作。她此前曾与 Yoshua Bengio 合作开展 AI for climate change 项目,并联合创立 Climate Change AI。

4月13日周三
3月23日周三
  1. Hugging Face Blog22

    Hugging Face 机器学习专家访谈:Margaret Mitchell 谈伦理 AI 与数据偏见

    Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾任 Google 伦理 AI 团队创始人兼联合负责人,现于 Hugging Face 负责伦理 AI 研究协议与包容性招聘。她因在微软 Seeing AI 项目中目睹模型将爆炸场景描述为"美丽景色"而转向伦理 AI,并指出 ML 团队普遍缺乏对偏见概念的认知与沟通词汇。

3月3日周四
1月27日周四
  1. OpenAI News80

    OpenAI 发布 InstructGPT,成为 API 默认语言模型

    OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,采用其对齐研究中的技术并引入人类参与训练。这些模型现已作为 OpenAI API 的默认语言模型部署。

    推荐理由:OpenAI 官方说明 InstructGPT 的指令跟随与对齐改进,并交代其已成为 API 默认模型。

4月16日周四
11月21日周四
9月19日周四
  1. OpenAI News60

    OpenAI 用人类偏好微调 774M 参数 GPT-2

    OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。

    推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何影响模型行为,也暴露了标注偏好与研究者预期的偏差。

8月22日周四
7月10日周三
  1. OpenAI News34

    OpenAI 为何认为负责任 AI 发展需要安全合作

    OpenAI 发布政策研究论文,提出四项可立即用于提升 AI 安全规范长期行业合作可能性的策略:沟通风险与收益、技术协作、提高透明度、激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能引发集体行动问题,导致 AI 公司对安全投入不足。

2月19日周二
  1. OpenAI News42

    OpenAI:AI 安全研究需要社会科学家参与

    OpenAI 发布论文指出,长期 AI 安全研究需要社会科学家参与,以确保 AI 对齐算法在涉及真实人类时能够奏效。论文认为,要让先进 AI 系统与人类价值观正确对齐,必须解决人类理性、情绪与偏见等心理学层面的诸多不确定性,OpenAI 计划全职招聘社会科学家推进这一方向。

10月22日周一
5月3日周四
2月20日周二
8月3日周四
7月17日周一
6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 提出从人类偏好中学习目标的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要的目标。OpenAI 称,构建安全 AI 系统的一步是免去人类手写目标函数,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。

2月24日周五
6月21日周二