跳到正文
2月6日周一
1月24日周二
12月9日周五
  1. Hugging Face Blog62

    图解基于人类反馈的强化学习 RLHF

    Hugging Face 发布图解 RLHF 的教程文章,把训练流程拆成预训练语言模型、收集偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文章指出奖励模型输出标量奖励,训练时用 KL 散度惩罚约束策略偏离初始模型,并介绍了 TRL、TRLX、RL4LMs 等开源 RLHF 工具。文中还提到人类标注成本高、标注者意见不一致等局限,以及离线 RL、ILQL 等尚未充分探索的方向。

    推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了开源实现与已知局限,适合作为入门框架参考。

11月17日周四
  1. Hugging Face Blog22

    用同态加密在加密数据上做情感分析:Concrete-ML 实战教程

    Hugging Face 发布教程,演示如何用 Concrete-ML 库在完全同态加密(FHE)环境下构建情感分析模型,无需任何密码学背景。流程包括用 BERT 提取文本隐藏表示、训练 XGBoost 分类器,再将预测转为加密数据上的预测,并通过客户端/服务器协议部署到云端,最后在 Hugging Face Spaces 提供完整演示。

11月8日周二
10月12日周三
9月16日周五
8月2日周二
  1. Hugging Face Blog24

    Nyströmformer:用 Nyström 方法以线性时间与内存近似自注意力

    Nyströmformer 通过 Nyström 方法近似标准自注意力,将时间和内存复杂度从 O(n²) 降至 O(n)。它从 query 和 key 中用分段均值构造 landmark,仅需 32 或 64 个 landmark 即可在 n=4096 或 8192 的长序列上取得与标准自注意力及其他高效注意力机制相当的性能。该模型的原始实现与 HuggingFace 实现均已公开。

7月27日周三
7月22日周五
  1. Hugging Face Blog22

    Hugging Face 深度强化学习课程:Advantage Actor Critic (A2C)

    Hugging Face 深度强化学习课程第 7 单元讲解 Advantage Actor Critic (A2C),一种结合基于策略与基于价值方法的混合架构,通过 Actor 控制智能体行为、Critic 评估动作好坏来降低 Reinforce 中蒙特卡洛采样带来的高方差。课程使用 Stable-Baselines3 在 PyBullet 机器人环境中训练双足步行者和蜘蛛两个智能体行走。

7月7日周四
  1. Hugging Face Blog28

    Hugging Face 发布 Twitter 情感分析入门指南:用 Inference API 与 Zapier 实现推文情感分类

    Hugging Face 发布 Twitter 情感分析入门指南,面向开发者和非开发者分别给出实现路径。开发者可用 Tweepy 抓取推文、通过 Inference API 几行代码完成情感分类,并用 Matplotlib 和 WordCloud 可视化结果;非开发者则可借助 Zapier 无代码工具收集推文、调用 Inference API 分析并输出到 Google Sheets。

6月30日周四
5月20日周五
  1. Hugging Face Blog22

    Hugging Face 深度强化学习课程:Q-Learning 入门(下)

    Hugging Face 深度强化学习课程第二单元第二部分讲解 Q-Learning 算法,并从头实现首个 RL 智能体。该算法属于 off-policy 的基于价值方法,采用 TD 方式训练动作价值函数,内部维护一张 Q-table 存储每个状态-动作对的价值。智能体将在 Frozen Lake v1 和自动驾驶出租车两个环境中训练,为第三单元的 Deep Q-Learning 打基础。

5月18日周三
3月16日周三
3月11日周五
  1. Hugging Face Blog38

    在 🤗 Transformers 中用约束束搜索引导文本生成

    Hugging Face 在 🤗 Transformers 中推出约束束搜索(constrained beam search),通过 model.generate() 的 force_words_ids 参数让用户指定生成结果中必须包含的词。该功能支持强制单个词、多个短语以及析取约束(在候选词列表中至少包含一个),可在生成阶段直接控制输出,无需事后再筛选。

2月2日周三
11月4日周四
10月29日周五
  1. OpenAI News62

    OpenAI 训练系统求解小学数学应用题,准确率约为微调 GPT-3 的两倍

    OpenAI 训练了一个求解小学数学应用题的模型,准确率接近微调 GPT-3 模型的两倍。在自建数据集的同一批题目上,该系统的正确率为 55%,而 9-12 岁儿童小样本的正确率为 60%,即解题量约为这些孩子的 90%。

    推荐理由:OpenAI 用自建小学数学数据集对比微调 GPT-3,给出模型与 9-12 岁儿童在同一批题目上的准确率差距。

6月3日周四
4月20日周二
3月31日周三
  1. Hugging Face Blog40

    深入理解 BigBird 的块稀疏注意力机制

    Hugging Face 发文详解 BigBird 的块稀疏注意力机制,该模型通过滑动注意力、全局 token 和随机 token 三种方式近似 BERT 的完整注意力,可处理长达 4096 的序列,计算成本远低于 BERT,并已在长文档摘要、长上下文问答等任务上取得 SOTA。BigBird 的 RoBERTa 类模型现已集成到 Transformers 中。

3月9日周二
1月18日周一
10月10日周六
  1. Hugging Face Blog22

    基于 Transformer 的编码器-解码器模型详解

    Hugging Face 发布博客,详解基于 Transformer 的编码器-解码器架构如何建模序列到序列问题,聚焦其数学定义与推理用法。文章将架构拆解为编码器和解码器两部分,并关联 🤗Transformers 中的 T5、Bart、MarianMT、Pegasus 等模型的实际推理。该文不涉及模型训练,仅提供背景与图示说明。

7月3日周五
3月1日周日
10月31日周三
7月4日周三
  1. OpenAI News62

    OpenAI 用单次演示让智能体在《蒙特祖玛的复仇》中取得 74500 分

    OpenAI 训练出一个智能体,仅凭单次人类演示就在《蒙特祖玛的复仇》中取得 74500 分的高分,超过此前所有已公布结果。其算法从演示中挑选特定状态作为起点,让智能体依次游玩并优化游戏得分,所用强化学习算法 PPO 也是 OpenAI Five 的基础。

    推荐理由:OpenAI 用单次人类演示加 PPO 在《蒙特祖玛的复仇》上取得 74500 分,可了解演示驱动强化学习的早期思路。

12月21日周三