跳到正文
6月12日周三
  1. Hugging Face Blog62

    Hugging Face 在 TRL 中推出 RLOO 训练器

    Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)训练器,作为 PPO 之外的在线 RLHF 训练算法。官方称 RLOO 只需加载策略模型、参考策略模型和奖励模型三份模型,显存占用比 PPO 少约 50-70%,1B 模型上速度是 PPO 的 2 倍、6.9B 模型上最高 3 倍。

    推荐理由:原文给出 RLOO 与 PPO 在显存、速度和胜率上的对比数据,可据此判断在线 RLHF 训练的成本取舍。

5月28日周二
5月16日周四
4月29日周一
4月22日周一
4月4日周四
4月2日周二
3月28日周四
3月20日周三
  1. Hugging Face Blog60

    GaLore:在消费级硬件上推进大模型训练

    Hugging Face 博客介绍 GaLore 方法,通过将梯度投影到低秩子空间,可在 NVIDIA RTX 4090 等消费级 GPU 上训练 Llama 架构的 7B 参数模型,优化器状态内存减少超过 82.5%。

    推荐理由:原文给出 GaLore 在消费级显卡上训练 7B 模型的内存节省数据与 transformers 接入方式,便于判断显存受限场景的可行性。

3月18日周一
  1. Hugging Face Blog62

    Hugging Face 与 NVIDIA 推出 Train on DGX Cloud,可在 Hub 内用 H100 微调模型

    Hugging Face 与 NVIDIA 合作推出 Train on DGX Cloud,Enterprise Hub 组织可在 Hugging Face Hub 内通过 AutoTrain 和 Spaces 以无代码方式创建训练任务,运行在 NVIDIA DGX Cloud 的 H100 GPU 上。

    推荐理由:原文给出无代码训练入口、支持模型清单和按分钟计费价格,读者可据此估算在 H100 上微调的成本。

3月15日周五
  1. Hugging Face Blog40

    Hugging Face 发布 WebSight 数据集,用视觉语言模型将网页截图转为 HTML 代码

    Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,v0.1 版包含 823,000 对 HTML 代码与对应截图,v0.2 版改用真实图像和 Tailwind CSS 并扩展至 200 万样本。基于该数据集微调的视觉语言模型 Sightseer 能将网页截图转为可用的 HTML 代码,并支持在生成代码中嵌入与原截图相近的图像。

3月4日周一
2月28日周三
  1. Hugging Face Blog74

    BigCode 发布 StarCoder2 系列代码模型与 The Stack v2 数据集

    BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,全部基于新的高质量代码数据集 The Stack v2 训练。

    推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型在参数规模与训练数据上的最新配置。

2月23日周五
2月16日周五
  1. Hugging Face Blog60

    Hugging Face 教程:用开源 LLM 合成数据训练定制模型,成本降至 2.7 美元

    Hugging Face 发布教程,演示如何用开源 Mixtral-8x7B-Instruct-v0.1 为金融新闻情感分类生成合成数据,再通过 AutoTrain 蒸馏出约 0.13B 参数的 RoBERTa-base 模型。

    推荐理由:用开源 LLM 生成合成数据再蒸馏小模型,给出了成本、延迟与碳排放的完整对比,方法可直接迁移到其他分类任务。

2月15日周四
  1. OpenAI News85

    OpenAI 研究:视频生成模型可作为世界模拟器

    OpenAI 发布研究说明,介绍在视频数据上大规模训练生成模型的工作,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建物理世界通用模拟器的一条可行路径。

    推荐理由:OpenAI 官方披露 Sora 的技术路线,说明视频生成模型被当作物理世界通用模拟器来训练。

2月1日周四
  1. Hugging Face Blog62

    Hugging Face 发布开源模型 Constitutional AI 完整配方

    Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展的合成数据生成。

    推荐理由:Hugging Face 公开了用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可据此复现或改造对齐流程。

1月19日周五
1月18日周四
1月2日周二
12月6日周三
11月9日周四
11月7日周二
10月27日周五
10月25日周三
  1. Hugging Face Blog38

    用一行代码交互式探索你的 Hugging Face 数据集

    Renumics Spotlight 现可直接读取 Hugging Face datasets,只需一行 spotlight.show(ds) 即可对数据集做交互式可视化,无需复制或预处理数据。Spotlight 支持加载预测结果与嵌入向量,通过相似度图、混淆矩阵等布局定位关键数据簇与模型失败模式,并可在 GUI 或 Python API 中自定义检查流程。

10月24日周二
  1. Hugging Face Blog62

    RLHF 与 PPO 的 N 个实现细节:复现 OpenAI lm-human-preferences

    作者复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。

    推荐理由:作者复现 OpenAI 原始 RLHF 代码并逐条列出实现细节,其中 PyTorch 与 TensorFlow 版 Adam 的差异会直接影响训练稳定性。

9月28日周四
9月27日周三
9月15日周五
9月13日周三
9月6日周三
  1. Hugging Face Blog78

    TII 的 Falcon 180B 上线 Hugging Face

    TII 发布 Falcon 180B 并上线 Hugging Face,模型有 1800 亿参数,在 3.5 万亿 token 的 RefinedWeb 数据上预训练,是当时最大的公开可用语言模型。

    推荐理由:原文给出 Falcon 180B 的参数量、训练数据与评测对比,可据此判断开源大模型当时的规模上限。

8月24日周四
8月8日周二
8月2日周三
8月1日周二
  1. Hugging Face Blog60

    Segmind 开源 SD-Small 与 SD-Tiny 知识蒸馏代码和权重

    Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,同时保持接近的图像保真度。

    推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,并给出参数量、加速比与使用方式,便于复现和二次微调。