跳到正文

内容形态

教程实践 最新动态

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

146 条精选近 30 天 26 条共收录 810 条

更新

精选归档 · 第 7 页

9月23日周六第 121–140 条
  1. Anthropic News62

    Anthropic 发布 Claude 长上下文提示工程实验

    Anthropic 发布针对 Claude 10 万 token 长上下文窗口的提示工程实验,测试两种提升长文档召回的方法:先抽取与问题相关的引用再作答,以及在提示中补充文档其他部分正确问答的示例。

    推荐理由:Anthropic 用可复现实验量化了长上下文问答中引用摘录与示例提示的效果,方法可直接迁移到自家文档问答。

8月8日周二
7月27日周四
6月15日周四
  1. Hugging Face Blog62

    用 Core ML 在 iPhone、iPad 和 Mac 上加速 Stable Diffusion

    Hugging Face 介绍了借助 Core ML 新优化在 Apple 设备上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,把权重从 16 位浮点压缩到每参数 6 bit,并在推理时逐层解压以降低内存占用。

    推荐理由:原文给出 6-bit palettization 的量化转换流程与已上传的四个 Stable Diffusion 模型,读者可据此在 Apple 设备上自行部署。

5月15日周一
5月11日周四
  1. Hugging Face Blog62

    Hugging Face 提出辅助生成解码方法,可将文本生成延迟降低最多 10 倍

    Hugging Face 发布辅助生成(assisted generation)解码方法,通过小模型生成候选 token、大模型一次前向验证,在消费级硬件上最多降低 10 倍延迟。

    推荐理由:Hugging Face 官方详解辅助生成解码原理与 Transformers 用法,读者可据此判断低延迟文本生成的可行路径。

5月9日周二
  1. Hugging Face Blog60

    用 StarCoder 打造编码助手 StarChat

    Hugging Face 团队介绍如何将 16B 参数的 StarCoder 微调为对话式编码助手 StarChat,使用 OpenAssistant 约 2.1 万条英文对话数据,并采用 ChatML 格式标记角色、屏蔽用户轮次的损失。

    推荐理由:原文完整给出用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。

  2. Anthropic News62

    Anthropic 公布 Claude 的宪法与 Constitutional AI 训练方法

    Anthropic 发布 Claude 的宪法全文,说明 Constitutional AI 用一组明文原则替代大规模人类反馈来塑造模型行为。训练分两阶段:先让模型依据原则自我批评和修改回答,再用基于原则的 AI 反馈做强化学习,官方称其在无害性上未使用人类数据,并称 Constitutional RL 在有用性与无害性上相对 RLHF 取得帕累托改进。

    推荐理由:Anthropic 公开 Claude 宪法全文与 Constitutional AI 的两阶段训练流程,可了解模型价值观如何被显式写入并可调整。

4月26日周三
4月5日周三
  1. Hugging Face Blog62

    StackLLaMA:用 RLHF 训练 LLaMA 的实操指南

    Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。

    推荐理由:Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现或迁移到自己的模型对齐任务。

3月24日周五
  1. Hugging Face Blog62

    用 diffusers 训练自己的 ControlNet

    Hugging Face 发布教程,讲解如何用 diffusers 训练 ControlNet,并以人脸姿态为例走完条件设计、数据集构建和模型训练三步。数据集基于微软 FaceSynthetics 的 100K 合成人脸,用 SPIGA 提取 iBUG 68 点关键点生成条件图,再用 BLIP 生成 caption。

    推荐理由:Hugging Face 官方复盘了从条件设计、数据集构建到 diffusers 训练脚本的完整 ControlNet 训练流程,并给出不同显存下的参数配置。

3月3日周五
  1. Hugging Face Blog62

    用机器学习援助土耳其地震幸存者:afetharita 的模型与部署实践

    2023 年 2 月 6 日土耳其东南部发生 7.7 和 7.6 级地震后,一群程序员在 Discord 上协作开发了名为 afetharita(灾害地图)的应用,用于从幸存者的推文和截图中提取地址与需求信息,供搜救队和志愿者使用。

    推荐理由:作者以志愿者身份复盘土耳其地震救援中的模型选型与部署流程,可迁移到快速搭建应急类 ML 应用。

1月26日周四
1月24日周二
12月9日周五
  1. Hugging Face Blog62

    图解基于人类反馈的强化学习 RLHF

    Hugging Face 发布图解 RLHF 的教程文章,把训练流程拆成预训练语言模型、收集偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文章指出奖励模型输出标量奖励,训练时用 KL 散度惩罚约束策略偏离初始模型,并介绍了 TRL、TRLX、RL4LMs 等开源 RLHF 工具。文中还提到人类标注成本高、标注者意见不一致等局限,以及离线 RL、ILQL 等尚未充分探索的方向。

    推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了开源实现与已知局限,适合作为入门框架参考。

11月7日周一
11月3日周四
  1. Hugging Face Blog62

    用 Transformers 微调 Whisper 实现多语言 ASR

    Hugging Face 发布教程,介绍如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖 Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估及 Gradio 演示的完整代码。

    推荐理由:原文给出用 Transformers 微调 Whisper 的完整代码流程,并附 8 小时数据把 WER 从 63.5% 降到 32.0% 的实测结果。

10月13日周四
9月27日周二
  1. Hugging Face Blog62

    Accelerate 如何借助 PyTorch 运行超大模型

    Hugging Face 撰文解释 Accelerate 如何借助 PyTorch 在内存和显存不足的消费级硬件上加载并运行超大模型。它先用 meta device 创建空模型并计算 device map,再按分片逐步加载权重,把层分配到多张 GPU、CPU 内存乃至磁盘,最后通过 hooks 在每次前向传播前后搬运权重。

    推荐理由:原文拆解了 Accelerate 借助 PyTorch meta device 与分片加载在有限显存下跑大模型的完整流程,可迁移到自己的推理部署。