Anthropic 发布 Claude 长上下文提示工程实验
Anthropic 发布针对 Claude 10 万 token 长上下文窗口的提示工程实验,测试两种提升长文档召回的方法:先抽取与问题相关的引用再作答,以及在提示中补充文档其他部分正确问答的示例。
推荐理由:Anthropic 用可复现实验量化了长上下文问答中引用摘录与示例提示的效果,方法可直接迁移到自家文档问答。
内容形态
拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。
146 条精选近 30 天 26 条共收录 810 条
Anthropic 发布针对 Claude 10 万 token 长上下文窗口的提示工程实验,测试两种提升长文档召回的方法:先抽取与问题相关的引用再作答,以及在提示中补充文档其他部分正确问答的示例。
推荐理由:Anthropic 用可复现实验量化了长上下文问答中引用摘录与示例提示的效果,方法可直接迁移到自家文档问答。
Hugging Face 在 TRL 库中上线 Direct Preference Optimization(DPO)方法,并演示如何用它在 stack-exchange 偏好数据上微调 Llama v2 7B 模型。
推荐理由:Hugging Face 官方给出 DPO 在 TRL 中的完整训练流程与代码,读者可据此在自有偏好数据上复现对齐训练。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在 Apple Silicon Mac 上本地运行,并发布混合比特调色板量化方案。
推荐理由:原文给出混合比特调色板量化的具体压缩比与 PSNR 数据,可据此判断本地跑 SDXL 的体积与质量取舍。
Hugging Face 介绍了借助 Core ML 新优化在 Apple 设备上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,把权重从 16 位浮点压缩到每参数 6 bit,并在推理时逐层解压以降低内存占用。
推荐理由:原文给出 6-bit palettization 的量化转换流程与已上传的四个 Stable Diffusion 模型,读者可据此在 Apple 设备上自行部署。
Hugging Face 官方博客宣布,结合 RNN 与 Transformer 优势的 RWKV 架构已集成进 transformers 库,可通过源码或主分支使用。
推荐理由:Hugging Face 官方博客介绍 RWKV 架构并入 transformers 库,读者可了解其兼顾 RNN 推理效率与 Transformer 训练并行的设计思路。
Hugging Face 发布辅助生成(assisted generation)解码方法,通过小模型生成候选 token、大模型一次前向验证,在消费级硬件上最多降低 10 倍延迟。
推荐理由:Hugging Face 官方详解辅助生成解码原理与 Transformers 用法,读者可据此判断低延迟文本生成的可行路径。
Hugging Face 团队介绍如何将 16B 参数的 StarCoder 微调为对话式编码助手 StarChat,使用 OpenAssistant 约 2.1 万条英文对话数据,并采用 ChatML 格式标记角色、屏蔽用户轮次的损失。
推荐理由:原文完整给出用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。
Anthropic 发布 Claude 的宪法全文,说明 Constitutional AI 用一组明文原则替代大规模人类反馈来塑造模型行为。训练分两阶段:先让模型依据原则自我批评和修改回答,再用基于原则的 AI 反馈做强化学习,官方称其在无害性上未使用人类数据,并称 Constitutional RL 在有用性与无害性上相对 RLHF 取得帕累托改进。
推荐理由:Anthropic 公开 Claude 宪法全文与 Constitutional AI 的两阶段训练流程,可了解模型价值观如何被显式写入并可调整。
Hugging Face 博客介绍如何在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上用 diffusers 运行 DeepFloyd 的 IF 文生图模型。
推荐理由:原文给出在免费 Colab 上分阶段加载 IF 的完整代码与显存取舍,可迁移到其他大模型的低显存部署。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。
推荐理由:Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现或迁移到自己的模型对齐任务。
Hugging Face 发布教程,讲解如何用 diffusers 训练 ControlNet,并以人脸姿态为例走完条件设计、数据集构建和模型训练三步。数据集基于微软 FaceSynthetics 的 100K 合成人脸,用 SPIGA 提取 iBUG 68 点关键点生成条件图,再用 BLIP 生成 caption。
推荐理由:Hugging Face 官方复盘了从条件设计、数据集构建到 diffusers 训练脚本的完整 ControlNet 训练流程,并给出不同显存下的参数配置。
Hugging Face 在 Diffusers 中集成 ControlNet,通过 StableDiffusionControlNetPipeline 支持 canny 边缘、OpenPose 姿态、深度图、分割图等多种空间条件控制图像生成。
推荐理由:Diffusers 官方给出 ControlNet 的完整接入方式与多种条件控制示例,可据此判断显存与速度开销。
2023 年 2 月 6 日土耳其东南部发生 7.7 和 7.6 级地震后,一群程序员在 Discord 上协作开发了名为 afetharita(灾害地图)的应用,用于从幸存者的推文和截图中提取地址与需求信息,供搜救队和志愿者使用。
推荐理由:作者以志愿者身份复盘土耳其地震救援中的模型选型与部署流程,可迁移到快速搭建应急类 ML 应用。
Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低只需 11 GB 显存,产出的新增权重文件约 3 MB,比原 UNet 小约一千倍。
推荐理由:Hugging Face 官方给出 LoRA 微调 Stable Diffusion 的完整流程与显存、权重体积数据,可直接照做。
Hugging Face 博客梳理了让对话智能体变得有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF)。
推荐理由:梳理 IFT、SFT、CoT 与 RLHF 在对话智能体中的作用,并对比多家早期聊天机器人的训练与评测差异。
Hugging Face 发布图解 RLHF 的教程文章,把训练流程拆成预训练语言模型、收集偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文章指出奖励模型输出标量奖励,训练时用 KL 散度惩罚约束策略偏离初始模型,并介绍了 TRL、TRLX、RL4LMs 等开源 RLHF 工具。文中还提到人类标注成本高、标注者意见不一致等局限,以及离线 RL、ILQL 等尚未充分探索的方向。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了开源实现与已知局限,适合作为入门框架参考。
Hugging Face 用 🧨 Diffusers 的 Dreambooth 训练脚本做了大量实验,分析不同超参数对微调 Stable Diffusion 的影响并给出推荐设置。
推荐理由:基于大量实验给出 Dreambooth 微调 Stable Diffusion 的超参数建议,可迁移到自己的训练流程。
Hugging Face 发布教程,介绍如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖 Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估及 Gradio 演示的完整代码。
推荐理由:原文给出用 Transformers 微调 Whisper 的完整代码流程,并附 8 小时数据把 WER 从 63.5% 降到 32.0% 的实测结果。
Hugging Face Diffusers 自 0.5.1 版起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上快速推理 Stable Diffusion。
推荐理由:Hugging Face 官方给出在 TPU 上用 JAX/Flax 跑 Stable Diffusion 的完整步骤与并行原理,可迁移到多设备推理。
Hugging Face 撰文解释 Accelerate 如何借助 PyTorch 在内存和显存不足的消费级硬件上加载并运行超大模型。它先用 meta device 创建空模型并计算 device map,再按分片逐步加载权重,把层分配到多张 GPU、CPU 内存乃至磁盘,最后通过 hooks 在每次前向传播前后搬运权重。
推荐理由:原文拆解了 Accelerate 借助 PyTorch meta device 与分片加载在有限显存下跑大模型的完整流程,可迁移到自己的推理部署。