Hugging Face 为 tokenizer 引入 chat_template 属性
Hugging Face 的 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,把消息列表转成正确格式的字符串。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可据此理解格式错配为何会静默拖垮模型表现。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
307 条精选近 30 天 55 条共收录 1,024 条
Hugging Face 的 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,把消息列表转成正确格式的字符串。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可据此理解格式错配为何会静默拖垮模型表现。
Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在所有基准上超过 Llama 2 13B,并在多项基准上超过 Llama 1 34B,采用 Apache 2.0 许可可无限制使用。
推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并采用 Apache 2.0 开源,读者可据此判断小模型的能力边界与部署成本。
Anthropic 宣布亚马逊将向其投资最高 40 亿美元,AWS 将成为其关键任务负载的主要云服务商,并提供 AWS Trainium 和 Inferentia 芯片用于模型训练与部署。
推荐理由:Anthropic 官方披露亚马逊最高 40 亿美元投资与 AWS 成为主要云服务商的安排,可了解双方在算力与 Bedrock 上的绑定关系。
Hugging Face 把 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法将模型量化为 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化如何接入 Transformers 生态,读者可据此判断低比特部署的可行路径与限制。
OpenAI 宣布开发者现在可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的用例,同时更新了 API。原文仅给出这一句说明,未披露微调价格、可用范围或具体 API 变更细节。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,是当时最受关注的 API 能力变化。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者在 Apple 设备上用 Core ML 本地运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 放出在 Apple 设备本地跑 Llama 2 的 Swift 工具链,读者可据此了解端侧 LLM 的转换与优化路径。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在 Apple Silicon Mac 上本地运行,并发布混合比特调色板量化方案。
推荐理由:原文给出混合比特调色板量化的具体压缩比与 PSNR 数据,可据此判断本地跑 SDXL 的体积与质量取舍。
Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可。Hugging Face 同步完成集成,提供模型卡、transformers 支持、Text Generation Inference 与 Inference Endpoints 部署,并给出用 PEFT 在单张 GPU 上微调 7B 版本的示例。
推荐理由:Meta 开源 Llama 2 并同步接入 Hugging Face 生态,读者可了解其许可、规模与推理微调路径。
Hugging Face 介绍了借助 Core ML 新优化在 Apple 设备上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,把权重从 16 位浮点压缩到每参数 6 bit,并在推理时逐层解压以降低内存占用。
推荐理由:原文给出 6-bit palettization 的量化转换流程与已上传的四个 Stable Diffusion 模型,读者可据此在 Apple 设备上自行部署。
OpenAI 宣布对 API 进行多项更新,包括更易引导的模型、函数调用能力、更长的上下文以及更低的价格。
推荐理由:OpenAI 公布 API 多项更新,读者可据此了解模型可控性、函数调用与价格的变化方向。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大部分 HF 模型,并可在 4bit 模型上训练 LoRA 适配器。
推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 微调接入 transformers,读者可据此判断消费级显卡能跑多大模型。
Hugging Face 发布辅助生成(assisted generation)解码方法,通过小模型生成候选 token、大模型一次前向验证,在消费级硬件上最多降低 10 倍延迟。
推荐理由:Hugging Face 官方详解辅助生成解码原理与 Transformers 用法,读者可据此判断低延迟文本生成的可行路径。
Hugging Face 博客介绍如何在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上用 diffusers 运行 DeepFloyd 的 IF 文生图模型。
推荐理由:原文给出在免费 Colab 上分阶段加载 IF 的完整代码与显存取舍,可迁移到其他大模型的低显存部署。
Hugging Face 官方发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调成本大幅降低。方案先用 LLM.int8() 以 8 位精度加载模型,再用 peft 添加低秩适配器只训练少量参数,并借助 disable_adapters 复用同一模型获取参考模型与当前模型的 logits,从而省去第二份模型副本。
推荐理由:trl 与 peft 的集成给出了在 24GB 消费级 GPU 上做 RLHF 微调的具体路径,可迁移到自有训练流程。
2023 年 2 月 6 日土耳其东南部发生 7.7 和 7.6 级地震后,一群程序员在 Discord 上协作开发了名为 afetharita(灾害地图)的应用,用于从幸存者的推文和截图中提取地址与需求信息,供搜救队和志愿者使用。
推荐理由:作者以志愿者身份复盘土耳其地震救援中的模型选型与部署流程,可迁移到快速搭建应急类 ML 应用。
Hugging Face 联合 Apple 工程师把 Stable Diffusion 权重转换为 Core ML 格式并上传到 Hub,可在 Apple Silicon 的 CPU、GPU 和神经引擎上运行。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的完整流程与性能参考,可迁移到本地部署实践。
Hugging Face Diffusers 自 0.5.1 版起支持 Flax,可在 Colab、Kaggle 或 Google Cloud 的 TPU 上快速推理 Stable Diffusion。
推荐理由:Hugging Face 官方给出在 TPU 上用 JAX/Flax 跑 Stable Diffusion 的完整步骤与并行原理,可迁移到多设备推理。
Hugging Face 撰文解释 Accelerate 如何借助 PyTorch 在内存和显存不足的消费级硬件上加载并运行超大模型。它先用 meta device 创建空模型并计算 device map,再按分片逐步加载权重,把层分配到多张 GPU、CPU 内存乃至磁盘,最后通过 hooks 在每次前向传播前后搬运权重。
推荐理由:原文拆解了 Accelerate 借助 PyTorch meta device 与分片加载在有限显存下跑大模型的完整流程,可迁移到自己的推理部署。
Hugging Face 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等大模型显存占用减半且推理性能几乎无损。
推荐理由:Hugging Face 官方详解 LLM.int8() 量化原理与 transformers 集成细节,可了解大模型显存减半的落地方式。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集和指标评测模型。评测结果会以 PR 形式写入模型卡的元数据,并可在数据集页查看排行榜;官方已用该工具评测数百个模型并提交了对应 PR。工具支持为任务寻找最佳模型、在新数据集上跑基线、以及用多个相关数据集评测自己的模型三种场景。
推荐理由:Hugging Face 把模型评测做成 Hub 上的一键流程,读者可了解免代码评测与结果写入模型卡的做法。