Hugging Face 修复 Transformers 梯度累积损失计算错误
Hugging Face 修复了 Transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积后损失与全批量训练不一致,正确做法应是累积步内总损失除以全部非 padding token 数,而非各批次损失的平均值。
Hugging Face 修复了 Transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积后损失与全批量训练不一致,正确做法应是累积步内总损失除以全部非 padding token 数,而非各批次损失的平均值。
Hugging Face 与 Dask 结合,用 FineWeb-Edu 分类器对 FineWeb 数据集做教育价值打分,从本地 pandas 处理 100 行扩展到 Dask 在云端多 GPU 上并行处理 2.11 亿行。
Intel Labs 与 Hugging Face 提出动态推测解码,通过按助手模型置信度动态调整每轮草稿 token 数量,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 上实现最高 1.52 倍加速,而启发式方法无明显提速。
Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了去重表现:追加 1 万行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量只去重 89%,需额外 230MB,删除一行则导致后半文件全部重写。团队提出改用相对偏移量、对行组做内容定义分块(CDC)等改进思路,并希望与 Apache Arrow 社区合作落地。
Hugging Face 发布教程,介绍如何将顶点着色网格转换为 UV 贴图纹理网格,并开源了实现该流程的 InstantTexture 库,可通过 pip 安装后一行代码完成 .obj 到 .glb 的转换。教程用 xatlas 生成 UV 贴图,再经重心坐标插值填充纹理,并用修复、中值滤波、高斯模糊和 LANCZOS 下采样消除纹理空洞。
Hugging Face 的 Daily Papers 页面已收录超过 3,700 篇论文、订阅数突破 12k,作者可一键认领论文并关联到自己的账号。该页面还支持所有用户提交论文、在评论区与作者直接讨论、通过 @librarian-bot 推荐相似论文,以及多语言评论与内置翻译。论文页右侧集中展示关联的模型、数据集和 demo,用户可通过点赞支持论文,并订阅每日(周末除外)论文更新邮件。
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署,减少依赖。
Hugging Face 团队探索出把已有模型微调到 1.58bit 的方法,用 BitNet 的三值权重(-1、0、1)架构微调 Llama3 8B,并在 HF1BitLLM 组织下开源了三个模型。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积降至原始版本的 14%,最佳情况可达 0.2%,同时保持完整训练能力。解码单帧耗时与加载压缩图片相当,连续多帧解码仅为后者的 25%-50%,并原生集成 Hub 与可视化工具。
Hugging Face Hub 拥有超 85 万个公开模型、每月新增约 5 万个,但其中 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 五项工具常被忽视。
Hugging Face 发布教程,介绍如何在 Google Cloud Vertex AI 上以 FP8 量化版本部署 Meta Llama 3.1 405B Instruct,运行于配备 8 块 H100 GPU 的 A3 节点,并使用 Text Generation Inference(TGI)与 Hugging Face 深度学习容器(DLC)。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像与文本标注,用于视觉语言模型微调。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合图像修复,避免缩放、模糊等常规变换损害文字提取精度。初版已移除同义词替换以降低时间开销,可通过 pip 安装 albumentations 使用。
Hugging Face 展示如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散管线显存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟略增。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:原文给出把 Mistral 7B 转成 Core ML 并在 Mac 上以不到 4GB 内存运行的完整步骤,可迁移到其他模型转换。
Hugging Face 博客展示了如何借助 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档生成合成数据集,微调领域专用嵌入向量模型,再搭建向量数据库,并将 Gradio 应用部署到 Hugging Face Space,交互记录存入 Argilla 用于持续评估改进。
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并发布使用教程。示例基于 Idefics2-8b 模型和包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset 数据集,该 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
Intel 与 MILA 将多模态蛋白质设计语言模型 ProtST 重新架构并发布在 Hugging Face Hub,可用 Optimum for Intel Gaudi 库在 Gaudi 2 上运行推理与微调。
微软 6 月发布的 Florence-2 视觉语言模型提供 0.2B 和 0.7B 两个小尺寸版本,支持 captioning、目标检测、OCR 等任务,但官方模型不含 VQA 能力。作者在 DocVQA 上微调后,验证集 Levenshtein 相似度从 0 提升至 57.0,并开源了 Colab notebook 与演示 Space。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Hugging Face 宣布将重新设计 Transformers 文档,原因是现有文档内容零散、导航困难且过时。新文档将面向构建 AI 产品的开发者,采用代码优先和解决方案导向的方式,并用更灵活的结构替代 Diátaxis 的刚性框架,让内容自然生长与整合。
Hugging Face 发布博客介绍 Text Generation Inference(TGI)配套的 TGI Benchmarking 工具,可同时测量吞吐量与延迟,帮助用户按需调优 LLM 部署。
Hugging Face 发布博客,介绍如何用 Sentence Transformers 库微调嵌入向量模型,也可从零训练新模型。训练涉及数据集、损失函数、训练参数、评估器和 Trainer 五大组件,数据可来自 Hugging Face Hub 或本地 CSV、JSON、Parquet、Arrow、SQL 格式。
Intel 在 OPEA 开放平台上展示了用 Gaudi 2 AI 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,LLM 跑在 Gaudi 2 上、嵌入模型跑在 Granite Rapids CPU 上。
Hugging Face 发布自定义推理 handler 方案,在 Inference Endpoints 上把 Whisper 语音识别、Pyannote 说话人分离与推测解码整合进单一 API。
Gradio 推出 reload mode,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。
Zama 团队将基于全同态加密(FHE)的 Concrete ML 预编译模型部署到 Hugging Face Endpoints,用户可通过自定义 inference handler 一键部署并运行加密推理。
Hugging Face 发布视觉语言模型入门文章,介绍其图像编码器、嵌入投影层与文本解码器的典型结构,并汇总 LLaVA 1.6、DeepSeek-VL、CogVLM、Qwen-VL 等开源模型的分辨率与能力差异。
推荐理由:系统梳理视觉语言模型的组成、选型榜单与微调流程,并给出可直接运行的 transformers 与 TRL 代码示例。
MotherDuck 与 Numbers Station 推出 DuckDB-NSQL-7B,一个专为 DuckDB SQL 设计的大语言模型,基于 Meta Llama-2-7b 微调并进一步用 DuckDB text-to-SQL 数据对精调,可生成包括官方文档和扩展在内的多种有效 DuckDB SQL 语句。
Hugging Face 联合 Intel Labs 与 UKP Lab 开发的 SetFit 少样本微调框架,借助 Optimum Intel 在 Intel Xeon CPU 上通过训练后静态量化(PTQ)可将推理速度提升 7.8 倍。
Hugging Face 博客介绍嵌入向量的二值量化与标量(int8)量化,用于降低检索的内存、磁盘占用和成本。二值量化把 float32 值转为 1 bit,内存与存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化减少 4 倍,性能保留约 99.3%。
推荐理由:原文给出二值与标量量化的实测数据与代码示例,读者可据此评估检索成本与性能的取舍。
Hugging Face 发布面向非技术人群的 Transformers 入门指南,无需 Python 基础即可上手。教程以在 Hugging Face Space 的 JupyterLab 中运行微软 Phi-2 LLM 为例,需租用 NVIDIA A10G Small GPU(24GB 显存,每小时几美元)。文中还介绍了 Transformers 库、Hub 与 Spaces 的基本概念。
Hugging Face 博客介绍 GaLore 方法,通过将梯度投影到低秩子空间,可在 NVIDIA RTX 4090 等消费级 GPU 上训练 Llama 架构的 7B 参数模型,优化器状态内存减少超过 82.5%。
推荐理由:原文给出 GaLore 在消费级显卡上训练 7B 模型的内存节省数据与 transformers 接入方式,便于判断显存受限场景的可行性。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成推理。
Hugging Face 发布教程,展示如何借助 Optimum Intel 与 IPEX 在英特尔 Xeon CPU 上加速 BGE 嵌入模型,并集成进 fastRAG 的 RAG 流程。优化聚焦 45M、110M、355M 参数的 BGE small、base、large 三款模型,通过 int8 量化、bf16 及 AMX 加速降低单条查询延迟并提升吞吐。
Hugging Face 发布基于 Optimum Habana 的自定义 pipeline 类,可在 Intel Gaudi 2 AI 加速器上用几行代码运行 Llama 2 系列(7b、13b、70b)文本生成。
Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印与生成后添加水印两种主要方法,前者需访问模型但更稳健,后者可适用于闭源模型。文章还梳理了 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案,并讨论了水印开放与闭源的利弊。
Hugging Face 发布教程,介绍如何用 Transformers 和 PEFT 库对 Google DeepMind 的开源模型 Gemma(2B 和 7B 参数)进行参数高效微调(PEFT)。
Hugging Face 发布 Matryoshka 嵌入模型入门博客,介绍这类模型可输出多种维度的有效嵌入,将重要信息前置以便截断后仍保持性能。
Hugging Face 发布教程,演示如何用开源 Mixtral-8x7B-Instruct-v0.1 为金融新闻情感分类生成合成数据,再通过 AutoTrain 蒸馏出约 0.13B 参数的 RoBERTa-base 模型。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型,给出了成本、延迟与碳排放的完整对比,方法可直接迁移到其他分类任务。