如何用 distilabel 打造 Argilla 2.0 聊天机器人
Hugging Face 博客展示了如何借助 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档生成合成数据集,微调领域专用嵌入向量模型,再搭建向量数据库,并将 Gradio 应用部署到 Hugging Face Space,交互记录存入 Argilla 用于持续评估改进。
Hugging Face 博客展示了如何借助 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档生成合成数据集,微调领域专用嵌入向量模型,再搭建向量数据库,并将 Gradio 应用部署到 Hugging Face Space,交互记录存入 Argilla 用于持续评估改进。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 两阶段微调,先做 CoT 数据训练,再用 GPT-4 生成的约 6 万个工具集成推理样本训练模型调用 Python REPL。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛或微调任务。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 300K+ 个 Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。KerasHub 模型可在 TensorFlow、JAX、PyTorch 后端间无缝切换,需将 keras 升级至 3.3.3 以上。
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并发布使用教程。示例基于 Idefics2-8b 模型和包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset 数据集,该 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
Hugging Face 用基于 transformers.agents 的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:Hugging Face 用 Code Agent 在 GAIA 上取得领先,并公开了工具、执行沙箱与规划策略的实现细节。
Hugging Face 发布 BigCodeBench,包含 1140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每项任务平均 5.6 个测试用例、分支覆盖率 99%。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)上线 Hugging Face Hub 并接入 Diffusers,同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)训练器,作为 PPO 之外的在线 RLHF 训练算法。官方称 RLOO 只需加载策略模型、参考策略模型和奖励模型三份模型,显存占用比 PPO 少约 50-70%,1B 模型上速度是 PPO 的 2 倍、6.9B 模型上最高 3 倍。
推荐理由:原文给出 RLOO 与 PPO 在显存、速度和胜率上的对比数据,可据此判断在线 RLHF 训练的成本取舍。
Mistral AI 在 la Plateforme 上线模型定制功能,提供三条路径:开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。
推荐理由:Mistral 同时给出开源微调代码库与托管微调服务,读者可据此判断自建与托管两条路径的成本差异。
Hugging Face 联合 Cubzh 与 Gigax 发布 NPC-Playground,一个可在浏览器中直接体验的 3D 演示,让玩家与 LLM 驱动的 NPC 互动,并用几行 Lua 脚本教它们新技能。
Hugging Face 将辅助生成(Assisted Generation)适配并优化到 Intel Gaudi 处理器,现已集成进 Optimum Habana。该方法基于 Speculative Sampling,用草稿模型生成 K 个 token 再由目标模型评估,大型 Transformer 模型通常可获得约 2x 加速,且采样质量与自回归采样相当。
Mistral 发布首款代码模型 Codestral,22B 开放权重,支持 80+ 编程语言,上下文窗口 32k,采用 fill-in-the-middle 机制补全代码和写测试。
推荐理由:Mistral 首款代码模型给出 22B 参数、32k 上下文与 80+ 语言支持,并附免费 API 与主流 IDE 集成入口。
Hugging Face 发布博客,介绍如何用 Sentence Transformers 库微调嵌入向量模型,也可从零训练新模型。训练涉及数据集、损失函数、训练参数、评估器和 Trainer 五大组件,数据可来自 Hugging Face Hub 或本地 CSV、JSON、Parquet、Arrow、SQL 格式。
Hugging Face 与 AMD 合作,为 AMD Instinct MI300 GPU 在 Hugging Face 平台提供一等公民级集成,用户无需修改代码即可通过 transformers 和 text-generation-inference 在 Azure ND MI300x V5 虚拟机上部署模型。
Hugging Face 在 Transformers 中上线 KV Cache 量化功能,通过降低 KV 缓存精度减少长上下文生成的内存占用,int4 精度下质量与 fp16 接近,int2 则出现明显下降。
Hugging Face 与 LangChain 联合推出合作包 langchain_huggingface,这是一个由双方共同维护的 Python 包,旨在将 Hugging Face 最新能力更快带入 LangChain 生态。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体类型之外新增可基于历史观察迭代的 ReactAgent 等两类智能体,并加入共享功能。
推荐理由:官方给出新智能体框架的模块划分与 GAIA 榜单成绩,可据此判断开源智能体方案的可用性。
Hugging Face 发布自定义推理 handler 方案,在 Inference Endpoints 上把 Whisper 语音识别、Pyannote 说话人分离与推测解码整合进单一 API。
Hugging Face 排行榜与评测团队发现,同一 MMLU 任务仅改变提示词格式,5 个模型的得分波动约 10 分,Qwen1.5-7B 甚至从 51.2% 跌至 22.9%,模型排名也随之改变。为此他们与 .txt 合作,尝试用 Outlines 库的结构化生成约束模型输出,以减少提示词格式带来的评测方差。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、全透明且许可宽松的代码大语言模型,无需人工标注或从 GPT-4 等专有模型蒸馏数据。
推荐理由:StarCoder2-15B-Instruct 用自生成数据完成指令微调,其开源流程与评测对比可供代码模型训练参考。
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无链式推理提示时的准确率差值 Δ。该榜单覆盖 LogiQA、LSAT 等多项选择题任务,已实现 Classic 与 Reflect 两种提示策略,并称对训练数据污染更具鲁棒性。
Hugging Face 发布 Jack of All Trades(JAT)项目,开源首个通用智能体训练数据集 JAT dataset 及基于 GPT-Neo 的 Transformer 智能体模型,可玩视频游戏、控制机器人并执行导航指令。
Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅 39B 激活参数,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。
推荐理由:Mixtral 8x22B 以 39B 激活参数和 Apache 2.0 许可发布,读者可据此判断开源模型的性能与成本取舍。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,从 LeetCode、AtCoder、CodeForces 持续收集带发布日期的编程题,通过“随时间滚动”评估检测并防止数据污染。
Hugging Face 发布 Idefics2,一个 8B 参数、Apache 2.0 许可的多模态模型,可接受任意文本与图像序列输入并生成文本回复,支持图像问答、文档信息抽取和基础算术。
推荐理由:8B 参数、Apache 2.0 许可并同步放出多模态指令微调数据集,读者可据此判断开源多模态的可用起点。
Hugging Face 联合 Intel Labs 与 UKP Lab 开发的 SetFit 少样本微调框架,借助 Optimum Intel 在 Intel Xeon CPU 上通过训练后静态量化(PTQ)可将推理速度提升 7.8 倍。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型的统一接口,首个版本聚焦 3D 物体检测,可输出物体在三维空间中的 (x, y, z) 坐标。
Hugging Face 博客介绍嵌入向量的二值量化与标量(int8)量化,用于降低检索的内存、磁盘占用和成本。二值量化把 float32 值转为 1 bit,内存与存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化减少 4 倍,性能保留约 99.3%。
推荐理由:原文给出二值与标量量化的实测数据与代码示例,读者可据此评估检索成本与性能的取舍。
Hugging Face 博客介绍 GaLore 方法,通过将梯度投影到低秩子空间,可在 NVIDIA RTX 4090 等消费级 GPU 上训练 Llama 架构的 7B 参数模型,优化器状态内存减少超过 82.5%。
推荐理由:原文给出 GaLore 在消费级显卡上训练 7B 模型的内存节省数据与 transformers 接入方式,便于判断显存受限场景的可行性。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于复现 Phi-1.5 的预训练数据。
推荐理由:Hugging Face 公开了构建 250 亿 token 合成预训练数据集的完整流程与代码,可供复现和迁移。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重及 int8、float8 激活,可在 CUDA 和 MPS 等任意设备上运行。
Hugging Face 发布教程,展示如何借助 Optimum Intel 与 IPEX 在英特尔 Xeon CPU 上加速 BGE 嵌入模型,并集成进 fastRAG 的 RAG 流程。优化聚焦 45M、110M、355M 参数的 BGE small、base、large 三款模型,通过 int8 量化、bf16 及 AMX 加速降低单条查询延迟并提升吞吐。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,v0.1 版包含 823,000 对 HTML 代码与对应截图,v0.2 版改用真实图像和 Tailwind CSS 并扩展至 200 万样本。基于该数据集微调的视觉语言模型 Sightseer 能将网页截图转为可用的 HTML 代码,并支持在生成代码中嵌入与原截图相近的图像。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,全部基于新的高质量代码数据集 The Stack v2 训练。
推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型在参数规模与训练数据上的最新配置。
Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印与生成后添加水印两种主要方法,前者需访问模型但更稳健,后者可适用于闭源模型。文章还梳理了 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案,并讨论了水印开放与闭源的利弊。
Hugging Face 的 PEFT 库新增了面向 LoRA 适配器的多种合并方法,包括 cat、linear、svd、ties、dare 和 magnitude_prune 等,可通过 add_weighted_adapter() 调用。
SegMind 发布 SegMoE 框架,可从零构建混合专家(MoE)扩散模型,并已集成 Hugging Face diffusers。同时发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。
推荐理由:原文给出了从零构建 MoE 扩散模型的完整流程与显存门槛,读者可据此判断自己能否复现。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,用计算复杂度类别评估 LLM 推理能力。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展的合成数据生成。
推荐理由:Hugging Face 公开了用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可据此复现或改造对齐流程。
Hugging Face 博客给出 PatchTST 的上手示例:先在 Electricity 数据集上直接训练并评估预测性能,再用已训练模型在 ETTh1 数据集上做零样本预测,随后进行线性探测与微调。