HuggingChat 推出 Community Tools,可将任意 Space 变成模型可调用工具
Hugging Face 在 HuggingChat 上线 Community Tools,用户可把任意公开 Space 转成模型可直接调用的工具,并借此扩展图像理解、视频生成和文本转语音等多模态能力。
Hugging Face 在 HuggingChat 上线 Community Tools,用户可把任意公开 Space 转成模型可直接调用的工具,并借此扩展图像理解、视频生成和文本转语音等多模态能力。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积降至原始版本的 14%,最佳情况可达 0.2%,同时保持完整训练能力。解码单帧耗时与加载压缩图片相当,连续多帧解码仅为后者的 25%-50%,并原生集成 Hub 与可视化工具。
Hugging Face Hub 拥有超 85 万个公开模型、每月新增约 5 万个,但其中 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 五项工具常被忽视。
Hugging Face 在 Transformers 中推出 DataCollatorWithFlattening,让无 padding 的打包指令微调与 Flash Attention 2 兼容,训练吞吐最高提升 2 倍。
Hugging Face 发布教程,介绍如何在 Google Cloud Vertex AI 上以 FP8 量化版本部署 Meta Llama 3.1 405B Instruct,运行于配备 8 块 H100 GPU 的 A3 节点,并使用 Text Generation Inference(TGI)与 Hugging Face 深度学习容器(DLC)。
Hugging Face 团队复现 Google 的 Infini-Attention 后发现,随着记忆压缩次数增加,模型性能持续下降,该实验被判定为失败。团队认为 ring attention、YaRN 和 rope scaling 仍是扩展预训练模型上下文长度的最佳方案,并开源了训练 checkpoint 供测试。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
Hugging Face 在 Transformers 中推出统一的工具调用 API,同一份代码可在 Mistral、Cohere、NousResearch 和 Llama 等模型家族间通用,几乎无需针对模型做改动。
推荐理由:原文给出跨模型统一工具调用接口与 Transformers 辅助函数,读者可据此判断迁移成本与复用方式。
阿布扎比 TII 发布 Falcon Mamba 7B,称其为首个大规模通用纯 Mamba 模型,采用开放许可并已上线 Hugging Face 生态。该模型基于原始 Mamba 架构并加入额外 RMS 归一化层以稳定大规模训练,用约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,单张 A10 24GB GPU 即可运行。
推荐理由:TII 发布首个大规模纯 Mamba 架构 7B 模型,并给出与同规模 Transformer 的基准和长序列内存对比。
Hugging Face 宣布收购西雅图公司 XetHub,其 12 人团队将加入,创始人此前在 Apple 构建并扩展内部 ML 基础设施。XetHub 的技术让 Git 可扩展到 TB 级仓库,HF CTO Julien Chaumond 表示团队将帮助 Hub 把存储后端换成自研的 LFS 替代方案。
推荐理由:Hugging Face 收购 XetHub 并计划替换 Hub 的 Git LFS 存储后端,读者可了解大文件版本管理将如何变化。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像与文本标注,用于视觉语言模型微调。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合图像修复,避免缩放、模糊等常规变换损害文字提取精度。初版已移除同义词替换以降低时间开销,可通过 pip 安装 albumentations 使用。
Hugging Face 梳理了截至 2024 年 8 月 6 日 Hub 上的安全功能:面向所有用户的细粒度 token、2FA、commit 签名、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化安全扫描。Enterprise Hub 用户还可使用 SAML 2.0 与 OIDC 协议的 SSO、Resource Groups 等高级控制。
Hugging Face 展示如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散管线显存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟略增。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(无服务器),可在 Hugging Face Hub 内用标准化 API 对 Llama、Mistral 等开源模型运行推理。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现。
Meta 发布 Llama 3.1 系列开源模型,包含 8B、70B、405B 三种规模,各有基础版和指令微调版,上下文长度从 8K 提升到 128K token,支持英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语 8 种语言。
推荐理由:Meta 发布 Llama 3.1 三档开源模型,128K 上下文与工具调用能力配合更宽松的许可证,读者可据此判断开源模型在合成数据与蒸馏上的可用边界。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:原文给出把 Mistral 7B 转成 Core ML 并在 Mac 上以不到 4GB 内存运行的完整步骤,可迁移到其他模型转换。
Mistral AI 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最高 128k token 上下文窗口,并以 Apache 2.0 许可开放预训练基础版和指令微调版权重。
推荐理由:Mistral 与 NVIDIA 联合发布的 12B 模型,给出 128k 上下文、Apache 2.0 权重和 FP8 推理等可对比细节。
Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的数据集,包含 240 万张图像和 950 万对 Q/A,规模是此前数据集的 240 倍。该数据集由 PDFA 的 210 万份 PDF 转录文本经 Phi-3-small 生成 Q/A,并过滤掉 15% 的幻觉样本。用其微调 Florence-2 后,DocVQA 性能相对提升近 20%。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可根据请求中的 adapter_id 动态选择对应的 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:原文给出 TGI Multi-LoRA 的部署方式与成本对比,读者可据此判断多微调模型能否合并到一次部署。
Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,官方在最高 256k tokens 的上下文检索能力上做了测试。
推荐理由:Mistral 官方发布 Mamba 架构代码模型,给出参数量、上下文测试长度与部署方式,可对比 Transformer 路线的取舍。
Mistral AI 发布专注 STEM 与复杂多步数学推理的 Mathstral 7B,基于 Mistral 7B 构建,与 Project Numina 合作产出。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三种参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了 135M 到 1.7B 三档小模型的训练数据配方与评测对比,可据此判断端侧小模型的取舍。
Hugging Face 博客展示了如何借助 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档生成合成数据集,微调领域专用嵌入向量模型,再搭建向量数据库,并将 Gradio 应用部署到 Hugging Face Space,交互记录存入 Argilla 用于持续评估改进。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 两阶段微调,先做 CoT 数据训练,再用 GPT-4 生成的约 6 万个工具集成推理样本训练模型调用 Python REPL。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛或微调任务。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,用户可查看数据集 PII 含量报告,以便在训练前决定是否进一步过滤。该功能面向含 PII 的标注数据集和大规模预训练数据集,后者虽经过滤仍可能残留少量敏感信息。数据集所有者也可用报告验证发布前的 PII 过滤流程。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 300K+ 个 Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。KerasHub 模型可在 TensorFlow、JAX、PyTorch 后端间无缝切换,需将 keras 升级至 3.3.3 以上。
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并发布使用教程。示例基于 Idefics2-8b 模型和包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset 数据集,该 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
Hugging Face 宣布其 Inference Endpoints 和 Spaces 现已支持 Google Cloud TPU v5e,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 合作开发了一套基于 RAG 的主权数据方案,用于支持 EduRénov 校园生态改造项目,首阶段已完成。
Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按文本、图像、音频等模态及行数区间检索,并支持 Parquet、WebDataset 等格式和 Pandas、Dask、Datasets 库兼容性过滤。这些筛选可相互组合,并与语言、任务、许可证等已有过滤器及文本搜索栏搭配使用。
Intel 与 MILA 将多模态蛋白质设计语言模型 ProtST 重新架构并发布在 Hugging Face Hub,可用 Optimum for Intel Gaudi 库在 Gaudi 2 上运行推理与微调。
Hugging Face 用基于 transformers.agents 的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:Hugging Face 用 Code Agent 在 GAIA 上取得领先,并公开了工具、执行沙箱与规划策略的实现细节。
Google 发布开源大模型 Gemma 2,提供 9B 和 27B 两个参数规模,各有预训练基础版与指令微调版,上下文长度 8K tokens,采用与初代相同的宽松许可,允许再分发、微调和商用。
推荐理由:原文给出 Gemma 2 的两种参数规模、训练数据量与评测对比,可据此判断开源小模型的能力位置。
XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于 Hugging Face 专家支持计划合作,在多领域专利数据上微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。该模型用于专利撰写、无效检索和新颖性比对,借助 Hugging Face Inference Endpoints 与 TEI,嵌入吞吐从约 300 个/秒提升至约 2700 个/秒。
Hugging Face 发布《伦理与社会通讯 #6》,聚焦 AI 数据质量,提出高质量数据应满足相关性、全面性、时效性和偏见缓解等要求。文章以 Reddit 与 Google 的 RAG 搜索合作为例,说明低质数据会导致"披萨加胶水"这类错误推荐。文中强调数据质量需贯穿 AI 开发全生命周期,并给出数据去重、内容过滤、人工反馈和治理框架等实践策略。
微软 6 月发布的 Florence-2 视觉语言模型提供 0.2B 和 0.7B 两个小尺寸版本,支持 captioning、目标检测、OCR 等任务,但官方模型不含 VQA 能力。作者在 DocVQA 上微调后,验证集 Levenshtein 相似度从 0 提升至 57.0,并开源了 Colab notebook 与演示 Space。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划发布 DIBT/10k_prompts_ranked 数据集,由 385 多人参与完成 1 万条合成与人工提示词的质量排序,并已被用于训练 SPIN 等新模型。
视觉沟通软件公司 Prezi 加入 Hugging Face Expert Support Program,将更小、更高效的开放模型整合进其 ML 工作流。Prezi 旗舰产品 Prezi AI 结合视觉模型、文本模型和 VLM,专家建议其加入开源 re-ranker 模型以更低成本、更快、更好地为演示文稿匹配图文素材。