Hugging Face 为 TGI 和 Inference Endpoints 推出兼容 OpenAI 的 Messages API
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API。
推荐理由:Hugging Face 官方给出 TGI 兼容 OpenAI 接口的迁移路径与代码示例,读者可据此评估从闭源模型切换到开源模型的改造成本。
公司与模型
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
226 条精选近 30 天 6 条共收录 741 条
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API。
推荐理由:Hugging Face 官方给出 TGI 兼容 OpenAI 接口的迁移路径与代码示例,读者可据此评估从闭源模型切换到开源模型的改造成本。
SegMind 发布 SegMoE 框架,可从零构建混合专家(MoE)扩散模型,并已集成 Hugging Face diffusers。同时发布 SegMoE-2x1、SegMoE-4x2 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。
推荐理由:原文给出了从零构建 MoE 扩散模型的完整流程与显存门槛,读者可据此判断自己能否复现。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展的合成数据生成。
推荐理由:Hugging Face 公开了用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可据此复现或改造对齐流程。
Hugging Face 发布博客,介绍如何用 LangChain 新集成的 ChatHuggingFace 封装把开源模型搭建成 ReAct 智能体,并给出完整代码示例。
推荐理由:原文给出 ReAct 智能体的完整搭建代码与开源模型对比基准,可据此判断哪些模型适合驱动智能体工作流。
Hugging Face 发布教程,介绍如何用 ComfyUI-to-Python-Extension 把 ComfyUI 工作流导出为纯 Python 脚本,再用 Gradio 封装成应用并部署到 Hugging Face Spaces 的 ZeroGPU 上免费运行。
推荐理由:教程给出把 ComfyUI 工作流导出为 Python、封装 Gradio 并部署到 ZeroGPU 的完整步骤,可迁移到自己的工作流。
Hugging Face 博客介绍社区开发的轻量库 Unsloth,与 transformers、PEFT、TRL 生态兼容,可将 LLM 微调速度提升约 2 倍并降低显存占用,精度相对标准 QLoRA 无下降。
推荐理由:原文给出 Unsloth 与 TRL 的集成方式和 59 次基准数据,读者可据此判断微调成本能降多少。
Hugging Face 发布 SDXL Dreambooth LoRA 高级训练脚本,将 Pivotal Tuning 与 Prodigy 优化器结合,并给出配套参数配置。
推荐理由:汇总 SDXL Dreambooth LoRA 微调的社区实践,含 Pivotal Tuning 与 Prodigy 优化器的参数配置和对比实验。
Mistral 发布 Mixtral 8x7B,采用 MoE 架构,含基础版与 Instruct 版,支持 32k token 上下文,以 Apache 2.0 许可开放商用。
推荐理由:Hugging Face 官方给出 Mixtral 的架构说明、基准对比与量化部署路径,可据此判断 MoE 开源模型的落地成本。
Hugging Face 与 AMD 宣布在 AMD Instinct GPU 上实现开箱即用支持,所有 Transformers 模型和任务无需修改代码即可运行,示例代码与 NVIDIA GPU 上完全一致。
推荐理由:原文给出 AMD GPU 上无需改代码运行 Transformers 的支持范围与实测对比数据,可据此判断迁移成本。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需将 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒,首 token 延迟最高降低 3.3 倍。
推荐理由:Hugging Face 与 NVIDIA 联合推出的推理库,用一行代码替换即可获得最高 28 倍吞吐提升,适合关注 LLM 部署成本的读者。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出了 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的可用性。
Hugging Face 发布教程,展示如何用其 GitHub 组织前 10 个公开仓库的代码微调 StarCoder,训练出名为 HugCoder 的代码补全助手。
推荐理由:完整复现了从数据采集、QLoRA 微调到 VS Code 本地部署的全流程,并给出成本与效果对比,可迁移到自有代码库。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多种推理优化,未优化管线占用 28GB 显存、耗时 72.2 秒,改用 fp16 后降至 21.7GB 和 14.8 秒。
推荐理由:Hugging Face 官方给出 SDXL 在 Diffusers 中的显存与延迟实测数据,可直接对照选择优化组合。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用完全在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断前端部署与隐私场景的可行性。
Hugging Face 的 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,把消息列表转成正确格式的字符串。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可据此理解格式错配为何会静默拖垮模型表现。
Hugging Face 发布 Würstchen 文本条件扩散模型,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 两级压缩实现 42x 空间压缩,Stage C 在压缩潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练成本对比,读者可据此判断高效扩散模型在显存与算力上的取舍。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的预训练 checkpoint。
推荐理由:对比 ControlNet 的参数与显存占用,并给出 diffusers 中的调用方式,便于评估可控生成方案的取舍。
TII 发布 Falcon 180B 并上线 Hugging Face,模型有 1800 亿参数,在 3.5 万亿 token 的 RefinedWeb 数据上预训练,是当时最大的公开可用语言模型。
推荐理由:原文给出 Falcon 180B 的参数量、训练数据与评测对比,可据此判断开源大模型当时的规模上限。
Meta 发布 Code Llama 系列代码模型,包含 7B、13B、34B 三个参数规模,基于 Llama 2 初始化并用 5000 亿 token 代码数据训练,采用与 Llama 2 相同的社区许可并允许商用。
推荐理由:Meta 发布 Code Llama 系列并接入 Hugging Face 生态,读者可了解其参数规模、上下文窗口与多语言基准表现。
Hugging Face 把 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法将模型量化为 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:Hugging Face 官方说明 GPTQ 量化如何接入 Transformers 生态,读者可据此判断低比特部署的可行路径与限制。