跳到正文

公司与模型

Hugging Face 最新动态

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

226 条精选近 30 天 6 条共收录 741 条

更新

精选归档 · 第 10 页

8月22日周二第 181–200 条
  1. Hugging Face Blog75

    Hugging Face 发布 IDEFICS:Flamingo 的开源复现视觉语言模型

    Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,仅使用公开数据和模型(LLaMA v1 与 OpenCLIP),提供 9B 和 80B 两个参数规模,各有基础版和指令微调版。

    推荐理由:IDEFICS 用公开数据和模型复现了未开源的 Flamingo,读者可据此了解开源多模态模型当时的能力边界与训练数据构成。

8月8日周二
8月1日周二
  1. Hugging Face Blog60

    Segmind 开源 SD-Small 与 SD-Tiny 知识蒸馏代码和权重

    Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,同时保持接近的图像保真度。

    推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,并给出参数量、加速比与使用方式,便于复现和二次微调。

7月27日周四
7月24日周一
7月18日周二
  1. Hugging Face Blog88

    Meta 发布 Llama 2,Hugging Face 全面接入

    Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可。Hugging Face 同步完成集成,提供模型卡、transformers 支持、Text Generation Inference 与 Inference Endpoints 部署,并给出用 PEFT 在单张 GPU 上微调 7B 版本的示例。

    推荐理由:Meta 开源 Llama 2 并同步接入 Hugging Face 生态,读者可了解其许可、规模与推理微调路径。

6月23日周五
6月15日周四
  1. Hugging Face Blog62

    用 Core ML 在 iPhone、iPad 和 Mac 上加速 Stable Diffusion

    Hugging Face 介绍了借助 Core ML 新优化在 Apple 设备上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,把权重从 16 位浮点压缩到每参数 6 bit,并在推理时逐层解压以降低内存占用。

    推荐理由:原文给出 6-bit palettization 的量化转换流程与已上传的四个 Stable Diffusion 模型,读者可据此在 Apple 设备上自行部署。

6月5日周一
5月24日周三
  1. Hugging Face Blog78

    Hugging Face 在 transformers 中集成 bitsandbytes 4-bit 量化与 QLoRA

    Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大部分 HF 模型,并可在 4bit 模型上训练 LoRA 适配器。

    推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 微调接入 transformers,读者可据此判断消费级显卡能跑多大模型。

5月23日周二
  1. Hugging Face Blog60

    Hugging Face 公布 safetensors 安全审计结果并推动其成为默认格式

    Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的关键安全漏洞,并已修复规范格式不精确和允许 polyglot 文件的验证缺失问题。

    推荐理由:Hugging Face 联合 EleutherAI、Stability AI 公开 safetensors 外部安全审计结果,读者可了解该格式为何被推向默认。

5月15日周一
5月11日周四
  1. Hugging Face Blog62

    Hugging Face 提出辅助生成解码方法,可将文本生成延迟降低最多 10 倍

    Hugging Face 发布辅助生成(assisted generation)解码方法,通过小模型生成候选 token、大模型一次前向验证,在消费级硬件上最多降低 10 倍延迟。

    推荐理由:Hugging Face 官方详解辅助生成解码原理与 Transformers 用法,读者可据此判断低延迟文本生成的可行路径。

5月9日周二
  1. Hugging Face Blog60

    用 StarCoder 打造编码助手 StarChat

    Hugging Face 团队介绍如何将 16B 参数的 StarCoder 微调为对话式编码助手 StarChat,使用 OpenAssistant 约 2.1 万条英文对话数据,并采用 ChatML 格式标记角色、屏蔽用户轮次的损失。

    推荐理由:原文完整给出用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。

5月4日周四
  1. Hugging Face Blog78

    BigCode 发布 StarCoder 代码大模型

    BigCode 发布 StarCoder 与 StarCoderBase 两个代码大模型,基于 GitHub 宽松许可数据训练,覆盖 80 多种编程语言,参数规模约 15B、训练 1 万亿 token。

    推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的能力水位。

4月26日周三
3月9日周四
  1. Hugging Face Blog62

    Hugging Face 将 trl 与 peft 集成,可在 24GB 消费级 GPU 上微调 20B 大模型

    Hugging Face 官方发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调成本大幅降低。方案先用 LLM.int8() 以 8 位精度加载模型,再用 peft 添加低秩适配器只训练少量参数,并借助 disable_adapters 复用同一模型获取参考模型与当前模型的 logits,从而省去第二份模型副本。

    推荐理由:trl 与 peft 的集成给出了在 24GB 消费级 GPU 上做 RLHF 微调的具体路径,可迁移到自有训练流程。

3月6日周一
  1. Hugging Face Blog62

    Kakao Brain 与 Hugging Face 发布 ViT 和 ALIGN 模型及 COYO 数据集

    Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿图文对)以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。

    推荐理由:Kakao Brain 开源了首个可复现的 ALIGN 模型及配套 7 亿图文对数据集,读者可据此了解开放数据对视觉语言模型复现的意义。

3月3日周五
  1. Hugging Face Blog62

    用机器学习援助土耳其地震幸存者:afetharita 的模型与部署实践

    2023 年 2 月 6 日土耳其东南部发生 7.7 和 7.6 级地震后,一群程序员在 Discord 上协作开发了名为 afetharita(灾害地图)的应用,用于从幸存者的推文和截图中提取地址与需求信息,供搜救队和志愿者使用。

    推荐理由:作者以志愿者身份复盘土耳其地震救援中的模型选型与部署流程,可迁移到快速搭建应急类 ML 应用。