跳到正文
8月30日周三
8月23日周三
  1. Hugging Face Blog62

    Hugging Face 将 AutoGPTQ 集成进 Transformers,支持 8/4/3/2-bit 量化

    Hugging Face 把 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法将模型量化为 8、4、3 甚至 2-bit 精度运行,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。

    推荐理由:Hugging Face 官方说明 GPTQ 量化如何接入 Transformers 生态,读者可据此判断低比特部署的可行路径与限制。

8月22日周二
  1. OpenAI News62

    OpenAI 开放 GPT-3.5 Turbo 微调并更新 API

    OpenAI 宣布开发者现在可以用自己的数据微调 GPT-3.5 Turbo,以适配各自的用例,同时更新了 API。原文仅给出这一句说明,未披露微调价格、可用范围或具体 API 变更细节。

    推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,是当时最受关注的 API 能力变化。

8月10日周四
  1. Hugging Face Blog28

    Hugging Face Hub 上线 AWS Marketplace:可用 AWS 账户直接付费

    Hugging Face Hub 已上线 AWS Marketplace,用户可通过 AWS 账户订阅并支付 Hugging Face 的使用费用。订阅后,Inference Endpoints、Spaces 硬件升级和 AutoTrain 等服务的组织用量费用将自动计入 AWS 账单,价格与 Hugging Face 公开定价一致。连接需使用具备 admin 角色的组织账户,暂不支持个人账户。

8月9日周三
8月8日周二
8月4日周五
8月2日周三
7月27日周四
7月18日周二
  1. Hugging Face Blog88

    Meta 发布 Llama 2,Hugging Face 全面接入

    Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可。Hugging Face 同步完成集成,提供模型卡、transformers 支持、Text Generation Inference 与 Inference Endpoints 部署,并给出用 PEFT 在单张 GPU 上微调 7B 版本的示例。

    推荐理由:Meta 开源 Llama 2 并同步接入 Hugging Face 生态,读者可了解其许可、规模与推理微调路径。

7月17日周一
7月14日周五
7月5日周三
7月4日周二
7月3日周一
7月1日周六
6月29日周四
6月22日周四
6月15日周四
  1. Hugging Face Blog62

    用 Core ML 在 iPhone、iPad 和 Mac 上加速 Stable Diffusion

    Hugging Face 介绍了借助 Core ML 新优化在 Apple 设备上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,把权重从 16 位浮点压缩到每参数 6 bit,并在推理时逐层解压以降低内存占用。

    推荐理由:原文给出 6-bit palettization 的量化转换流程与已上传的四个 Stable Diffusion 模型,读者可据此在 Apple 设备上自行部署。

6月13日周二
6月2日周五
  1. Hugging Face Blog22

    如何在 Unity 中用 Hugging Face Unity API 实现语音识别

    Hugging Face 发布教程,讲解如何借助 Hugging Face Unity API 在 Unity 游戏中实现语音识别,可用于下达指令、与 NPC 对话或提升无障碍体验。教程从创建含开始/停止按钮和 TextMeshPro 文本框的场景入手,用 Microphone.Start() 以 44100 Hz 录制最长 10 秒音频,再编码为 WAV 格式发送给 API 转成文本。

5月31日周三
5月25日周四
5月24日周三
  1. Hugging Face Blog78

    Hugging Face 在 transformers 中集成 bitsandbytes 4-bit 量化与 QLoRA

    Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大部分 HF 模型,并可在 4bit 模型上训练 LoRA 适配器。

    推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 微调接入 transformers,读者可据此判断消费级显卡能跑多大模型。

5月23日周二
5月16日周二
5月15日周一
5月11日周四
  1. Hugging Face Blog62

    Hugging Face 提出辅助生成解码方法,可将文本生成延迟降低最多 10 倍

    Hugging Face 发布辅助生成(assisted generation)解码方法,通过小模型生成候选 token、大模型一次前向验证,在消费级硬件上最多降低 10 倍延迟。

    推荐理由:Hugging Face 官方详解辅助生成解码原理与 Transformers 用法,读者可据此判断低延迟文本生成的可行路径。

5月1日周一
4月27日周四
4月26日周三
4月21日周五
4月17日周一
4月6日周四
3月28日周二