跳到正文
1月30日周四
1月28日周二
  1. Hugging Face Blog60

    Hugging Face 在 Hub 上线 Inference Providers,接入 fal、Replicate、SambaNova、Together AI

    Hugging Face 在 Hub 模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务,并同步集成到 JS 与 Python 客户端 SDK。

    推荐理由:Hugging Face 把四家无服务器推理商接入模型页与 SDK,读者可据此了解多供应商切换与计费方式的变化。

1月27日周一
  1. Hugging Face Blog62

    Diffusers 中的开源视频生成模型现状

    Hugging Face Diffusers 团队梳理了开源视频生成模型的现状,列出 CogVideoX、Mochi-1、HunyuanVideo、Allegro、LTX Video 等开放模型与 Sora、Veo 2、Kling 等闭源模型的对照。

    推荐理由:Diffusers 团队梳理开源视频生成模型现状,并给出显存优化与微调的实测数据,可据此评估本地部署门槛。

1月23日周四
1月22日周三
1月16日周四
1月15日周三
  1. Hugging Face Blog62

    Hugging Face 发布静态嵌入模型,CPU 推理快 100 至 400 倍

    Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1,在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。

    推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此判断低算力场景下嵌入推理的可行边界。

1月13日周一
  1. Mistral AI62

    Mistral AI 发布 Codestral 25.01 代码模型

    Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。

    推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文及多项 FIM 基准对比,可据此判断其在代码补全场景的位置。

12月24日周二
  1. Hugging Face Blog62

    如何在 PyTorch 中可视化并理解 GPU 显存占用

    Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录显存快照、导出 profile.pkl 并在 pytorch.org/memory_viz 可视化,逐步拆解模型创建、前向、反向和优化器各阶段的显存变化。

    推荐理由:原文给出 PyTorch 显存快照的可视化步骤与显存估算公式,读者可据此定位训练中的显存峰值来源。

12月23日周一
12月18日周三
  1. Hugging Face Blog62

    IBM 等联合发布 Bamba-9B 混合 Mamba2 模型

    IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。

    推荐理由:原文给出混合 Mamba2 架构在 vLLM 中的吞吐与延迟实测数据,以及开放权重和训练配方,便于判断该架构的推理效率取舍。

12月17日周二
12月9日周一
12月5日周四
12月3日周二
11月26日周二
11月20日周三
  1. Hugging Face Blog47

    Hugging Face 如何用内容定义分块提升存储效率

    Hugging Face 的 Xet 团队正用内容定义分块(CDC)把文件拆成可变大小的块,只传输和存储被修改的块,从而提升存储效率与迭代速度。在 CORD-19 数据集基准中,Xet 后端相比 Git LFS 平均下载时间从 51 分钟降至 19 分钟、上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。

11月7日周四
  1. Mistral AI58

    Mistral AI 发布内容审核 API

    Mistral AI 发布新的内容审核 API,即其 Le Chat 审核服务所用的同一套接口,现开放给用户按自身应用和安全标准使用。该模型是一个 LLM 分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,并针对对话场景分类最后一条消息。模型原生支持多语言,训练语言包括阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。

11月5日周二
10月29日周二
  1. Hugging Face Blog62

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation,可用任意助手模型加速解码

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),通过双向 tokenizer 转换让目标模型与任意模型族的助手模型配对,从而加速推理。

    推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的通用辅助生成方法,读者可了解其如何让任意小模型充当助手并带来 1.5x-2.0x 推理加速。

10月23日周三
10月22日周二
  1. Hugging Face Blog40

    Hugging Face 如何在 Inference Endpoints 上部署 Speech-to-Speech

    Hugging Face 发布 Speech-to-Speech(S2S)级联流水线,串联 VAD、STT、语言模型与 TTS,支持英语、法语、西班牙语、中文、日语和韩语,可用单语言模式或 auto 标志自动检测语言。由于本地运行对算力要求高、易出现延迟,官方给出用自定义 Docker 镜像将其部署到 Hugging Face Inference Endpoints 的分步指南。

  2. Hugging Face Blog62

    Diffusers 支持 Stable Diffusion 3.5 Large,含 8B 与 timestep-distilled 两个 checkpoint

    Stable Diffusion 3.5 已在 Hugging Face Hub 上线并可通过 Diffusers 使用,发布包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,后者支持 4-8 步少步推理。

    推荐理由:Stable Diffusion 3.5 Large 已在 Hub 上线并接入 Diffusers,文中给出量化推理与 LoRA 训练的完整代码路径。

10月21日周一
10月10日周四
10月9日周三
10月8日周二
  1. Hugging Face Blog42

    Intel Labs 与 Hugging Face 推出动态推测解码,文本生成最高提速 2.7 倍

    Intel Labs 与 Hugging Face 提出动态推测解码,通过按助手模型置信度动态调整每轮草稿 token 数量,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 上实现最高 1.52 倍加速,而启发式方法无明显提速。

10月5日周六
  1. Hugging Face Blog22

    Hugging Face 如何改进 Hub 上 Parquet 文件的去重效率

    Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了去重表现:追加 1 万行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量只去重 89%,需额外 230MB,删除一行则导致后半文件全部重写。团队提出改用相对偏移量、对行组做内容定义分块(CDC)等改进思路,并希望与 Apache Arrow 社区合作落地。

10月1日周二
  1. OpenAI News60

    OpenAI 在 API 中推出 Prompt Caching

    OpenAI 在 API 中推出 Prompt Caching,对模型近期已见过的输入自动提供折扣。官方说明该机制面向重复出现的输入内容,具体折扣幅度与适用条件未在摘要中给出。

    推荐理由:OpenAI 在 API 层面对近期出现过的输入自动打折,读者可据此判断长提示词与重复上下文的成本变化。

9月20日周五
9月18日周三
9月17日周二
  1. Mistral AI70

    Mistral 发布 Pixtral 12B 多模态模型

    Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用 400M 参数从头训练的视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与 128k token 上下文窗口内的多图输入。

    推荐理由:官方给出架构细节、MMMU 等基准对比和 Apache 2.0 许可,可据此判断开源多模态模型的当前水位。