跳到正文
4月2日周三
  1. Hugging Face Blog36

    高效请求排队:优化 LLM 性能

    TNG Technology Consulting 分享了自托管 LLM 服务中通过公平调度优化请求排队的方法:在 vLLM 等推理引擎前加一层 LLM-Server,为每个用户和模型维护独立队列,用轮询调度替代 FIFO,避免单个用户的大量请求阻塞其他人。

3月31日周一
3月28日周五
3月21日周五
3月20日周四
3月18日周二
  1. Hugging Face Blog62

    Hugging Face 将 Xet 存储上线 Hub,首批仓库完成迁移

    Hugging Face 的 Xet 团队已将首批模型和数据集仓库从 LFS 迁移到 Xet 存储,迁移量约 4.5 TB,占 Hub 下载流量约 6%。Xet 采用内容定义分块(约 64KB)做字节级去重,改动小部分数据时只上传变化的块,官方举例称一个约 5 GB 的 SQLite 数据库追加 1 MB 数据,上传耗时从 LFS 下的 13 分钟降到 0.1 秒。

    推荐理由:Hugging Face 官方复盘 Xet 存储首次迁移,给出块级去重带来的传输收益与迁移中暴露的工程问题。

3月12日周三
  1. Hugging Face Blog82

    Google 发布 Gemma 3 开源多模态模型,覆盖 1B 至 27B 四种尺寸

    Google 发布 Gemma 3 系列开放权重模型,包含 1B、4B、12B、27B 四种尺寸,均有预训练和指令微调版本。4B、12B、27B 支持图像与文本输入及 140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k(1B 为 32k)。

    推荐理由:梳理 Gemma 3 的四种尺寸、多模态与 128k 上下文等规格,并给出 transformers 与端侧推理的可用路径。

3月7日周五
  1. Mistral AI76

    Mistral AI 发布文档理解 OCR API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可读取图片和 PDF,按顺序交错输出文本与图像,并已作为 Le Chat 文档理解的默认模型。

    推荐理由:官方给出与 Google Document AI、Azure OCR、Gemini 系列的横向基准对比,可据此判断文档解析在 RAG 流程中的选型空间。

3月6日周四
2月28日周五
2月25日周二
2月24日周一
2月18日周二
2月17日周一
  1. Mistral AI62

    Mistral 发布 24B 区域语言模型 Mistral Saba

    Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,参数规模 24B,基于中东和南亚地区精选数据集训练。该模型支持阿拉伯语和多种印度语系语言,在南印度语系如泰米尔语上表现突出,官方称其回答比规模大 5 倍以上的模型更准确,同时速度更快、成本更低。

    推荐理由:Mistral 推出面向中东和南亚的区域语言模型,读者可了解其参数规模、语言覆盖和本地部署方式。

2月14日周五
2月13日周四
2月12日周三
2月7日周五
2月6日周四
1月30日周四
1月28日周二
  1. Hugging Face Blog60

    Hugging Face 在 Hub 上线 Inference Providers,接入 fal、Replicate、SambaNova、Together AI

    Hugging Face 在 Hub 模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务,并同步集成到 JS 与 Python 客户端 SDK。

    推荐理由:Hugging Face 把四家无服务器推理商接入模型页与 SDK,读者可据此了解多供应商切换与计费方式的变化。

1月27日周一
  1. Hugging Face Blog62

    Diffusers 中的开源视频生成模型现状

    Hugging Face Diffusers 团队梳理了开源视频生成模型的现状,列出 CogVideoX、Mochi-1、HunyuanVideo、Allegro、LTX Video 等开放模型与 Sora、Veo 2、Kling 等闭源模型的对照。

    推荐理由:Diffusers 团队梳理开源视频生成模型现状,并给出显存优化与微调的实测数据,可据此评估本地部署门槛。

1月23日周四
1月22日周三
1月16日周四
1月15日周三
  1. Hugging Face Blog62

    Hugging Face 发布静态嵌入模型,CPU 推理快 100 至 400 倍

    Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1,在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。

    推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此判断低算力场景下嵌入推理的可行边界。

1月13日周一
  1. Mistral AI62

    Mistral AI 发布 Codestral 25.01 代码模型

    Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。

    推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文及多项 FIM 基准对比,可据此判断其在代码补全场景的位置。

12月24日周二
  1. Hugging Face Blog62

    如何在 PyTorch 中可视化并理解 GPU 显存占用

    Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录显存快照、导出 profile.pkl 并在 pytorch.org/memory_viz 可视化,逐步拆解模型创建、前向、反向和优化器各阶段的显存变化。

    推荐理由:原文给出 PyTorch 显存快照的可视化步骤与显存估算公式,读者可据此定位训练中的显存峰值来源。

12月23日周一
12月18日周三
  1. Hugging Face Blog62

    IBM 等联合发布 Bamba-9B 混合 Mamba2 模型

    IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。

    推荐理由:原文给出混合 Mamba2 架构在 vLLM 中的吞吐与延迟实测数据,以及开放权重和训练配方,便于判断该架构的推理效率取舍。

12月17日周二
12月9日周一
12月5日周四
12月3日周二
11月26日周二
11月20日周三
  1. Hugging Face Blog47

    Hugging Face 如何用内容定义分块提升存储效率

    Hugging Face 的 Xet 团队正用内容定义分块(CDC)把文件拆成可变大小的块,只传输和存储被修改的块,从而提升存储效率与迭代速度。在 CORD-19 数据集基准中,Xet 后端相比 Git LFS 平均下载时间从 51 分钟降至 19 分钟、上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。

11月7日周四