跳到正文
7月10日周四
  1. Hugging Face Blog50

    Hugging Face 详解异步机器人推理:解耦动作预测与执行

    Hugging Face 发布博客详解异步机器人推理,通过将动作预测与执行解耦,让机器人在 PolicyServer 计算下一段动作时持续执行当前动作队列,从而消除等待推理的空闲时间。该方案在 SmolVLA 上实现约 2 倍任务完成速度提升,任务成功率相当,PolicyServer 与 RobotClient 之间通过 gRPC 通信,性能约为同类 REST API 的 5 倍。

7月9日周三
7月8日周二
  1. Hugging Face Blog20

    Hugging Face 生产基础设施背后的三大关键告警

    Hugging Face 基础设施团队公开了支撑其生产环境的三大告警机制,分别覆盖 NAT 网关吞吐量、Hub 请求日志归档成功率等环节。NAT 网关告警在流量超过预设静态阈值时触发,用于发现异常流量峰值并优化网络路径成本;日志归档链路则通过 Filebeat、Logstash 与 Elasticsearch 完成采集、加工与存储。

  2. Hugging Face Blog36

    Hugging Face 详解高效多模态数据管道:从朴素填充到背包算法

    Hugging Face 以 nanoVLM 项目为例,展示如何用五阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充阶段约 60% 的 batch 被无用 padding token 占据,团队随后引入全局最大长度约束,并借助背包问题(knapsack)实现贪心打包,将序列按 token 数尽量塞满每个 batch。

7月1日周二
6月23日周一
6月19日周四
  1. Hugging Face Blog62

    如何在消费级硬件上用 QLoRA 微调 FLUX.1-dev

    Hugging Face 发布教程,介绍用 diffusers 库和 QLoRA 在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以下。在 RTX 4090 上,QLoRA 峰值显存约 9GB,标准 BF16 LoRA 需 26GB,700 步训练约 41 分钟。

    推荐理由:原文给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,可据此复现低显存训练流程。

6月16日周一
  1. Hugging Face Blog22

    Groq 成为 Hugging Face Hub 支持的推理服务商

    Groq 现已作为推理服务商接入 Hugging Face Hub,支持 Llama 4、Qwen QWQ-32B 等开源模型,并集成到 JS 和 Python 客户端 SDK。Groq 基于 LPU 提供低延迟、高吞吐的推理,采用按需付费模式,用户可用自有 API key 或通过 HF 路由调用。PRO 用户每月获 2 美元推理额度,官方 SDK 支持将在 v0.33.0 版本发布。

6月12日周四
6月11日周三
6月4日周三
  1. Mistral AI62

    Mistral 发布企业级 AI 编码助手 Mistral Code

    Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量与气隙本地 GPU 部署,代码留在企业边界内。

    推荐理由:官方给出企业级编码助手的模型组合、部署形态与首批客户,可据此判断私有化编码方案的落地路径。

  2. Hugging Face Blog22

    nanoVLM 从零实现 KV Cache,生成速度提升 38%

    Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使生成速度提升 38%。nanoVLM 是一个用纯 PyTorch 训练自研视觉语言模型的轻量代码库,KV Cache 在 Attention 块、语言模型和生成循环三处启用,将生成从全序列重算改为增量更新。相关经验可推广到所有自回归语言模型生成。

6月3日周二
5月28日周三
  1. Mistral AI62

    Mistral 发布代码嵌入模型 Codestral Embed

    Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。

    推荐理由:官方给出代码嵌入模型在检索基准上的对比与按维度裁剪的存储成本权衡,可据此评估代码 RAG 的选型。

5月27日周二
  1. Mistral AI72

    Mistral 发布 Agents API,支持内置连接器与多智能体编排

    Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、Web 搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。

    推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,可据此判断企业级智能体平台的搭建方式。

5月25日周日
5月23日周五
5月22日周四
5月21日周三
5月19日周一
5月15日周四
  1. Hugging Face Blog62

    Hugging Face 将 Transformers 定位为跨框架模型定义标准

    Hugging Face 在博客中表示,未来目标是让 Transformers 成为各框架之间的模型定义中枢,模型架构只要被 Transformers 支持,就能在生态其他工具中获得支持。

    推荐理由:Hugging Face 官方说明 Transformers 将作为跨框架模型定义中枢,读者可据此理解模型接入与部署链路的变化。

5月14日周三
5月13日周二
5月8日周四
5月7日周三
  1. Mistral AI60

    Mistral 发布 Le Chat Enterprise,由 Mistral Medium 3 驱动

    Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,提供企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。

    推荐理由:Mistral 官方发布企业版助手,列出企业搜索、Agent 构建与混合部署等能力,可据此判断其企业落地路径。

4月30日周三
4月29日周二
4月26日周六
  1. Hugging Face Blog62

    ServiceNow 开源 PipelineRL:用 inflight 权重更新兼顾推理吞吐与 on-policy 训练

    ServiceNow 开源实验性 RL 实现 PipelineRL,核心是在 RL 训练中做 inflight 权重更新,推理不中断即可接收新权重,从而维持高推理吞吐并减少 rollout 权重与最新模型权重之间的滞后。

    推荐理由:原文给出开源仓库与训练契约设计,读者可据此判断大规模 RL 训练中吞吐与 on-policy 数据如何兼顾。

4月16日周三
  1. Hugging Face Blog36

    并发请求下的 Prefill 与 Decode:优化 LLM 性能

    TNG 在 24 块 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章解析 LLM 生成的两个阶段:prefill 阶段可并行处理全部输入 token,decode 阶段只能逐个生成输出 token,二者分别对应首 token 延迟和单 token 延迟两项指标。

4月9日周三
4月4日周五
  1. Hugging Face Blog22

    Gradio 月活开发者突破 100 万:Hugging Face 分享五年增长经验

    Gradio 月活开发者已超过 100 万,被 Automatic1111、LLaMA-Factory 等热门开源项目使用。Hugging Face 回顾其五年增长经验:坚持投入底层原语而非高层抽象,如今 gr.Blocks 占 Gradio 使用量的 80%;专注机器学习 Web 应用这一细分场景,并借助 share links 和 Hugging Face Spaces 实现病毒式传播。