跳到正文
5月11日周日
  1. Hugging Face Blog34

    LeRobot 社区数据集:机器人领域的“ImageNet”何时到来、如何实现?

    Hugging Face 的 LeRobot 项目正推动社区共建机器人数据集,目标是打造机器人领域的“ImageNet”。目前 Hub 上的 lerobot 数据集数量快速增长,贡献主要集中在 So100 和 Koch 机械臂,聚焦操作任务。文章将泛化视为数据问题,呼吁通过简化录制流程、降低硬件成本来扩大数据多样性。

4月30日周三
4月26日周六
  1. Hugging Face Blog62

    ServiceNow 开源 PipelineRL:用 inflight 权重更新兼顾推理吞吐与 on-policy 训练

    ServiceNow 开源实验性 RL 实现 PipelineRL,核心是在 RL 训练中做 inflight 权重更新,推理不中断即可接收新权重,从而维持高推理吞吐并减少 rollout 权重与最新模型权重之间的滞后。

    推荐理由:原文给出开源仓库与训练契约设计,读者可据此判断大规模 RL 训练中吞吐与 on-policy 数据如何兼顾。

4月25日周五
4月23日周三
  1. Hugging Face Blog36

    TNG 微调 olmOCR-7B-0225-preview,打造忠实还原页眉页脚的 OCR 引擎

    TNG 基于 olmOCR-7B-0225-preview 微调出忠实版 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,微调后模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。该模型已在 Hugging Face 开源。

4月16日周三
  1. Hugging Face Blog36

    并发请求下的 Prefill 与 Decode:优化 LLM 性能

    TNG 在 24 块 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章解析 LLM 生成的两个阶段:prefill 阶段可并行处理全部输入 token,decode 阶段只能逐个生成输出 token,二者分别对应首 token 延迟和单 token 延迟两项指标。

4月9日周三
  1. Mistral AI35

    Mistral 如何用 LLM as a Judge 评估 RAG 系统

    Mistral 提出用 LLM as a Judge 配合结构化输出实现 RAG Triad 评估框架,从上下文相关性、有据性和答案相关性三个维度打分。该框架由 TruLens 提出,RAGAS 等类似方案也已出现,用于端到端评估 RAG 系统的检索与生成质量。Mistral 模型可同时充当生成器和评判器,结构化输出让评分标准可复用且易于机器读取。

4月4日周五
  1. Hugging Face Blog22

    Gradio 月活开发者突破 100 万:Hugging Face 分享五年增长经验

    Gradio 月活开发者已超过 100 万,被 Automatic1111、LLaMA-Factory 等热门开源项目使用。Hugging Face 回顾其五年增长经验:坚持投入底层原语而非高层抽象,如今 gr.Blocks 占 Gradio 使用量的 80%;专注机器学习 Web 应用这一细分场景,并借助 share links 和 Hugging Face Spaces 实现病毒式传播。

4月3日周四
4月2日周三
  1. Hugging Face Blog36

    高效请求排队:优化 LLM 性能

    TNG Technology Consulting 分享了自托管 LLM 服务中通过公平调度优化请求排队的方法:在 vLLM 等推理引擎前加一层 LLM-Server,为每个用户和模型维护独立队列,用轮询调度替代 FIFO,避免单个用户的大量请求阻塞其他人。

3月31日周一
3月26日周三
3月20日周四
3月7日周五
3月4日周二
2月28日周五
2月13日周四
2月12日周三
2月4日周二
1月31日周五
1月30日周四
1月27日周一
  1. Hugging Face Blog62

    Diffusers 中的开源视频生成模型现状

    Hugging Face Diffusers 团队梳理了开源视频生成模型的现状,列出 CogVideoX、Mochi-1、HunyuanVideo、Allegro、LTX Video 等开放模型与 Sora、Veo 2、Kling 等闭源模型的对照。

    推荐理由:Diffusers 团队梳理开源视频生成模型现状,并给出显存优化与微调的实测数据,可据此评估本地部署门槛。

1月16日周四
1月15日周三
  1. Hugging Face Blog62

    Hugging Face 发布静态嵌入模型,CPU 推理快 100 至 400 倍

    Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1,在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。

    推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此判断低算力场景下嵌入推理的可行边界。

12月24日周二
  1. Hugging Face Blog62

    如何在 PyTorch 中可视化并理解 GPU 显存占用

    Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录显存快照、导出 profile.pkl 并在 pytorch.org/memory_viz 可视化,逐步拆解模型创建、前向、反向和优化器各阶段的显存变化。

    推荐理由:原文给出 PyTorch 显存快照的可视化步骤与显存估算公式,读者可据此定位训练中的显存峰值来源。

12月23日周一
12月17日周二
12月3日周二
12月2日周一
  1. Hugging Face Blog40

    开源开发者指南:欧盟 AI 法案(EU AI Act)要点解读

    Hugging Face 发布开源开发者指南,解读已正式生效的欧盟 AI 法案(EU AI Act)。法案按风险分级监管,仅通用目的 AI(GPAI)模型被直接监管,训练算力超 10^25 FLOPs 的模型被认定存在系统性风险。多数开源项目只需提供清晰文档、模型信息披露并遵守现有版权与隐私规则,Hugging Face 提供模型卡、数据集卡、Gradio 水印及个人数据脱敏等工具协助合规。

11月25日周一
  1. Hugging Face Blog22

    如何一步步推导出 Transformer 的 SOTA 位置编码 RoPE

    Hugging Face 博客通过逐步改进位置编码方案,推导出 Llama 3.2 及多数现代 Transformer 使用的旋转位置编码(RoPE)。文章以 Llama 3.2 1B 为例,演示无位置信息时自注意力对同一 token 在不同位置输出完全相同,并提出位置编码应满足唯一性、线性关系、长度泛化、确定性生成和可扩展至多维等五项理想属性。

11月21日周四
11月20日周三
  1. Hugging Face Blog47

    Hugging Face 如何用内容定义分块提升存储效率

    Hugging Face 的 Xet 团队正用内容定义分块(CDC)把文件拆成可变大小的块,只传输和存储被修改的块,从而提升存储效率与迭代速度。在 CORD-19 数据集基准中,Xet 后端相比 Git LFS 平均下载时间从 51 分钟降至 19 分钟、上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。

10月29日周二
  1. Hugging Face Blog62

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation,可用任意助手模型加速解码

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),通过双向 tokenizer 转换让目标模型与任意模型族的助手模型配对,从而加速推理。

    推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的通用辅助生成方法,读者可了解其如何让任意小模型充当助手并带来 1.5x-2.0x 推理加速。

10月28日周一
10月22日周二
  1. Hugging Face Blog40

    Hugging Face 如何在 Inference Endpoints 上部署 Speech-to-Speech

    Hugging Face 发布 Speech-to-Speech(S2S)级联流水线,串联 VAD、STT、语言模型与 TTS,支持英语、法语、西班牙语、中文、日语和韩语,可用单语言模式或 auto 标志自动检测语言。由于本地运行对算力要求高、易出现延迟,官方给出用自定义 Docker 镜像将其部署到 Hugging Face Inference Endpoints 的分步指南。

10月21日周一