跳到正文
3月11日周三
3月10日周二
3月9日周一
  1. Hugging Face Blog60

    Ulysses 序列并行:用百万 token 上下文训练大模型

    Hugging Face 发布教程,介绍源自 Snowflake AI Research 的 Ulysses 序列并行如何通过注意力头切分把长序列训练分布到多张 GPU,并已集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。

    推荐理由:原文给出 Ulysses 序列并行在 Hugging Face 生态的接入方式与实测数据,可据此判断长上下文训练的显存与吞吐取舍。

3月6日周五
3月5日周四
  1. Hugging Face Blog34

    Hugging Face 博客:在嵌入式平台部署机器人 AI——数据集录制、VLA 微调与端侧优化

    NXP 发布在嵌入式平台部署机器人 AI 的实践指南,涵盖机器人数据集录制、VLA 策略(ACT 和 SmolVLA)微调,以及 NXP i.MX 95 SoC 优化后的实时性能表现。指南以"把茶包放进杯子"任务为例,记录了 120 个 episode,并建议采用 3 摄像头配置(顶部、夹爪、左侧)以平衡精度与延迟。

3月4日周三
2月26日周四
  1. Hugging Face Blog62

    Hugging Face 详解 transformers 中的 MoE 支持:权重加载重构、专家后端与专家并行

    Hugging Face 发布博客,介绍 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端与专家并行三部分。

    推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重构的加载、后端与专家并行设计,并给出 v4 与 v5 的加载耗时对比。

2月20日周五
2月18日周三
  1. Hugging Face Blog62

    用 Gradio 的 gr.HTML 一次性生成任意 Web 应用

    Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 Claude 等前沿 LLM 一次性生成前端、后端与状态管理,全部写在一个 Python 文件里,无需构建步骤即可部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.HTML 的三模板 API 与单文件示例,读者可据此让 LLM 一次性生成可部署的交互组件。

2月13日周五
2月12日周四
  1. Hugging Face Blog62

    OpenEnv 实践:在真实环境中评测工具型智能体

    Meta 与 Hugging Face 联合推出开源框架 OpenEnv,用于让智能体连接真实工具与 API 而非模拟环境,采用 Gym 风格 API 和标准 MCP 工具调用接口。

    推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 日历环境给出了工具型智能体在权限与多步流程下的实测数据,可据此判断真实环境评测的难点。

2月11日周三
2月4日周三
2月3日周二
1月29日周四
1月28日周三
1月27日周二
1月23日周五
1月22日周四
  1. Mistral AI34

    Heaps do lie:排查 vLLM 内存泄漏

    Mistral AI 团队在 vLLM 上排查一起内存泄漏:在 Mistral Medium 3.1、开启 graph compilation 的 Prefill/Decode 分离部署中,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。Heaptrack 显示堆内存稳定,泄漏发生在堆外,最终指向 NIXL 经 UCX 传输 KVCache 的依赖层。

1月8日周四
1月5日周一
12月18日周四
  1. Hugging Face Blog36

    Transformers v5 重构 Tokenization:更简单、更清晰、更模块化

    Hugging Face 发布 Transformers v5,将 tokenizer 架构与训练词表分离,类似 PyTorch 分离网络结构与权重,使 tokenizer 可检查、可定制、可从零训练。v5 提供清晰的类层级和单一快速后端,支持 BPE、Unigram、WordPiece 等算法,并可通过 AutoTokenizer 自动选择正确的 tokenizer 类。

12月17日周三
12月16日周二
12月12日周五
12月11日周四
  1. Hugging Face Blog66

    Hugging Face 教程:用 Codex 和 HF Skills 端到端微调模型

    Hugging Face 发布教程,展示如何让 OpenAI Codex 通过 HF Skills 仓库完成端到端机器学习实验,包括数据校验、硬件选择、提交 Hugging Face Jobs 训练、监控进度、评测并生成训练报告。

    推荐理由:原文给出 Codex 调用 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。

12月4日周四
11月25日周二
  1. Hugging Face Blog22

    从第一性原理理解 continuous batching

    Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该方法通过并行处理多个对话、完成即换出,最大化高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量为 O(n²d),随序列长度呈平方增长。

  2. Hugging Face Blog62

    Tavily 如何构建达到 SOTA 的深度研究智能体

    Tavily 分享其深度研究智能体的构建经验,通过上下文工程把工具输出蒸馏为反思而非在上下文中累积原始 token,相比 LangChain 的 Open Deep Research 减少 66% token 消耗,并在 DeepResearch Bench 上达到 SOTA。

    推荐理由:Tavily 复盘自建深度研究智能体的架构取舍,给出上下文工程与 token 消耗对比的具体做法,可迁移到其他长任务智能体。

11月19日周三
11月17日周一
11月7日周五
10月30日周四
  1. Hugging Face Blog42

    MiniMax M2 的智能体对齐:从基准测试到真实世界泛化

    MiniMax M2 的后训练团队分享了智能体对齐的核心经验:智能体需要交错思考(Interleaved Thinking),在任务全程而非仅在开头进行推理,以应对工具输出带来的持续扰动。团队发现,仅靠工具数量扩展无法实现泛化,真正的泛化要求模型对整个操作空间中的扰动保持稳定,包括系统提示词、用户提示词、环境和工具响应。M2 用户需保留包含思考步骤的完整会话历史,因为上下文就是它的记忆。

10月29日周三
  1. Hugging Face Blog62

    NVIDIA Isaac for Healthcare 如何从仿真到部署构建医疗机器人

    NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端手术辅助机器人工作流,覆盖数据采集、训练与真机部署。该工作流用 LeRobot 采集仿真与真机数据,后训练 GR00T N1.5,并在 Isaac Lab 评估后部署到硬件,其中超过 93% 的训练数据由仿真合成生成。

    推荐理由:原文给出从仿真采集、GR00T N1.5 后训练到真机部署的完整命令与硬件要求,可据此复现医疗机器人工作流。

10月28日周二
  1. Hugging Face Blog38

    Hugging Face 提出“语音同意门”:让声音克隆必须先获得本人同意

    Hugging Face 发布博客提出“语音同意门”(voice consent gate),让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动声音克隆,并提供了示例 Space 和配套代码。该方案由语言模型为每次授权生成一对全新句子,一句表达明确同意、一句提供语音多样性,从而把同意变成可追溯、可审计的系统前置条件。

10月21日周二