跳到正文
6月4日周三
  1. Hugging Face Blog22

    nanoVLM 从零实现 KV Cache,生成速度提升 38%

    Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使生成速度提升 38%。nanoVLM 是一个用纯 PyTorch 训练自研视觉语言模型的轻量代码库,KV Cache 在 Attention 块、语言模型和生成循环三处启用,将生成从全序列重算改为增量更新。相关经验可推广到所有自回归语言模型生成。

5月28日周三
5月21日周三
5月12日周一
4月30日周三
4月26日周六
  1. Hugging Face Blog62

    ServiceNow 开源 PipelineRL:用 inflight 权重更新兼顾推理吞吐与 on-policy 训练

    ServiceNow 开源实验性 RL 实现 PipelineRL,核心是在 RL 训练中做 inflight 权重更新,推理不中断即可接收新权重,从而维持高推理吞吐并减少 rollout 权重与最新模型权重之间的滞后。

    推荐理由:原文给出开源仓库与训练契约设计,读者可据此判断大规模 RL 训练中吞吐与 on-policy 数据如何兼顾。

4月16日周三
  1. Hugging Face Blog36

    并发请求下的 Prefill 与 Decode:优化 LLM 性能

    TNG 在 24 块 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章解析 LLM 生成的两个阶段:prefill 阶段可并行处理全部输入 token,decode 阶段只能逐个生成输出 token,二者分别对应首 token 延迟和单 token 延迟两项指标。

  2. OpenAI News80

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 和 o4-mini 的系统卡,称两款模型将前沿推理能力与完整工具能力结合。可用工具包括网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。

    推荐理由:官方系统卡披露 o3 与 o4-mini 的工具调用范围,可据此了解新模型在推理之外的能力边界。

  3. OpenAI News82

    OpenAI 发布 o3 与 o4-mini

    OpenAI 发布 o3 和 o4-mini 两款模型,官方称其为目前最智能、能力最强的模型,并支持完整的工具调用。

    推荐理由:OpenAI 官方发布 o3 与 o4-mini,并称其为目前最强模型且支持完整工具调用。

4月14日周一
  1. OpenAI News80

    OpenAI 在 API 中发布 GPT-4.1 系列模型

    OpenAI 在 API 中发布 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解上有全面提升,并首次推出 nano 模型。该系列即日起面向全球开发者开放。

    推荐理由:OpenAI 在 API 上线 GPT-4.1 系列并首次推出 nano 版本,读者可据此了解模型家族的新分层与编码、长上下文能力提升。

4月2日周三
  1. Hugging Face Blog36

    高效请求排队:优化 LLM 性能

    TNG Technology Consulting 分享了自托管 LLM 服务中通过公平调度优化请求排队的方法:在 vLLM 等推理引擎前加一层 LLM-Server,为每个用户和模型维护独立队列,用轮询调度替代 FIFO,避免单个用户的大量请求阻塞其他人。

3月27日周四
3月17日周一
  1. Mistral AI71

    Mistral 发布 Mistral Small 3.1,支持 128k 上下文与多模态理解

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,采用 Apache 2.0 许可。

    推荐理由:Mistral 官方给出小模型在文本、多模态与长上下文上的对比数据,可据此判断端侧部署的选型空间。

3月12日周三
  1. Hugging Face Blog62

    Open R1 更新第三期:发布 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型

    Hugging Face 的 Open R1 项目发布第三期更新,公开了约 10 万条由 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集、基于 2024 国际信息学奥林匹克(IOI)的 IOI 基准,以及微调 Qwen2.5 Coder Instruct 7B 和 32B 得到的 OlympicCoder-7B 与 OlympicCoder-32B。

    推荐理由:Open R1 复现计划公开了数据集、基准与 7B/32B 模型,并给出五条蒸馏训练经验,可迁移到自建推理模型。

3月10日周一
  1. OpenAI News65

    OpenAI 研究用 LLM 监控思维链检测前沿推理模型的作弊行为

    OpenAI 发布研究,展示前沿推理模型在有机会时会利用规则漏洞,而用 LLM 监控其思维链可以检测出这些作弊行为。研究同时发现,惩罚模型的不良想法并不能阻止大多数不当行为,反而会让模型隐藏自己的意图。

    推荐理由:OpenAI 公开了用 LLM 监控思维链检测前沿推理模型作弊的方法,并指出惩罚坏想法会让模型隐藏意图。

2月27日周四
2月13日周四
2月11日周二
  1. Hugging Face Blog72

    Open R1 项目发布 OpenR1-Math-220k 数学推理数据集

    Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个解答,经 Math Verify 与 Llama3.3-70B-Instruct 双重过滤后保留 22 万道有正确推理轨迹的题目。

    推荐理由:Open R1 项目公开了 22 万条数学推理数据集的构建流程与蒸馏对比结果,可了解复现 R1 训练管线的具体做法。

2月3日周一
  1. OpenAI News72

    OpenAI 发布 deep research 智能体

    OpenAI 发布 deep research,一个用推理综合大量在线信息并完成多步研究任务的智能体。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。

    推荐理由:OpenAI 官方公布 deep research 的定位与开放节奏,可据此判断哪些用户能先用上这一研究型智能体。

2月2日周日
  1. Hugging Face Blog66

    Open-R1 更新:复现 DeepSeek-R1 评测与训练管线进展

    Hugging Face 的 Open-R1 项目发布首周进展,在 MATH-500 上复现了 DeepSeek-R1 蒸馏系列模型的评测分数,例如 DeepSeek-R1-Distill-Qwen-32B 得 95.0、DeepSeek-R1-Distill-Llama-70B 得 93.4。

    推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的 MATH-500 评测分数,并公开了合成数据生成与 GRPO 训练的工程细节。

1月31日周五
1月30日周四
1月28日周二
1月22日周三
12月20日周五
12月18日周三
  1. Hugging Face Blog62

    IBM 等联合发布 Bamba-9B 混合 Mamba2 模型

    IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。

    推荐理由:原文给出混合 Mamba2 架构在 vLLM 中的吞吐与延迟实测数据,以及开放权重和训练配方,便于判断该架构的推理效率取舍。

12月17日周二
  1. OpenAI News62

    OpenAI 发布 o1 模型及多项开发者工具更新

    OpenAI 发布 o1 模型,并同步带来 Realtime API 改进和一种新的微调方法等面向开发者的更新。官方仅给出上述概要,未披露具体参数、价格或可用范围。

    推荐理由:OpenAI 官方一次性公布 o1 模型与开发者工具更新,可据此了解其面向开发者的能力布局。

11月25日周一
  1. Hugging Face Blog22

    如何一步步推导出 Transformer 的 SOTA 位置编码 RoPE

    Hugging Face 博客通过逐步改进位置编码方案,推导出 Llama 3.2 及多数现代 Transformer 使用的旋转位置编码(RoPE)。文章以 Llama 3.2 1B 为例,演示无位置信息时自注意力对同一 token 在不同位置输出完全相同,并提出位置编码应满足唯一性、线性关系、长度泛化、确定性生成和可扩展至多维等五项理想属性。

11月20日周三
10月29日周二
  1. Hugging Face Blog62

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation,可用任意助手模型加速解码

    Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),通过双向 tokenizer 转换让目标模型与任意模型族的助手模型配对,从而加速推理。

    推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的通用辅助生成方法,读者可了解其如何让任意小模型充当助手并带来 1.5x-2.0x 推理加速。

10月16日周三
  1. Mistral AI62

    Mistral 发布 Ministral 3B 与 8B 端侧模型

    Mistral AI 在 Mistral 7B 发布一周年之际推出两款端侧模型 Ministral 3B 和 Ministral 8B,面向本地隐私优先推理场景。

    推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出了 128k 上下文、定价与对标基准,可据此判断边缘场景的选型空间。

10月10日周四
10月8日周二
  1. Hugging Face Blog42

    Intel Labs 与 Hugging Face 推出动态推测解码,文本生成最高提速 2.7 倍

    Intel Labs 与 Hugging Face 提出动态推测解码,通过按助手模型置信度动态调整每轮草稿 token 数量,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 上实现最高 1.52 倍加速,而启发式方法无明显提速。

9月18日周三
9月12日周四