跳到正文
3月25日周三
  1. Google Research62

    Google 发布 TurboQuant 等向量量化算法,将 KV cache 压缩至 3 bit

    Google Research 提出 TurboQuant 压缩算法,并配套 QJL 和 PolarQuant 两种方法,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 发表。

    推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度的前提下把 KV cache 压到 3 bit,并给出与基线的对比数据。

3月21日周六
  1. Hugging Face Blog62

    如何在一天内构建领域专用嵌入模型

    NVIDIA 发布一套基于 NeMo 的嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成领域专用模型,无需人工标注。流程包含用 LLM 从领域文档生成合成问答对、挖掘难负样本、多跳问题展开、对比学习微调、BEIR 评测以及导出为 ONNX/TensorRT 并用 NVIDIA NIM 部署六步。

    推荐理由:原文给出从文档到部署的六步嵌入模型微调流程与实测指标,可迁移到自有领域语料。

3月18日周三
  1. Mistral AI60

    Mistral AI 推出企业级模型训练系统 Forge

    Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统。Forge 支持预训练、后训练和强化学习等阶段,可训练模型理解内部术语、代码库与流程,并支持 dense 与 MoE 架构及多模态输入。该产品面向智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据,企业还能通过内部评测与强化学习持续改进模型。

    推荐理由:原文给出企业用自有数据训练前沿模型的产品定位与训练流程,可据此判断企业自建模型与智能体的落地路径。

3月17日周二
3月12日周四
3月11日周三
  1. OpenAI News60

    OpenAI 为 Responses API 配备计算机环境,从模型走向智能体

    OpenAI 介绍如何用 Responses API、shell 工具和托管容器构建智能体运行时,让智能体在安全、可扩展的环境中处理文件、工具和状态。原文仅提供摘要,未给出具体版本号、开放时间或性能数据。

    推荐理由:OpenAI 官方说明如何用 Responses API、shell 工具与托管容器搭建智能体运行时,可了解其安全与扩展思路。

3月10日周二
  1. Hugging Face Blog62

    Hugging Face Hub 推出 Storage Buckets 可变对象存储

    Hugging Face 在 Hub 上推出 Storage Buckets,一种非版本化的 S3 式可变对象存储,可通过浏览器、Python 或 hf CLI 管理,地址形如 hf://buckets/username/my-training-bucket。

    推荐理由:原文给出可变对象存储的定位与 Xet 去重、预热的机制,读者可据此判断它是否适合训练中间产物的存放。

3月9日周一
  1. Hugging Face Blog60

    Ulysses 序列并行:用百万 token 上下文训练大模型

    Hugging Face 发布教程,介绍源自 Snowflake AI Research 的 Ulysses 序列并行如何通过注意力头切分把长序列训练分布到多张 GPU,并已集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。

    推荐理由:原文给出 Ulysses 序列并行在 Hugging Face 生态的接入方式与实测数据,可据此判断长上下文训练的显存与吞吐取舍。

3月5日周四
  1. Hugging Face Blog34

    Hugging Face 博客:在嵌入式平台部署机器人 AI——数据集录制、VLA 微调与端侧优化

    NXP 发布在嵌入式平台部署机器人 AI 的实践指南,涵盖机器人数据集录制、VLA 策略(ACT 和 SmolVLA)微调,以及 NXP i.MX 95 SoC 优化后的实时性能表现。指南以"把茶包放进杯子"任务为例,记录了 120 个 episode,并建议采用 3 摄像头配置(顶部、夹爪、左侧)以平衡精度与延迟。

2月27日周五
2月26日周四
  1. Hugging Face Blog62

    Hugging Face 详解 transformers 中的 MoE 支持:权重加载重构、专家后端与专家并行

    Hugging Face 发布博客,介绍 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端与专家并行三部分。

    推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重构的加载、后端与专家并行设计,并给出 v4 与 v5 的加载耗时对比。

2月20日周五
2月18日周三
  1. Hugging Face Blog62

    用 Gradio 的 gr.HTML 一次性生成任意 Web 应用

    Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 Claude 等前沿 LLM 一次性生成前端、后端与状态管理,全部写在一个 Python 文件里,无需构建步骤即可部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.HTML 的三模板 API 与单文件示例,读者可据此让 LLM 一次性生成可部署的交互组件。

2月13日周五
  1. Hugging Face Blog66

    Hugging Face 发布 CUDA kernel Agent 技能,Claude 与 Codex 端到端生成可用内核

    Hugging Face 发布 cuda-kernels Agent 技能,让 Claude Code、Codex 等编码智能体自动编写生产级 CUDA kernel,并完成 PyTorch 绑定与基准测试。

    推荐理由:Hugging Face 把 CUDA kernel 开发经验打包成 Agent 技能,并给出两个真实模型的实测数据,可迁移到其他领域知识封装。

2月12日周四
  1. Hugging Face Blog62

    OpenEnv 实践:在真实环境中评测工具型智能体

    Meta 与 Hugging Face 联合推出开源框架 OpenEnv,用于让智能体连接真实工具与 API 而非模拟环境,采用 Gym 风格 API 和标准 MCP 工具调用接口。

    推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 日历环境给出了工具型智能体在权限与多步流程下的实测数据,可据此判断真实环境评测的难点。

2月9日周一
2月6日周五
2月5日周四
2月4日周三
2月3日周二
  1. Hugging Face Blog38

    从 DeepSeek 到 AI+:全球开源 AI 生态的未来走向

    Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构近期的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k,远超 Llama 的 27k 和 DeepSeek 的 6k;腾讯自 2025 年 5 月起以混元品牌加速开源视觉、视频与 3D 模型,百度则通过 Ernie 4.5 系列和 PaddlePaddle 重返开源生态。

1月29日周四
  1. Hugging Face Blog62

    Gradio 团队开源 Daggr:用 Python 串联 AI 工作流并自动生成可视化画布

    Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串联成 AI 工作流,并自动生成可视化画布。画布可查看任意节点的中间输出、修改输入并单独重跑某一步,无需执行整条流水线,还支持状态持久化和用 backup nodes 替换模型。

    推荐理由:Gradio 团队开源 Daggr,用代码定义工作流并自动生成可视化画布,可单独重跑某一步,为多模型串联调试提供了一种轻量方案。

1月28日周三
  1. Mistral AI62

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。

    推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的能力边界与成本。

1月27日周二
1月22日周四
  1. Mistral AI34

    Heaps do lie:排查 vLLM 内存泄漏

    Mistral AI 团队在 vLLM 上排查一起内存泄漏:在 Mistral Medium 3.1、开启 graph compilation 的 Prefill/Decode 分离部署中,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。Heaptrack 显示堆内存稳定,泄漏发生在堆外,最终指向 NIXL 经 UCX 传输 KVCache 的依赖层。

1月20日周二
  1. Hugging Face Blog62

    微软发布 Differential Transformer V2:差分注意力去掉自定义 kernel 与 RMSNorm

    微软 unilm 团队发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下把 query 头数翻倍,使解码速度与标准 Transformer 持平,且不再需要自定义注意力 kernel。

    推荐理由:微软团队给出 DIFF V2 的代码与消融对比,读者可据此理解差分注意力在解码速度与训练稳定性上的取舍。

1月15日周四
  1. Hugging Face Blog66

    OpenAI 发起 Open Responses 开放推理标准,Hugging Face 生态支持

    OpenAI 发起、开源社区构建、Hugging Face 生态支持的 Open Responses 开放推理标准发布,基于 Responses API 设计,面向智能体场景。该标准默认无状态,支持加密推理,将流式输出建模为语义事件序列,并原生支持内部与外部工具及子智能体循环。开发者可通过 Hugging Face Inference Providers 和 Spaces 上的早期访问版本试用。

    推荐理由:OpenAI 发起、Hugging Face 生态支持的开放推理标准,读者可了解它如何替代 Chat Completion 格式并支持智能体循环。