跳到正文
2月12日周四
  1. Hugging Face Blog62

    OpenEnv 实践:在真实环境中评测工具型智能体

    Meta 与 Hugging Face 联合推出开源框架 OpenEnv,用于让智能体连接真实工具与 API 而非模拟环境,采用 Gym 风格 API 和标准 MCP 工具调用接口。

    推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 日历环境给出了工具型智能体在权限与多步流程下的实测数据,可据此判断真实环境评测的难点。

2月9日周一
2月6日周五
2月5日周四
2月4日周三
2月3日周二
  1. Hugging Face Blog38

    从 DeepSeek 到 AI+:全球开源 AI 生态的未来走向

    Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构近期的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k,远超 Llama 的 27k 和 DeepSeek 的 6k;腾讯自 2025 年 5 月起以混元品牌加速开源视觉、视频与 3D 模型,百度则通过 Ernie 4.5 系列和 PaddlePaddle 重返开源生态。

1月29日周四
  1. Hugging Face Blog62

    Gradio 团队开源 Daggr:用 Python 串联 AI 工作流并自动生成可视化画布

    Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串联成 AI 工作流,并自动生成可视化画布。画布可查看任意节点的中间输出、修改输入并单独重跑某一步,无需执行整条流水线,还支持状态持久化和用 backup nodes 替换模型。

    推荐理由:Gradio 团队开源 Daggr,用代码定义工作流并自动生成可视化画布,可单独重跑某一步,为多模型串联调试提供了一种轻量方案。

1月28日周三
  1. Mistral AI62

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。

    推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的能力边界与成本。

1月27日周二
1月22日周四
  1. Mistral AI34

    Heaps do lie:排查 vLLM 内存泄漏

    Mistral AI 团队在 vLLM 上排查一起内存泄漏:在 Mistral Medium 3.1、开启 graph compilation 的 Prefill/Decode 分离部署中,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。Heaptrack 显示堆内存稳定,泄漏发生在堆外,最终指向 NIXL 经 UCX 传输 KVCache 的依赖层。

1月20日周二
  1. Hugging Face Blog62

    微软发布 Differential Transformer V2:差分注意力去掉自定义 kernel 与 RMSNorm

    微软 unilm 团队发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下把 query 头数翻倍,使解码速度与标准 Transformer 持平,且不再需要自定义注意力 kernel。

    推荐理由:微软团队给出 DIFF V2 的代码与消融对比,读者可据此理解差分注意力在解码速度与训练稳定性上的取舍。

1月15日周四
  1. Hugging Face Blog66

    OpenAI 发起 Open Responses 开放推理标准,Hugging Face 生态支持

    OpenAI 发起、开源社区构建、Hugging Face 生态支持的 Open Responses 开放推理标准发布,基于 Responses API 设计,面向智能体场景。该标准默认无状态,支持加密推理,将流式输出建模为语义事件序列,并原生支持内部与外部工具及子智能体循环。开发者可通过 Hugging Face Inference Providers 和 Spaces 上的早期访问版本试用。

    推荐理由:OpenAI 发起、Hugging Face 生态支持的开放推理标准,读者可了解它如何替代 Chat Completion 格式并支持智能体循环。

1月14日周三
1月9日周五
1月8日周四
1月5日周一
12月18日周四
  1. Hugging Face Blog36

    Transformers v5 重构 Tokenization:更简单、更清晰、更模块化

    Hugging Face 发布 Transformers v5,将 tokenizer 架构与训练词表分离,类似 PyTorch 分离网络结构与权重,使 tokenizer 可检查、可定制、可从零训练。v5 提供清晰的类层级和单一快速后端,支持 BPE、Unigram、WordPiece 等算法,并可通过 AutoTokenizer 自动选择正确的 tokenizer 类。

12月17日周三
  1. Mistral AI62

    Mistral 发布 OCR 3,表单与手写识别胜率较上代提升 74%

    Mistral 发布文档解析模型 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。

    推荐理由:官方给出 OCR 3 相对上一代在表单、手写和复杂表格上的胜率与定价,可据此判断文档解析成本与适用场景。

12月11日周四
  1. Hugging Face Blog60

    llama.cpp 新增模型管理功能:router 模式支持动态加载与切换模型

    llama.cpp server 新增 router 模式,可在不重启服务的情况下动态加载、卸载和切换多个模型。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;支持自动发现缓存或 --models-dir 目录中的 GGUF 文件、按需加载、LRU 淘汰(默认 --models-max 为 4)以及按请求中的 model 字段路由。

    推荐理由:llama.cpp 新增 router 模式,可在不重启服务的前提下动态加载、卸载和切换多个模型,适合本地多模型部署场景。

  2. Hugging Face Blog66

    Hugging Face 教程:用 Codex 和 HF Skills 端到端微调模型

    Hugging Face 发布教程,展示如何让 OpenAI Codex 通过 HF Skills 仓库完成端到端机器学习实验,包括数据校验、硬件选择、提交 Hugging Face Jobs 训练、监控进度、评测并生成训练报告。

    推荐理由:原文给出 Codex 调用 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。

12月9日周二
  1. Mistral AI80

    Mistral 发布 Devstral 2 编码模型家族与 Vibe CLI

    Mistral 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,均开源,前者采用修改版 MIT 许可,后者采用 Apache 2.0。

    推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。

12月5日周五
12月3日周三
  1. Mistral AI80

    Mistral 发布 Mistral 3 系列,含 675B 参数 Mistral Large 3 与 3B/8B/14B Ministral 3

    Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个稠密小模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。

    推荐理由:Mistral 3 全系以 Apache 2.0 开源并给出 NVFP4 量化与多平台部署路径,可据此判断开源前沿模型的落地成本。

12月1日周一
  1. Hugging Face Blog72

    Hugging Face 发布 Transformers v5,主打互操作性

    Hugging Face 发布 Transformers v5.0.0rc-0,主题是互操作性,官方称该库目前每天通过 pip 安装超过 300 万次、累计安装量超 12 亿次,模型架构从 v4 时的 40 个增至 400 多个。

    推荐理由:官方给出 v5 在简化模型定义、训练与推理上的取舍,读者可据此判断自家训练和部署链路要不要跟进。

11月26日周三
11月25日周二
  1. Hugging Face Blog22

    从第一性原理理解 continuous batching

    Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该方法通过并行处理多个对话、完成即换出,最大化高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量为 O(n²d),随序列长度呈平方增长。

  2. Hugging Face Blog62

    Tavily 如何构建达到 SOTA 的深度研究智能体

    Tavily 分享其深度研究智能体的构建经验,通过上下文工程把工具输出蒸馏为反思而非在上下文中累积原始 token,相比 LangChain 的 Open Deep Research 减少 66% token 消耗,并在 DeepResearch Bench 上达到 SOTA。

    推荐理由:Tavily 复盘自建深度研究智能体的架构取舍,给出上下文工程与 token 消耗对比的具体做法,可迁移到其他长任务智能体。

11月22日周六
  1. Google Research20

    Google Research 如何用简单线性回归模型预测 EV 充电桩可用性

    Google Research 提出一种轻量线性回归模型,预测未来若干分钟后 EV 充电端口可用的概率,以缓解续航焦虑。该模型以一天中各小时为特征、学习各时段占用变化权重,在 30 至 60 分钟预测区间上优于"保持当前状态"基线,主要靠识别高占用周转时刻取胜。评估覆盖 CA 和德国两地 100 个随机站点、每日采样 48 次、持续一周。

11月21日周五
  1. Hugging Face Blog62

    Hugging Face TRL 集成 RapidFire AI,微调实验提速最高 20 倍

    Hugging Face TRL 正式集成 RapidFire AI,用户可用 RFSFTConfig、RFDPOConfig、RFGRPOConfig 近乎零代码替换原有 SFT/DPO/GRPO 配置,在单张 GPU 上并发运行多组微调配置。

    推荐理由:官方集成给出了并发调度与实时控制的具体机制和基准数字,可据此判断微调实验流程能压缩多少时间。

11月20日周四