跳到正文
8月24日周一
8月21日周五
  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。

    推荐理由:官方给出三个模型的草稿检查点与 H100、MacBook 实测吞吐,可据此判断投机解码在端侧与云端的落地差异。

  2. Microsoft Research36

    微软 Skala 1.1 发布:训练数据扩大 2.5 倍,并集成进 CP2K 等主流 DFT 软件

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比首个公开版本多 2.5 倍,在 GMTKN55 上取得 2.8 kcal/mol 的加权平均误差,55 个类别中 32 项排名第一。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。

8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search 检索层

    Mistral 发布 Agentic Search,作为让模型在复杂文档中导航、阅读并核验信息的检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统一次性 RAG 的边界。

8月18日周二
  1. Hugging Face Blog60

    Sentence Transformers v6.0 新增 MultiVectorEncoder 支持晚交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。

    推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。

8月14日周五
  1. Hugging Face Blog62

    用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 打通录制训练部署闭环

    Hugging Face 博客给出 Strands Robots 流式数据闭环的完整走查:同一个 Robot() 录制 LeRobotDataset、经 sync_dataset_to_bucket 同步进 Storage Bucket、再用 stream_dataset 从 Hub 流式读取训练,最后改一个 mode="real" 参数把 checkpoint 部署回硬件。

    推荐理由:以可运行 notebook 串起录制、去重同步、流式训练到真机部署的完整数据闭环,适合评估机器人数据工程方案。

8月13日周四
8月12日周三
8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与优先服务层级,并接入第三方开源模型

    Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,同时 Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把区域推理、优先服务层级和第三方开源模型接入放在同一套基础设施上,读者可据此判断企业级 AI 部署的区域合规选项。

  2. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS 多语言语音模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖与各 GPU 上的 TTFA 实测数据,可据此评估自建语音链路的延迟预算。

8月10日周一
8月6日周四
8月4日周二
  1. Microsoft Research71

    微软研究院开源 Orchard:可扩展智能体 AI 框架

    微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署框架内直接训练智能体。

    推荐理由:微软研究院开源了可复用的智能体环境服务与三套训练配方,读者可据此了解小模型在真实任务上的训练路径。

8月3日周一
7月30日周四
  1. Hugging Face Blog22

    GPU 管理:为什么闲置 GPU 正在成为新的停场飞机

    Hugging Face 博客指出,AI 的下一个真正瓶颈是 GPU 利用率而非模型智能。GPU 按日历小时计费,却只在计算小时产出,企业自建集群后问题从"能否买到加速器"变成"能否让它们保持忙碌"。文章以航空业停场飞机作类比,强调集群即使满载也可能浪费大部分潜力,因为 GPU 全天运行而需求并不持续。

  2. OpenAI News62

    OpenAI 下调 GPT-5.6 在 Luna 与 Terra 上的定价

    OpenAI 宣布下调 GPT-5.6 在 Luna 和 Terra 上的定价,并介绍更高效的模型如何帮助企业在规模化场景中部署 AI 工作流。原文未披露具体价格数字与模型能力细节。

    推荐理由:OpenAI 公布 GPT-5.6 在 Luna 与 Terra 上的更低定价,读者可据此评估企业级 AI 工作流的部署成本。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。

    推荐理由:原文给出跨平台内核迁移的具体方法与实测数据,读者可据此判断 CUDA 经验能否复用到 Apple Silicon。

7月27日周一
  1. Hugging Face Blog66

    NVIDIA 发布 Cosmos-H-Dreams 实时手术机器人生成式仿真器

    NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 流式推理库提供服务。

    推荐理由:原文给出实时生成式手术仿真器的蒸馏与推理优化路径,读者可据此判断世界模型进入交互闭环的工程门槛。

7月23日周四
  1. Hugging Face Blog62

    Diffusers 原生支持 Nunchaku 4-bit 扩散推理

    Hugging Face 在 Diffusers 中集成 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格 4-bit 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。

    推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的原生加载方式与量化工具链,读者可据此判断消费级 GPU 跑扩散模型的内存与延迟取舍。

7月22日周三
7月16日周四
7月15日周三
  1. Hugging Face Blog87

    Thinking Machines 发布 Inkling 与 Inkling-Small 开源多模态模型

    Thinking Machines 在 Hugging Face 发布 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文,训练数据达 45 万亿 token。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月14日周二
7月10日周五
7月9日周四
  1. Mistral AI57

    Mistral Studio 上线 Prompts 与 Skills 管理系统

    Mistral 在 Studio 中上线 Prompts 与 Skills 管理系统,为每个提示词和技能提供版本化、归属和可追溯能力。每个版本不可变并记录完整历史,支持版本对比、回滚、分类标签和审计日志,非开发者也能直接编辑测试并触发 CI/CD 上线。技能可作为 MCP 服务器直接从 Studio 调用,确保生产执行的是同一受治理资产。

7月8日周三
7月7日周二
  1. Hugging Face Blog62

    微软在 Foundry Managed Compute 上线 Hugging Face 模型集合

    微软在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型引入 Foundry 模型目录,每周刷新,可一键部署到托管 GPU 平台。

    推荐理由:微软在 Foundry 上托管 Hugging Face 开源权重模型,读者可了解企业部署开源模型时被接管的运维环节。

  2. Hugging Face Blog62

    SkyPilot 与 Hugging Face 打通零出口费存储,可在任意云运行 AI 负载

    SkyPilot 与 Hugging Face 联合推出 store: hf 存储后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地环境中调度运行。

    推荐理由:原文给出零出口费存储与跨云调度的组合方式,读者可据此判断数据与 GPU 分离时的成本结构。

7月6日周一
  1. Hugging Face Blog34

    Hugging Face Kernels 项目重大更新:新增 kernel 仓库类型与代码签名

    Hugging Face 为 Kernels 项目引入 Hub 上的全新 "kernel" 仓库类型,并新增可信发布者与代码签名两层安全机制,默认只加载可信发布者的 kernel。项目还重构了 kernels 与 kernel-builder 的 CLI,新增对 Torch Stable ABI 和 Apache TVM FFI 的支持,为智能体自主开发 kernel 打下基础。