跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

195 条精选近 30 天 20 条共收录 533 条

更新

精选归档 · 第 2 页

9月3日周四第 21–40 条
  1. Google DeepMind78

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,直接学习实时卫星观测数据,每小时生成一次预报,地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 清晰约 5 倍。

    推荐理由:官方给出与上一代的分辨率、更新频率和降水精度对比,可据此判断AI天气预报在谷歌产品中的落地程度。

  2. Hugging Face Blog71

    Hugging Face 发布 funes,为编码智能体提供自有记忆层

    Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes,通过一条 add 命令把本机已有会话索引为可召回的记忆。

    推荐理由:Hugging Face 官方发布的本地记忆层,给出安装命令与跨智能体召回机制,可据此判断多机多智能体协作的落地方式。

9月2日周三
  1. Google DeepMind74

    Google DeepMind 为 Gemini 推出智能体视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。

    推荐理由:官方给出 token 与成本降幅及准确率变化,并说明 API 开启方式,便于开发者评估长视频分析方案。

9月1日周二
  1. Hugging Face Blog62

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核与 Fleet 浏览器基准工具

    Hugging Face 发布 @huggingface/kernels,一个从 Hub 加载并运行优化 WebGPU 内核的 JavaScript 库,同时上线 207 个内核的初始集合,均以独立仓库发布并采用 Apache-2.0 许可。

    推荐理由:Hugging Face 把浏览器端 GPU 算子做成可版本化、可测试的独立仓库,并给出与 ORT WebGPU 的实测对比,便于判断浏览器推理的底层现状。

8月25日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.2 推理模型家族:3B、8B、30B 三档,Apache 2.0 开源

    IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部以 Apache 2.0 许可开源。

    推荐理由:原文完整披露了 Granite 4.2 的预训练、SFT 数据配比与多阶段 RL 细节,可据此了解推理模型在智能体环境中的训练路径。

  2. Hugging Face Blog60

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 9 项基准中 7 项超过其全精度版本

    Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,在 9 项基准中有 7 项超过该 60B 模型的 bfloat16 版本。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复配方,并附 9 项基准对比,可据此判断 4-bit 部署的精度取舍。

  3. Hugging Face Blog66

    Gradio 推出 gr.Workflow,把 AI 流水线变成可拖拽画布与 REST API

    Hugging Face 在 Gradio 中内置 gr.Workflow,把多步 AI 流水线描述为带类型端口的节点图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见。

    推荐理由:Gradio 把多步 AI 流水线做成可拖拽的图,并自动暴露 REST 接口,读者可据此判断现有 Python 脚本的改造方式。

8月21日周五
  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。

    推荐理由:官方给出三个模型的草稿检查点与 H100、MacBook 实测吞吐,可据此判断投机解码在端侧与云端的落地差异。

8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search 检索层

    Mistral 发布 Agentic Search,作为让模型在复杂文档中导航、阅读并核验信息的检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统一次性 RAG 的边界。

8月18日周二
  1. Hugging Face Blog60

    Sentence Transformers v6.0 新增 MultiVectorEncoder 支持晚交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。

    推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。

8月14日周五
  1. Hugging Face Blog62

    用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 打通录制训练部署闭环

    Hugging Face 博客给出 Strands Robots 流式数据闭环的完整走查:同一个 Robot() 录制 LeRobotDataset、经 sync_dataset_to_bucket 同步进 Storage Bucket、再用 stream_dataset 从 Hub 流式读取训练,最后改一个 mode="real" 参数把 checkpoint 部署回硬件。

    推荐理由:以可运行 notebook 串起录制、去重同步、流式训练到真机部署的完整数据闭环,适合评估机器人数据工程方案。

8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与优先服务层级,并接入第三方开源模型

    Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,同时 Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把区域推理、优先服务层级和第三方开源模型接入放在同一套基础设施上,读者可据此判断企业级 AI 部署的区域合规选项。

  2. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS 多语言语音模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖与各 GPU 上的 TTFA 实测数据,可据此评估自建语音链路的延迟预算。

8月4日周二
  1. Microsoft Research71

    微软研究院开源 Orchard:可扩展智能体 AI 框架

    微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署框架内直接训练智能体。

    推荐理由:微软研究院开源了可复用的智能体环境服务与三套训练配方,读者可据此了解小模型在真实任务上的训练路径。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。

    推荐理由:原文给出跨平台内核迁移的具体方法与实测数据,读者可据此判断 CUDA 经验能否复用到 Apple Silicon。

7月27日周一
  1. Hugging Face Blog66

    NVIDIA 发布 Cosmos-H-Dreams 实时手术机器人生成式仿真器

    NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 流式推理库提供服务。

    推荐理由:原文给出实时生成式手术仿真器的蒸馏与推理优化路径,读者可据此判断世界模型进入交互闭环的工程门槛。

7月23日周四
  1. Hugging Face Blog62

    Diffusers 原生支持 Nunchaku 4-bit 扩散推理

    Hugging Face 在 Diffusers 中集成 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格 4-bit 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。

    推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的原生加载方式与量化工具链,读者可据此判断消费级 GPU 跑扩散模型的内存与延迟取舍。

7月15日周三
  1. Hugging Face Blog87

    Thinking Machines 发布 Inkling 与 Inkling-Small 开源多模态模型

    Thinking Machines 在 Hugging Face 发布 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文,训练数据达 45 万亿 token。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月8日周三
7月7日周二
  1. Hugging Face Blog62

    微软在 Foundry Managed Compute 上线 Hugging Face 模型集合

    微软在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型引入 Foundry 模型目录,每周刷新,可一键部署到托管 GPU 平台。

    推荐理由:微软在 Foundry 上托管 Hugging Face 开源权重模型,读者可了解企业部署开源模型时被接管的运维环节。