Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,直接学习实时卫星观测数据,每小时生成一次预报,地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 清晰约 5 倍。
推荐理由:官方给出与上一代的分辨率、更新频率和降水精度对比,可据此判断AI天气预报在谷歌产品中的落地程度。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
195 条精选近 30 天 20 条共收录 533 条
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,直接学习实时卫星观测数据,每小时生成一次预报,地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 清晰约 5 倍。
推荐理由:官方给出与上一代的分辨率、更新频率和降水精度对比,可据此判断AI天气预报在谷歌产品中的落地程度。
Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes,通过一条 add 命令把本机已有会话索引为可召回的记忆。
推荐理由:Hugging Face 官方发布的本地记忆层,给出安装命令与跨智能体召回机制,可据此判断多机多智能体协作的落地方式。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明 API 开启方式,便于开发者评估长视频分析方案。
Hugging Face 发布 @huggingface/kernels,一个从 Hub 加载并运行优化 WebGPU 内核的 JavaScript 库,同时上线 207 个内核的初始集合,均以独立仓库发布并采用 Apache-2.0 许可。
推荐理由:Hugging Face 把浏览器端 GPU 算子做成可版本化、可测试的独立仓库,并给出与 ORT WebGPU 的实测对比,便于判断浏览器推理的底层现状。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部以 Apache 2.0 许可开源。
推荐理由:原文完整披露了 Granite 4.2 的预训练、SFT 数据配比与多阶段 RL 细节,可据此了解推理模型在智能体环境中的训练路径。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,在 9 项基准中有 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复配方,并附 9 项基准对比,可据此判断 4-bit 部署的精度取舍。
Hugging Face 在 Gradio 中内置 gr.Workflow,把多步 AI 流水线描述为带类型端口的节点图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见。
推荐理由:Gradio 把多步 AI 流水线做成可拖拽的图,并自动暴露 REST 接口,读者可据此判断现有 Python 脚本的改造方式。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:官方给出三个模型的草稿检查点与 H100、MacBook 实测吞吐,可据此判断投机解码在端侧与云端的落地差异。
Mistral 发布 Agentic Search,作为让模型在复杂文档中导航、阅读并核验信息的检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统一次性 RAG 的边界。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。
Hugging Face 博客给出 Strands Robots 流式数据闭环的完整走查:同一个 Robot() 录制 LeRobotDataset、经 sync_dataset_to_bucket 同步进 Storage Bucket、再用 stream_dataset 从 Hub 流式读取训练,最后改一个 mode="real" 参数把 checkpoint 部署回硬件。
推荐理由:以可运行 notebook 串起录制、去重同步、流式训练到真机部署的完整数据闭环,适合评估机器人数据工程方案。
Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,同时 Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理、优先服务层级和第三方开源模型接入放在同一套基础设施上,读者可据此判断企业级 AI 部署的区域合规选项。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。
推荐理由:原文给出 364M 开源权重模型的多语言覆盖与各 GPU 上的 TTFA 实测数据,可据此评估自建语音链路的延迟预算。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署框架内直接训练智能体。
推荐理由:微软研究院开源了可复用的智能体环境服务与三套训练配方,读者可据此了解小模型在真实任务上的训练路径。
Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。
推荐理由:原文给出跨平台内核迁移的具体方法与实测数据,读者可据此判断 CUDA 经验能否复用到 Apple Silicon。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 流式推理库提供服务。
推荐理由:原文给出实时生成式手术仿真器的蒸馏与推理优化路径,读者可据此判断世界模型进入交互闭环的工程门槛。
Hugging Face 在 Diffusers 中集成 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格 4-bit 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的原生加载方式与量化工具链,读者可据此判断消费级 GPU 跑扩散模型的内存与延迟取舍。
Thinking Machines 在 Hugging Face 发布 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文,训练数据达 45 万亿 token。
推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已追平甚至超过 vLLM 手写原生实现,模型作者无需移植即可获得高速推理。
推荐理由:原文给出 vLLM 的 transformers 后端在多种 Qwen3 模型上追平手写实现,读者可据此判断是否省去移植成本。
微软在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型引入 Foundry 模型目录,每周刷新,可一键部署到托管 GPU 平台。
推荐理由:微软在 Foundry 上托管 Hugging Face 开源权重模型,读者可了解企业部署开源模型时被接管的运维环节。