跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

15 条精选近 30 天 11 条共收录 70 条

更新

部署工程的精选

今天10月4日周日第 1–15 条
  1. 美团技术团队62

    美团图灵团队公开 Agent 评测实践:从评测体系到长程 Agent 演进

    美团图灵 Agent 评测团队将内部博客公开,由浅入深讲解 Agent 评测,涵盖评测是什么、如何建立评测体系,以及长程 Agent 框架带来的变化。文章提出观测加评测等于持续迭代的研发公式,主张评测需覆盖结果、过程、效率、风险四层,并给出把模糊指标下钻为二元化 Rubric、追求人人一致与人机一致的实践方法。

    推荐理由:美团图灵团队公开两年 Agent 评测实践,给出从指标下钻到人机对齐的可迁移方法论与落地路径。

10月2日周五
  1. Google Research66

    Google 发布基于 TEE 的联邦学习系统,Gboard 已采用

    Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型,隐私保证更强且准确率提升。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署情况,可了解隐私计算在端侧训练中的工程路径。

9月30日周三
9月28日周一
  1. Hugging Face Blog71

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 用同一套权重覆盖 GUI、代码、MCP 与 API 四类接口,并公开全部评测轨迹,便于对照其成本与能力取舍。

9月24日周四
  1. Microsoft Research62

    微软研究院:把物理 AI 推理从机器人卸载到边缘或云端

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现并延长续航。

    推荐理由:微软研究院对机器人推理负载的系统性测量,给出了把推理从机载 GPU 卸载到边缘或云端的性能与续航数据。

  2. Google DeepMind62

    Google DeepMind 为 Private AI Compute 引入安全服务端持久记忆

    Google DeepMind 公布 Private AI Compute 的新技术能力,将持久化服务端记忆引入该平台,使 AI 助手能跨设备保留上下文,同时维持端侧级别的隐私标准。

    推荐理由:Google 给出私有 AI 计算新增持久化服务端记忆的架构思路,读者可了解云端记忆如何与端侧密钥结合。

9月17日周四
  1. GitHub Blog · AI & ML78

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 Copilot 应用和 CLI 把 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个 PR 中增量合并,而非一次性切换。

    推荐理由:一位工程师复盘用 Copilot 智能体把运行时从 TypeScript 迁到 Rust 的全过程,含并发会话协作与提示缓存数据。

9月3日周四
  1. Google DeepMind78

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气模型,直接学习实时卫星观测数据,每小时生成一次预报,地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 清晰约 5 倍。

    推荐理由:官方给出与上一代的分辨率、更新频率和降水精度对比,可据此判断AI天气预报在谷歌产品中的落地程度。

8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search 检索层

    Mistral 发布 Agentic Search,作为让模型在复杂文档中导航、阅读并核验信息的检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统一次性 RAG 的边界。

8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与优先服务层级,并接入第三方开源模型

    Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,同时 Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把区域推理、优先服务层级和第三方开源模型接入放在同一套基础设施上,读者可据此判断企业级 AI 部署的区域合规选项。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。

    推荐理由:原文给出跨平台内核迁移的具体方法与实测数据,读者可据此判断 CUDA 经验能否复用到 Apple Silicon。