跳到正文
今天10月4日周日9 条
  1. 美团技术团队62

    美团图灵团队公开 Agent 评测实践:从评测体系到长程 Agent 演进

    美团图灵 Agent 评测团队将内部博客公开,由浅入深讲解 Agent 评测,涵盖评测是什么、如何建立评测体系,以及长程 Agent 框架带来的变化。文章提出观测加评测等于持续迭代的研发公式,主张评测需覆盖结果、过程、效率、风险四层,并给出把模糊指标下钻为二元化 Rubric、追求人人一致与人机一致的实践方法。

    推荐理由:美团图灵团队公开两年 Agent 评测实践,给出从指标下钻到人机对齐的可迁移方法论与落地路径。

  2. 美团技术团队34

    美团 GeoRA:为 RLVR 设计的 LoRA,获 ACL 2026 杰出论文

    美团与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文。它先用谱先验与欧氏先验定位 RLVR 偏好的稀疏更新区域,再用 SVD 压缩成低秩适配器并冻结残差锚点,在 1.5B 到 32B 的 Qwen 与 Llama 上于数学、医学、代码任务稳定优于低秩基线。

  3. 美团技术团队38

    美团智播:数字人直播技术创新与实践

    美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。

  4. 美团技术团队38

    美团技术团队《Agent 评测白皮书》系列01:Agent 评测全览

    美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备的 Agent 评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因相互咬合。四个模块中离线评测作为变更门控,依赖固定评测集与贴近生产的执行环境。

  5. 美团技术团队34

    美团 MTFM:统一推荐基座大模型在外卖多业务场景的落地实践

    美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 通过异构 Tokenizer、动态掩码、混合注意力与 Target Scale-Up 等设计应对规模可扩展性、场景可延展性与架构高效性挑战,外卖多业务订单量提升 2.06%~6.68%,推理成本降低 24%。

  6. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的回答。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非回答文本判分,并给出 20 次重复下的稳定性与成本对比。

10月3日周六
10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项值得强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。

  2. Google Research66

    Google 发布基于 TEE 的联邦学习系统,Gboard 已采用

    Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型,隐私保证更强且准确率提升。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署情况,可了解隐私计算在端侧训练中的工程路径。

  3. AWS Machine Learning Blog37

    Amazon Quick 推出 Live Data in Apps:AI 构建的应用可实时查询受治理数据集

    Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开时都会实时查询受治理的 Quick Sight 数据集,不再依赖构建时的静态快照。查询以查看者身份执行,现有行级和列级安全规则自动生效,SPICE 与 Direct Query 数据集均支持,查看者需为已认证的 Quick 用户并逐数据集授权。

  4. AWS Machine Learning Blog22

    如何在 AWS 上为 Claude Platform 配置多环境访问

    AWS 博客给出 Claude Platform on AWS(CPonAWS)多环境访问的完整配置方案,采用专用 AI Services 账户加工作负载账户的三账户结构。AWS 工作负载通过跨账户 SigV4 免密钥调用推理,开发者用绑定开发工作区的 API key,外部环境则通过 OIDC 联邦获取短期凭证。生产与开发流量以 workspace 隔离,共享同一订阅。

10月1日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。

9月30日周三
  1. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印在数字模型和合成出的实体蛋白质上都能被验证,同时保持其生物功能。

    推荐理由:DeepMind 把水印从数字内容延伸到合成生物,公开了方法与代码,可观察生物安全筛查这一新方向。