美团发布全场景 AI Agent 平台 CatPaw,搭载 LongCat 2.0
美团正式上线全场景 AI Agent 平台 CatPaw,搭载本月开源的 LongCat 2.0(总参数 1.6T,原生支持 1M 上下文),提供 AI 智能工作台与企业级 Agent 开发托管能力。
推荐理由:原文给出 CatPaw 的多端协作、专家技能与托管能力,读者可据此判断企业级 Agent 平台的落地形态。
美团正式上线全场景 AI Agent 平台 CatPaw,搭载本月开源的 LongCat 2.0(总参数 1.6T,原生支持 1M 上下文),提供 AI 智能工作台与企业级 Agent 开发托管能力。
推荐理由:原文给出 CatPaw 的多端协作、专家技能与托管能力,读者可据此判断企业级 Agent 平台的落地形态。
美团图灵 Agent 评测团队将内部博客公开,由浅入深讲解 Agent 评测,涵盖评测是什么、如何建立评测体系,以及长程 Agent 框架带来的变化。文章提出观测加评测等于持续迭代的研发公式,主张评测需覆盖结果、过程、效率、风险四层,并给出把模糊指标下钻为二元化 Rubric、追求人人一致与人机一致的实践方法。
推荐理由:美团图灵团队公开两年 Agent 评测实践,给出从指标下钻到人机对齐的可迁移方法论与落地路径。
美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、跨域 ETA 元泛化框架 UME、自动竞价模型 GRAD、生成式推荐训练系统 MTGenRec 等方向。
美团搜索团队将 LLM 语义表征引入服务零售精排,用 Query、POI、Deal 的语义向量 cosine 相似度分桶后注入排序模型,三期实践均已完成全量上线。
美团与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文。它先用谱先验与欧氏先验定位 RLVR 偏好的稀疏更新区域,再用 SVD 压缩成低秩适配器并冻结残差锚点,在 1.5B 到 32B 的 Qwen 与 Llama 上于数学、医学、代码任务稳定优于低秩基线。
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备的 Agent 评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因相互咬合。四个模块中离线评测作为变更门控,依赖固定评测集与贴近生产的执行环境。
美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 通过异构 Tokenizer、动态掩码、混合注意力与 Target Scale-Up 等设计应对规模可扩展性、场景可延展性与架构高效性挑战,外卖多业务订单量提升 2.06%~6.68%,推理成本降低 24%。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的回答。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非回答文本判分,并给出 20 次重复下的稳定性与成本对比。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备相应工作流。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提出合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言问题翻译为固定类型操作并叙述结果。
Amazon Bedrock AgentCore Gateway 可将 Claude Desktop 接入 Web Search,突破模型训练知识截止限制,查询流量全程留在 AWS 基础设施内,无需外部 API key。
AWS 团队在 Amazon SageMaker AI 上用多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,仅调整 max_epochs、global_batch_size、rollout_max_concurrency 三个超参数,其余走默认值。
Ai2 开源 AstaBrief 8B,一个把研究问题与检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,并同步开放训练数据。
推荐理由:原文公开了训练数据构造、引用过滤与评测细节,可供做科学文献合成与RAG报告生成的团队参考。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型,隐私保证更强且准确率提升。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署情况,可了解隐私计算在端侧训练中的工程路径。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出 DGX Spark 64GB 统一内存版本,10 月 23 日开售,起售价 4,999 美元,预装 DGX OS 与 NVIDIA AI 软件栈。
推荐理由:原文给出 64GB 新配置的价格、上市时间和双机集群方式,可据此判断本地跑大模型的门槛变化。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,自动生成并验证新的训练任务,把模型的能力缺口转化为训练数据。
Chatham Financial 借助 Codex 和 GPT-5.6 构建技术并重构工作流,将交易验证时间从 30 分钟缩短到 4 分钟以内。该机构借此扩展其资本市场专业能力。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:原文给出 Astra Ultrafast 在 Blackwell 上的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。
AWS Professional Services 用四个智能体组成的模式,把每应用 3 到 4 周的 IaC 开发时间缩短到几分钟,该模式基于 Strands Agents SDK 构建、运行在 Amazon Bedrock AgentCore 上,通过 AgentCore Gateway 暴露的 MCP 工具连接源与目标。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开时都会实时查询受治理的 Quick Sight 数据集,不再依赖构建时的静态快照。查询以查看者身份执行,现有行级和列级安全规则自动生效,SPICE 与 Direct Query 数据集均支持,查看者需为已认证的 Quick 用户并逐数据集授权。
NVIDIA NeMo Agent Toolkit(NAT)可将 Amazon S3 Vectors 作为自定义持久记忆后端,实现语义检索、强写一致性和单索引最高 20 亿向量的弹性扩展。
OpenAI 发文探讨先进 AI 对突破性创意背后日常工作的价值,认为执行环节可能决定下一阶段经济的形态与进步速度。文章未给出具体模型、参数或评测数据,仅提出这一判断供进一步探讨。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)做获客漏斗个性化,七周线上 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一人群则未见改善。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent):它监听 Amazon S3 事件通知、EventBridge 规则、Lambda 触发器等事件流并自动执行任务,需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复。
AWS 博客给出 Claude Platform on AWS(CPonAWS)多环境访问的完整配置方案,采用专用 AI Services 账户加工作负载账户的三账户结构。AWS 工作负载通过跨账户 SigV4 免密钥调用推理,开发者用绑定开发工作区的 API key,外部环境则通过 OIDC 联邦获取短期凭证。生产与开发流量以 workspace 隔离,共享同一订阅。
Amazon Quick Sight 发布层级筛选器,可将最多五级的相关字段(如 Region → Country → City)收进单个紧凑控件,替代多个独立筛选器。该控件支持跨层级混选(如整个国家加单个城市),并默认作用于单视觉对象,可切换为跨工作表过滤整个仪表板。
Albertsons 正使用 ChatGPT Enterprise 和 OpenAI API 帮助团队加快工作速度,并让数百万顾客的购物体验更便捷。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。
NVIDIA 提出 AI 工厂投资回报由产能、使用寿命和需求三要素决定,其平台以每兆瓦吞吐量、硬件寿命和通用性同时优化这三项。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 分之一。
The Den 借助 ChatGPT Work 将拨款申请的准备时间从 3 天缩短至 2 小时,酒牌材料从 4 天缩短至 3 小时,每周因此省出 10-15 小时用于业务增长。这家社交俱乐部正筹备开设新门店。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
NVIDIA 第 26 届研究生奖学金项目面向全球开放申请,聚焦 AI、机器学习、自动驾驶、计算机图形、机器人、医疗和高性能计算等领域,每位学生奖金最高 6 万美元。
微软研究院实习生开发了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报及地质电导率数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档并返回带引用的答案。
AWS 官方博客给出在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线的完整教程,三个智能体分别负责作曲、交付与合规审查,通过同一 runtimeSessionId 共置在一台 GPU 实例上共享文件系统协作。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印在数字模型和合成出的实体蛋白质上都能被验证,同时保持其生物功能。
推荐理由:DeepMind 把水印从数字内容延伸到合成生物,公开了方法与代码,可观察生物安全筛查这一新方向。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并计划提供面向 AI 智能体的 NVIDIA Vera CPU。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Cognition 实测吞吐与沙箱启动数据,可据此判断智能体训练到推理的闭环成本。
OpenAI 披露其阻断了一起协同模型蒸馏攻击,该攻击试图提取受保护的模型推理内容。OpenAI 表示正在加强针对对抗性蒸馏的防御。