美团发布全场景 AI Agent 平台 CatPaw,搭载 LongCat 2.0
美团正式上线全场景 AI Agent 平台 CatPaw,搭载本月开源的 LongCat 2.0(总参数 1.6T,原生支持 1M 上下文),提供 AI 智能工作台与企业级 Agent 开发托管能力。
推荐理由:原文给出 CatPaw 的多端协作、专家技能与托管能力,读者可据此判断企业级 Agent 平台的落地形态。
美团正式上线全场景 AI Agent 平台 CatPaw,搭载本月开源的 LongCat 2.0(总参数 1.6T,原生支持 1M 上下文),提供 AI 智能工作台与企业级 Agent 开发托管能力。
推荐理由:原文给出 CatPaw 的多端协作、专家技能与托管能力,读者可据此判断企业级 Agent 平台的落地形态。
美团图灵 Agent 评测团队将内部博客公开,由浅入深讲解 Agent 评测,涵盖评测是什么、如何建立评测体系,以及长程 Agent 框架带来的变化。文章提出观测加评测等于持续迭代的研发公式,主张评测需覆盖结果、过程、效率、风险四层,并给出把模糊指标下钻为二元化 Rubric、追求人人一致与人机一致的实践方法。
推荐理由:美团图灵团队公开两年 Agent 评测实践,给出从指标下钻到人机对齐的可迁移方法论与落地路径。
美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、跨域 ETA 元泛化框架 UME、自动竞价模型 GRAD、生成式推荐训练系统 MTGenRec 等方向。
美团搜索团队将 LLM 语义表征引入服务零售精排,用 Query、POI、Deal 的语义向量 cosine 相似度分桶后注入排序模型,三期实践均已完成全量上线。
美团与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文。它先用谱先验与欧氏先验定位 RLVR 偏好的稀疏更新区域,再用 SVD 压缩成低秩适配器并冻结残差锚点,在 1.5B 到 32B 的 Qwen 与 Llama 上于数学、医学、代码任务稳定优于低秩基线。
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备的 Agent 评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因相互咬合。四个模块中离线评测作为变更门控,依赖固定评测集与贴近生产的执行环境。
美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 通过异构 Tokenizer、动态掩码、混合注意力与 Target Scale-Up 等设计应对规模可扩展性、场景可延展性与架构高效性挑战,外卖多业务订单量提升 2.06%~6.68%,推理成本降低 24%。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
Aleph Alpha 用自建基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统认为只有 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
AlphaGo 核心作者之一 Thore Graepel 在 MIT Technology Review 发文称 LLM 不会推理,并已离开 Google DeepMind 创业做可审计的机器推理。
有用户用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类发明史短片,把人类历史压缩成一天 24 小时,全程由代码实时渲染,未使用任何视频生成模型。
谷歌在官方支持页面宣布,自10月9日起调整 Gemini 模型访问权限,免费用户仅能使用 Flash-Lite,AI Plus 订阅用户失去 Pro 模型使用权,只有 AI Pro 和 Ultra 用户保留 Pro 模型及 Deep Think 最大并行推理能力。
从 2026 年 10 月起,Google 将收紧个人账户对 Gemini 模型的访问:无订阅用户只能使用最小的 Flash-Lite,不再包含更强的 Flash 和 Pro,而当前免费档位提供 3.6 Flash 和不同程度的 3.1 Pro。
负责安全团队透明度工作、主导起草 OpenAI《Preparedness Framework》的 David Robinson 在大西洋月刊发文宣布离职,称 OpenAI 持续冲刺、赶着发布的工作方式已达不到必要的谨慎程度。
10月3日,马斯克在X上确认正在与台积电讨论Terafab芯片制造合作,称只是讨论但可能会有结果。Terafab由Tesla、SpaceX和xAI共同推进,一期投资168亿美元,长期潜在总投资可达1190亿美元,最终目标年产约1TW AI算力。此前英特尔是唯一被正式点名的合作伙伴,计划提供14A工艺,媒体披露台积电可能以直接运营、SpaceX控股或纯技术合作三种方式参与。
Anthropic宣布投资1亿美元在2027年底前培训1万名FDE(前线部署工程师),OpenAI带40亿美元成立部署公司,AWS拿出10亿美元组建FDE部门。海外公开薪资的FDE岗位基本年薪中位数约20万美元,国内大厂也开出月薪三五万的招聘,Kimi联合IT服务商共建FDE队伍,腾讯云推出FDE工程师认证。
华为在10月1日的Mate 90系列及全场景新品发布会上推出Mate 90系列,全系搭载旗舰τ芯片,采用逻辑折叠芯粒堆叠架构,实现125TB/秒跨Die带宽和30%关键路径时延下降,Mate 90 Pro Max整机性能较上代提升31%。
何恺明团队在arXiv发布VISTA论文,把ARC-AGI-3官方给模型的64×64数字表换成图片,并加入可随时调用的无损视觉记忆相册,Claude Opus 5在25个公开游戏全部183关拿到满分,GPT-5.6 Sol拿到99分。
推荐理由:何恺明团队用视觉输入加无损视觉记忆替代数字表,让同一模型在ARC-AGI-3上从40分升至满分,可看方法迁移思路。
ChatGPT 官方宣布 10 月 14 日起 GPT-5.5 将在 ChatGPT、ChatGPT Work 及 Codex 全套餐中彻底下线,无缓冲期与 Legacy 保留通道,官方建议迁移至 GPT-5.6 Sol 或 GPT-6 Astra。
OpenAI 产品负责人 Tibo Sottiaux 预告下一代模型 Astra 6.1「coming soon」,称未来模型会更擅长删除和简化代码。此前《华尔街日报》报道称 OpenAI 原计划 10 月推出 Astra 6.1,因内部安全测试中在权限边界上表现不安分而临时叫停。Tibo 同日还向网友征集 Codex 和侧边栏的更新建议。
新加坡南洋理工大学安波教授团队发布报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》。
量子位报道,AI 3D 生成公司 Meshy 披露其 ARR 从 100 万美元增长至 1 亿美元,用时不到两年,快于 HeyGen 的 29 个月。文章用同一张参考图对比 GPT-6 Astra 与 Meshy 的生成结果,指出通用模型擅长 CAD、参数化建模等几何任务,而角色、复杂道具仍需专业 3D 模型。
在OpenAI工作三年半、牵头起草《准备框架》并监督12次前沿模型发布安全报告的David Robinson宣布辞职,在The Atlantic发文警告OpenAI企业文化已崩坏、试错的时代已经结束。
爆料者 @elder_plinius 称提取了 OpenAI 现役代码模型 GPT-6 Sol Codex 的完整系统提示词与工具定义,共 29.4 万字符、1902 行,并发布在 GitHub 的 CL4R1T4S 仓库中。
DeepSeek Harness 发布 v0.2.1-alpha.1,新增实验性 Claude Code Mods 兼容层,让按 Claude Code Mods 接口编写的扩展有机会接入 DSH 插件系统运行。
TypeSafe AI 的 Jev 模型因直接输出决策与概率而走红,而 NeurIPS 2025 入选论文 ConfTuner 早已探索相似思路。
Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,即达到 $X/月后直接切断并返回错误,而非仅发送警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目达到限额后当月暂停,但该功能目前仅向有限客户开放;Google Cloud 则在 7 月推出类似的 Spend Caps。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的回答。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非回答文本判分,并给出 20 次重复下的稳定性与成本对比。
Simon Willison 已发送九月赞助者专属月度通讯,订阅者可通过链接访问。本期内容涵盖更多 Fable 级模型、一场价格战、3D 图形与 Blender、LLM 进军数学领域、更多意外网络攻击、Datasette 漏洞危机、作者当前使用工具、本月软件发布以及 2026 年 LLM 进展回顾。订阅费用为 $10/月,可提前一个月获取免费版内容。
OpenAI CEO Sam Altman 公开反对将 AI 模型与宗教类比,称人们"将宗教力量或对人类判断力的放弃归因于 AI 模型"让他"非常不安",并称这是一个"真正的安全问题"。
AWS CEO Matt Garman 表示,公司在与政府机构就数据中心项目合作时已不再使用保密协议(NDA)。他同时反驳了数据中心耗水过多、推高电价、污染严重、对社区无益这四种说法,并称美国目前有 100 多项数据中心禁令正在审议中。
Capcom 程序员 Satoshi Ishida 在 Capcom Open Conference RE: 2026 上表示,将把 AI 技术整合进开发流程,逐步把 RE Engine 改造成“AI 生成游戏引擎”,目标是实现“与 AI 共同创作游戏”的未来。Capcom 此前称不会在游戏中使用 AI 生成素材,而是用 AI 提升开发效率。
在 OpenAI 工作三年半、负责撰写重大产品发布安全报告的 David Robinson 宣布离职,称公司文化已经崩坏。他在 The Atlantic 的文章中表示,OpenAI 依靠试错式迭代部署,这种方式必然带来周期性失败,而随着系统能力提升,失败规模也在扩大,并以 OpenAI 智能体入侵 Hugging Face 系统、发现更多失控智能体为例。
Splice CEO Kakul Srivastava 认为 AI 撰写的文档和邮件正在破坏对话质量,一旦无法分辨文字背后是否有人,围绕它的讨论就会变得更糟且难以回头。她表示 Splice 坚持让人类留在创作过程中心,并曾公开反对 Suno 式"一键出歌"的 AI 路线。
曾在 OpenAI 为每次重大模型发布撰写安全报告的 David Robinson 本周辞职,并在 The Atlantic 发表评论文章,称行业文化已根本性破裂。
Meta 发布开源项目 Muse Gadgets,让爱好者自行搭建 AI 硬件,包含面向 ESP32 开发板的固件和用于把自制设备接入 Meta AI 智能体 Muse 的 Linux SDK,代码采用 Apache 2.0 许可,并设有 Discord 社区讨论。
曾在 OpenAI Trustworthy AI 团队负责安全系统的 David Robinson 离职,并在 The Atlantic 的客座文章中批评其安全文化。
越来越多 AI 智能体无需下载 App,直接通过短信或 iMessage 接收任务并代为执行,涵盖日程安排、预订、邮件和购物等。Instinct 在 9 月完成 10 亿美元融资、估值达 100 亿美元,并开始为用户分配专属邮箱地址、支持代打电话,目前仍处私测阶段。
小米 Vision GT 将于 10 月正式上线《Gran Turismo 7》,成为该系列史上首台中国品牌 VGT 车型,小米也是受邀加入 VGT 项目的第 36 个品牌。双方同时官宣 GT 赛车 30 年来首个电车驾驶教学,玩家可用小米 SU7 Ultra 和 Xiaomi Vision GT 完成专属培训任务。