美团发布全场景 AI Agent 平台 CatPaw,搭载 LongCat 2.0
美团正式上线全场景 AI Agent 平台 CatPaw,搭载本月开源的 LongCat 2.0(总参数 1.6T,原生支持 1M 上下文),提供 AI 智能工作台与企业级 Agent 开发托管能力。
推荐理由:原文给出 CatPaw 的多端协作、专家技能与托管能力,读者可据此判断企业级 Agent 平台的落地形态。
美团正式上线全场景 AI Agent 平台 CatPaw,搭载本月开源的 LongCat 2.0(总参数 1.6T,原生支持 1M 上下文),提供 AI 智能工作台与企业级 Agent 开发托管能力。
推荐理由:原文给出 CatPaw 的多端协作、专家技能与托管能力,读者可据此判断企业级 Agent 平台的落地形态。
美团图灵 Agent 评测团队将内部博客公开,由浅入深讲解 Agent 评测,涵盖评测是什么、如何建立评测体系,以及长程 Agent 框架带来的变化。文章提出观测加评测等于持续迭代的研发公式,主张评测需覆盖结果、过程、效率、风险四层,并给出把模糊指标下钻为二元化 Rubric、追求人人一致与人机一致的实践方法。
推荐理由:美团图灵团队公开两年 Agent 评测实践,给出从指标下钻到人机对齐的可迁移方法论与落地路径。
美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、跨域 ETA 元泛化框架 UME、自动竞价模型 GRAD、生成式推荐训练系统 MTGenRec 等方向。
美团搜索团队将 LLM 语义表征引入服务零售精排,用 Query、POI、Deal 的语义向量 cosine 相似度分桶后注入排序模型,三期实践均已完成全量上线。
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 通过异构 Tokenizer、动态掩码、混合注意力与 Target Scale-Up 等设计应对规模可扩展性、场景可延展性与架构高效性挑战,外卖多业务订单量提升 2.06%~6.68%,推理成本降低 24%。
10月3日,马斯克在X上确认正在与台积电讨论Terafab芯片制造合作,称只是讨论但可能会有结果。Terafab由Tesla、SpaceX和xAI共同推进,一期投资168亿美元,长期潜在总投资可达1190亿美元,最终目标年产约1TW AI算力。此前英特尔是唯一被正式点名的合作伙伴,计划提供14A工艺,媒体披露台积电可能以直接运营、SpaceX控股或纯技术合作三种方式参与。
Anthropic宣布投资1亿美元在2027年底前培训1万名FDE(前线部署工程师),OpenAI带40亿美元成立部署公司,AWS拿出10亿美元组建FDE部门。海外公开薪资的FDE岗位基本年薪中位数约20万美元,国内大厂也开出月薪三五万的招聘,Kimi联合IT服务商共建FDE队伍,腾讯云推出FDE工程师认证。
华为在10月1日的Mate 90系列及全场景新品发布会上推出Mate 90系列,全系搭载旗舰τ芯片,采用逻辑折叠芯粒堆叠架构,实现125TB/秒跨Die带宽和30%关键路径时延下降,Mate 90 Pro Max整机性能较上代提升31%。
新加坡南洋理工大学安波教授团队发布报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》。
Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,即达到 $X/月后直接切断并返回错误,而非仅发送警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目达到限额后当月暂停,但该功能目前仅向有限客户开放;Google Cloud 则在 7 月推出类似的 Spend Caps。
DeepSeek 弹性计算团队大量招聘,尤其需要资深工程师,并同步公开技术分享《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》。
TypeSafe AI 联合创始人兼 CEO Diogo Almeida 在 Latent Space 访谈中表示,Jev 日处理量已突破一万亿 token,夜间流量持续走高,说明大量调用来自机器自动化。
9 月 30 日,上海 AI 公司 StartLux(原点星辉)发布完全开源的决策模型 StartLux-Decision,推出 0.8B、2B、4B、9B 和 27B 五档版本并提供本地部署量化模型。
钟毓英语衡水体字帖生成器从 PyQt6 v1.1.1 重构为 Electron v2.0.x,实现 Windows / macOS / Linux 跨平台。项目采用 electron-vite、Canvas 2D、tesseract.js OCR 与 electron-builder,并处理 pickle 兼容与 Bottles 交叉打包等迁移问题。
DepthART 将单目深度基础模型压缩到 6.0M 参数,被 ACM Multimedia 2026 接收,并开源代码与权重。
The Verge 记者 Allison Johnson 实测了 OpenAI 本周发布的智能体平台 Dots,它拥有可自定义名字的拟人化头像,界面与 Meta Muse 类似,但定位更偏企业办公软件。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备相应工作流。
MIT Technology Review 报告指出,2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业仍未能靠 AI 增长收入。报告将 AI 从工具转向运营模式的转变称为“智能体转型”,主张以流程重构为先、建设可组合架构与数据主权,让 AI 智能体能在数据所在处直接查询和准备数据。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提出合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言问题翻译为固定类型操作并叙述结果。
Amazon Bedrock AgentCore Gateway 可将 Claude Desktop 接入 Web Search,突破模型训练知识截止限制,查询流量全程留在 AWS 基础设施内,无需外部 API key。
AWS 团队在 Amazon SageMaker AI 上用多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,仅调整 max_epochs、global_batch_size、rollout_max_concurrency 三个超参数,其余走默认值。
Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型,隐私保证更强且准确率提升。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署情况,可了解隐私计算在端侧训练中的工程路径。
Airbnb CTO Ahmad Al-Dahle 披露公司 AI 原生改造进展:60% 代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍,约一半客服工单由 AI 独立解决。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出 DGX Spark 64GB 统一内存版本,10 月 23 日开售,起售价 4,999 美元,预装 DGX OS 与 NVIDIA AI 软件栈。
推荐理由:原文给出 64GB 新配置的价格、上市时间和双机集群方式,可据此判断本地跑大模型的门槛变化。
openJiuwen 开源智能路由框架 model-router,并首发 x-router 自演进路由算法,在 Agent 与模型之间增加一层按请求动态选模的决策能力。
Earendil 旗下 Pi 发布 1.0 版本并推出 Pi Durable,两者登上 Hacker News 首页。Pi 1.0 带来 Codemode 原生支持 MCP、Jev 与图像模型,新增虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题和默认全屏模式。
影身智能比李飞飞World Labs早两年押注原生4D世界模型路线,已用4到6台消费级摄像头加单块消费级GPU实时生成4D数据,并在福建晋江制鞋工厂落地机器人、拿到2亿元订单。其4D数据集已达万小时量级,产品形态为「影身360」,同时布局4D直播与4D游戏两条业务线。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,自动生成并验证新的训练任务,把模型的能力缺口转化为训练数据。
Chatham Financial 借助 Codex 和 GPT-5.6 构建技术并重构工作流,将交易验证时间从 30 分钟缩短到 4 分钟以内。该机构借此扩展其资本市场专业能力。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:原文给出 Astra Ultrafast 在 Blackwell 上的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。
AWS Professional Services 用四个智能体组成的模式,把每应用 3 到 4 周的 IaC 开发时间缩短到几分钟,该模式基于 Strands Agents SDK 构建、运行在 Amazon Bedrock AgentCore 上,通过 AgentCore Gateway 暴露的 MCP 工具连接源与目标。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开时都会实时查询受治理的 Quick Sight 数据集,不再依赖构建时的静态快照。查询以查看者身份执行,现有行级和列级安全规则自动生效,SPICE 与 Direct Query 数据集均支持,查看者需为已认证的 Quick 用户并逐数据集授权。
Google 的轨道计算卫星原型随 SpaceX 火箭从加州升空,首次将其先进芯片送入太空,用于验证 TPU 能否在轨运行。该卫星由 Planet Labs 建造,入轨后将让 TPU 以 15 分钟为一段间歇运行,以测试供电、散热和模型推理表现。
NVIDIA NeMo Agent Toolkit(NAT)可将 Amazon S3 Vectors 作为自定义持久记忆后端,实现语义检索、强写一致性和单索引最高 20 亿向量的弹性扩展。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)做获客漏斗个性化,七周线上 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一人群则未见改善。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,不生成文本而是在预设选项中做选择并给出置信度,可本地运行。该模型由 AWS 杰出工程师 Marc Brooker 在看过 TypeSafe 的 Jev 后自行开发,曾在同规模模型的 Jevbench 排名上短暂登顶,随后由 Strands Labs 整理发布。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent):它监听 Amazon S3 事件通知、EventBridge 规则、Lambda 触发器等事件流并自动执行任务,需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复。
针对团队使用 Codex 和 Claude Code 时的 API Key 与模型权限管理问题,开发者开源了 Zentrola。它面向从个人到团队的场景,解决真实 API Key 是否分发、新成员可用哪些模型、成员离职后如何撤销权限,以及上游服务商故障时是否需通知所有人临时修改等管理难题。
NVIDIA 提出 AI 工厂投资回报由产能、使用寿命和需求三要素决定,其平台以每兆瓦吞吐量、硬件寿命和通用性同时优化这三项。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 分之一。