美团智播:数字人直播技术创新与实践
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 通过异构 Tokenizer、动态掩码、混合注意力与 Target Scale-Up 等设计应对规模可扩展性、场景可延展性与架构高效性挑战,外卖多业务订单量提升 2.06%~6.68%,推理成本降低 24%。
AlphaGo 核心作者之一 Thore Graepel 在 MIT Technology Review 发文称 LLM 不会推理,并已离开 Google DeepMind 创业做可审计的机器推理。
何恺明团队在arXiv发布VISTA论文,把ARC-AGI-3官方给模型的64×64数字表换成图片,并加入可随时调用的无损视觉记忆相册,Claude Opus 5在25个公开游戏全部183关拿到满分,GPT-5.6 Sol拿到99分。
推荐理由:何恺明团队用视觉输入加无损视觉记忆替代数字表,让同一模型在ARC-AGI-3上从40分升至满分,可看方法迁移思路。
TypeSafe AI 的 Jev 模型因直接输出决策与概率而走红,而 NeurIPS 2025 入选论文 ConfTuner 早已探索相似思路。
Meta 超级智能实验室的毕树超宣布,其模型 Muse Spark 1.1 和 1.2 在过去 6 个月内协助数学家攻克概率论、微分方程、群论、优化理论、算术物理学、非结合代数六大领域的开放问题,产出 6 篇论文,其中 5 篇给出悬而未决问题的答案,并推翻了群论中一项 2024 年提出的猜想。
推荐理由:Meta 用网页端对话模型在 6 个月内参与解决 6 个数学开放问题,可观察 AI 辅助科研的实际边界。
GPT-6 Astra与Claude Opus 5.5几乎同时破译了1593年天主教联盟的两封绝密信件,其中GPT-6 Astra破译完整度达100%,仅一个字符存疑。
TypeSafe AI 联合创始人兼 CEO Diogo Almeida 在 Latent Space 访谈中表示,Jev 日处理量已突破一万亿 token,夜间流量持续走高,说明大量调用来自机器自动化。
亚马逊与杜克大学的研究提出极端稀疏监督方法,在 OPD 后训练中每条 rollout 仅随机保留一个 token 的梯度信号,学生模型推理能力仍显著提升。研究基于 Qwen3 系列构造 9 组教师—学生配置,并跨代码推理、Llama 系列和 PPO 的 RLVR 验证了该现象。
9 月 30 日,上海 AI 公司 StartLux(原点星辉)发布完全开源的决策模型 StartLux-Decision,推出 0.8B、2B、4B、9B 和 27B 五档版本并提供本地部署量化模型。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备相应工作流。
前 Google DeepMind 核心成员、AlphaGo 团队成员 Thore Graepel 撰文指出,大语言模型逐 token 预测本质是系统 1 式的直觉,链式思维仍由同一预测过程生成,因此不构成真正的推理。
openJiuwen 开源智能路由框架 model-router,并首发 x-router 自演进路由算法,在 Agent 与模型之间增加一层按请求动态选模的决策能力。
丘成桐参与的最新论文在致谢中感谢GPT 6 Astra和Claude Pro,称它们帮助探索了部分证明思路和计算。论文宣称证明七维空间28种球面每一种都能配上截面曲率严格为正的度量,补上了从非负曲率到正曲率的关键一步,并附带SageMath验证代码。丘成桐对AI的态度从2023年称AI不可能影响最尖端数学家,逐步转变为主张学生尽早学习使用AI工具。
清华唐杰团队在「Memory For LLM」工作中,从信息保存形式、更新方式、持续时长三个维度系统梳理了 LLM 模型层面的记忆机制。此前 TTT Layers、Titans、MemoryLLM 分别尝试用快速权重、可更新神经记忆模块和固定大小记忆池将历史信息写入模型内部,但信息写入权重后仍可能被新任务覆盖。
MIT 研究者 Alex Zhang 在 Latent Space 播客中讲述其从 GPU kernel、KernelBench 到递归语言模型(RLM)的研究路径,并称基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:原文给出 Astra Ultrafast 在 Blackwell 上的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)做获客漏斗个性化,七周线上 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一人群则未见改善。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 在军棋类游戏 Stratego 中以 15 胜 1 负 4 平击败被文章称为史上最强的选手 Pim Niemeijer,训练仅用 16 块 GPU 和数千美元。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作与网络防御,先在 Fairwind 计划的政府用户和可信网络安全人员中开放,之后才向开发者、企业和消费者开放。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,可对照其与 Astra、Opus 5.5 的能力与成本差异。
华为发布 Mate90 系列旗舰手机,全系搭载旗舰韬芯片,首发第二代玲珑屏、第三代红枫原色影像和鸿蒙7系统,整机性能相比 Mate80 系列提升 20% 至 31%。
谷歌发布新一代旗舰模型 Gemini 4 Argon,面向软件工程、法律金融等企业知识工作与网络安全防御,输出 Token 上限从此前 6.4 万提升至 100 万。
推荐理由:谷歌发布 Gemini 4 Argon,披露了输出上限、基准成绩和 API 定价,可据此判断其企业级 Agent 任务的定位与成本。
Google 发布 Gemini 4 Argon,官方称其在 18 项测试中 13 项领先,知识与长文本能力明显强于编程和 Agent 能力。
Google 发布 Gemini 4 Argon,宣称在编码、知识工作和网络安全方面具备行业领先性能,但目前仅限公司内部工程师广泛使用,尚未对外开放。在软件工程基准 DeepSWE v1.1 上,Gemini 4 Argon 得分 77.9%,高于 GPT-6 Astra、Fable 5.1 和 Opus 5.5。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
针对2.8万亿参数、104B激活参数的Kimi K3推理难题,海内外团队几乎同时给出系统级优化方案。9月21日浪潮信息在AICC 2026发布元脑SD200 Ultra超节点AI服务器,紧耦合128芯本土AI芯片,单机承载K3,Token生成时延首破5.85毫秒,并将大量基础算子融合为超级算子,算子数量降低10倍、推理性能提升3倍以上。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出,无需测试时 CoT 推理 token。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:两款语音对话模型分别面向规模化与高复杂度任务,并给出语音智能体基准成绩与开发者接入渠道。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。
Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。
推荐理由:原文给出跨平台内核迁移的具体方法与实测数据,读者可据此判断 CUDA 经验能否复用到 Apple Silicon。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督,替代完整交互历史作为智能体工作上下文。在 CollabBench 协作编程任务中,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。
伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名单,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for Science 等方向。毕业生去向包括 OpenAI、Mistral AI、Physical Intelligence、Amazon 等机构,以及 UCLA、普林斯顿 CITP 和芝加哥大学等学术岗位,部分人仍在探索下一步。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS)的并行结构与分解策略由外部预设,而非模型自主决定。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使基于学习动力学(世界模型)的长时程规划变得可行。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 和 Amir Bar 合作完成。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在特征、数据和模型组件归因中识别 LLM 的关键交互。SPEX 利用交互的稀疏性与低阶性,将搜索问题转化为稀疏恢复问题;ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。