LEGO-Anything 用编码智能体从单张照片生成 Blender 3D 场景
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片迭代编写可执行的 Blender 程序,从而显式记录物体、几何、布局和相机位置,场景可像代码一样运行、检查和修改。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片迭代编写可执行的 Blender 程序,从而显式记录物体、几何、布局和相机位置,场景可像代码一样运行、检查和修改。
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
有用户用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类发明史短片,把人类历史压缩成一天 24 小时,全程由代码实时渲染,未使用任何视频生成模型。
何恺明团队在arXiv发布VISTA论文,把ARC-AGI-3官方给模型的64×64数字表换成图片,并加入可随时调用的无损视觉记忆相册,Claude Opus 5在25个公开游戏全部183关拿到满分,GPT-5.6 Sol拿到99分。
推荐理由:何恺明团队用视觉输入加无损视觉记忆替代数字表,让同一模型在ARC-AGI-3上从40分升至满分,可看方法迁移思路。
量子位报道,AI 3D 生成公司 Meshy 披露其 ARR 从 100 万美元增长至 1 亿美元,用时不到两年,快于 HeyGen 的 29 个月。文章用同一张参考图对比 GPT-6 Astra 与 Meshy 的生成结果,指出通用模型擅长 CAD、参数化建模等几何任务,而角色、复杂道具仍需专业 3D 模型。
小米 Vision GT 将于 10 月正式上线《Gran Turismo 7》,成为该系列史上首台中国品牌 VGT 车型,小米也是受邀加入 VGT 项目的第 36 个品牌。双方同时官宣 GT 赛车 30 年来首个电车驾驶教学,玩家可用小米 SU7 Ultra 和 Xiaomi Vision GT 完成专属培训任务。
智东西用动效视频、鸡尾酒动画和像素巫师三组前端任务实测 MiniMax M3.1-Flash,发现这款国庆前夕上线并开启公测的 Flash 模型能复现不少原本被认为只有旗舰模型才能完成的前端效果,部分细节处理甚至偶有惊喜。
GPT-6 Astra与Claude Opus 5.5几乎同时破译了1593年天主教联盟的两封绝密信件,其中GPT-6 Astra破译完整度达100%,仅一个字符存疑。
截至 9 月 30 日,Utopai Studios 自研模型 Utopai X 在 Artificial Analysis 带音频文生视频排行榜中位列全球第二,仅次于 Wan 3.0,是该榜排名最高的美国公司模型。
MiniMax 于 9 月 28 日上线 M3.1-Flash-Preview,百万 token 上下文、原生多模态,在 MiniMax Code 首发并可通过 API 订阅套餐调用。
爱范儿在 MiniMax Code 中用 Opus 5.5 案例的公开提示词测试 MiniMax M3.1 Flash Preview,覆盖动态作品集、手绘与水墨短片、时间轴交互场景和街机卡丁车等游戏原型。
阿里巴巴 TaoLive AIGC 团队开源音视频联合流式生成模型 TaoMate-H3,基于 MiniMax H3,将三步 LoRA 推理与自回归生成结合,可按文本描述连续生成含对白、歌声或环境音的视频,支持分钟级续写和 480p、768p、1080p 横竖屏输出。
OpenAI 宣布在全球范围上线两项 ChatGPT 购物功能,包括虚拟试穿服装与配饰,以及可保存商品的收藏功能。虚拟试穿以 Try On 按钮出现在购物结果中,用户上传自拍或全身照即可预览上身效果,也可上传商品截图让 ChatGPT 试穿。OpenAI 称新功能基于新发布的 ChatGPT Images 2.5 模型,该模型在光照、纹理和编辑指令遵循上有所改进并降低了生成延迟。
何恺明团队提出NAT-ARC,一套不依赖LLM的纯视觉ARC解题方案,用ImageNet上的MAE预训练encoder,再迁移到抽象格子推理。表现最好的单模型为0.6B参数,在ARC-1上取得63.4% pass@2,集成后达70.2%,约为专用LLM方案The ARChitects(8B参数、71.6%)四分之一的参数量。
华为发布 Mate90 系列旗舰手机,全系搭载旗舰韬芯片,首发第二代玲珑屏、第三代红枫原色影像和鸿蒙7系统,整机性能相比 Mate80 系列提升 20% 至 31%。
华为发布 Mate 90、Mate 90 Pro、Mate 90 Pro Max、Mate 90 RS 非凡大师四款旗舰,5999 元起即日全系开售。Mate 90 Pro Max 首发麒麟 9050 Pro,多核性能提升 23%、GPU 渲染提升 40%、NPU 提升 140%,并支持 120 帧极致光追。
百度将文库、网盘十余年积累的内容资产作为AI办公的上下文优势,其GenFlow 1.0于去年4月以通用AI Agent形态切入写论文、做PPT等场景,今年8月官宣中文名“库库AI”并上线独立端。库库AI企业版已吸引3000家企业试用,同时开放连接器授权以调用飞书、钉钉等平台内容。海外版由Oreate AI焕新为「Kooko」,原平台一年内海外用户突破1000万。
智东西将美团 LongCat 团队 9 月 25 日上线的预览版模型 LongCat-2.5-Preview 接入 Claude Code,连续测试复刻 Meta Muse App、制作 SpaceX 星舰升空动画和开发 3D 赛车游戏三个 Coding 任务,三项均完成可实际运行的项目。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的世界模型,以及连接模型、科学工具、文献与研究者的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。
AMD 以 82 亿美元收购 World Labs。World Labs 创始人李飞飞在博客中回顾,公司自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并在收购 SceniX 后推进机器人仿真能力。其近期发布的 Atlas 是一种 omni 模型架构,从 2D 图像输入预测新视角,在稀疏重建这一计算机视觉长期难题上超过专用模型,可用于机器人 RL 环境、场景生成与真实世界重建。
Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态追踪问题,缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与角色保持的评测结果,便于了解多智能体编排在视频生成中的具体分工。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上为原生实时对话模型加入近实时视觉形象,可同时处理视觉与音频输入并输出带表情和口型同步的音视频。
推荐理由:官方给出 Live Avatar 的多模态对话、异步工具调用与 97 语言同步细节,可据此判断企业级实时数字人落地的能力边界。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景中的分工。
Google Research 发布研究实验,让教师借助生成式 UI(GenUI)为课程目标动态生成可交互的学习模拟,并同步开放 30 多个面向中学 STEM 的英文示例库。
推荐理由:Google Research 用生成式 UI 让教师按课程目标生成互动模拟,并给出教师评分与试点入口。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列仍不可靠。