美团智播:数字人直播技术创新与实践
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态追踪问题,缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与角色保持的评测结果,便于了解多智能体编排在视频生成中的具体分工。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上为原生实时对话模型加入近实时视觉形象,可同时处理视觉与音频输入并输出带表情和口型同步的音视频。
推荐理由:官方给出 Live Avatar 的多模态对话、异步工具调用与 97 语言同步细节,可据此判断企业级实时数字人落地的能力边界。
invideo 借助 GPT‑6 Astra 让剪辑规划更精准,调色与色彩校正效率提升 3 倍,并在一天内产出 50 个自定义特效。
Higgsfield AI 借助 GPT-6 Astra,在一天内上线了新的视频功能,让小型企业更轻松地制作视频广告,并更快将新创意工具推向市场。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明 API 开启方式,便于开发者评估长视频分析方案。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。
推荐理由:官方给出场景延展、首尾帧插值与 4K 放大等具体能力与 API 入口,可据此判断生成视频工作流的可控性变化。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型同时开放开发者入口,并给出延迟、单价与能力边界,便于判断多模态流水线的成本与可行性。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni 把多模态输入与对话式视频编辑结合,读者可据此判断视频生成工作流的变化方向。
Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。
推荐理由:Waypoint-1.5 把实时生成世界模型下放到消费级显卡,读者可据此判断本地交互式世界生成的硬件门槛。
OpenAI 针对 Sora 2 视频模型和 Sora 社交创作平台带来的新型安全挑战,将安全作为设计基础,并以具体防护措施为核心构建方案。
OpenAI 公布 Sora 信息流的设计理念,通过个性化推荐激发创意、促进连接,并以家长控制和强护栏保障体验安全。
Higgsfield 借助 OpenAI 的 GPT-4.1、GPT-5 和 Sora 2,让创作者从简单输入直接生成电影级、适配社交平台的视频。该方案面向社交视频创作场景,强调以简单创意为起点完成成片输出。
Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上线 Hugging Face,Small 版为 2.3B 参数。
推荐理由:原文给出模型权重、训练方法和推理库,读者可据此判断实时交互视频生成的技术路线与可用性。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的编码器-解码器 Transformer 架构完成动态场景的 4D 重建与追踪。
推荐理由:D4RT 把动态场景重建统一进单一框架,并给出 18x 至 300x 的加速数据,可据此判断 4D 重建的实时化路径。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频在短提示词下更富表现力,并提升角色身份、背景与物体的一致性。
推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的具体变化,可据此判断移动端短视频工作流是否值得迁移。
迪士尼与 OpenAI 达成协议,将把迪士尼、漫威、皮克斯和星球大战的 200 多个角色引入 Sora,用于粉丝创作的短视频。协议还包含迪士尼在全公司范围使用 ChatGPT Enterprise 和 OpenAI API。
推荐理由:迪士尼与 OpenAI 达成角色授权协议,读者可了解生成式视频在版权合作上的落地方式。
OpenAI 发布视频生成模型 Sora 2,可在生成视频中同步对话与音效。原文同时说明 Sora 产品已不再提供。
推荐理由:OpenAI 发布视频生成模型 Sora 2,首次在生成视频中同步对话与音效,可据此了解视频生成的能力边界变化。
OpenAI 发布 Sora 2 和 Sora 应用,称二者在构建时即以安全为基础,以应对先进视频模型与新型社交创作平台带来的新安全挑战。官方表示其做法建立在具体防护措施之上。
推荐理由:官方说明 Sora 2 与 Sora 应用在安全机制上的设计取向,可了解视频模型与社交创作平台的安全边界。
OpenAI 发布新一代视频与音频生成模型 Sora 2,并同步公开系统卡。相比 Sora,新模型在物理准确性、画面真实感、音画同步、可控性和风格覆盖范围上有所提升。
推荐理由:官方系统卡披露 Sora 2 在物理准确性、同步音频与可控性上的能力变化,可据此了解视频生成模型的新边界。
Hugging Face 开源长视频理解基准 TimeScope,通过在 1 分钟至 8 小时的视频中插入 5-10 秒的"needle"片段,评测模型的局部检索、信息综合与细粒度时序感知三项能力。结果显示,包括 Gemini 2.5-Pro 在内的领先视觉语言模型在真正的长视频时序理解上仍表现吃力,性能随视频变长明显下滑。
Invideo AI 借助 OpenAI 的 GPT-4.1、gpt-image-1 和文本转语音模型,把创意想法在几分钟内转化为专业视频,创作速度提升 10 倍。
Hugging Face 与 Cloudflare 达成合作,让 FastRTC 开发者凭 Hugging Face token 即可接入 Cloudflare 覆盖 335 多个地点的全球 TURN 网络,构建低延迟实时语音与视频应用。
Hugging Face Diffusers 团队实验性推出 Remote VAE,将潜空间扩散模型的 VAE 解码过程委托给远程 Inference Endpoints,以降低高分辨率图像和视频生成对消费级 GPU 的显存压力。
Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三个参数规模,并称 500M 与 256M 是迄今最小的视频语言模型。
推荐理由:Hugging Face 发布三档小尺寸视频理解模型,并给出端侧与 MLX 的可用路径,可据此判断小模型做视频理解的实际边界。
Hugging Face 发布了一套用于构建视频生成数据集的开源工具链,采用三阶段流水线:用 yt-dlp 下载视频并切分为短片段,再通过 LAION-5B-WatermarkDetection。
Hugging Face 发布首期 AI 艺术工具通讯,回顾 2024 年创意 AI 工具的关键进展。
Hugging Face Diffusers 团队梳理了开源视频生成模型的现状,列出 CogVideoX、Mochi-1、HunyuanVideo、Allegro、LTX Video 等开放模型与 Sora、Veo 2、Kling 等闭源模型的对照。
推荐理由:Diffusers 团队梳理开源视频生成模型现状,并给出显存优化与微调的实测数据,可据此评估本地部署门槛。
OpenAI 的视频生成模型 Sora 已在 sora.com 开放使用,支持生成最高 1080p 分辨率、最长 20 秒的视频,并提供宽屏、竖屏和方形画幅。用户可导入自有素材进行延展、重混和融合,也可直接由文本生成全新内容。
推荐理由:OpenAI 官方公布 Sora 的开放入口与分辨率、时长、画幅等关键规格,读者可据此判断可用范围。
电影制作双人组 Vallée Duhamel 解释了 Sora 如何帮助他们构建新的世界。
OpenAI 发布 Sora 系统卡,介绍这是其视频生成模型,可接收文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 系列模型的经验构建,定位是为用户提供更丰富的叙事与创意表达工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形态与模型来源,可据此了解其视频生成能力边界。
跨学科艺术家 Minne Atairu 讲述 Sora 如何帮助她实现自己的创作构想。
电影制作人 Lyndon Barrois 分享了如何将 Sora 用作叙事工具来创造新世界。
Hugging Face 构建了 FineVideo 数据集,包含 4.3 万个视频、总计 3.4 千小时,并配有丰富描述、叙事细节、场景切分和 QA 对。该数据集从 YouTube-Commons 的 190 万个英文视频出发,经词密度与视觉动态性过滤后,用 Gemini 1.5 Pro 和 GPT-4o 完成内容标注与结构化输出。
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下生成图像、音频和视频,从而解决扩散模型生成速度慢的问题。扩散模型虽推动了图像、音频和视频生成领域的发展,但其迭代采样过程导致生成缓慢。
OpenAI 上月发布 Sora 后,与艺术家合作探索该模型如何辅助创作流程,并公布了首批使用印象。
OpenAI 发布研究说明,介绍在视频数据上大规模训练生成模型的工作,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建物理世界通用模拟器的一条可行路径。
推荐理由:OpenAI 官方披露 Sora 的技术路线,说明视频生成模型被当作物理世界通用模拟器来训练。
Hugging Face 的 Diffusers 库迎来一周年,已从文生图工具箱扩展出视频、3D 与图像编辑能力。新增支持 DeepFloyd IF、Stability AI SDXL、OpenAI Shap-E 文生 3D,以及 VideoFusion、Text2Video-Zero 文生视频管线。
Hugging Face 推出 AI WebTV 实验性演示,用开源文生视频模型 Zeroscope 与音乐生成模型 MusicGen 自动合成视频与配乐并直播。视频由 zeroscope_v2_576 生成 576x320 片段,可选用 zeroscope_v2_XL 放大至 1024x576,再经 FILM 插帧处理,提示词由 ChatGPT 生成。
Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性,面临算力成本高、高质量数据集稀缺、视频描述模糊三大挑战。