Fable 5.5 首测:纯代码生成人类万年史等视频
有用户用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类发明史短片,把人类历史压缩成一天 24 小时,全程由代码实时渲染,未使用任何视频生成模型。
有用户用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类发明史短片,把人类历史压缩成一天 24 小时,全程由代码实时渲染,未使用任何视频生成模型。
阿里巴巴 TaoLive AIGC 团队开源音视频联合流式生成模型 TaoMate-H3,基于 MiniMax H3,将三步 LoRA 推理与自回归生成结合,可按文本描述连续生成含对白、歌声或环境音的视频,支持分钟级续写和 480p、768p、1080p 横竖屏输出。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。
推荐理由:官方给出场景延展、首尾帧插值与 4K 放大等具体能力与 API 入口,可据此判断生成视频工作流的可控性变化。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:两款新模型同时开放开发者入口,并给出延迟、单价与能力边界,便于判断多模态流水线的成本与可行性。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni 把多模态输入与对话式视频编辑结合,读者可据此判断视频生成工作流的变化方向。
Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。
推荐理由:Waypoint-1.5 把实时生成世界模型下放到消费级显卡,读者可据此判断本地交互式世界生成的硬件门槛。
Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上线 Hugging Face,Small 版为 2.3B 参数。
推荐理由:原文给出模型权重、训练方法和推理库,读者可据此判断实时交互视频生成的技术路线与可用性。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的编码器-解码器 Transformer 架构完成动态场景的 4D 重建与追踪。
推荐理由:D4RT 把动态场景重建统一进单一框架,并给出 18x 至 300x 的加速数据,可据此判断 4D 重建的实时化路径。
OpenAI 发布视频生成模型 Sora 2,可在生成视频中同步对话与音效。原文同时说明 Sora 产品已不再提供。
推荐理由:OpenAI 发布视频生成模型 Sora 2,首次在生成视频中同步对话与音效,可据此了解视频生成的能力边界变化。
OpenAI 发布新一代视频与音频生成模型 Sora 2,并同步公开系统卡。相比 Sora,新模型在物理准确性、画面真实感、音画同步、可控性和风格覆盖范围上有所提升。
推荐理由:官方系统卡披露 Sora 2 在物理准确性、同步音频与可控性上的能力变化,可据此了解视频生成模型的新边界。
Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三个参数规模,并称 500M 与 256M 是迄今最小的视频语言模型。
推荐理由:Hugging Face 发布三档小尺寸视频理解模型,并给出端侧与 MLX 的可用路径,可据此判断小模型做视频理解的实际边界。
OpenAI 发布 Sora 系统卡,介绍这是其视频生成模型,可接收文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 系列模型的经验构建,定位是为用户提供更丰富的叙事与创意表达工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形态与模型来源,可据此了解其视频生成能力边界。