跳到正文
热点事件持续更新

本地世界模型Part 2支持文本引导

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月7日,Reddit用户 /u/lucidml_lover 在 r/LocalLLaMA 发布自研本地 AI 世界模型 Part 2。据其介绍,该模型在过去两个月训练完成,此次加入文本引导能力,可将图像转为可操控角色,并支持在生成过程中实时切换文本提示词。模型为约 960M 参数的纯 Transformer,采用块因果掩码与 diffusion forcing 训练,推理时每帧做 2-5 步扩散并写入 KV cache,仅保留过去 80 帧的滑动窗口上下文。作者称演示视频在 RTX 5090 上仅占用约 30% 利用率;该约 1B 模型在 RTX 5090 上峰值帧率为 50-60 fps,但被其用软件强制限制到 12 fps。作者还表示尚未将模型移植到 MLX,但基准测试显示在其 M5 MacBook 上可跑到 30 fps,并希望今年年底前发布可供拥有 RTX GPU 或新款 MacBook 的用户尝试的版本。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. r/LocalLLaMA
    本地 AI 世界模型 Part 2:用深度神经网络把图像变成可操控角色,支持生成中切换提示词

    作者发布自研世界模型 Part 2,可将图像转为可操控角色,并支持在生成过程中实时切换文本提示词。模型为约 960M 参数的纯 Transformer,采用块因果掩码与 diffusion forcing 训练,推理时每帧做 2-5 步扩散并写入 KV cache,仅保留过去 80 帧的滑动窗口上下文。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。