字节跳动准备用于实时空间视频生成的人工智能模型
核心要点
- TikTok 母公司正在其 Seed 研究团队的带领下,推动交互式、空间感知的人工智能视频系统的发展 字节跳动正在构建能够实时生成具有空间感知的视频的人工智能系统。
- TikTok 母公司已经制定了世界模型,其中包括实时交互式视频和 3D 感知生成,这是 2026 年人工智能的首要优先事项。

TikTok 母公司正在其 Seed 研究团队的带领下,推动交互式、空间感知的人工智能视频系统的发展
字节跳动正在构建能够实时生成具有空间感知的视频的人工智能系统。 TikTok 母公司已经制定了世界模型,其中包括实时交互式视频和 3D 感知生成,这是 2026 年人工智能的首要优先事项。
技术构建块
字节跳动的种子研究团队一直在稳定地发布版本。 Seedance 2.0 于 2026 年 2 月推出,重点关注物理精确的多模态生成。随后于 7 月 31 日发布了 Seedance 2.5,它通过 30 秒单通道音频视频剪辑、增强的空间控制以及用于 3D 运动规划的粘土渲染参考系统进一步突破了极限。
格洛丽亚 您的经纪公司向您显示余额。格洛丽亚(Gloria)向您展示了他们迁移的原因——跨越每一个地产。在格洛丽亚看到它 →
8 月 24 日左右发表的 arXiv 论文介绍了自回归对抗性训练后(AAPT)。论文中描述的模型可以以每秒 24 帧的速度生成低延迟视频,产生一分钟长的连贯输出。
在 Seedance 2.5 之前,字节跳动已经发布了 Helios,这是一种开放权重模型,在单个 GPU 上运行一分钟长的视频时,帧率达到约 19.5 fps。 Helios 于 2026 年 3 月坠落。
交互式控件也是该包的一部分。该系统接受姿势和相机输入,支持虚拟人类生成等应用,用户可以直接输出而不仅仅是提示输出。
世界模型和 Genie 3 基准
2026 年 6 月,字节跳动正式将世界模型提升为顶级 AI 焦点。既定目标是与 Google 的 Genie 3 相媲美,后者是交互式世界模拟的基准。
字节跳动为此投入了大量资金。世界模型的训练数据预算已经达到人民币八位数。
该公司的多媒体实验室正在同时将用于体积内容的 4D 和 6DoF(六自由度)空间视频管道商业化。这些系统可处理实时和按需空间体验,并在 2025 年底至 2026 年期间取得部署进展。
