字节跳动正悄然布局一项具有颠覆性潜力的技术领域——实时空间视频生成AI模型。据内部消息,这款被寄予厚望的新模型最快可能在下个月亮相,标志着字节跳动正式加入世界模型的技术竞赛,与meta、Alphabet等科技巨头在机器人、自动驾驶等前沿领域展开直接竞争。
项目由字节跳动创始人张一鸣亲自推动,他不仅统筹协调跨部门资源,还要求公司加大AI研发和算力投入。知情人士透露,这款模型基于字节跳动已有的电影级视频生成技术Seedance开发,核心功能是生成可交互的虚拟世界,可广泛应用于直播、短剧制作和游戏开发等领域。张一鸣的愿景是,通过这一技术将TikTok庞大的创作者生态引入世界模型领域,打造一个全新的内容创作生态。
字节跳动的战略调整十分明显。这家总部位于北京的公司正在将大量ToB业务资源转向视频制作与生成赛道。这款新模型被定位为类似谷歌Genie的沉浸式三维世界构建工具,旨在打通字节跳动的AI技术、云计算资源,并联动其内容平台生态和XR品牌Pico的硬件布局。通过这种整合,字节跳动希望形成一个技术-内容-硬件的闭环生态系统。
从技术路线来看,字节跳动与谷歌的选择不谋而合,都聚焦于以视频为核心的世界模型。谷歌今年早些时候推出的Genie已经实现了用户与实时渲染虚拟世界的交互,而字节跳动的新模型则被视为这一领域的又一重要突破。这类空间模型被视为机器人和自动驾驶等领域的关键底层技术,张一鸣的入局意味着他将与李飞飞、杨立昆等顶尖研究者共同探索视觉AI的未来发展方向。
如果这款模型能够顺利落地,字节跳动将在XR硬件领域之外,与meta和苹果开辟新的竞争战线。目前,meta正围绕Quest系列头显构建大众级XR生态,而苹果则通过Vision Pro布局高端空间计算市场。两者在向主流市场渗透的过程中都面临诸多挑战,而空间AI模型很可能成为决定未来行业格局的核心竞争点。字节跳动的加入,无疑将为这一领域注入新的活力。











