【字节跳动被曝开发实时空间视频模型,可生成交互式虚拟世界】9月8日,据“网易科技”援引“彭博社”报道,字节跳动正在开发一款用于实时空间视频生成的AI模型。该模型基于字节现有视频生成系统Seedance构建,用户可创建用于直播、短剧和游戏的交互式虚拟世界。最快可能于10月推出,计划仍可能调整。
世界模型,就目前大家所使用的意义上而言,是一个能够充分学习环境行为方式,从而渲染出一个能够对用户在其中的操作做出连贯响应的环境的系统。据知情人透露,模型可实现约每秒20帧的按需视频生成,端到端延迟控制在0.05秒左右,视频渲染在云端完成而非本地设备。该模型计划服务字节旗下XR业务Pico头显,生成能够对用户声音和动作做出响应的虚拟环境。
报道提到,张一鸣近期在协调公司各业务部门的协作,并调动AI资源及算力推进该项目。“彭博社”分析认为,远程渲染空间内容可以减轻头显的计算负担,从而降低硬件的处理能力要求,进而降低成本。如果该模型成功落地,XR领域的竞争可能从硬件规格转向模型能力、云容量和内容分发。
据“36氪”今年早些时候的报道,字节跳动已将世界模型列为2026年四大AI发展重点之首。公司正在同时推进两条路线:一是面向具身智能和机器人的视觉-语言-动作方法,二是面向娱乐和游戏的3D模拟。此次曝光的空间视频模型属于后者。