近日,生数科技正式发布Vidu S2,并于发布当天全量开放在线体验。
此次发布包括两款模型:面向持续交互数字角色生成的S2-Avatar,以及面向输入视频流实时编辑的S2-Editing。
其中,S2-Avatar将实时输出提升至720P,并支持用户在互动过程中随时加入新的参考图,让角色能够持续响应新的指令和视觉信息;S2-Editing则面向持续输入的视频流,可以实时改变画面中的风格、服装、人物和背景。
除了实时互动和实时编辑,Vidu S2还把探索进一步延伸到了空间视频。
几乎同一时间,“实时空间视频”正在成为视频模型领域新的关注方向。9月7日,字节跳动开发一款基于Seedance的实时空间视频生成模型,并计划面向直播、短剧、游戏以及Pico等VR场景,探索交互式虚拟世界。具体发布时间目前尚未最终确定。
Vidu S2此次也展示了类似方向上的技术探索:将实时生成或实时编辑的视频转换为左右眼视频,并通过VR头显观看。
例如,一个由S2-Avatar实时生成的角色,可以一边与你持续对话和互动,一边以空间视频的形式呈现在头显中;基于S2-Editing,现实世界持续输入的视频也可以被实时修改,再进一步转换为空间视频观看。
视频模型正在从“生成一段内容”,继续走向对持续视频流乃至沉浸式空间体验的实时操控。从实时生成,到实时编辑,再到空间视频,这也是Vidu S2进一步扩展的能力边界。
Vidu S2的全链路研发由朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。Vidu S2选择发布即全量开放。用户可通过“插入官方地址”直接使用,在实际操作中感受模型对新指令、新参考图以及持续视频输入的实时响应。
根据生数科技公布的技术报告,S2-Avatar在实时数字角色生成基准StreamAV-Bench的九项指标中,均取得报告所列对比模型结果;S2-Editing在多项视频编辑基准中,也取得超过报告所列离线与流式对比模型的总体得分。

