生数科技Vidu S2支持实时视频编辑
生数科技发布了新一代视频模型Vidu S2,重点升级实时交互和实时编辑能力。新版本包含Vidu S2-Avatar与Vidu S2-Editing两个细分模型:前者面向数字人实时对话和动作控制,后者面向视频流中的服装、角色、背景与风格修改。相比约两个月前推出的Vidu S1,S2不再只强调语音驱动的连续互动,而是把更复杂的肢体动作、参考图输入和实时视频改写整合到同一套体验中,并在发布当天面向用户开放。
在Avatar能力上,Vidu S2把实时输出分辨率从上一代540p提升至720p,人物面部、衣物纹理等细节更清晰。测试中,同样要求数字人跳舞、转圈、跺脚,S1难以完成大幅动作,而S2能够跟随语音指令执行。用户还可以在互动过程中临时上传参考图,让数字人换上指定服装、拿起图中物品或切换到新的场景,使虚拟角色从“能聊天”进一步扩展到“能表演、能接物、能持续响应”。
Vidu S2-Editing则把实时视频编辑作为主要新增能力。演示中,正在播放的人物视频可被实时换装,服装会随身体动作产生较自然的形变,脸部一致性和遮挡关系也能保持;模型还可切换背景、替换主体角色,或将整段视频转成不同视觉风格。个别场景仍能看到色块涂抹感、帽子与头发穿模等瑕疵,但整体已可覆盖直播视觉包装、虚拟角色演出、短视频创意改编等需求,例如根据观众弹幕即时给主播换装、换场景或换画风。
从Vidu S1到Vidu S2的迭代间隔为69天。Vidu S系列的核心变化,是把传统“音频驱动口型+预设动作库”的数字人方案,推进到实时交互式视频生成:每一帧都需要根据用户输入即时计算,生成速度必须跟上播放速度。为降低卡顿,团队采用SageAttention等方法提升计算效率,并通过多GPU协同调度减少不同模块之间的等待。到S2阶段,这套链路进一步支持720p输出、更复杂动作、中途参考图注入,以及视频流中的实时编辑。
Vidu S2还开始探索实时空间视频。空间视频利用左右眼不同视角呈现立体深度,通常需要在Apple Vision Pro等空间计算设备上观看,在普通屏幕上则接近二维视频。基于S2-Avatar,用户可实时生成空间视频;基于S2-Editing,还能对空间视频进行实时编辑,甚至把头显摄像头看到的真实环境作为创作画布。团队同时表示,头显对清晰度和延迟要求很高,画面模糊会影响舒适度,延迟过高也会导致转头与画面不同步,因此相关体验仍需继续优化,后续还计划从固定视角扩展到全景空间视频。
在训练数据与标注上,团队为丰富数字人的动作和表情,引入舞蹈、二维动画、三维动画等素材,并对合适视频进行背景稳定处理,以降低镜头运动对模型学习的干扰。标注方式也围绕连续互动重新设计,不只描述画面内容,还记录动作从何时开始、造成什么变化、结束后人物处于何种状态。这样一来,模型在学习“抬手、拿杯子、继续端着杯子说话”等连续动作时,可以更准确地理解动作边界与状态延续。
流式训练方面,Vidu S2先通过Hybrid Forcing学习逐段生成,再引入Self-Replay Forcing,让模型连续生成一段视频后,对结果分块加噪并进行可训练的因果回放,从而学会修正自身生成中积累的偏差。画质与实时性则依靠Backbone-Refiner两阶段架构:Backbone先以低分辨率确定主体结构、运动和语义,Refiner再补充细节;两者通过异步流水线并行推进,使720p实时输出尽量保持流畅。
实时换装、换背景等能力依赖时间戳对齐机制。当用户中途输入参考图时,模型不仅要理解“换成什么”,还要判断“从什么时候开始生效”。Vidu S2通过重新设计位置编码,将参考图注入位置与时间对齐,使新条件能平滑进入后续画面,并保持运动和光照连续。系统还引入基于视觉语言模型的VLM Agent,持续解析已生成画面、跟踪人物状态与指令执行进度,再规划下一步生成。训练阶段还加入偏好与奖励优化:双向阶段采用DPO提升画质、表情、动作自然度和音画同步,流式阶段采用Streaming NFT优化持续生成模型,使输出更接近真实运行中的用户预期。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文