AI视频生成正在告别“一锤子买卖”的静态输出,全面转向实时流式交互。9月15日,生数科技发布了Vidu S2视频大模型系列,把重点放在了动态参考图和实时编辑上。这套模型由朱军教授的博士生张金涛负责全链路研发,直接瞄准了持续交互的视频生成痛点。
Vidu S2这次拆成了两个核心模型。Vidu S2-Avatar专门生成能持续交互的数字角色,Vidu S2-Editing则允许对输入的视频流进行实时编辑修改。他们甚至已经开始探索VR头显的实时空间视频生成,想把交互体验拉满。
这和学术界最新的研究方向高度一致。arXiv上近期公布的PhysStream框架,试图把视频生成的交互控制从粗略提示词,升级为细粒度、符合物理规律的动态场景操作。另一项GenStream研究则针对体育、表演等以人为中心的媒体内容,提出了语义流式重建框架,解决传统编解码器对结构化内容处理效率低下的问题。
说白了,AI视频生成现在拼的是“流”和“控”。从生数科技的工程落地,到PhysStream的物理引擎化,再到GenStream的语义编解码,整个行业都在往实时、细粒度、结构化控制的方向狂奔。粗放式的文生视频已经不够看了,能实时响应、物理正确的流式交互才是下一个战场。