AI视频进入实时流式时代:精细操控与语义重建三线并进
AI技术

AI视频进入实时流式时代:精细操控与语义重建三线并进

AI视频生成正从"离线出片"转向"实时流式交互"。生数科技9月15日发布的Vidu S2系列就是典型代表,包含S2-Avatar和S2-Editing两个核心模型,分别负责持续交互的数字角色生成和视频流实时编辑,还把触角伸到了VR头显的空间视频生成。负责人张金涛主导了全链路研发,方向很明确——让视频生成变成可交互的实时体验。

学术界也在往同一方向使劲。PhysStream提出了基于物理的流式视频生成框架,核心思路是用结构化场景记忆实现细粒度操控。以前的可控生成大多靠粗略prompt驱动,现在要的是对动态场景做物理意义上的精确控制——物体怎么动、碰撞怎么响应,都得讲道理。

GenStream则从传输效率切入。传统视频编码器处理体育、表演等结构化人物内容时效率很低,它用语义流式框架做生成式重建,把视频流从"压缩像素"升级为"理解和重建语义"。这意味着未来的视频流可能不再逐帧传输,而是传语义、端侧生成。

三条路线指向同一个趋势:AI视频不再只是创作工具,而是朝着实时、可控、语义化的流式基础设施演进。谁先跑通这条链路,谁就有机会重新定义视频流量的底层架构。