AI视频赛道最近是真的卷。生数科技Vidu S2直接甩出三个大招:实时互动、实时改视频,甚至开始探索空间视频。这意味着视频生成不再只是盲盒“抽卡”,创作者能像捏泥人一样实时调整画面细节。交互体验直接拉满,用户主导权越来越高。
模型越来越强,评测基准也得跟上节奏。复旦大学发布了以人为中心的复杂场景音视频追踪基准AVTrack,目前已经被ICML 2026接收。这个基准专治各种复杂场景下的追踪难题,逼着AI模型在动态环境中更精准地锁定目标。以后AI看视频,不仅能看清,还能结合音轨听懂场景。
光看清还不够,物理规律也得拿捏。arXiv上的新研究PhysStream把目标投向了流式物理视频生成。它通过结构化场景记忆和细粒度交互控制,让视频生成从粗糙的提示词进化到精确的物理级操作。简单说,就是让AI生成的视频里的物体,动起来必须符合现实物理规律,不再穿模乱飞。
从实时修改到物理模拟,再到复杂场景的精准追踪,AI视频技术正在全方位补齐短板。创作者手里的控制权越来越大,生成内容也越来越靠谱。照这个速度迭代,真正的AI大片量产,可能真的不远了。