视频生成正在从"能出片"转向"能实时"。MiniMax H3 在单张 RTX 5090 上跑出了 1.28 倍实时渲染:一段 30 秒的视频,23.51 秒就生成完了。靠的是显存优化加 ComfyUI 工作流,单卡就能出片,不用堆机器。对做短视频和直播的人来说,这个数字比跑分实在得多。
生成快了,交互精度也得跟上。arXiv 上的 4D-HOF 盯的是手和物体怎么互动——现有方案要么对每段序列单独优化,算力烧得心疼;要么从随机噪声里硬生成,结果经常跑偏。4D-HOF 换了思路,用 flow matching 做前馈式的 4D 手物交互重建,一次前向就出结果。手怎么抓杯子、怎么拧瓶盖,这些时空细节都能还原。
另一篇论文问了个更接地气的问题:人在屋里走动,为什么能记住东西放在哪?《Never Look Back》研究第一视角视频里的 3D 物体记忆,核心是"持久性"——哪些物体该记住,哪些可以忘。你路过一个柜子时用不上,但十分钟后想找开瓶器,就得知道它可能在那儿。这个能力,具身智能和机器人助手都离不开。
三件事凑到一起,方向就清楚了。生成速度、交互精度、场景记忆,前两个解决"看得见",后一个解决"记得住"。AI 视频正在从渲染画面转向理解画面里发生了什么、接下来会怎样。单卡实时生成先把落地的门推开了,4D 重建和物体记忆,决定这些视频能不能真正被用起来。