AI行业

AI视频吸金54亿:从实时编辑到底层模型大爆发

AI视频这赛道现在是真的赚钱。Higgsfield刚拿了4亿美金,估值直接飙到54亿。人家凭什么?就靠企业客户,年化收入硬是做到了7亿美元。下游也一样疯,AI短剧产能狂飙,现在连竞争都卷到抢上游IP了。说白了,钱和流量全往里砸,逼着技术只能拼命往前跑。

需求既然爆了,底层模型跟不上肯定不行。现在各家厂商都在死磕实时视频能力。像京东前阵子就实测了流式视频编辑模型,终于把“边播边改”给弄出来了。实际上,这种实时交互体验已经成了新的分水岭。谁的延迟能压到最低,谁就能抢下更多的B端客户。

想把长视频和实时控制做出来,自回归模型的加速是核心。现有的蒸馏方法老有信息错位的毛病。CMD方法就换了思路,改用因果教师模型,评估时只盯着历史信息和控制信号。它甚至故意去扰动早期那些不可靠的前缀,硬把训练稳定性给提了上来。这招贼管用,短视频和长视频生成速度直接起飞,还能精准响应镜头随时间变化的控制信号。

到了游戏这种强交互场景,光靠像素或潜空间硬生成是绝对不够的。Marionette模型干脆换个玩法,把整个流程拆成三步走:先预测世界状态,再渲染几何体,最后画外观。这么一拆解,姿态、几何遮挡这些结构化属性就能明明白白地维护起来,不再是一笔糊涂账。底子架构不革新,AI视频根本走不到成熟那一天。