YouTube把变现门槛翻了一倍。创作者想拿分成,得攒更多人、更长的观看时长。平台的意思挺明显:流量往短视频上赶。长视频也好,短视频也罢,谷歌都是赢家,这盘棋它怎么下都不亏。
数字人这边的卡点是实时。3D高斯头像渲染够快,可一动画就得跑昂贵的神经推理,帧率立刻掉下来。新论文给了个高斯blendshape蒸馏的思路:把预训练头像的动画能力蒸成轻量表示,实时驱动不再依赖重型网络。
让模型真正"看懂"流式视频,OneStreamer换了个新解法。它把持续感知、可复用的事实记忆和及时响应捏在一起——模型一边看,一边生成带时间信息的局部细节描述和已完成事件摘要,攒成后续问答的上下文。训练时特意练了对重要状态变化的识别,重复输出会被压掉。团队还放出了百万条级别的OneStreamer-1M数据集。
效果不虚。这个4B模型在全部八项基准测试里都胜过对比方法。消融实验显示,保留生成的描述能改善对历史事件的问答,同时不拖累实时感知——过去记得住,现在也没耽误看。
三条线索指向同一件事:视频AI正从"能生成"走到"能实时、能记事、能赚钱"。渲染层解决速度,模型层解决记忆,平台层解决变现。真正跑通的方案,这三关得一起过。