正好刚读完『智能涌现』写的有关 Seedance 2.5 的文章,有些很有趣的新发现:
此前已经有不少业内人说过,Seedance 2.0 的逆袭属于是数据维度的成功,大家会想当然认为抖音对此功不可没。
但字节内部人士说,Seedance 几乎没有使用抖音的数据来训练,而是采买了大量影视资源,再用语言模型把它们拆解成脚本和分镜。
最初这也是无奈之举。毕竟从算力的角度,字节很难和大洋彼岸的谷歌、OpenAI 等抗衡,就算在内部,语言模型的重要性也比视频模型要高。
既然算力捉襟见肘,便只能在结构和数据上下功夫。
据『智能涌现』这篇报道说,在字节内部,为 Seedance 做模型数据评测的团队就有上千人(之前我了解到的数字是 2000 多人,不知道对不对)。而且他们坚持不做蒸馏,所有的数据都要靠自己合成、采买、清洗。
这就又带来个问题:投入。
视频模型的投入如此巨大,以至于财大气粗的 OpenAI 也不得不放弃了 Sora 2,但字节却成功扛住了成本,甚至大赚特赚:不说即梦这些 To C 的产品,Seedance 2.0 单个模型就可以为火山带来单月超过 10 亿元的收入,毛利率高达 70% 以上。
这背后最重要的就是字节的生态。
在短视频端,字节拥有抖音,在短剧端,他们拥有红果。只要他们稍微修改下分账规则,就能吸引创作者们放弃真人短剧,转投 AI 漫剧。
由此,字节可以吃掉整个产业所有环节的多数利润:
制作端(Seedance的 API 以及各类 C 端会员)、宣发端(投流)、用户端(抖和红果充值)、广告端。
而 SOTA 视频模型,则是维系这个生态运转的基石。
所以 Seedance 2.5 对字节而言是只能赢,不能输的战役。据说在时长、清晰度等基础能力之外,字节会更加押注模型的动态生成能力 —— 指的是用户可以输入指令,随时调整视频生成的内容和剧情。
如果这项能力真的可以实现,用户就可以自己制作互动剧集和互动游戏。
而这,是在短剧之外又一片充满想象力的变现空间。