现状 目前的主流视频模型在人物场景占位、镜头调度、打斗镜头,整体表现不太好。现有的解决方案就是使用一些 3D 软件进行预演,导出视频发给视频模型进行模仿生成。 遐想 如果能训练出一个比较廉价的白膜视频模型,能够使用提示词或结构化的数据(可以使用主流大模型生成)准取的处理完成白膜视频的预演。这样是不是就可以解决目前的问题。 问题 由于是现在视频模型的能力问题,但是后面肯定迭代这个能力问题肯定会被解决。 不知道大家有什么看法