文生视频这块现在国内百度、讯飞、字节都在下场,谁先做出真正能打的东西,我觉得关键不在参数堆多大,而在数据管线和推理成本谁先理顺。
字节有短视频生态的天然素材优势,训练数据这块起点高;百度模型底子厚,但产品化节奏一直不温不火;讯飞强在语音和多模态整合,做带口播的视频可能有奇招。
真正难的是长时序一致性,人物动作不崩、镜头连贯这些,现在谁都还没完全解决。谁先啃下这块硬骨头,谁就有机会。
文生视频这块现在国内百度、讯飞、字节都在下场,谁先做出真正能打的东西,我觉得关键不在参数堆多大,而在数据管线和推理成本谁先理顺。
字节有短视频生态的天然素材优势,训练数据这块起点高;百度模型底子厚,但产品化节奏一直不温不火;讯飞强在语音和多模态整合,做带口播的视频可能有奇招。
真正难的是长时序一致性,人物动作不崩、镜头连贯这些,现在谁都还没完全解决。谁先啃下这块硬骨头,谁就有机会。
时序一致性确实是最大的墙
字节数据优势太大了这个