刚看到南加州大学联合 Cantina Labs 发了个成果,方向是 AI 视频和图像生成里的量化难题。具体方法细节我还没拿到,只知道是冲着这个点去的。
量化这事在生成模型上一直比在语言模型上难做。语言模型掉一点精度,输出可能就是措辞变化;扩散模型每一步的误差是往下累积的,低比特下最容易先崩的就是颜色和纹理细节,跑视频还要再叠一层时间维度的一致性,帧间闪烁基本躲不掉。所以真要说"破解",我更关心他们在多少比特下、掉了多少质量、能不能在消费级卡上跑通。
等论文出来再看吧,这类标题我一般先打个折。
刚看到南加州大学联合 Cantina Labs 发了个成果,方向是 AI 视频和图像生成里的量化难题。具体方法细节我还没拿到,只知道是冲着这个点去的。
量化这事在生成模型上一直比在语言模型上难做。语言模型掉一点精度,输出可能就是措辞变化;扩散模型每一步的误差是往下累积的,低比特下最容易先崩的就是颜色和纹理细节,跑视频还要再叠一层时间维度的一致性,帧间闪烁基本躲不掉。所以真要说"破解",我更关心他们在多少比特下、掉了多少质量、能不能在消费级卡上跑通。
等论文出来再看吧,这类标题我一般先打个折。
打折这个态度对
视频量化最难的确实是帧间一致性,不是单帧好看就行
细节没放出来之前,先当宣传稿看