字节最新那个视频模型这两天到处刷屏,不少人第一反应不是喊厉害,而是说有点渗人。我扒了几段流出的效果,动态一致性和光影确实到了让人分不清真假的地步,那种害怕大概就来自这里——不是画得丑,是太真了反而让人不安。
作为写代码的,我更好奇它背后把推理成本压到多少才敢这么放开生成。
具体参数官方没细说,我先不瞎猜。手痒,等真开放了自己跑一遍才算数。
字节最新那个视频模型这两天到处刷屏,不少人第一反应不是喊厉害,而是说有点渗人。我扒了几段流出的效果,动态一致性和光影确实到了让人分不清真假的地步,那种害怕大概就来自这里——不是画得丑,是太真了反而让人不安。
作为写代码的,我更好奇它背后把推理成本压到多少才敢这么放开生成。
具体参数官方没细说,我先不瞎猜。手痒,等真开放了自己跑一遍才算数。
太真了反而渗人,说到点子上
渗人恰恰是因为动得太顺,人眼对那种不自然的顺滑特别敏感