整理一下这周 ComfyUI 新支持的三个开源模型,方向都不一样。
Netflix 开源的 VOID 是视频去物体的,比单纯抹像素狠——你删掉一个主体,它连带把这主体造成的影子、反射、被它带动的物体一起处理掉。关键是它不用普通二值 mask,而是用四值灰度的 quadmask 告诉模型哪些要删、哪些重叠、哪些被物理影响、哪些别动,让模型去推因果。初始 mask 可以用 SAM3 这类分割模型生成。它给了两个 checkpoint,Pass 1 够用大多数片段,Pass 2 加光流细化做长片的时序一致。
BiRefNet 是高分辨率抠图分割,来自 CAAI AIR 2024,头发、毛发、透明表面这种细节它抠得干净,还兼顾显著目标和伪装目标检测,一个轻量包搞定一堆抠图活。
Gemma 4 是谷歌的多模态模型,文字图像音频视频都能进,带可配的思考模式。在 ComfyUI 里当文本编码器用,配 TextGenerate 节点,E2B/E4B 两个小变体消费级显卡就能起。