今天 Xmax AI 把 X2.0 放出来了,说是通用实时交互 AI 视频模型,API 同步开放。摆出来的能力一共五个:实时换人 CharX、实时换装 ClothX、实时改风格 VibeX、触控交互 MoX、次元交互 DimX,另外还有个 Free 模式能自己写提示词。
对我这种天天剪片子的人来说,最扎眼的不是换装换脸,是它那套端到端流式重渲染——逐帧生成,不用等上一段渲完。还有个统一多模态交互架构,触屏拖拽、手势、摄像头画面、文字指令能同时理解,还能自由组合,这个组合的说法挺大的。
最狠的是端侧:靠混合精度量化、结构化剪枝加移动端芯片优化,在 iPhone 上做到了实时流式推理,目前 384p,官方口径是全球第一个在手机上跑通实时交互视频生成的模型。价格是 API 海外 6 美元一小时,国内大概 20 块一小时,按小时计费这个模式我还没见过几家。
384p 这个分辨率,你们觉得是能直接用在成片里,还是只能当预览?