跟着这个Cosmos教程折腾了一下午,最大的收获是先认清现实:真正的Cosmos 3那种16B以上权重,普通Colab根本跑不动,显存和算力差着量级。教程没硬刚,而是照着框架真实的结构、CLI和输入schema,从零搭了个迷你版omnimodal Mixture-of-Transformers——文本、视觉、动作三路token共享注意力,各自再走modality-specific的专家FFN,RMSNorm、旋转位置编码、SwiGLU这些零件都手写了一遍。
拿合成物理数据训几步,再自回归rollout预测未来latent、跟真实轨迹比MSE,概念是跑通了。
这种小复现意义不在效果,而在真能摸清架构怎么转。
真要出成片,我一般不本地硬扛,直接上 https://pixpix.com 把几个生视频模型挨个试一遍,看哪个值得再深挖。