刚看到智象未来完成新一轮融资,对外的说法是要做下一代原生全模态的世界模型。全模态加原生这两个词组合起来,意思大概是想从底层就把文本、图像、视频、音频这些放到一个统一的表征空间里训,而不是几个单模态模型拼接。
这条路技术上很有野心——统一表征理论上能让跨模态的理解和生成更自洽,但训练数据的对齐、算力和工程复杂度都是硬骨头。
世界模型这个提法现在很热,各家定义还挺不一样。能不能真正做出对物理世界有内在建模能力的东西,而不是又一个多模态生成器,是关键分水岭。
刚看到智象未来完成新一轮融资,对外的说法是要做下一代原生全模态的世界模型。全模态加原生这两个词组合起来,意思大概是想从底层就把文本、图像、视频、音频这些放到一个统一的表征空间里训,而不是几个单模态模型拼接。
这条路技术上很有野心——统一表征理论上能让跨模态的理解和生成更自洽,但训练数据的对齐、算力和工程复杂度都是硬骨头。
世界模型这个提法现在很热,各家定义还挺不一样。能不能真正做出对物理世界有内在建模能力的东西,而不是又一个多模态生成器,是关键分水岭。
原生统一表征和拼接路线完全两码事,前者难太多
数据对齐才是最烧钱烧人的环节
世界模型定义各家不一,先看落地再吹
蹲
野心够大,就看工程能不能扛住复杂度
别又是个套壳多模态生成器就行