智象未来又融了一轮,目标是做原生全模态世界模型

刚看到智象未来完成新一轮融资,对外的说法是要做下一代原生全模态的世界模型。全模态加原生这两个词组合起来,意思大概是想从底层就把文本、图像、视频、音频这些放到一个统一的表征空间里训,而不是几个单模态模型拼接。

这条路技术上很有野心——统一表征理论上能让跨模态的理解和生成更自洽,但训练数据的对齐、算力和工程复杂度都是硬骨头。

世界模型这个提法现在很热,各家定义还挺不一样。能不能真正做出对物理世界有内在建模能力的东西,而不是又一个多模态生成器,是关键分水岭。

原生统一表征和拼接路线完全两码事,前者难太多

数据对齐才是最烧钱烧人的环节

1 个赞

世界模型定义各家不一,先看落地再吹

野心够大,就看工程能不能扛住复杂度

别又是个套壳多模态生成器就行