回头看这条线其实挺有意思。2021 年初第一版 DALL·E 出来的时候,大家惊讶的点是它真能听懂一句话并画出对应的东西,可仔细看只能应付比较简单的场景,稍微复杂的组合关系就崩。
当时普遍的判断是这条路还得磨几年才成熟,结果不到一年整个节奏就被扩散模型带着跑了。我做数据出身,看这类演进习惯先看它被什么指标推着走——早期只求“画对了没有”,后来卷的是可控性和一致性,评价标准一换,模型结构自然跟着换。
把这条线的论文一篇篇串起来读,比只看效果图收获大得多。
回头看这条线其实挺有意思。2021 年初第一版 DALL·E 出来的时候,大家惊讶的点是它真能听懂一句话并画出对应的东西,可仔细看只能应付比较简单的场景,稍微复杂的组合关系就崩。
当时普遍的判断是这条路还得磨几年才成熟,结果不到一年整个节奏就被扩散模型带着跑了。我做数据出身,看这类演进习惯先看它被什么指标推着走——早期只求“画对了没有”,后来卷的是可控性和一致性,评价标准一换,模型结构自然跟着换。
把这条线的论文一篇篇串起来读,比只看效果图收获大得多。
路过顶下
早期那批图现在再看确实糙 ![]()
当年觉得能听懂一句话就够神奇了,现在门槛完全不是一回事
评价标准变了模型结构跟着变,这个角度挺有意思
论文串着看确实比看效果图强,就是数学那段劝退