HiDream-O1-World 在 WBench 上拿了第一,消息本身不复杂,我更想聊的是这类基准该怎么看。
干测试的,对榜单的第一反应永远是三件事:谁定的指标、样本怎么选、复现流程公不公开。交互式世界模型比图像生成难评太多——图像还能拉一堆人打分,交互得看你操作之后世界的反应对不对,主观成分不小,多轮之后误差还会往上累。
所以第一这个位置,短期含金量取决于有多少家来跑同一套题。只有一两个模型上榜的时候,排名的信息量其实很有限。等参评的多了、复测的人多了,这个榜才谈得上参考价值。眼下先当个信号收着。