新出的具身智能测评,人类100分最强模型才考了12.8

新出的一个具身智能测评榜单挺扎眼:人类拿满分 100,目前最强的模型只考了 12.8,这差距看得人有点乐。写了这么多年代码,越发觉得让机器"动手"比让它"动嘴"难太多了。

语言模型这两年被吹上天,可一旦落到真实物理世界——抓个东西、开个门、判断一下空间关系,立马原形毕露。

这类硬核 benchmark 挺好,能把牛皮吹破,让大家知道具身这块离真能用还有多远。分数低不丢人,起码方向是诚实的。

12.8这分数太顶了 :joy:

动嘴容易动手难,精辟

动手难这条太真,模型写代码一套一套,让它拧个螺丝立马露馅 :joy: