具身大模型榜单超20个含金量几何?仿真刷分容易真机测试一将难求
当前具身大模型榜单数量已超20个,发起方包括清华、北大、斯坦福、英伟达等。但业内公认的权威标准尚未形成。仿真榜单刷分容易、真机测试成本高昂,榜单性质混杂。以RoboDojo评测为例,真实世界部分表现最好的模型总体成功率仅12.8%。专家指出需从仿真走向实战,引入盲测机制,将仿真测试与真机测试结合验证。
当前具身大模型榜单数量已超20个,发起方包括清华、北大、斯坦福、英伟达等。但业内公认的权威标准尚未形成。仿真榜单刷分容易、真机测试成本高昂,榜单性质混杂。以RoboDojo评测为例,真实世界部分表现最好的模型总体成功率仅12.8%。专家指出需从仿真走向实战,引入盲测机制,将仿真测试与真机测试结合验证。