具身模型 Benchmark

在统一的具身语义标准下,度量 VLA / 具身基础模型的能力上限与可信边界——能提出行动,更要能证明结果、划定安全边界。

评测榜单

榜单收录各类具身基础模型在统一任务集与评测协议下的表现。所有结果可追溯、可复现。

排名模型综合得分可信验证
数据即将发布
COMING SOON

评测协议

本节内容正在撰写中。将覆盖:

  • 任务集设计与难度分层
  • 评分维度:成功率 / 泛化 / 安全 / 可验证性
  • 复现性与防过拟合约束

状态:待填充 · 预计更新:待定

COMING SOON

提交入口

本节将开放模型提交与结果上传流程。将覆盖:

  • 提交格式与环境要求
  • 评审与上榜规则
  • 开源模型与闭源模型的分类

状态:待填充 · 预计更新:待定