MODEL BENCHMARK
具身模型 Benchmark
在统一的具身语义标准下,度量 VLA / 具身基础模型的能力上限与可信边界——能提出行动,更要能证明结果、划定安全边界。
评测榜单
榜单收录各类具身基础模型在统一任务集与评测协议下的表现。所有结果可追溯、可复现。
排名模型综合得分可信验证
数据即将发布
COMING SOON
评测协议
本节内容正在撰写中。将覆盖:
- 任务集设计与难度分层
- 评分维度:成功率 / 泛化 / 安全 / 可验证性
- 复现性与防过拟合约束
状态:待填充 · 预计更新:待定
COMING SOON
提交入口
本节将开放模型提交与结果上传流程。将覆盖:
- 提交格式与环境要求
- 评审与上榜规则
- 开源模型与闭源模型的分类
状态:待填充 · 预计更新:待定