关于 ▸ About
我们把失败,
当作证据。
EthSeq 研究具身智能:机器人在物理世界里为什么会失败,怎样用受控比较找到原因,再把原因整理成待检验的数据计划。每一件事,我们只写到查到的那一步。
01 ▸ 为什么
失败、因果、证据,
是做事的顺序。
先把失败留下来,再用受控比较找原因,最后只写证据撑得住的话。
- 失败Failure
- 成功很少说明原因。一次失败连同任务、轨迹和模型版本一起留下来,就是一个可以比较的起点。
- 因果Causality
- 相关说不清该改哪里。每次只改一个因素,再配一个安慰剂对照,才能把它和「操作本身」分开。
- 证据Evidence
- 门槛在实验前写定,结果出来后不改。负结果和没做完的,与正结果并排写出来。
02 ▸ 现在在哪里
已经做到的,
和还没有的。
这里只列概况。每一条的协议、数据和结论边界,都在证据档案里。
通过 · 范围见每行右侧
- 受控双向失败归因已验证 · 受控只在受控仿真、冻结协议下成立
- OpenVLA #303 相关公开复现离线归因通过只针对公开复现路径;模型未被修复
- CPF v2.12 框架测试112 / 112 通过框架 / 协议测试,不是机器人任务表现
部分通过,或未获支持
- LeRobot #2605训练轨迹因果定位闭环任务根因尚未确定
- robomimic #292机制通过 · 任务级未验证缺检查点与数据,任务级 A/B 受阻
- S-02 · CPF 定向修复数据未获支持不声称定向数据更有效,不声称自动修复
尚未完成
- 真机与外部独立验证尚未完成不声称已完成真实世界或外部独立验证
- S-01 · 透明方块(示例)未执行预注册草稿,只说明比较结构
以上结果都来自受控评估设置,不代表普遍的物理或因果智能。These results are from controlled evaluation settings and do not establish universal physical or causal intelligence.
03 ▸ 愿景
我们想走到的地方。
愿景 · 未验证
机器人的每一次失败,都留下一份能被复核的记录:原因经过受控比较确认;补什么数据、补多少,有依据;改完以后,在真机上、由外部独立地再验证一次。
这是方向,不是结果。离这里还有多远:找原因的那半圈,有外部案例和受控验证;补数据的那半圈,目前的等预算受控比较(S-02)没有支持定向数据的独特优势;真机与外部独立验证尚未完成。
04 ▸ 边界
这里不会出现的。
网站上的每一句话,都按证据档案的规矩写。
不写
- 虚构的客户、合作或认可。外部案例都来自公开 issue,不代表相关项目与 EthSeq 合作或认可。
- 没有执行过的比较得出的评分、成功率或排名。
- 冒充实验记录的图像。网站上的插图和影片都是线描示意,并标明「不是实验记录」。
- 写成结论的假设。未经验证的假设标为 DataGap,没有执行的比较标「待执行」。
联系
带一段失败轨迹来。
一个具体任务、几段失败轨迹,就够开始。我们先写定门槛,再动手查。
写信给我们:ethseq@ethseq.com