智涌飞轮

具身数据 · 采集 × 效用计量 × 独立验证合作洽谈工作台登录

← 返回证据库

PhyAgentOS 评估报告(软硬结合层执行基座候选)

一、结论先行

总体咬合度:中。建议不整体引入作为执行基座,走"借理念 + 小试点"两步。

评估项 咬合度 一句话结论
(a) 证据/审计结构 ↔ 我方证据包 schema 中-高 sha256 manifest、不可变执行记录、缺测标记三项直接同构;预注册判定、授权、预算三项无对应,需自建
(b) License 商用集成 MIT,无障碍
(c) 数据回流与 LeRobot 格式 无耦合(不冲突也不互补) 全仓 0 处提及 LeRobot/parquet/hdf5/openx/rlds;其回流闭环作用于 AgentTask 教训提炼(Lesson/技能晋升),不产生训练数据集格式

建议:第一阶段把它的"三记录分离(Execution/Evidence/Verdict)+ 逐文件 sha256 + 执行记录不可变"作为我方 evidence schema v2 的设计参照(纯理念借用,零依赖成本);第二阶段视其补测试与发版节奏(v1.0.0 发布仅 2 天、仓库零测试),再决定是否在采集工作单的执行审计环节做 forge_evidence_bundle_v1 适配器试点。不建议把数据业务底座压在它上面。

二、框架事实

2.1 版本与定位

2.2 架构(以 v1.0.0 代码为准)

调用链:AgentLoop+Planner → ForgeToolClient → Gateway(/tools、/invocations)→ ToolEndpoint → Dora → 机器人/仿真器(README.md 架构段;PhyAgentOS/forge/、PhyAgentOS/skill_runtime/)。

核心机制(均从源码核实):

  1. 三记录分离:Execution(执行事实)/ Evidence(证据)/ Verdict(判定)分别版本化:paos_execution_record_v1、forge_evidence_bundle_v1、verification_verdict_v1、task_verification_contract_v1(PhyAgentOS/verification/contracts.py 84-239 行);另有 agent_task_record_v2、plan_revision_v2、tool_execution_record_v2(PhyAgentOS/forge/task.py)。pydantic 契约普遍 extra="forbid"。
  2. 验证四模式:off / audit / enforce / recovery,fail-closed;recovery 模式判 replan_required 时追加 PlanRevision(append-only,contracts.py 189-214 行交叉校验:success 必须全 criterion satisfied;failure/replan 必须至少一项非 satisfied)。
  3. 证据机:SHA-256 摘要 + 原子写 + workspace 路径逃逸防护 + execution_record.json 不可变(重写不同内容即报错,PhyAgentOS/forge/evidence.py 231-235 行)。
  4. 经验回流:3 次独立同因失败 → 收敛出 Lesson;3 次独立成功 → 技能晋升;SQLite 经验库 + LESSONS.md 投影(PhyAgentOS/agent/experience/,约 3157 行)。注意:回流对象是 AgentTask 结果,不是数据集格式。
  5. 技能运行时:manifest-v2 + SHA-256 清单 + Dora CLI v0.4.1;具体技能不在仓内捆绑(skills/README.md)。

2.3 规模与活跃度

2.4 出身与宣传口径核实

三、demo 实测结果

跑了,纯 CPU,全程约 10 分钟,无 GPU/torch 依赖,未配 LLM API key(本路径不需要)。

环境:Windows 11 + Python 3.13.14 venv(C:/Users/chunx/Projects/_phyagentos_eval/.venv)。

步骤 结果 备注
pip install -e . EXIT=0 需先清掉环境里 SOCKS 代理变量(本机环境问题,非框架问题)
paos onboard / paos status OK 隔离 HOME=C:/Users/chunx/Projects/_phyagentos_eval/home 下完成初始化
证据写入冒烟(自写 smoke_evidence.py 调 ForgeEvidenceWriter) 全部通过 见下

冒烟实测输出(C:/Users/chunx/Projects/_phyagentos_eval/smoke_evidence.py):

未测部分:AgentLoop 对话/规划(需 LLM key)、Gateway→Dora→机器人链路(需硬件)。故执行链路的端到端可靠性〔待核实〕。

四、三项咬合评估

4.1 证据结构 ↔ 我方证据包 schema(中-高)

字段对照表(左列=我方 seed3 证据字段,中列=PAOS 契约字段,右列=咬合度):

我方字段(runtime/selfproof-seed3.json 及 docs/evidence/2026-09-01-seed3-results.md) PAOS 字段(verification/contracts.py / forge/evidence.py) 咬合
任务/实验 ID(seed3、eval_info 关联) session_id + command_id(+ task_id)
数据/文件 sha256 manifest(watchdog 日志、eval_info 交叉核验) EvidenceArtifact.sha256 + byte_size + media_type + uri;skill bundle SHA-256 清单 高(直接同构)
watchdog 监控链条(连续过程日志) ExecutionRecord(timeline/status) + EvidenceCaptureWindow(before/terminal/after) + 不可变 execution_record.json 中(PAOS 是动作前后快照式,无常驻过程流)
预注册判定:predeclared_at + verdict_rule(confirm ≥20pp / 不足则降级) TaskVerificationContract(goal/success_criteria/constraints/mode) + VerificationVerdict 逐条 criterion 中(有契约位,但无预注册时间戳机制、无统计阈值/降级规则;PAOS 判定由 LLM verifier 产出,非确定性)
授权 authorization(人工批款记录) 无对应
预算 budget(GPU 时长/花费上限) 仅 execution_timeout_s 单次超时,无预算概念
B 轨缺测处理(缺测→维持 n=2 CONFIRMED 口径) EvidenceQuality.complete=False + missing_requirements 列表 中-高(概念同构)
环境纪律 environment_discipline Skill manifest-v2 + SHA-256 清单 + Dora 版本 pin 中(对象是 skill bundle,非实验环境)
评测产物 eval_info.json ×10 + pc_success 交叉核验 无对应(PAOS 不做数据集级指标)

结论:证据"完整性/可追溯"层咬合好(sha256+不可变+缺测标记),证据"判定语义"层需自建(预注册、统计规则、授权、预算)。PAOS 证据是"单次动作级机器人证据",我们是"实验级指标证据",粒度不同,不能直接替换,只能借结构。

4.2 License 商用集成(高)

MIT(LICENSE,Copyright (c) 2025 PhyAgentOS contributors)。允许商用、修改、闭源集成,仅需保留版权声明。无障碍。

4.3 数据回流与 LeRobot(无耦合)

五、风险与缺口

  1. 零测试:tests/ 目录不存在(pyproject 声明了 testpaths 但目录缺失)。作为执行基座的核心质量门槛不达标。
  2. v1.0.0 发布仅 2 天(2026-08-30),且历史被 squash 成单提交、无 GitHub Release/Tag,版本治理粗糙,回滚/追责困难。
  3. 平台层源自 OpenClaw(skills/README.md 明示),残留 HKUDS 链接与 openclaw 元数据回退(cli/commands.py:267、agent/skills.py:270-273),代码出身混杂,审计成本高。
  4. verifier 是 LLM 驱动:verification_verdict_v1 的判定由 session_verifier 依赖 LLM 产出,非确定性;我们的结算级判定需要统计规则(≥20pp 阈值、降级条款),PAOS 无此机制,直接套用会破坏"预注册判定"纪律。
  5. 技能/Gateway/Dora 运行时不在仓内捆绑:具体技能要自建;Dora 桥依赖外部组件,端到端链路未实测〔待核实〕。
  6. 宣传与代码代差:官网仍是 v0.1.x 双轨架构叙事;"State-as-a-File"字面串代码 0 命中。评估其能力时必须以代码为准,不能引官网/论文。
  7. 与我们现有栈(LeRobot 数据链、GOALS/证据包纪律)相比,整体引入收益集中在"执行审计"一环,而这一环也可用远小于 28k 行的方式自建。

六、建议下一步

  1. 现在做(零成本):把"三记录分离 + 逐文件 sha256 + 不可变执行记录 + 缺测显式标记(missing_requirements)"四点写进我方 evidence schema v2 的设计输入;可参考其 contracts.py 字段命名与交叉校验写法(约 240 行,可整体读完)。
  2. 观察期(1-2 个版本周期):跟踪其是否补 tests/、是否开始打 Release/Tag、OpenClaw 残留是否清理。满足"有测试 + 有发布纪律"再谈引入。
  3. 若试点(条件成熟后):仅限采集工作单的执行审计环节,做 forge_evidence_bundle_v1 → 我方证据包的导出适配器(方向:PAOS 证据导出给我们,不反向);先在本仓 docs/evidence 挂设计稿,不进代码。
  4. 不做:不把数据业务底座/众包派单/结算语义放到 PAOS 上(违反本仓 SSOT 边界,见 CLAUDE.md 所有权条款);不因 1967 stars 放大其成熟度——热度≠工程质量,本项目 277 会话最大教训即"自报≠实测"。

报告完。所有事实均有来源(文件路径/URL/命令输出);标注〔待核实〕处为未实测项。