workflow_solid_decision_review
道-方法 · 道层 skill 全文
本页是 <code>rules/skills/drafts/workflow_solid_decision_review.md</code> 的逐字投影(仅隐私清洗,零改写)。
时点提示:本页是仓内文件 rules/skills/drafts/workflow_solid_decision_review.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。
草案 Workflow:Solid Decision 审查
状态
Draft skill。来源需求:adhoc_jobs/workflow_controller_loop_evolution_20260505/loop_update_management_20260523_20260524/SKILL_REQUIREMENT_PROMPTS.md。
当某个 decision、design、claim、Phase transition、closure、promotion、scheduler stop 或 Final Report 状态取决于证据是否足够强时使用。
这个 draft 还不是正式晋升的 Workflow skill。workflow_controller_loop 仍可通过 task card 的 protocol_visibility 路由 reviewer / Controller decision-gate Unit 读取它。
目的
本 skill 判断从现有证据中可以诚实声明什么。它防止 Loop、Skill、测试和报告决策把 self-evaluation、文件完整性、cold-read judge 或一个 positive case 当成 broad behavior 的证明。
它不执行任务、不设计测试套件,也不替代文件产生检查。它接收 bounded evidence bundle,并返回允许的 claim ceiling 和 next reaction。
必需输入
可用的 review packet 包含:
- target decision 或 claim。
- user requirement ids 和 source anchors。
- 位于 Loop 内时的当前 Controller Phase、User Requirement Phase、Agent Unit Phase 和 task phase plan id。
- required read paths 和 read-compliance receipt。
- 已产生的 artifacts、tests、run logs、factpack 和 reviewer findings。
- 已知 missing evidence、oracle boundaries、forbidden reads 和 residual risks。
- proposed next reaction,例如
advance、close、promotion、await_user、block、repair或continue_test。
如果 packet 缺少 user requirement anchors、evidence paths 或 read-compliance status,该 decision 不能是 solid。
证据等级
使用最弱的相关 evidence class 作为 claim ceiling。
| 等级 | 含义 | 典型允许声明 |
|---|---|---|
solid | 相关真实或 fresh 条件下的直接行为证据,已独立检查、基于 source;若声明很宽,还需要反例、mutation 或交叉验证 guard。 | 其他门禁均通过时,可支持宽泛声明、收束、晋级或停止调度。 |
bounded | 证据直接且可用,但范围较窄,例如一个 bounded 真实案例、一个 feature 路径或声明过边界的 fixture。 | 只支持有界完成或阶段完成。 |
partial | 存在有用证据,但覆盖、独立性、读取合规或真实条件保真度不完整。 | 继续、修复或明确写成 partial report。 |
observational | 证据来自历史笔记、审查者文本、静态检查,或没有实际运行目标行为的冷读模拟。 | 只支持假设、设计学习或分流。 |
weak | 证据是自评、文件存在、artifact 丰富度、用一个正例支撑宽泛声明、泄漏 oracle、只有 summary 的证明或无 source 断言。 | 不支持晋级,不支持宽泛收束,需要修复。 |
invalid_or_leaked 不是证据等级;它是 oracle 泄漏、禁读、fixture 被改写或状态冲突导致证据不可安全使用时的裁决。
四域词表对照(跨域判定时用哪套词表看哪个域)
本 skill 的证据五级(solid / bounded / partial / observational / weak)是证据强度词表,专管「从现有证据能诚实声明到多强」。它不是唯一的判定词表——跨域判定时会撞见另外几套语义相邻但域不同的受控词表。用错域就等于用错量尺:证据强度不能替 claim 生命周期、也不能替史实 verdict。这里只登指针(枚举值不复制,去各真源看),说明每套管哪个域:
| 词表(真源指针) | 管哪个域 | 与本 skill 证据五级的关系 |
|---|---|---|
| 证据五级 solid/bounded/partial/observational/weak(本 skill §证据等级即真源) | 证据强度:从现有证据能诚实声明的上限(claim ceiling) | 本表;下述各表判定时都可能需要它定级 |
claim 四态 built/wired/effective/steady(rules/TERMS_REGISTRY.md §1 → context_infra_migration_20260709/GLOSSARY.md r012 + METHODOLOGY_AMENDMENT_R012.md:94) | 单元/资产生命周期:建成→接线→真实效果→跨 run 稳态 | 正交轴:一个资产可以 wired 但支撑它「已生效」的证据只到 partial。判 effective/steady 需 solid/bounded 级行为证据,不能拿 built-not-wired 的存在性冒充 |
判断 Agent 四值 worked/worked_partially/did_not_work/cannot_judge(rules/TERMS_REGISTRY.md §1 → rules/DETERMINISTIC_SEMANTIC_LAYERS.md §5) | 判断 Agent 输出值域:某次运行「有没有奏效」 | 是本 skill 的下游消费者之一:判断 Agent 给 worked/… 时,其证据仍受本表 ceiling 约束(worked 但证据 observational = 只支持假设,不支持 broad closure) |
史实 verdict 5 态 contradicted/misframed/partly_supported/unsubstantiated/corroborated(rules/TERMS_REGISTRY.md §1 → chinese_internet_pseudohistory_research_20260716/…claim_ledger.tsv verdict 列 + tools/claim_ledger_check.py) | 史实/事实主张真伪方向:一条主张与证据是相符还是相悖 | 不同轴——verdict 是「主张对不对」,证据五级是「支撑这个 verdict 的证据有多强」。二者成对用(如 contradicted × high = 高置信地判其错),别把 verdict 当证据强度 |
confidence 三档 high/medium/low(rules/TERMS_REGISTRY.md §1 → 同 verdict 的 claim_ledger.tsv confidence 列) | 对上面某个 verdict 的置信度 | 与本 skill 证据五级语义相近但不是同一套:confidence 是史实 program 的置信标度,证据五级是本 skill 的 claim-ceiling 标度;跨引时显式声明用的是哪套,不混用 |
用法:判「资产是否 landed / 生效」→ 主看 claim 四态,证据五级定其状态声明的强度;判「某次运行奏效否」→ 判断 Agent 四值 + 本表 ceiling;判「某史实/事实主张真伪」→ 史实 verdict 5 态 × confidence 三档,本 skill 只在有人要给「这个 verdict 的证据够不够强」定级时介入。全部真源存在性登记见 rules/TERMS_REGISTRY.md §1(跨域术语指针在 §3),铸新判定词表前先查该簿防撞名。
硬门禁
- 缺少必需 phase 读取或读取合规 receipt 会阻止
solid,通常也会阻止advance、close、promotion和停止调度。 - 文件存在、JSON 解析成功、状态 PASS、artifact 丰富或审查者文本本身永远不能证明需求完成。
- 执行者的 self-evaluation 不能作为 promotion-level proof。
- 只有 cold-read judge 的结果是 observational,除非另有 fresh behavior evidence 或 deterministic checks 支撑。
- 一个 positive case 不能支持 broad stability、whole-task closure 或 formal promotion,除非用户明确把任务限定为一个 case,且 claim ceiling 允许。
- 对 Skill trigger stability claim,需要 N by N trigger matrix:每个
should_triggerprompt 都要对照每条 candidate Skill route。分别记录 diagonal hit rate 和 off-diagonal false-trigger rate。 - 对 trigger stability claim,至少使用 10 个 realistic tasks,除非 claim 明确低于 stability。
- Evidence 必须引用 source paths、line anchors、runs、test artifacts 或 factpack entries。没有 evidence paths 的 summary verdict 不是 solid。
- 如果提出 broad closure、promotion、scheduler stop 或 Final Report status,review 必须输出 claim ceiling,并解释为什么不需要或不允许继续。
- 镜像条款(失败声明对称举证):证据五级与硬门禁对
block/repair/close-as-fail 等负面或停止结论同样适用。下「失败 / 未完成 / blocked」结论要和下solid一样接受独立或确定性检查;单一负面信号或单个 reviewer 文本只到observational,不足以 solid 地判失败。broad failure 或整体 blocked 需第二信号或确定性核验(如全仓find/grep确认产物确实不在任何路径)。这条针对 2026-05-29 的真实失败:把成功但写错路径的产物误判为 blocked。 - 框架检查:target decision 继承的 frame 若未经审查(未记录目的、视角、范围,或由单一请求者/历史先例直接锁定),不得评
solid;先写出「我们决定解决的问题是什么」与「请求是什么」并确认不是默认接受,才进入证据评估(DQ AX_14 thrown-frame;疑似 narrow-framing 追加 AX_15)。 - 备选检查:评
solid的宽泛结论须确认竞争备选或替代假设已纳入比较且彼此有实质差异;仅对单一方案做反例 mutation 不等于比较过备选项(DQ AX_26 alternative-set-ceiling)。 - 价值/停止:next reaction 为
continue/continue_test或任何追加投入时,须给边际价值论证(新增工作可能改变哪个选择、排序或承诺);说不出具体改变、或预期改善已小于追加成本,则应止步(DQ AX_08 cost-value-stopping、AX_41 information-has-stopping-rule)。 - context-loss 检查:evidence 经 reviewer 转手(层级汇总、摘要、压缩)须核查细节、异议、来源强度、不确定性是否保留;只有 summary verdict 而无原始信号路径的转手证据最高只到
observational(challenger AX_09 structural-secrecy)。 - 综合从众检查(与 context-loss 检查互为镜像,一防丢信息、一防被污染):当 decision 是对多个 peer agent 输出的综合、且结论无法被综合者独立验证(主观判断、设计取舍、无 oracle 的评估)时,若综合者在去权威化和保留异见之前就接触了带权威/资历标签或「N 个 agent 一致」社会框架的 peer 结论,则该综合最高只到
bounded,不得评solid。要支持solid需:综合者拿到可独立核验的证据(把不可验证转成可验证是最强防御),或 peer 结论已去权威化、去「一致多数」措辞、保留异见,且尽量换 provider。可独立验证的综合(可重算/可机械核验)不受此条约束。并叠加一个更基础的问题:单次主观综合判断本身不稳定(churn,模型重新考虑即改 44-80%),不可当稳定信号,优先转可验证或多采样取众数。依据 2026-05-30~31 受控实验(含框架隔离):从众主要由模型基线决定(claude-haiku 即便 bare 裸调也从众、sonnet bare 反而 reactance),「框架成 subagent」只是小且模型依赖的次级效应(净从众 sonnet −0.24→+0.07,n=45,p=0.09 marginal;kimi 上甚至 backfire;起作用的是「多数一致」措辞而非 subagent 身份;项目 settings 注入与 persona 已排除 p=0.75),churn(重思即改 44-80%)是更普遍的风险,可验证综合跨 harness 零从众是最强防线;故本门禁对不可验证综合保守封顶bounded,按强到弱优先转可验证 / 多采样 / 选抗从众模型 / 剥措辞。早期高从众率(89% 等)与「harness 门控」说法均已被上述对照修正;codex/GLM 数据点已弃;机制层支持 arXiv:2601.05384 / 2603.27771 / 2510.04229。详见methodology/subagent_conformity_reproduction_and_defense_20260530.md。
输出 Schema
把这个 section 写入 effect review、Decision Packet、closure review,或专门的 evidence/reviews/solid_decision_<id>.md:
solid_decision_review:
target_decision:
target_claim:
user_requirement_ids: []
phase_position:
task_phase_plan_id:
controller_phase_id:
user_requirement_phase_id:
agent_unit_phase_id:
required_read_paths: []
read_compliance_verdict: pass | partial | fail | not_applicable
missing_required_reads: []
evidence_map:
- evidence_path:
labels: [D, I, W] # Decision / Implementation / Workflow evidence, when useful
supports:
limitations:
weakest_evidence_class: solid | bounded | partial | observational | weak
invalid_or_leaked: true | false
synthesis_over_peers: true | false # 是否对多个 peer 输出做综合判断
synthesis_independently_verifiable: true | false | not_applicable
anti_conformity_guards: [] # 仅 unverifiable 综合需要: verifiable_evidence_given | de_authority | dissent_preserved | provider_isolated
claim_ceiling:
decision_stability: solid_for_claim | bounded_for_scope | partial_continue | observational_only | weak_repair_required | invalid_or_oracle_leaked
next_reaction: repair | continue_execution | continue_test | branch | advance | await_user | block | close
why_this_reaction:
repair_or_continuation_tasks: []
forbidden_claims: []Loop 集成契约
在 workflow_controller_loop 中,如果 review result 会影响 phase advance、closure、await_user、block、promotion、scheduler stop、broad claim wording 或 Final Report status,本 skill 必须介入。
通常顺序是:
- read-compliance review 检查 Unit 是否读取了 required phase files,并避开 forbidden paths。
- artifact review 检查 promised outputs。
- effectiveness review 检查 task effect。
- solid decision review 设置 evidence class、claim ceiling 和 allowed next reaction。
- next-step planner 把结果转成下一 Unit contract。
低风险小 Unit 可以把这些内容作为一个 round review 文件的多个 section。Protocol-gated、closure-sensitive 或 multi-agent Unit 应把 read-compliance 和 solid-decision section 写得足够明确,确保另一个 agent 能消费。