workflow_data_check_review
道-方法 · 道层 skill 全文
本页是 <code>rules/skills/drafts/workflow_data_check_review.md</code> 的逐字投影(仅隐私清洗,零改写)。
时点提示:本页是仓内文件 rules/skills/drafts/workflow_data_check_review.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。
报告元数据(frontmatter)
name: workflow_data_check_review
description: 数据检查审查法(道2 审查方法论)—— 审查一批已完成 / 在执行的工作是否真的正确完成,不信执行者自报。三根支柱:(1) 数据检查回原始源(claim 里的数 / 事实溯到 raw 文件:行,不查派生的二次产物);(2) 追问挖掘(从对话 / session 历史找用户反复追问的点,当经验性弱点信号);(3) partial 审查(每条 claimed-done 给 correct / partial / wrong / unverifiable 定级,非 correct 必附可定位反例)。从 DD2525 论文复现审查抽象成的通用 checklist。配 data_check_review_gate 检测器。触发:用户说"检查一下最近这些 loop / 任务做对没""又 partial 了吧""核一下数据对不对"。
type: Workflow(道层 / 审查方法论)
status: draft (Beta) — 晋级前需在 ≥1 个真实非 DD2525 任务上按本法产出 data_check_ledger 并过 data_check_review_gate,且 dogfood 之外再积累真实使用记录,证据到 bounded 以上
created: 2026-06-05
version: 0.1.0 (draft)数据检查审查法:核数据、挖追问、查 partial
一句话
对一批"声称做完"的工作,不读执行者的完成声明,而是把每条声称溯回原始数据、挖出用户反复追问的点、给每条 claimed-done 定一个 partial 级别。"做对了 / 做完了"由这三个外部证据源裁定,不由执行者自报。
何时用
- 用户要对最近的 loop / 在执行的任务做一次较完整的检查("做对没""数据对不对""哪里又 partial 了")。
- 一批 claimed-done 工作要核它真完成还是半完成,尤其在执行者自己说"已 landed / 已完成"之后。
- 判一份数据检查审查产物是否良构(用配套
data_check_review_gate)。
非 trivial 的"审查最近这批工作"任务前,先按 _DAO_ROUTING 路由到本 skill;核一个孤立小事实不必。
不做什么(边界)— 防重复
净空白 = 既有审查 skill 都不做的那件事:以原始数据 + 用户追问轨迹为锚,给一批 claimed-done 工作逐条定 partial 级别。边界点名划清:
- 不做 session 级 claim-vs-reality 的 Harness Reference diff:写应然表 → 独立取实然 → diff 归
workflow_session_claim_audit(V-01)。本法在 partial 审查阶段消费它当取证手段之一,但自己的锚是"原始数据 + 用户追问",不是 Harness Reference 应然表。 - 不做单产物 closure 定级 / 晋升:证据够不够强、能不能晋升归
workflow_solid_decision_review。本法只给"对不对 / 完没完",定级交它。 - 不做需求覆盖完整性:所有用户消息覆盖了没、有没有塌缩 turn 归
workflow_requirement_analysis_quality。本法假设需求已知,查的是"声称满足需求的实现真满足了没"。 - 不做单个数字的机械溯源:那是
f2_number_traceability检测器(一个 mechanical instance,adhoc_jobs/complexity_defense_method_20260602/detectors/f2_number_traceability/)。本法是方法层,支柱 1 在"数字跨粒度比较"子 case 上路由 F2,其余数据 / 事实靠人按方法溯。
核心方法:三支柱
理论根:执行者不能当自己的 oracle(meta_analysis_20260604/DIAGNOSIS_order_intake_insight.md + 记忆 project_open_loop_control_theory)。实测规律是"所有自我诊断都发生在用户追问之后"——执行者判"我做对了"与重做任务同等代价、且内部不可见,所以不会主动发现自己的 partial。审查要把误差信号锚在执行者影响不了的三个外部源。三支柱直接对应用户原话的三点(数据检查方法 / 追问记录 / 未正确实现的部分)。
支柱 1 — 数据检查回原始源
每条定量 / 事实声称,溯到产生它的原始数据(raw 文件:行 / 脚本原始输出),核它是否真支撑该声称。
- 失败模式(实证):中间产物多时,agent 从派生的二次产物(整理过的中文摘要 / integration 汇总 / 别的报告)里读数当结论,不回原始 CSV / 脚本输出。真实翻车两例:把某列
instr_count当复杂度指标,实际那列是len_to_10s(核了次级中文产物,没核原始 CSV);把295(单阶段预算)当成削减600(总预算)的证据,实际295+295+10=600是同一总预算两种粒度。 - 方法:每条标
source_kind = original | derived。derived 不是自动错,但拿 derived 当 ground-truth 下定量结论 = 红旗,必须回 original 复核。数字跨粒度比较子 case 路由f2_number_traceability做机械溯源(它产出可定位反例:每个量的path:line+ 正确 reconciliation)。
支柱 2 — 追问挖掘
从对话 / session 历史找用户反复追问的内容,当经验性弱点清单。
- 为什么:用户的重复追问是已经暴露出来的误差信号("我之前说过…""为什么还是…""这个 partial 了吧")。执行者自己生成不出这个信号(自诊断滞后于追问),主动去历史里把它挖出来,等于把"下一次追问才会暴露的问题"提前到这一轮查。
- 方法:扫被审任务相关的 session / log,找用户侧重复出现的诉求 / 纠正 / 质疑,每条落
follow_up_anchor(session:line)。挖到的每条进 item 当 suspicion 驱动检查——用户反复追的地方优先核。真没有反复追问就记follow_up_scan.found: 0+ 扫了哪些源(强制做扫描,不强制有结果;跳过扫描 = FLAG)。
支柱 3 — partial 审查
每条 claimed-done 给固定 taxonomy 定级,非 correct 必附可定位反例:
correct:核过、真完成,附确认命中(在哪看到它真做完)。partial:只做了一半,标清缺哪半。wrong:做了但做错(数据 / 逻辑错),附反例。unverifiable:本轮核不了(源不可达 / 证据缺),标什么挡住——这是诚实的非声称,不是失败。
重点查"要求实现但没正确完成 / 常 partial"的——用户点名的高发区。partial / wrong 的取证可路由 workflow_session_claim_audit(claim-vs-reality)或 landing_gate(消费链走通没、是不是 staged 冒充 landed)。
产出:data_check_ledger
审查产物落一个 yaml fenced block(top-level 扁平 key,配套检测器解析它)。schema:
scope: "<被审工作:哪些 loop / 任务 / session>"
follow_up_scan:
sources:
- "<扫过的 session id / log 路径>"
found: 0 # 找到几条反复追问;0 允许,但必须做了扫描
items:
- id: "DC-1"
claim: "<被审的 claimed-done 声称(执行者说做完 / 做对了什么)>"
follow_up_anchor: "<session:line 用户反复追问处 / 'none'>"
source_checked: "<核对依据的原始数据 file:line>"
source_kind: "original" # original | derived
verdict: "correct" # correct | partial | wrong | unverifiable
evidence: "<correct: 确认命中; 非 correct: 可定位反例(file:line + 期望 vs 实际)>"完成判据(一份 data_check_ledger 是否良构)
配套检测器 data_check_review_gate(确定层壳 DC1-DC3 + regulator DC4,工具路径查 tools/INDEX.md)。一个无上下文 agent 拿这四条也能判过没过:
- DC1 三支柱在场(确定层):
scope非空;follow_up_scan做了(sources非空 list,found可为 0);items非空 list;每条 item 有 id + claim + verdict。缺 follow_up_scan(支柱 2 被跳过)/ items 空 = FLAG。 - DC2 数据溯源到原始源(确定层):每条 item
source_checked非空、带 locator(file:line / § / #);source_kind ∈ {original, derived}。缺 source / source_kind 非法 = FLAG。 - DC3 partial 定级带反例(确定层):每条
verdict ∈ {correct, partial, wrong, unverifiable};非 correct 的 verdict(partial / wrong / unverifiable)附非空evidence带 locator。verdict 非法、或非 correct 缺反例 = FLAG。 - DC4 检查是真核还是复述(regulator,语义):独立第二 agent(codex:high,
forbidden_read含被审 agent 的成功叙事 / 自报),逐条判source_checked是真原始数据支撑该 verdict、还是查了派生产物 / 复述了 claim / 仪式性"看着像做完了";对source_kind: derived的条目,判它是不是该回 original 的真失败。每条grounded(真核原始数据)/restated(查派生 / 复述 claim / 仪式性)/unknown,任一restated= FLAG,给可定位反例(哪条、为什么不是真核、怎么修)。unverifiable条目不参与 DC4(诚实非声称)。
fail-safe:检测器任一项不可判(regulator 通道失败等)→ UNKNOWN → 当 FLAG,不放行。
收口调用(这一步是审查的机械 exit 信号,不靠执行者自报"查过了"):审查产出 data_check_ledger 后,跑 python3 tools/data_check_review_gate/check.py --asset <ledger 路径> --regulator-tier codex:high --timeout 900 核 DC1-DC4;FLAG 按可定位反例修过、再当审查完成。确定层快速过结构用 --no-regulator(DC1-DC3),完整核(含 DC4 判真核 vs 复述)跑全。
与相邻审查 skill 的衔接
本法(数据检查审查) 取证手段(被本法消费)
───────────────────── ──────────────────────────
支柱1 数据回原始源 → f2_number_traceability(数字子case机械溯源)
支柱2 追问挖掘 → (扫 session/log,本法自己做)
支柱3 partial 审查 → session_claim_audit(claim-vs-reality)
landing_gate(消费链/staged 冒充 landed)
↓ 定级交下游
solid_decision_review(证据强度 → claim ceiling / 能否晋升)正交上游:workflow_requirement_analysis_quality(查需求覆盖够不够,本法不做;本法查的是覆盖到的需求实现对没对)。
大型多 session 任务的审查编排见 workflow_large_scale_task_audit,本法是它 partial 取证的一种。
可用资源
- mechanical instance:
f2_number_traceability检测器,adhoc_jobs/complexity_defense_method_20260602/detectors/f2_number_traceability/(支柱 1 数字子 case)。 - 取证 skill:
workflow_session_claim_audit(claim-vs-reality)、landing_gate(landed 四条件)、workflow_solid_decision_review(证据定级)。 - 正交上游:
workflow_requirement_analysis_quality(消息覆盖)。 - 配套检测器:
data_check_review_gate,工具路径查tools/INDEX.md。 - 理论根:
meta_analysis_20260604/DIAGNOSIS_order_intake_insight.md(确定层有信号 / 语义层没有 → satisfice);记忆project_open_loop_control_theory(缺失误差信号 + 调控者必须是第二智能体)、project_complexity_defense_method(F2 / F5 检测器实例)。
诚实 claim ceiling / 缺口
- 证据等级 bounded / observational:本法抽象自 DD2525 论文复现审查的原始诉求 + 既有失败模式实证(F2 instr_count / 295-600),dogfood 应用于 ≥1 个非 DD2525 真实任务一次,未经大规模真实审查验证。proof obligation 与原 req 一致(observational)。
- 支柱 2 的"反复"阈值是定性的(追问几次算"持续追问"),未给确定层默认;扫描覆盖也靠人圈定相关 session 范围。
- 支柱 1 的 original-vs-derived 判定在非数字事实上靠人 + regulator 判,只有"数字跨粒度比较"子 case 有 F2 机械化;其余数据 / 事实的 source_kind 误标,确定层挡不住,靠 DC4 regulator 兜。
- DC4 regulator 与 precise_reading / session_claim_audit 的 PR4 / SA4 一样,judge 的是"从 ledger 看像不像真核",不亲自重跑原始数据核对(那是审查者自己该做的,detector 不替做)。