context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

workflow_data_check_review

Z3 全文↑ Z2 条目

道-方法 · 道层 skill 全文

← 返回道层 skill 索引 · 返回方法论区

本页是 <code>rules/skills/drafts/workflow_data_check_review.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 rules/skills/drafts/workflow_data_check_review.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

报告元数据(frontmatter)
name: workflow_data_check_review
description: 数据检查审查法(道2 审查方法论)—— 审查一批已完成 / 在执行的工作是否真的正确完成,不信执行者自报。三根支柱:(1) 数据检查回原始源(claim 里的数 / 事实溯到 raw 文件:行,不查派生的二次产物);(2) 追问挖掘(从对话 / session 历史找用户反复追问的点,当经验性弱点信号);(3) partial 审查(每条 claimed-done 给 correct / partial / wrong / unverifiable 定级,非 correct 必附可定位反例)。从 DD2525 论文复现审查抽象成的通用 checklist。配 data_check_review_gate 检测器。触发:用户说"检查一下最近这些 loop / 任务做对没""又 partial 了吧""核一下数据对不对"。
type: Workflow(道层 / 审查方法论)
status: draft (Beta) — 晋级前需在 ≥1 个真实非 DD2525 任务上按本法产出 data_check_ledger 并过 data_check_review_gate,且 dogfood 之外再积累真实使用记录,证据到 bounded 以上
created: 2026-06-05
version: 0.1.0 (draft)

数据检查审查法:核数据、挖追问、查 partial

一句话

对一批"声称做完"的工作,不读执行者的完成声明,而是把每条声称溯回原始数据、挖出用户反复追问的点、给每条 claimed-done 定一个 partial 级别。"做对了 / 做完了"由这三个外部证据源裁定,不由执行者自报。

何时用

非 trivial 的"审查最近这批工作"任务前,先按 _DAO_ROUTING 路由到本 skill;核一个孤立小事实不必。

不做什么(边界)— 防重复

净空白 = 既有审查 skill 都不做的那件事:以原始数据 + 用户追问轨迹为锚,给一批 claimed-done 工作逐条定 partial 级别。边界点名划清:

核心方法:三支柱

理论根:执行者不能当自己的 oracle(meta_analysis_20260604/DIAGNOSIS_order_intake_insight.md + 记忆 project_open_loop_control_theory)。实测规律是"所有自我诊断都发生在用户追问之后"——执行者判"我做对了"与重做任务同等代价、且内部不可见,所以不会主动发现自己的 partial。审查要把误差信号锚在执行者影响不了的三个外部源。三支柱直接对应用户原话的三点(数据检查方法 / 追问记录 / 未正确实现的部分)。

支柱 1 — 数据检查回原始源

每条定量 / 事实声称,溯到产生它的原始数据(raw 文件:行 / 脚本原始输出),核它是否真支撑该声称。

支柱 2 — 追问挖掘

从对话 / session 历史找用户反复追问的内容,当经验性弱点清单。

支柱 3 — partial 审查

每条 claimed-done 给固定 taxonomy 定级,非 correct 必附可定位反例:

重点查"要求实现但没正确完成 / 常 partial"的——用户点名的高发区。partial / wrong 的取证可路由 workflow_session_claim_audit(claim-vs-reality)或 landing_gate(消费链走通没、是不是 staged 冒充 landed)。

产出:data_check_ledger

审查产物落一个 yaml fenced block(top-level 扁平 key,配套检测器解析它)。schema:

scope: "<被审工作:哪些 loop / 任务 / session>"
follow_up_scan:
  sources:
    - "<扫过的 session id / log 路径>"
  found: 0            # 找到几条反复追问;0 允许,但必须做了扫描
items:
  - id: "DC-1"
    claim: "<被审的 claimed-done 声称(执行者说做完 / 做对了什么)>"
    follow_up_anchor: "<session:line 用户反复追问处 / 'none'>"
    source_checked: "<核对依据的原始数据 file:line>"
    source_kind: "original"       # original | derived
    verdict: "correct"            # correct | partial | wrong | unverifiable
    evidence: "<correct: 确认命中; 非 correct: 可定位反例(file:line + 期望 vs 实际)>"

完成判据(一份 data_check_ledger 是否良构)

配套检测器 data_check_review_gate(确定层壳 DC1-DC3 + regulator DC4,工具路径查 tools/INDEX.md)。一个无上下文 agent 拿这四条也能判过没过:

fail-safe:检测器任一项不可判(regulator 通道失败等)→ UNKNOWN → 当 FLAG,不放行。

收口调用(这一步是审查的机械 exit 信号,不靠执行者自报"查过了"):审查产出 data_check_ledger 后,跑 python3 tools/data_check_review_gate/check.py --asset <ledger 路径> --regulator-tier codex:high --timeout 900 核 DC1-DC4;FLAG 按可定位反例修过、再当审查完成。确定层快速过结构用 --no-regulator(DC1-DC3),完整核(含 DC4 判真核 vs 复述)跑全。

与相邻审查 skill 的衔接

本法(数据检查审查)           取证手段(被本法消费)
─────────────────────         ──────────────────────────
支柱1 数据回原始源       →     f2_number_traceability(数字子case机械溯源)
支柱2 追问挖掘           →     (扫 session/log,本法自己做)
支柱3 partial 审查       →     session_claim_audit(claim-vs-reality)
                              landing_gate(消费链/staged 冒充 landed)
        ↓ 定级交下游
   solid_decision_review(证据强度 → claim ceiling / 能否晋升)

正交上游:workflow_requirement_analysis_quality(查需求覆盖够不够,本法不做;本法查的是覆盖到的需求实现对没对)。

大型多 session 任务的审查编排见 workflow_large_scale_task_audit,本法是它 partial 取证的一种。

可用资源

诚实 claim ceiling / 缺口


← 返回道层 skill 索引 · 返回方法论区