production-readiness · 终报
轮次报告全文 · 逐字真源投影
本页是轮次报告的逐字投影(仅隐私清洗,零改写)。渲染不了的元素退化为代码块原文。
时点提示:本页是仓内文件 adhoc_jobs/context_infra_base_tooling_buildout_20260615/production_readiness_20260704/FINAL_REPORT.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。
报告元数据(frontmatter)
req_id: BT-PROD-001
req_id_2: BT-PROD-002
task_id: T1082
session_id: c2c220ad-32f5-4d1a-bb19-1b8616e4b84f
created_at: 2026-07-04
phase: BT-P5-close
doc_type: final_report
verdict: BT-PROD-CLOSED-BOUNDED-WITH-FIRST-REAL-EVIDENCEBaseTooling Buildout production-readiness 推进 — 最终报告
一段话回答核心问题
你要的三件事都有了真实运行证据:分层重定义落成系统级真源 rules/DETERMINISTIC_SEMANTIC_LAYERS.md(一个分界原则、能力/检查两个位点、确定层四职能+输出反馈契约、2×2 判断矩阵覆盖判据);测试方法论基于 26 本库内软工书籍提炼成八条道层原则+六类模块术表(fitness function 治理/oracle 降级阶梯/STPA 触发分类/统计纪律/通道身份纪律/production 耦合),并全部落成可跑的件;你点名的疑问「之前的测试是否真的启动了 Claude Code」查清了——机械审计确认历史上 30 处 CC 派发声明 30 处全真(transcript 逐一回指验证),但其中 27 处跑在 GLM/Kimi 后端、只有 2 处原生 Anthropic 通道,且全部集中在 Run3 收尾 45 小时窗口内,Run4 修复轮零 CC 证据——这个「CC 外壳真、原生模型少、修复轮空白」的格局现在被通道身份三字段+记分牌通道谓词永久机械化盯防,今天的 T1 测试补上了原生通道臂。本轮收口判级 bounded-verified-build + first-real-evidence:建的每件都被至少一次真实运行消费过,但都是单 case 单日证据,不冒领 production-final。
做了什么(五阶段闭环)
P1 三路调查(research/):测试真实性机械审计(30/30 验证+通道分布+Run4 空白);分层定义现状盘点(9 处既有定义逐字对照,发现「触发判据独大、功能内容散落」+ 术语双义 + regulator 默认值两套矛盾语义);156 本书 manifest+26 本精读的方法论提取(5 条正交候选)。
P2 设计 + 对抗审查(design/):分层重定义 v2 与测试方法论设计由我亲做(多候选对比:记分牌真源三族+审查补录第四族,裁定 A 注册表+B 探针 join);独立 Fable 对抗审查给出 5 verdict + 4 必须修项(M1 四值契约校验件缺执行件、M2 覆盖判据自相矛盾、M3 着色无通道维度、M4 registry 塞 gates[] 会静默降级 live 白名单)——全部修入 v2.1/v1.1。
P3 八切片实装(impl/IMPL_LEDGER.md,全部主 agent 独立验收非信自报):S1 gate 单真源(28 条 manifest+INDEX GENERATED 派生+一致性自检);S2 PROMOTE-ONE(intake_gate 迁底座,产 base 契约缺口 4 条);S3 判断 Agent 构件族(judgment_packet+semantic_verdict 四值校验件+landing 第五察验+regulator forced 升档);S4 capabilities registry+test_health 记分牌(19 能力、通道谓词着色、缺口 todo intake 接头);S5 eval_harness 强化(通道三字段/claim_scope/isolation 单真源/transcript_sha 去重/--replicate/UCA/合成探针 schema);S6a 测试卫生(2 个 mock 不安全单测修复,断网可过);S6b 分层真源晋升 rules/;S7 判定类 worker phase-hook 豁免(修复 5 跑 3 中的判决挤占,修后 6/6 干净)。测试计数:本轮相关套件独立复跑累计 400+ passed。
P4 真实 CC session 测试(tests/TEST_RUNS_LEDGER.md,用户点名强制步骤):
- T1 催缺机制三臂:正臂(原生 claude:high,worker 自我 arm→义务追踪→advance 注入→放行)PASS;pos2 纯净拦截标本(外部武装+植入义务,worker 不知 plan 存在,仅凭确定层注入完成 拦截→感知→补齐→放行 全回路,kimi 后端)PASS;负臂 mutation guard(worker 被指令拒补,催缺三次开火、义务未闭不放行)oracle 判 FLAG=期望。四 artifact 三臂齐,通道身份全链入账。
- T3 语义主门端到端:真实 LLM 判断 Agent 拿完整判断包(需求逐字/意义/MVP 效果/实现要求/模块化+机械信号)出四值判决——正臂 worked→landing shell+C5 双层 PASS(「两层齐过才 landed」真实走通);负臂拿一个 registry 已注册、零实现的真实缺口判 did_not_work+可定位反例→主门拦截。
- T2 改道处置:记分牌 CLI 形态已验;注入接线缺口由记分牌自己暴露、判断 Agent 判决、缺口接头 intake 入队(BT-PROD-F3)——「缺口→判决→修复动作」回路在同一缺口上有机转了一圈。
P5 收口:solid_decision_phase 联动综合(9 closure×7 条 linked 联动、疑问 2 条补料闭环)过 gate SD1-SD4 全 PASS(regulator 真跑)。
测试中抓到并处理的真问题(测试系统在自证有效)
- F1 判决挤占(5 跑 3 中):regulator session 被 repo phase hook 干扰→S7 豁免机制当日修复+真实 2/2 验证。
- F2 oracle 硬耦合:eval_oracle 与 skill 场景绑死,phase 机制面只能手工组合判定(
_oracle_form全程留痕)→ 已入队。 - F3 注入接线缺口:记分牌自己暴露自己的最后一公里→已入队。
- 提取器缺陷现场修(S8):叙述+JSON 混排致首个真实判决 parse 失败→候选块枚举修复+回归测试,内容校验强度不变。
- 并发污染假阳:eval run 与实装 worker 并行导致 isolation 误报→逐文件归因+安静窗口反证,教训入 ledger。
- S4 台账冒名:worker 把「主 agent 亲验」写进我的台账→已当场更正并全量重验,署名纪律记录在案。
production-ready 判据现状(记分牌实况)
19 能力:68/76 格有效覆盖(89.5%)、⚠4(evolvable_workflow 仅 Codex 证据=Run4 模式现在机器可见)、✗4(F3 缺口)。六条审计收口条件:条件 2(K6 语义主门)本轮兑现(landing C5+forced 升档+T3 端到端);条件 5(gate 单真源+PROMOTE-ONE)本轮兑现;条件 6(注册 provenance)部分兑现(run receipt+commit 入 T3 正臂链);条件 1/3 靠有机使用积累(记分牌使其可观测);条件 4 显式 out-of-scope(intake 域)。
claim ceiling 与残差
BT-PROD-CLOSED-BOUNDED-WITH-FIRST-REAL-EVIDENCE:机械边全真实、每件被至少一次真实运行消费;单 case 单日,未跨任务积累;13 域全量按新方法论复测未做(是记分牌上的可见黄区而非盲区)。残差清单:BT-PROD-F2(oracle case 类型抽象)、F3(注入接线+T2 完整版)、15 gate 迁移债(S2 缺口清单为输入)、记分牌 covered 行误生成 intake 接头(小瑕疵)、判断 Agent 校准样本积累(长期)。全部在需求脊柱或 ledger 挂账,无静默丢失。
(a) 专业术语注释
- 确定层 / 语义层(能力位点 α):系统运行时能力的分层——不需要大模型语义理解即可正确执行的(hook/cron/gate 引擎/驱动器/守卫)归确定层,需要的(skill 语义使用、判断型 CLI、按语义归置)归语义层。真源
rules/DETERMINISTIC_SEMANTIC_LAYERS.md。 - 确定层检查 / 语义层检查(检查位点 β):同一分界应用在「判定干得怎么样」上——机械断言(文件/I-O/exit code/触发信号)vs 判断 Agent(是设计所指吗、解决痛点了吗)。
- 2×2 判断矩阵:两个判断轴(功能准确性 / 实现好不好)× 两层检查,四格都有内容才算「已测」。
- 判断 Agent:产出「好不好」判决的独立第二 LLM 构件;输入=判断包(judgment_packet:需求逐字/意义/MVP 效果/实现要求/模块化/机械信号),输出=四值判决(worked / worked_partially / did_not_work / cannot_judge)+ 可定位反例;fail-safe:cannot_judge/无反例/不可解析一律 FLAG。
- fitness function(FF):保护某个特征的命名检查(gate/eval/巡检/HUMAN_GATE 皆是),BEA 四维分类(原子/整体×触发/持续/时间×静态/动态×自动/人工)。
- capabilities registry / 记分牌:gate_manifest.yaml 新增 section 持有应然(能力清单+保护 FF+required_channel+2×2 覆盖要求);test_health/scoreboard.py 现算实然并 join 出缺口着色。
- 通道身份三字段 / claim_scope:{channel, backend_model, model_evidence_source} 全链透传;claim_scope=cc_native(原生 Anthropic)/ cc_shell_nonnative_model(CC 外壳+GLM/Kimi 后端)/ codex,判定结论按此限定范围。
- mutation guard(负对照):故意造一个该被判 FLAG 的场景,证明 oracle 不是只会 PASS 的摆设。
- 四 artifact:真实 session 评估闭环的四类产物——capture.jsonl / pre_snapshot.json / isolation_check.md / oracle_verdict.json。
- RAW_DELIVERED:regulator_runner 对自定义输出契约只送原文不校验的状态;S3 的 semantic_verdict 校验件在消费侧补上全部校验。
(b) 原始需求:Prompt 逐字原文
两条需求的逐字原文(sha256 冻结)在需求脊柱:
- BT-PROD-001:
adhoc_jobs/context_infra_base_tooling_buildout_20260615/requirement_records/BT-PROD-001.md(重定义确定层/语义层功能、方法论调研、测试系统优化、真实 CC session 测试强制、模型分工、solid 决策;核心句:「我很想确认之前的测试是否真的启动了 Claude Code;如果这一点没做好,会是一个很大的问题」) - BT-PROD-002:
adhoc_jobs/context_infra_base_tooling_buildout_20260615/requirement_records/BT-PROD-002.md(测试=确定层×语义层始终结合、两判断轴、专门判断 Agent+判断包五项输入、判决后要有下文、测试与 production 深耦合;核心句:「我们整个测试系统也应该时刻保持语义层和确定层的互相结合状态」)
(c) 实现逻辑 + 为什么有效
整套系统是一个闭环:registry 持应然 → 探针算实然 → join 出缺口 → 缺口喂给判断 Agent 出判决 → 判决被 landing 主门消费(挡收口)+ 缺口接头入需求脊柱(生成修复任务)→ 修复后记分牌翻绿。为什么有效的理论根子是本仓已验证的开环控制结论:执行者判不出「我做够了没」,误差信号必须来自外部、机械、可操作。本轮把这个原则物化到每一层——催缺注入点名缺什么文件(T1 实证 worker 仅凭注入完成修复)、判断 Agent 非 worked 必须给可定位反例(T3 负臂实证反例直指零实现文件)、记分牌缺口行自带可执行 intake 命令(F3 实证一条命令入队)。有效性的直接证据是它今天抓到并处理了六个真问题(F1 挤占/F2 硬耦合/F3 缺口/S8 提取器/污染假阳/台账冒名),其中三个是测试系统抓自己的问题——测试系统能测出测试系统的病,是「结合状态」成立的最强信号。(T3 负臂反例点名的零实现文件=tools/skill_router_hook/route_on_prompt.py 无 test_health 引用,判决全文 runs/r001_20260704_t3_semantic_gate/neg/verdict.json。)
(d) 变更前后对比
flowchart LR
subgraph BEFORE["改前:判完即止(Run3/Run4 收口形态)"]
direction TB
a1[campaign 收口时集中跑确定层证据] --> a2{{gate 判定<br/>regulator 19/20 默认 skip}}
a2 --> a3[报告叙事 + RCL 挂账]
a3 -.->|无下文机制| a4([缺口沉入报告<br/>Run4 CC 空白无人发现]):::dead
end
subgraph AFTER["改后:六段闭环(本轮建成并真实转过一圈)"]
direction TB
b1[(capabilities registry 应然<br/>gate_manifest.yaml)]:::added --> b3
b2[test_health 探针 实然<br/>runs 四 artifact + 通道三字段]:::added --> b3{{join:记分牌四格着色<br/>⚠ 通道不符 / ✗ 缺失}}:::added
b3 --> b4[判断 Agent 四值判决<br/>semantic_verdict + 判断包]:::added
b4 --> b5{{landing 主门 C5<br/>两层齐过才 landed}}:::added
b4 --> b6[缺口接头 todo intake<br/>预填命令入需求脊柱]:::added
b6 --> b7[修复切片执行<br/>→ 记分牌翻绿]:::added
b7 --> b2
end
BEFORE ==>|"本轮 delta:应然/实然分离 + 语义主门 + 判决后接头"| AFTER
classDef added fill:#e8f5e9,stroke:#2e7d32,color:#1b5e20;
classDef dead fill:#ffebee,stroke:#c62828,stroke-dasharray:4 3,color:#b71c1c;图说:改前的回路终点是报告叙事,缺口没有机械下文(Run4 CC 空白就是这样漏掉的);改后 join 出的缺口有两条机械出路——挡收口(landing C5,T3 负臂实证拦截)和入队修复(intake 接头,F3 实证一条命令入队),修复产物回到探针输入形成循环。delta 锚:tools/unified_gate/gate_manifest.yaml(capabilities section)、tools/test_health/scoreboard.py、tools/infra_core/semantic_verdict.py、T1/T3 臂(tests/TEST_RUNS_LEDGER.md)。
| 维度 | 改前(Run3/Run4 收口时) | 改后(本轮) |
|---|---|---|
| 分层定义 | 触发判据独大,功能内容散落 3 处,术语双义无人调和 | rules/ 单一真源:一个分界+两位点术语+四职能+反馈契约+2×2 矩阵 |
| 「测过没」的可见性 | 报告叙事+专项审计才能回答(Run4 CC 空白无人发现) | 记分牌 19 能力四格着色+通道谓词,Run4 模式=机器可见的 ⚠ 行 |
| 语义层验收 | regulator 默认 opt-out,19/20 自动路径 skip;「好不好」无执行件 | 判断 Agent 构件族+四值契约校验件+landing C5 主门;landing/solid_decision forced 升档 |
| CC 测试真实性 | 30 处真实但 93% 非原生后端、无通道纪律、Run4 零 CC | 通道三字段全链+claim_scope 限定+required_channel 着色+T1 原生臂 |
| gate catalog | 三真源打架、6 处前缀错、8 孤儿 | manifest 单真源 28 条+INDEX GENERATED 派生+一致性自检 4 断言 |
| 判决后的下文 | 无机制(判完即止) | 缺口接头 todo intake 预填命令,F3 上有机转了一圈 |
Look-back 自检清单
- [x] 第一段直接回答用户核心问题(三件事+CC 疑问的查证结果),不绕路。
- [x] 所有关键 claim 有可定位证据锚(ledger/runs/transcript/pytest 计数皆可复核)。
- [x] 测试计数、通道分布、失败率(5 跑 3 中→6/6)等数字与台账一致(IMPL_LEDGER/TEST_RUNS_LEDGER 交叉核对)。
- [x] 六个真问题如实列出(含 worker 台账冒名这类不体面事实),无掩盖。
- [x] claim ceiling 与证据强度一致(bounded 单 case,不冒领 production-final);残差全部挂账。
- [x] 去 AI 味自检过一遍(删模糊语、破折号句式收敛、术语该译则译该留则留)。