context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

production-readiness · 终报

Z3 全文↑ Z2 条目

轮次报告全文 · 逐字真源投影

← 返回报告库 · production 化推进

本页是轮次报告的逐字投影(仅隐私清洗,零改写)。渲染不了的元素退化为代码块原文。

时点提示:本页是仓内文件 adhoc_jobs/context_infra_base_tooling_buildout_20260615/production_readiness_20260704/FINAL_REPORT.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

报告元数据(frontmatter)
req_id: BT-PROD-001
req_id_2: BT-PROD-002
task_id: T1082
session_id: c2c220ad-32f5-4d1a-bb19-1b8616e4b84f
created_at: 2026-07-04
phase: BT-P5-close
doc_type: final_report
verdict: BT-PROD-CLOSED-BOUNDED-WITH-FIRST-REAL-EVIDENCE

BaseTooling Buildout production-readiness 推进 — 最终报告

一段话回答核心问题

你要的三件事都有了真实运行证据:分层重定义落成系统级真源 rules/DETERMINISTIC_SEMANTIC_LAYERS.md(一个分界原则、能力/检查两个位点、确定层四职能+输出反馈契约、2×2 判断矩阵覆盖判据);测试方法论基于 26 本库内软工书籍提炼成八条道层原则+六类模块术表(fitness function 治理/oracle 降级阶梯/STPA 触发分类/统计纪律/通道身份纪律/production 耦合),并全部落成可跑的件;你点名的疑问「之前的测试是否真的启动了 Claude Code」查清了——机械审计确认历史上 30 处 CC 派发声明 30 处全真(transcript 逐一回指验证),但其中 27 处跑在 GLM/Kimi 后端、只有 2 处原生 Anthropic 通道,且全部集中在 Run3 收尾 45 小时窗口内,Run4 修复轮零 CC 证据——这个「CC 外壳真、原生模型少、修复轮空白」的格局现在被通道身份三字段+记分牌通道谓词永久机械化盯防,今天的 T1 测试补上了原生通道臂。本轮收口判级 bounded-verified-build + first-real-evidence:建的每件都被至少一次真实运行消费过,但都是单 case 单日证据,不冒领 production-final。

做了什么(五阶段闭环)

P1 三路调查(research/):测试真实性机械审计(30/30 验证+通道分布+Run4 空白);分层定义现状盘点(9 处既有定义逐字对照,发现「触发判据独大、功能内容散落」+ 术语双义 + regulator 默认值两套矛盾语义);156 本书 manifest+26 本精读的方法论提取(5 条正交候选)。

P2 设计 + 对抗审查(design/):分层重定义 v2 与测试方法论设计由我亲做(多候选对比:记分牌真源三族+审查补录第四族,裁定 A 注册表+B 探针 join);独立 Fable 对抗审查给出 5 verdict + 4 必须修项(M1 四值契约校验件缺执行件、M2 覆盖判据自相矛盾、M3 着色无通道维度、M4 registry 塞 gates[] 会静默降级 live 白名单)——全部修入 v2.1/v1.1。

P3 八切片实装(impl/IMPL_LEDGER.md,全部主 agent 独立验收非信自报):S1 gate 单真源(28 条 manifest+INDEX GENERATED 派生+一致性自检);S2 PROMOTE-ONE(intake_gate 迁底座,产 base 契约缺口 4 条);S3 判断 Agent 构件族(judgment_packet+semantic_verdict 四值校验件+landing 第五察验+regulator forced 升档);S4 capabilities registry+test_health 记分牌(19 能力、通道谓词着色、缺口 todo intake 接头);S5 eval_harness 强化(通道三字段/claim_scope/isolation 单真源/transcript_sha 去重/--replicate/UCA/合成探针 schema);S6a 测试卫生(2 个 mock 不安全单测修复,断网可过);S6b 分层真源晋升 rules/;S7 判定类 worker phase-hook 豁免(修复 5 跑 3 中的判决挤占,修后 6/6 干净)。测试计数:本轮相关套件独立复跑累计 400+ passed。

P4 真实 CC session 测试(tests/TEST_RUNS_LEDGER.md,用户点名强制步骤):

P5 收口:solid_decision_phase 联动综合(9 closure×7 条 linked 联动、疑问 2 条补料闭环)过 gate SD1-SD4 全 PASS(regulator 真跑)。

测试中抓到并处理的真问题(测试系统在自证有效)

  1. F1 判决挤占(5 跑 3 中):regulator session 被 repo phase hook 干扰→S7 豁免机制当日修复+真实 2/2 验证。
  2. F2 oracle 硬耦合:eval_oracle 与 skill 场景绑死,phase 机制面只能手工组合判定(_oracle_form 全程留痕)→ 已入队。
  3. F3 注入接线缺口:记分牌自己暴露自己的最后一公里→已入队。
  4. 提取器缺陷现场修(S8):叙述+JSON 混排致首个真实判决 parse 失败→候选块枚举修复+回归测试,内容校验强度不变。
  5. 并发污染假阳:eval run 与实装 worker 并行导致 isolation 误报→逐文件归因+安静窗口反证,教训入 ledger。
  6. S4 台账冒名:worker 把「主 agent 亲验」写进我的台账→已当场更正并全量重验,署名纪律记录在案。

production-ready 判据现状(记分牌实况)

19 能力:68/76 格有效覆盖(89.5%)、⚠4(evolvable_workflow 仅 Codex 证据=Run4 模式现在机器可见)、✗4(F3 缺口)。六条审计收口条件:条件 2(K6 语义主门)本轮兑现(landing C5+forced 升档+T3 端到端);条件 5(gate 单真源+PROMOTE-ONE)本轮兑现;条件 6(注册 provenance)部分兑现(run receipt+commit 入 T3 正臂链);条件 1/3 靠有机使用积累(记分牌使其可观测);条件 4 显式 out-of-scope(intake 域)。

claim ceiling 与残差

BT-PROD-CLOSED-BOUNDED-WITH-FIRST-REAL-EVIDENCE:机械边全真实、每件被至少一次真实运行消费;单 case 单日,未跨任务积累;13 域全量按新方法论复测未做(是记分牌上的可见黄区而非盲区)。残差清单:BT-PROD-F2(oracle case 类型抽象)、F3(注入接线+T2 完整版)、15 gate 迁移债(S2 缺口清单为输入)、记分牌 covered 行误生成 intake 接头(小瑕疵)、判断 Agent 校准样本积累(长期)。全部在需求脊柱或 ledger 挂账,无静默丢失。


(a) 专业术语注释

(b) 原始需求:Prompt 逐字原文

两条需求的逐字原文(sha256 冻结)在需求脊柱:

(c) 实现逻辑 + 为什么有效

整套系统是一个闭环:registry 持应然 → 探针算实然 → join 出缺口 → 缺口喂给判断 Agent 出判决 → 判决被 landing 主门消费(挡收口)+ 缺口接头入需求脊柱(生成修复任务)→ 修复后记分牌翻绿。为什么有效的理论根子是本仓已验证的开环控制结论:执行者判不出「我做够了没」,误差信号必须来自外部、机械、可操作。本轮把这个原则物化到每一层——催缺注入点名缺什么文件(T1 实证 worker 仅凭注入完成修复)、判断 Agent 非 worked 必须给可定位反例(T3 负臂实证反例直指零实现文件)、记分牌缺口行自带可执行 intake 命令(F3 实证一条命令入队)。有效性的直接证据是它今天抓到并处理了六个真问题(F1 挤占/F2 硬耦合/F3 缺口/S8 提取器/污染假阳/台账冒名),其中三个是测试系统抓自己的问题——测试系统能测出测试系统的病,是「结合状态」成立的最强信号。(T3 负臂反例点名的零实现文件=tools/skill_router_hook/route_on_prompt.py 无 test_health 引用,判决全文 runs/r001_20260704_t3_semantic_gate/neg/verdict.json。)

(d) 变更前后对比

flowchart LR
  subgraph BEFORE["改前:判完即止(Run3/Run4 收口形态)"]
    direction TB
    a1[campaign 收口时集中跑确定层证据] --> a2{{gate 判定<br/>regulator 19/20 默认 skip}}
    a2 --> a3[报告叙事 + RCL 挂账]
    a3 -.->|无下文机制| a4([缺口沉入报告<br/>Run4 CC 空白无人发现]):::dead
  end
  subgraph AFTER["改后:六段闭环(本轮建成并真实转过一圈)"]
    direction TB
    b1[(capabilities registry 应然<br/>gate_manifest.yaml)]:::added --> b3
    b2[test_health 探针 实然<br/>runs 四 artifact + 通道三字段]:::added --> b3{{join:记分牌四格着色<br/>⚠ 通道不符 / ✗ 缺失}}:::added
    b3 --> b4[判断 Agent 四值判决<br/>semantic_verdict + 判断包]:::added
    b4 --> b5{{landing 主门 C5<br/>两层齐过才 landed}}:::added
    b4 --> b6[缺口接头 todo intake<br/>预填命令入需求脊柱]:::added
    b6 --> b7[修复切片执行<br/>→ 记分牌翻绿]:::added
    b7 --> b2
  end
  BEFORE ==>|"本轮 delta:应然/实然分离 + 语义主门 + 判决后接头"| AFTER
  classDef added fill:#e8f5e9,stroke:#2e7d32,color:#1b5e20;
  classDef dead fill:#ffebee,stroke:#c62828,stroke-dasharray:4 3,color:#b71c1c;

图说:改前的回路终点是报告叙事,缺口没有机械下文(Run4 CC 空白就是这样漏掉的);改后 join 出的缺口有两条机械出路——挡收口(landing C5,T3 负臂实证拦截)和入队修复(intake 接头,F3 实证一条命令入队),修复产物回到探针输入形成循环。delta 锚:tools/unified_gate/gate_manifest.yaml(capabilities section)、tools/test_health/scoreboard.pytools/infra_core/semantic_verdict.py、T1/T3 臂(tests/TEST_RUNS_LEDGER.md)。

维度改前(Run3/Run4 收口时)改后(本轮)
分层定义触发判据独大,功能内容散落 3 处,术语双义无人调和rules/ 单一真源:一个分界+两位点术语+四职能+反馈契约+2×2 矩阵
「测过没」的可见性报告叙事+专项审计才能回答(Run4 CC 空白无人发现)记分牌 19 能力四格着色+通道谓词,Run4 模式=机器可见的 ⚠ 行
语义层验收regulator 默认 opt-out,19/20 自动路径 skip;「好不好」无执行件判断 Agent 构件族+四值契约校验件+landing C5 主门;landing/solid_decision forced 升档
CC 测试真实性30 处真实但 93% 非原生后端、无通道纪律、Run4 零 CC通道三字段全链+claim_scope 限定+required_channel 着色+T1 原生臂
gate catalog三真源打架、6 处前缀错、8 孤儿manifest 单真源 28 条+INDEX GENERATED 派生+一致性自检 4 断言
判决后的下文无机制(判完即止)缺口接头 todo intake 预填命令,F3 上有机转了一圈

Look-back 自检清单


← 返回报告库 · production 化推进