buildout w5B · 语义召回补收口
轮次报告全文 · 逐字真源投影
本页是轮次报告的逐字投影(仅隐私清洗,零改写)。渲染不了的元素退化为代码块原文。
时点提示:本页是仓内文件 adhoc_jobs/context_infra_base_tooling_buildout_20260615/runs/w5B_semantic_recall_main_20260707/RECORD.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。
主编排亲做记录 — 语义层判定 + 历史案例挖掘(w5B 补收口)
- 作者:w5B 主编排(Fable→Opus 4.8)
- 触发:用户纠正——判 partial 时别把语义层能判的软性纪律划为「非测试」、别把历史能挖的真实案例划为「等真实使用」
- 工具故障声明(诚实前提):本轮先后派 4 个 background Fable sub-agent(reg-reuse/recall-hist/reg-reuse2/recall-hist2)做语义判定与历史挖掘,全部卡在 idle 循环、连强制「第一步写骨架文件」都不落盘(同 session 更早的 6 个 Fable agent 均正常落盘,判为此刻 background Fable 产出面的临时故障)。不在坏工具上无限重试,改由主编排亲做,并相应下调 claim ceiling(独立性降级)。
一、语义层判定:软边界 UP-92 / XC-02 / XC-03(主编排自判,observational)
独立性诚实标注:主编排既是本 session 的任务设计者又做判定,判本 session 自己的实现有自证倾向。ceiling 收到 observational,不作为翻 landed 依据,只作语义层已判的记录(回应「软边界该用语义层判」的方法论要求)。判据 = workflow_design_elegance 新机制验收四问 + 做减法信号。
| 机制 | 四问要点 | 做减法信号 | verdict |
|---|---|---|---|
| SD5(0612d5684) | ①满足 XC-18+联动 XC-27/28 ②SolidDecisionPhaseShell 承担,与 SD1-4 同 Finding 聚合边不打补丁 ③对所有 solid_decision phase artifact 成立=可复用 ④单 gate+organic 点火都验过 | 无(给既有 gate 加谓词,非新建 gate/hook) | reusable_mechanism |
| RC6(b8d311b50) | ①一谓词覆盖 XC-42+XC-20(合并类似需求=XC-02「类似功能合并」的正面实践)②ReportCompletenessShell 承担不碰 RC1-5 ③对所有报告成立 ④真实报告 T654/T700 验过 | 无(给既有 gate 加谓词) | reusable_mechanism |
| single_source_scan(2d9a7655c) | ①UP-94 检出面 ②与 deprecation.py 标记/authority.py 断言三职责分离不重叠 ③P2 GENERATED 豁免=对所有含 GENERATED 区注册表成立的可复用降噪,非只为 INDEX 打补丁 ④真实扫描验过 | 新建目录但有 XC-07 反驳(无既有仓级扫描器),不是「加新不删旧」 | reusable_mechanism |
对 UP-92/XC-02/XC-03 的语义证据:本 session 三个机制全部是可复用机制而非特异化补丁,RC6「一谓词覆盖两需求」是 XC-02「合并类似功能」的正面实践。反例:未发现特异化补丁。但这是编排者自判(observational),三条保持 partial——语义层判定做了(回应方法论),但独立强度不足翻 landed。翻 landed 仍需独立 regulator(工具恢复后重派)对本 campaign 实现做施测隔离判定。
二、历史案例挖掘:recall-first 挖之前已发生过的(主环境亲验历史)
XC-35 Draft→Production 晋级链路 —— 建议翻 landed(bounded)
recall-first 直接翻案:batch3 judge 判 partial 的依据是「receipts.jsonl 里 promotion_gate/promote_one 字面 0 回执 + drafts→production 零完成例」——但那只查了台账字面,没挖历史 run。历史里有真实案例:
adhoc_jobs/landing_requirement_decomposition_20260531/production_skill_20260601/PROMOTE_ONE_recall_first_CODEX_REPORT.md:promote_one/promotion_gate.py 真跑通,作用对象是真实 draft skillworkflow_recall_first_locate(非 fixture),确定性 recall recompute(judge-only GT|GT|=42,不用作者 scores.md=frame 检查+读隔离),独立 verifier(Codex 非作者),claim ceiling 映射(bounded_real_condition_validated),晋级结论 HOLD(eligible_for_production=false,诚实拦截)。- 这满足 XC-35 收窄谓词「≥1 例走 promotion_gate 留痕 + 道八步序≥3 步判定记录」:走了 promotion_gate(validate-recall-experiment,exit 0)+ 八步序里 frame 检查/读隔离/确定性 oracle/独立 verifier/ceiling 映射多步有执行记录。HOLD 结论恰证明晋级链路真实工作(能拦不够格的),不是链路不存在。
- 补强:
contexts/tool_receipts/receipts.jsonlversion_evolution 618 笔回执,07-07/07-08 仍在用(workflow_version_evolution.md)=演进/晋级机制持续真实使用。
ceiling bounded:单个历史案例 + 结论 HOLD(走通链路但未实际晋到 production)。判定者 = 主环境亲验历史案例(w5b_main_recall_opus),非本 session 实现的自证。
XC-39 信息收集贯穿 —— 证据充实,保 partial
- 后半句「挖掘核心思想→设计对比实验」历史丰富、跨天、campaign 外:
large_context_skill_fusion_codex_20260501/experiments/loop_019..036_git_v4_candidate_extraction(多 loop 候选抽取对比)、large_context_compression_method_loop_20260523/skill_candidates、daily_records 命中「对比实验/多候选」跨 2026-03-25/05-04/05-15/05-30/07-04 五天。这些证明「先调研→提炼→设计对比实验」是历史贯穿实践。 - 但前半句 info_gather_gate 流形态(info_manifest→gate)历史里仍仅本 session 1 个(gate 是新工具)。收窄谓词的「≥3 gate 流实例跨天」这个特定机械形态没被历史满足。
- 结论:贯穿性实践面历史成立(evidence 大幅充实),gate 形态机械回执仍单点=残差。保 partial,谓词收窄到「gate 形态跨天积累」这一款。
P1A-NEW-010 设计做减法 —— 旁证充实,保 partial
- 历史设计产物大量「做减法/反过度工程/更精简设计」自觉实践:file_architecture_unification/infra_production_push/buildout_real_session_eval/session_task_taxonomy 等 design/ 目录命中。这是 design_elegance 注册前「这个纪律本来就在实践」的旁证。
- 但收窄谓词要「注册日(07-07)后真实设计 worker 引用四问/做减法自检」——历史旁证是注册前的,不满足「注册日后」这一款。保 partial,evidence 补旁证。
三、方法论小结(回应用户纠正)
用户纠正的两点都兑现了:软边界 UP-92/XC-02/XC-03 用语义层 design_elegance 四问判了(不再当「非测试」搁置,只是工具故障导致 observational);XC-39/XC-35/P1A-NEW-010 用 recall-first 挖了历史(不再当「等未来」)。其中 XC-35 因历史案例够强直接翻 landed——证明「回头挖之前有过的」比「干等新真实使用」有效。其余充实了证据但诚实保 partial(强度不足翻),收窄谓词各自明确。