reflection_decisions_visibility
project2026-07-19 思考与复盘 campaign:四悬案考古+决策台账回填+四设计收口+infra.guiming.net 状态站(多模型建版+Fable 交叉复审)
CC 自动记忆的摘要投影:标题 + 描述 + mtime + 源指针。正文不在站投影(红名单与 FORBIDDEN 双门)。
数据 as-of 2026-07-22
2026-07-19 思考与复盘 campaign:四悬案考古+决策台账回填+四设计收口+infra.guiming.net 状态站(多模型建版+Fable 交叉复审)
context-infra 深度挖掘 campaign(文件树/方法论复用/需求→DesignDoc 闭环/网站每日更新与 Git 同步审计)恢复入口与关键状态
天池/魔搭等阿里系竞赛页面把截止时刻按浏览器本地时区渲染(非北京),读时间前必先用 live countdown 反推核实
调研任务禁止单 agent 扛一个完整领域——每个领域内部必须以 Deep Research 状态多 sub-agent 化(主 agent 分面拆解→并行采集→合成),领域之间仍完全分离
用户 07-21 指示——问题记录分流真源不动、infra 站做待决投影看板、Base64 类工具痛点须入台账、考虑 context-infra 工具面日检、授权直接更新网站(符合规范前提)
2026-07-18 provider 链大改:家族-通道命名+新默认链+K3 1M+Codex 300K+Ollama 入链+key 安全化+健康探测 cron+Cursor 接入
并发共享 checkout 场景下 worker 禁用 git stash/reset/checkout——stash push 内含工作树 reset 会扫掉所有 session 的未提交改动
方法论体系建设 campaign 07-19~20 CLOSED-BOUNDED——四域体系建成+S4 讯飞快验流 H1/H2/H3 bounded 支持;碰方法论存放/自动读取/回路/术语/竞赛方法论验证话题先读
用户 2026-07-20 授权:Crontab 在所有 session 自由安装,不再需要用户逐次授权;HUMAN_GATE 类 cron 挂账即时解锁
用户 07-19 纠偏:phase 安排等信息收集齐后再定;独立方向分别派多个独立 Fable;用户说「已有的东西」先定位既有产物绝不新写
07-19 trace/base tooling 内部审计已交付;碰 error_ledger/receipts/注入指标/消费链话题先读
重构(原迁移)program 接续头——r006-2.0 基线→r007 首执行→r008 现状综合+三席终裁+透明化机制→r009 wave-1 活跃;碰迁移/重构/新根话题必从此接续
2026-07-09 用户指示:sub-agent 判断层主用 Opus,Fable 只在最关键决断时用
OS 级 Computer Use 的 macOS 权限矩阵(宿主=Ghostty):已授/待开/验证方法
"2026-07-16~17 设计哲学全量提炼 campaign:全历史 60,363 用户轮 → 5,358 observation → 17 席分维 → 总纲七元原则 + 12 题裁决包;常驻管线已建成待 cron"
用户裁定:任务复盘/经验总结类产物放产生它的 job 目录内,不进 contexts/survey_sessions
2026-05-30~31 从众调研(三层细化 survey→N0对照→框架隔离):从众=模型基线主导(净从众 haiku+0.42≫sonnet−0.24≈codex≈0>kimi−0.08,框架下kimi跌到−0.58)+框架小且模型依赖的次级效应(非干净harness门控;settings与persona已排除p=0.75;早期89%是churn假象);churn最普遍;可验证综合跨harness零=最强且模型无关解
"开环控制视角解释 agent 线性/偷懒/幻觉 (2026-05-31) — 对抗验证后裁定: 两个耦合根, 缺失误差信号是支点, 控制论是词汇非同构"
用户点名总结的「交互式迭代演进」方法论已落盘:以 session 为回合的七步闭环(方向→冻结→设计→裁定→落地→验证→交接),observational 级
反表演式勤奋方法论草案 (2026-05-30) — 可观测性条件化优化=偷懒统一根因; 三杠杆; Opus4.8卡片精确界定; 引用诚信校正
OpenCode 聊天记录 7 天归档机制——活跃库(近7天,轻量)+归档库(冷存,可检索),合并进 event-cleanup cron 持续更新;2026-07-16 初次迁移 17G→186M
"After dispatching parallel sub-agents, don't probe filesystem to guess progress; \"Error writing file\" usually means Read-first violation, not permission denial"
SHC C 批多 session 并发时共享 task 板重放幽灵 stage 任务;SSOT 是各 bundle RUN_LOG 不是 task 板
gate 的 regulator 报 no_json_object_found/UNKNOWN 时先查 dispatch 失败与解释器,不是 codex 散文或解析器;派发链需 Python ≥3.10
图示方法论系统×学习记忆知识系统 program(DLS):r001 完成需求冻结+32本书入库+solid decision(三层验证);两系统设计态待 r002 dogfood
opencode 1.17.18 上游 schema/code 不一致致 prompt 500;workaround = 给 session_context_epoch 补回 simplify 迁移删掉的三列
2026-07-11 过夜 campaign——测试系统现状整理(SHC×DLS融合)+需求膨胀溯源+最小单元测试方法论+Fable决策机制+需求分析系统验证;已收口 CLOSED-BOUNDED(cut 0),剩 7 项 HUMAN_GATE 待用户
2026-07-11 过夜自主 campaign:Base Tooling「高完成度低落地」根因审计 + 开发方法论 A/B 域对比与推广;含完整断点恢复档案
"系统现状体检(SHC)方法论 campaign 07-10——从\"测试系统整理+画图\"长成一套通用\"检查各系统现状\"方法论;设计闭环+关键机理+落地状态"
2026-07-10 r009 base tooling 状态检查+七域并行快速落地:Stop hook 双根因修复、phase 台账 tail 化、29 条需求 intake、provider 台账、额度看板
07-10 session 6fbe9174「输入输出污染」根因=模型编造非通道污染;诊断法=JSONL 双源核验;Stop hook 超时面 32%、cron 兜底对主工作树失明、fallback 静默缺口
"Non-obvious CC CLI flags for workspace-rule injection, session JSONL storage layout for sub-agents, and methodology for auditing rule-load compliance"
用户裁定:harness 已自带的属性不要再造 enforcement 层(receipt/机械核/provider 处理);一句正向指令+fallback 即可;多余核验=context 污染
磁盘反复填满时先查哪几个大头 + 各自安全回收法(opencode event 表是 recurring 主犯)
i2p round6(2026-07-04)内核首个 dogfood + 两子系统落实 + 信息获取深查的收口状态与坑
Run2 charter(07-01 立、07-02 修订):入口三分(编排=Codex/实现=CC/测试入口=CC)、生产化进回路经授权、13 域推到生产级使用态;第一任务=provider_routing 收尾
i2p round5(2026-07-04 下午)production 优化收口:模块接入协议 v0.1 立骨(MODULE.md 自描述契约)+ K4 深化成六 Phase 筛选压缩方法论 + 测试系统真接线(accept_driver 正负 run 双复现 ground truth);整体 bounded
BT-PROD production-readiness campaign(07-04 收口 bounded):分层定义 v1.0.0 晋升 rules/、2×2 测试方法论、判断 Agent 构件族、记分牌、T1/T3 真实 CC session 测试
Dark Context 系统 campaign(2026-07-04)完成态:全历史 session 需求挖掘 + AAU 评估 + 双层族设计 + 落地序;含挖掘方法论四条硬教训
base tooling 设计已完成(r006 P7 READY_FOR_CODE_SLICE);SSOT漂移骗了我两次=最该记的教训;推进=存放修复+P8切片
跨系统收口整理 campaign(07-05)——14 系统盘点+需求逐字冻结+决策点归拢 25 票 6 组 awaiting_user;hook/git 两 bug 真相与四座制度化桥
调用 Kimi/GLM/Ollama/Codex/DeepSeek 的唯一真源指针 + 非显然的结构性事实和防静默护栏
i2p round4(2026-07-04)双链隔离跨优化收口:内核 skill L0 落地+触发面 live、K1 前台提问协议替代文件议程、buildout i2p 透镜审计 13 findings + 收口裁定 bounded-not-closed
base-tooling 全量实现图谱位置 + 完整性机制 + 逮到的状态债(launchd/latent hook 等)
2026-07-08/09 skill 去重复查+清理已执行完;v1方法出假阳性→v2委托图法修正=0真重复;含可复用去重方法+根因教训
全仓文件夹作用地图 + INDEX 审计 + 组织策略 solid decision(2026-07-08,Codex Spark 扫描);含 Dark Context≠文件夹扫描器的核查结论与 ci_map 用法
需求→设计→功能设计→代码→landed 四层追溯的现状诊断与优化设计(分析态,只分析不实现)
2026-07-05 跨系统根因分析 campaign:为什么多轮交互仍未建好(六根因)+ 测试系统重定位 D 族提案 + design protocol v0.1 草案 + hook timeout 根因;四波编排(6 侦察→3 收口 Fable→总收口 Fable→主 agent 亲写)
判 partial/未完成时别把语义层能判的划为「非测试」、别把历史能挖的划为「等真实使用」
本仓库多 session 并发时,Stop-hook autocommit 会把已 git add 的文件扫进任一 session 的 commit;手动 commit 须 add&&commit 单次原子链接
BT buildout r003 全域落地夜跑(2026-07-07):38 open 清障+测试平面点亮+判定全独立化的收口配方与数字
用户 07-05 裁定的决策权分配:人只给高层方向,执行路径 agent 自主;问人触发=确实不确定且细节关键;不关键多方案则自动测试择优
需求分析×任务拆解×Context隔离整体系统 program(r001 设计 + r002 实现验证均 complete):三病诊断+三层合成 D1.0.1;r002 七切片 landed + V1-V6 全证据,三 deferred 带谓词
Run5 落实 campaign(BT-RUN5-001/T1090):13 域推到可见性/可用性实处;07-05 凌晨夜跑收口 RUN5-CAMPAIGN-CLOSED-BOUNDED(13/13 域 landed+13+1 审查+反哺);真源=Run5/PLAN.md+CAMPAIGN_REPORT.md
Run3 收口当天的独立战后评估结论:建造高保真/投产未达、确定层武装率是主缺口、试金石链每边断、可见性分层重判
2026-07-03 git 自动提交系统治本重设计:混合方案已定稿,S0-S6 当天落地,S7-S10 影子期后切换
空间/堆积类问题用户要求从源头(生成机制)控制,提高清理频次的建议被明确否掉
base tooling buildout Run1 执行模型 + S0/S4 验金石findings + 裁定/嵌套/隔离三机制;续build读这个
buildout 真实 Session 评估机制建成(harness + 工具 + skill + dogfood 正负对照闭环)
Codex 卡/热/崩溃 = BUG-016 复发;统一根因+诊断捷径+live 止血手段
全 13 域设计优化 job(2026-06-20 起),工作目录 + 状态 + P4 交接,纠正 F0817 单域试点
跨域意义 R4 refinement(双刃剑/导向·移出·防御)+ 两 session 结构性 drift 证据 + 域整合执行方案 + runtime 试点
"用户确认的核心原则——判定权/误差信号外移:LLM 算不出自己做够没做对没((d) 根局限),所以「够没对没记没退没」的判定权必须从执行者搬到确定层(零熵机械谓词)+第二个独立 agent(语义),不靠自评。"
2026-06-18 buildout 需求记录机制完善 + 需求→DDP 自动填充落地,含独立验证抓 Codex 自报完成的方法论实证
2026-06-17 落地 adhoc_jobs 低摩擦重置机制 + git 权限全局去摩擦;git_guard 现全局 token 匹配三档(可恢复放行),relocate 工具上线
fa adhoc job 文件架构 schema(fa-1→fa-3 演进,现行 fa-3 SSOT);两级需求分离/报告锚定/过时化规范真源;context_infra_base_tooling_buildout = 文件系统 SSOT(2026-06-17 整合落地)
2026-06-16 orchestration 重设计——平铺→深度回路;确定性控制壳+分离审查lane+薄planner;三方跨模型收敛;决策已锁;现进落地段
CC 全套 hook (git自动提交/规则/skill/receipts/phase) 迁到 Codex+OpenCode,2026-06-17 部署 live
2026-06-16 Kimi 编排整夜运行的验证结果与两个 infra flag(claude:high→kimi 端点继承、交互式 orchestrator 权限死锁)
2026-06-15 ongoing 任务——默认链 Codex 优先 + 统一到 OpenCode + GLM 1M + provider 内自动版本管理;含通道端点差异等关键发现
2026-06-15 第二代按领域×多模型实现效果审查;暴露 CC-channel worker 被 phase-hook 劫持 + router parse-error 误判等 dispatch 基础设施缺口
"infra 生产化 program(T857)——99 条基线+4 原语+S0-S8 全切片 verified(四阶接力审计);production=bounded to harness 域;gateway live 双侧已兑现(用户装 crontab);reports/ 报告集+报告合规审查。06-13 需求补全(844277f2):扁平 baseline→6 域设计需求文件(REQUIREMENTS_DESIGN+requirements/design/,3145 行,新增 file_system 域),relevance workflow 591 判/460rel/~270new(上界),独立审计 verbatim~72%+7 修;过程 job production_push_requirement_supplement_20260613;follow-up=完整 fa-1 adoption/verbatim 全量升级/MC3 全量"
2026-06-13 工具/skill 更新演进 workflow 设计程序:更新=闭环控制,三正交误差信号源(结构/行为/意图)=家族A/B/C,observational,Codex 切片 S-1~S-7 待派
2026-06-12 Codex 配额冲刺:卡队列+检查闭环编排,4+2 条 codex:high lane 派发,状态与接手方法
phase/skill/trace runtime 2026-06-11 功能性复核裁定——functional-usable 非 production-final,跨管线真实消费已发生,缺口与优先序
执行序 v2 (infra_execution_reorder_20260610) 接力链进度与 requirement-record 机制状态
迭代修 bug 时用户要求加可复用资源/机制,禁特异化补丁;以可复用性+实现有效性主导方案
2026-06-10 R3 三级运行形态定案(Codex 入口/tmux 主 session/pause_at_boundary/skill 跟工作走)+ 四轴分析 + registry 挖掘
2026-06-10 phase 推进停滞根因(cwd 漂移+故障静默)修复 landed + eea4a058 自愈实证 + Goal-Loop 定时唤醒机制
2026-06-10 审计 phase/skill/trace runtime(3c0f2caf 构建)vs 用户愿景 R1-R16 的裁定、缺口清单与使用现状
"phase/skill/trace 运行时纠偏后的交互式 frame + step-1(session 分派)+ step-2(观察面:phase 状态 lib + trace phase 标签)落地;含\"使用环境≠实现机制\"的漂移教训"
三层运行时统一机制(Phase 安排/Skill 确认使用/Trace 记录)已 landed + 真实端到端验证;用 workflow_phase_skill_trace_runtime skill 跑多 phase 任务
2026-06-08 landing A/B/C/D 运行模型重设计落地新权威主目录 landing_run_model_20260608/ (A-CC-centric);supersedes v63/segment_d_feedback_loop;所有 Codex automation PAUSED;5 轴独立验证全 TRUE
2026-06-08 CC/Codex 运行时 skill 注入·trace 环境调研:两条 CC 自动边 + 注入通道真相 + Codex 空白 + sub-agent 注入不对称 + L1 task_id 闸门
"Mid-session authorizations that name a DIFFERENT task than the one this session owns are not yours to execute; transcribe/flag, don't act. Supervisor hard-corrected T811 live-crontab contamination from a T812-only session."
"L0→L1 最后一公里状态 + L1 自然路由脆弱性发现 (half_A 记录已落地, half_B staged 演示未闭环, 用户定 L1=被动积累指标)"
把 AAU 注入机制落进 Design Doc Protocol、造一套设计落地方法的垂类测试(goal-driven,进行中)
"运行时\"转向/pivot\"要分语义层(模型判断该做什么)vs工具层(failure guard);工具层只作低层信号不上升 phase 转向;真实环境测试是运行时能力验收"
"架构/非trivial 设计 SPEC 要多候选对比(2-3 solution families)+harness_refs/bad-behavior 接地+solid-decision+对比测试计划,不是单一首选设计+confirm 问题"
landing 串行执行 loop 已端到端跑通; Codex 调用具体机制 + 两个操作陷阱(CWD漂移/双重后台丢完成事件); guardian 拉起的自主 worker session 运维约束(权限须启动前预配/固定注入吃掉大半context预算→单任务早交接); run003实证预配不够——续跑旧session继承启动时旧settings(只在启动加载不热重载)→改过权限必须启动全新session+权限探针,否则连续撞墙零推进; run006~042实证guardian死循环(41轮6h零推进)根因=setting-source不匹配(allowlist在local源/启动--setting-sources排除local/project源settings.json不存在); receipt ready_for_new_session置11轮全无效(run034 grep坐实daemon从不读回该字段); 终结杠杆(run042)=改daemon每轮必读的state.json顶层mode→paused_*(line616 idle不spawn),state.json是普通数据文件会话内可写; 2026-06-04解阻塞业务session(用户启动权限正常,非guardian worker)真正打破41轮停滞=换到能跑python3的session而非修guardian,串行loop landed段A头两件语义层(T648 manage-unexpected道skill+premature_block检测器 / T709 design_doc SOP+check_completeness检测器),按共生+独立判配方(主agent写语义层skill+配确定性检测器[确定性壳判结构给字段:行号/第二agent regulator判语义给可操作反例,V1-V6]+派Codex实现+主agent亲跑亲读+held-out独立验regulator);新陷阱=Codex sandbox cli_agent通道常失败(app-server拒/ConnectionRefused/未登录)→主agent主环境补跑regulator兜底,router.py返回字段result_text非result;四确定层工具已提交(更正guardian run003-019 untracked旧快照); 2026-06-05段A完成7单元进段B(manage-unexpected/4工具语义层/landing消费链checker[landing_gate+promotion adapter T756]/RA-01末件): RA-01需求分析质量+消息覆盖(skill workflow_requirement_analysis_quality+检测器requirement_analysis_gate)真实数据verifier抓2 bug(正则\b在this_session_xxx.md下划线嵌入id失效误判主源零覆盖+我自建manifest误标a70869de)+复现d5d8961f覆盖塌缩(MC3列13零覆盖含真实漏掉W/N两簇)+抓11条衍生锚provenance缺口+RC4实证报告(c)证据backlink须写段内非指别段; 2026-06-05段B已landed P-01(phase框架)/X-07(solid_decision阶段)/道术路由L-04~06/V-01(session_claim_audit审查机制)/V-07(deferred_verification延后核验状态机,运行底本handoff v27); 两条新可复用教训: ①检测器某check只在相关marker存在时该apply的必须显式返回not_applicable否则假FLAG正常case(V-07 DV2漏gate误伤每个正常todo done,独立review才抓到),held-out除空壳负样本还要造"不在该机制流程的正常样本"负控; ②check类gate(…_gate)的landing_gate消费边=被它语义层skill的收口纪律调用(skill正文要显式写"跑check.py --task <id>"调用),claim别写反成"X消费gate"否则判registry_only(V-07初判registry_only补skill收口调用+正claim转real_consumption); 2026-06-06段B应用层审查4条landed(审pipeline自己):T679 claim-vs-reality 20单元17correct/3partial/0wrong无overclaim+消费边14skill仅3写收口命令 / T677+T685覆盖枚举SHAPE(召回证明+第二agent独立重算,非claim门) / T678月度bad behavior裁定精确两半=新landing真落地(17/17工具IN-HEAD/0掩盖/14skill 13个L1)但既有实现断层backlog(蒸馏0晋升40-57-20不变/B harness/protocol/Gap定理全VERIFIED-SAME)未动+诚实度增强(8流0纯掩盖唯loop_trace:682空壳); 可复用:审查既有分析时批判透镜用在其自身数据精度(抓05-30审计axioms46→44)+DC4抓claim范围超source粒度(24单元过宽→逐个git cat-file收窄)+sub-agent over-recall必亲核(E2「0done」误报); 2026-06-06 段B V簇收口件 T676/V-02复盘审查理念landed(SHAPE③复盘/meta非claim-audit非枚举),V-02~11审查簇全部完成→转机制残件(S-07/S-08/I-05/P-02~07非Phase5/T703);复盘三子项证据化结论(ledger9条5correct/3partial/1wrong过DC4一轮9/9grounded):05-30审计理念稳健(预定义靶/双向举证/诚实度轴)但单Opus当自己oracle(axioms正文46→亲跑实44自身未检出)+覆盖选择式非证明式,已演化(D-01/V-01比05-30晚5天入库/新机制反抓旧错);顺序经三模型跨厂商盲排独立验证(codex/GLM/Kimi收敛同段A/D)但机制化滞后(load_pipeline I-04→Phase2矛盾live到06-05才修);Solid Decision不对称(定序用了审计单Opus没用)+Large Context演化(ad-hoc5簇scan→characterize_universe覆盖证明);统一论点=装独立误差信号处可靠/让单agent当自己oracle处出盲点(05-30两数据错+覆盖缺口是新实例,用户「浮于表面」准确指后者,接[[project_open_loop_control_theory]][[project_anti_performative_diligence_methodology]]);三新可复用教训:①act-on-finding改required-reading/高引用文档且下游按行号引用它→APPEND不INSERT(插顶部/中间移位下游所有引用)②SHAPE③复盘选门=data_check_review_gate(失败模式=泛泛复述,对症DC2源溯源+DC4真核vs复述,非强套是失败模式匹配;复盘meta自指也过独立DC4)③regulator stderr turns=0/tokens~0是codex exec通道报账quirk非hollow run(对照已知真实.out同格式+duration真实+returncode0逐条verdict排除,区别于通道失败UNKNOWN); handoff v34 work 0c96ef66e+回填14eaeb918+docs 72adb8fe2; 2026-06-06 段末GS-02用量台账审查T775 landed(SHAPE④=claim-vs-reality+coverage hybrid,复用check_discipline+usage_hook不另造机制,ledger8条DC-1~8 correct2/partial4/wrong2过DC4 8/8grounded):created语料(12工具+22道skill)对账receipts.jsonl裁定**均未达cross-context L1、不晋级**——12工具D1非零真调用但receipt 90.5%空task_id(集中gate的check.py调用,scaffold带T-id证可填)+含自测污染fixtures/tmp/3工具intake_gate·requirement_analysis_gate·ci_map record()已接但0调用=receipt层orphan/skill用量全在usage_hook live窗口06-05→06-06=within-pipeline自指无cross-context L1/deferred_verification doc 0读gate却16次;统一论点=created+registered≠landed,within-pipeline自指≠L1,不blanket摘Bounded=反usage inflation;三新可复用教训:①**within-pipeline自指≠cross-context L1**(usage_hook只覆盖pipeline运行期→现有skill用量全自指,审查者读skill去审用量又被记成使用=自指inflation现行实例;晋级靠后续真实独立任务自然累积)②**DC4/regulator非确定性靠具体event_id grounding收敛不靠重跑**(同ledger 5轮跑出不同verdict分布,收敛=每条claim落具体event_id/file:line+derived/decision item引原始directive+被改对象真实标记行不引其它DC-x+双判断item拆单判断[DC-1调用/DC-8自测]+verdict=unknown空counterexample多半claim超证据或双信号混淆)③用量审查pin usage_hook live日first(0 receipt≠orphan:分真孤儿vs hook前用过);act-on-finding不晋级(裁定本身=最重要输出)+入队T776(确定层工具record()普遍不stamp task_id:check_report_completeness本有--task 1行可修/gate加--task或捕获TODO_ID/清自测receipt)+surface orphan不砍+过程缓解=workflow loop跑gate前export TODO_ID;无req_id内部任务report_scaffold报错→手写报告套同样(a)(b)(c)(d)+Look-back段头,check_report_completeness --task仍按task解析;运行底本handoff v37(取代v35);2026-06-06 **T776 task_id wiring landed**(record()抗删行seq=max(line_count,max_existing)+1+fixtures/tmp+空task_id自测自动隔离selftest_receipts.jsonl[空artifact的skill-read永不隔离=守canary]+12 gate/checker加--task thread进receipt task_id[record()早有TODO_ID环境兜底优先级meta>env>空,真洞在caller无显式入口]+真源迁移26自测污染work 42b4c422b回填209c1ca59;surface pre-existing dup TR-000103/104被引用保留不renumber);**T704/P-05 actionable信号嵌入审查 landed**(段B机制残件首条,SHAPE①子型=审某属性是否跨一组检测器/产物均匀成立:枚举15 detector家族全集+逐个亲读regulator原始源代码判V3-compliant,12离线gate+3起源[F2/F5/premature_block]全产可定位反例非1-bit,data_check_ledger DC-1~15 correct+DC-16 runtime注入半[REF-010注入方法/agent运行方法]unverifiable顺延Phase5,DC1-4 PASS 15/15 grounded+RC4 real_report PASS,work aeb49f00c回填47e71ca64;关键发现=P-04/P-05均已嵌入workflow_phase_framework[P-04理论母体:30/P-05约束3:36],故P-05非从零是确认残差);三新可复用教训:①**审查代码属性机械grep字样假阴**(措辞差异landing_gate C4用'name the missing real consumer'/文件位置差异check_discipline D4住check_discipline.py非check.py)→grep只枚举候选+定位,判定亲读原始源代码段(REGULATOR_PROMPT全文),data_check_review支柱1[数据回原始源不读派生]在代码属性审查上的实例②**诚实梯度不糊成correct**(SA4/DM4修复方向隐式vs其余10显式,均清V3核心[定位缺陷≠1-bit]判correct,梯度标在ledger evidence非笼统判过)③**T776 task_id wiring实证live in production**(本session gate跑出7条task_id=T704 receipt:check_report_completeness/todo/data_check_review_gate);下一条=P-04/T703充分性控制回路对账(理论母体,残差=phase_framework:99点名'未与60条对账',bounded coverage-audit非redesign,上手用phase_framework+requirement_analysis_quality框'对账什么算够');接[[project_anti_performative_diligence_methodology]][[feedback_llm_classifier_nondeterminism]][[project_verifiable_checkpoint_experiment]]; 2026-06-06 **P-04/T703充分性回路对账landed**(双轴枚举143需求+25 session,回路骨架6段全实例化+2缺口[边际增益门/surprise探针]+2 partial,普适bounded,DC4 13/13+RC4 PASS,work 1c1f2d4fd)→**段B机制层收口,转段C Phase5北极星**(用户2026-06-06 AskUserQuestion选);**段C Phase5设计盘点landed(T777)**:转段决策=先实读核段B残件(S-07主任务T646已landed/X-04·06即§5段序/X-07即T671/I-05即recall_first_locate)确认渐空,再AskUserQuestion把方向交用户;4并行盘点sub-agent(**纠正2f378f5b指针=该session实为F2/F5检测器非Phase5设计,真意图在d5d8961f[S-07/08/09]/43826bc3[RI-01/02]/98c28ab1[R6-c非线性]**)+主agent亲写三层设计文档design_docs/T777_phase5-staged-injection-runtime.md(DC1-4 PASS+报告RC1-4 PASS,work d5ecc4963+docs 9b87c8450);设计=Phase Runtime薄编排层驱动controller_loop Task Phase Plan复用AAU aau_v2(ledger/review/final_boundary/context_gate已跑通,Daemon 7触发点未实现)+UCR(role粒度静态注入bounded)不重写,5缺口[G1 phase-aware动态注入/G2非线性pivot/G3 hook E-04-05/G4充分性信号含两T703缺口/G5方法论RI-01-02]→4切片+方法论(消费边定序),第一切片=线性phase loop(G1+G4 exit-gate backbone)Layer-3完整,slice2-4+方法论只Layer1-2;状态PARTIAL实现未开始,**3架构决策待用户确认**(①线性先非线性后接受否②第一切片选线性phase loop还是先做E-04 hook③AAU+UCR薄层基底认可否);三新可复用教训:①**转段时先调研后问**(同段残件薄→先实读确认段渐空,再把需用户设计context的真分叉交用户surface一个战略AskUserQuestion,别manufacture薄审查/对账只为land点什么避问=表演式勤奋;phase边界单次战略问≠频繁停下问)②**handoff/二手指针回原文核**(handoff说设计在session X可能不准,2f378f5b实例;用provenance/extract_session_text.py抽user/asst-only防runaway,=回原始源核在handoff指针的实例)③**设计盘点活动配方(§9.5①''')**(phase边界产三层设计供用户定夺:并行盘点sub-agent[用户意图/资产inventory/需求全文]+主agent亲写三层[Layer1五格各heading/Layer2架构+职责表+决策表含rejected/Layer3 ADDED-MODIFIED-REMOVED]+check_completeness DC1-4[chore无req_id手写套结构,design_doc_scaffold要req_id会报错]+实现前停待用户确认架构决策点;landed=设计过门+进HEAD+停确认点,实现是后续gated-on-确认的unit);运行底本handoff v39
2026-06-05 段A(断言A)记录线审查裁定 — 工具记录2/8覆盖·skill记录0·E-01/02/04/05未落地·landing_gate C3 staged盲点
"下\"太大/做不到/不可能\"这类否定性确定结论前必须找对照验证,与\"完成声明要核验\"对称"
"handoff 必须自包含可运行(所有机制写进去不靠\"参照旧版\");当前情况只说 phase 到哪;需求不重列(在 order);纪律即机制"
2026-06-04 诊断 landing 执行序/todo-intake 反复做不好 + 大模型怎么产生 insight;统一根因=确定层有完成信号/语义层没有→agent satisfice 在确定层
landing pipeline Phase 1 (To-do 底座) 已 landed —— 队列已存在、dispatch 是消费接头、下一步是建消费它的 workflow
context-infra 存放/版本/Beta 架构重构(landing 11 条 A-01~RR-01);核心杠杆=本质/派生状态分离;切片A(ci_map)已落地验收
2026-06-02 用户对落地执行的重排序 + 上一轮 workflow 复盘的关键纠正(含我方 overclaim 自纠)
"别把\"收到的需求 + 用户对我的要求\"写进最终产物;等权/定序是怎么想/怎么裁定,不是文件内容"
2026-06-02 复杂情况 LLM 防御方法 交接 prompt + 三根因 + 漂移教训 + 执行(F2 数字溯源检测器验证通过 bounded + 道 skill workflow_complexity_drift_detection)
查"用户在某 session 里提了什么需求"必须读该 session 的 raw user turns; 蒸馏产物/survey 报告只记 agent 做了什么(完成态),不记用户工作中途临时提的新要求点。两者查不同问题,不可互替。覆盖任务必须盲抽 raw user turns 再对账。
"实跑实验 (2026-05-31, Codex驱动) 测反表演式勤奋的\"verifiable checkpoint\"候选 — 决定性发现:外部误差信号必须可操作(actionable)才有效"
"需求等权,严禁拿prompt被提及的先后(recency)当优先级;实现顺序只从依赖+连续性(谁先做出来喂后续创建)来;整体性合并所有轮次(含正在跑的session)需求;先逐字记录原话当锚→分类→联动→定序,不用主agent转述代替原话"
"信息收集召回的杠杆是枚举/定位步骤的召回工程纪律,不是 locate/read 阶段拆分(对照实验证伪+证实,bounded)"
2026-05-31 Library Distillation 书内 token-flow 信息保留实测 + 两个伤口 + 回望=误差信号 + 道术矩阵 prototype
"2026-05-31 15线程核验+串行路线图; git是\"坏\"(BUG-008死锁)非\"脏\"; R7是唯一跨线资产+PROMOTE-ONE首选; 串行 P0修机器→P1 commit R7→P2晋升门→P3 AAU/Loop→P4知识层→P5运维/文档"
"2026-05-31 用户定执行模型: 主agent只编排(需求分析/分类/功能定义/时序),不直接执行; 实现交Codex(codex:high=GPT-5.5 X-High); Opus做关键决策; 高任务量/高困惑度下先主动gather(Codex多维+读旧需求文档+盘运行中session)再提议,别过早问窄问题"
"2026-05-31 调研裁定\"Agent 原生数据范式\"假设 — 朴素版被证伪(熟悉JSON输出反伤推理)、三格式面相反、bounded optimum、机制未证、两子命题speculative"
2026-05-30 道/术分层 skill 融合架构决策 + Library Distillation 画靶射箭/过度设计取证
2026-05-30 决定如何借鉴花叔系 skill(女娲/仓颉/达尔文)+ skill 有效性测试/使用数据/优化机制设计
R7 real-scenario test of the 道(guidance)-skill trigger fix — deployed works on real cases (floor 0 → deployed 9/12) but bounded; synthetic 4/4 was overfit; stability ×3 quota-pending
审查类任务用户要的是过程合规(有没有按我的需求/用我要求的方式做),不是结果质量评判;跨 DD2525 复现 + AAU/Loop 实证的复现失效——停在分析/声称、不进实现+客观验证,完成判断(成功/失败都)不经外部核验不可靠
"2026-05-29 调研裁定\"多轮=熵累积\"假设:是方差爆炸非线性衰减、有界平衡非无限累积、需求锚点有效但有界;接 skill 矩阵环节3/4缺口"
"\"在不同 unit 给不同 agent 注入不同 context\" 现状: 2026-05-29 注入侧从声明层落地为可执行机制 UCR(unit_runtime_unified_mechanism_20260529),经 Opus 4.8 盲审+两轮修复+真实 kimi 验证;TIER-1 真实有效/TIER-2 仅确定层;detect 非 prevent"
"Give sub-agents full output paths (never `.../`); verify sibling paths + read full run log before declaring a sub-agent silently failed"
用户在瑞典斯德哥尔摩;display 用本地挂钟时间(CET/CEST 自动切换),不要假设 UTC+8 北京时间或硬编码偏移。
同一 LLM 同一输入两次跑出不同结论;audit 中 sub-agent 自身有 over-recall bias;pattern classifier 一刀切的盲点
User-enforced pattern for large-context exhaustive scans — multi-agent time window decision upfront + mechanical enumeration separated from LLM classification
context-infra architecture after 2026-04-06 redesign — directory structure, data flow, tooling, recent work through 2026-04-15
Recurring AI failure patterns in complex extraction/analysis work, with triggers and prevention strategies — catch them before the user does
How 张乐轩 (等天黑) works with AI — identity, preferences, corrections observed across sessions
adhoc_jobs/llm_task_fitness/ — user-supervised S-001~S-004, autonomous S-005+; 2026-04-16 reframing: methodology is an executable injection system, not a document. Binary success criterion. Type 4 classification gap identified
Quantitative benchmarks on how many constraints an LLM can reliably follow — foundational data for agent task design, pointer to the 2026-04-14 deep research
WeChat → Claude Code dispatch subsystem at adhoc_jobs/weclaude/ — v2 TODO-first coordinator live since 2026-04-11, Phase 1-6 code changes may still be in progress
Approaches proven effective through actual use — autoresearch, Judge E2E, Scope Anchoring defense, CASCADE rename, three-layer distillation, Anti-Anchor Protocol, compliance audit
When asked to review/audit, produce observations and judgments, not improvement plans or next-step roadmaps. Dispatching multiple sub-agents for a review task is F4.
Sub-agents without mandatory rule injection operate at 40% compliance — use system-level injection, not prompt reminders
Reason from grapeot's framework; extensions now validated but must serve the core mission; never delete original SOP content without explicit instruction
User demands thorough execution of complex tasks. Don't mark done prematurely, don't mix deliverables, verify your own output before presenting.
Any workspace tool using pycookiecheat (Chrome cookies) MUST run under /usr/bin/python3 — Homebrew python3 is a different binary without the "always allow" grant
Three tools for video/audio download and transcription — bilibili_download, video_download, audio_transcribe — including which Python interpreter each requires
How to use remindctl CLI for TODO sync — installed path, auth status, list name, key commands