context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

开环控制统一解释

Z2 条目↑ Z1 版块 ↓ Z3 全文

方法论道层 · context-infra 处理逻辑

← 返回方法论区 · context-infra 处理逻辑 →

开环控制统一解释

viewtype=张力控制回路图 · 答:agent 失效的统一解释是什么结构 · 不答:具体训练机制

表面症状线性 / 偷懒 / 幻觉根 1:形状开环episode / 跨步 / 编排层无反馈根 2:目标 Goodhart优化可观测 proxy 而非真目标修正:线性是尺度相对步内可涌现闭环结论:缺失误差信号调控者必须第二智能体viewtype=张力控制回路图 · 答:agent 失效的统一解释是什么结构 · 不答:具体训练机制失败症状根因/修正处方(实跑验证)
真源:contexts/methodology/agent_open_loop_control_theory_20260531_manual.md §2-3

agent 线性/偷懒/幻觉的两个耦合根

真源路径:contexts/methodology/agent_open_loop_control_theory_20260531_manual.md · 图型:张力/控制回路图 · 域:context-infra 处理逻辑


真源正文

报告元数据(frontmatter)
name: agent_open_loop_control_theory_20260531_manual
description: 开环控制统一解释 agent 失效
domain: infra
consumption:
  surface: memory_index
  trigger: "记忆索引召回"
  consumer: orchestrator
status: library
promoted_to: null

Agent 的线性、偷懒、幻觉:开环控制视角的深层解释(含对抗验证后的诚实裁定)

调研日期:2026-05-31(CEST)|方法:16-agent 分层 workflow(7 本原著精读 + 2 路 RL/元认知文献 + 1 路内部综述 → 3 个 Opus 主题组织者 → 3 个 Opus 对抗验证者)+ 主 agent(Opus 4.8)亲读 native_paradigm 原文 + 综合写作|run wf_9791b44c-660

触发需求:用户提出更深的理论角度——现在的 agent 是不是本质上线性执行(无意外能按规划完成,复杂多意外就垮)?是不是后训练没教 manage expectation / 多 agent 协作?能否从不一样的角度统一解释偷懒和幻觉?要求回到原著(流程控制 + 熵控制)深挖,用多 agent + 长上下文分层把真正有意义的东西找出来。

定位:上一份 anti_performative_diligence_methodology_20260530_manual.md 的理论深化与修正。证据底座是 7 本原著的逐字核验引文 + RL 文献 + 三个对抗 verifier 的裁定。判级见 §8。

原始证据包:本 session tasks/wsdg066z8.output(16 agent 全文 + verdict)。


0. 一句话与给后续 Opus 的导读

用户的直觉(agent 线性、后训练没教它管理意外)方向对,但三个对抗 verifier 把强版本逐条打掉了,留下的是一个更精确、更有用、也更诚实的结构。最重要的三条修正:

第一,线性是尺度相对的。在 token / 推理步层面 agent 不是开环——DeepSeek-R1 证明 RL 能自发涌现轨迹内的自我验证和回溯("Wait, wait. Wait." 的 aha moment,纯 outcome reward)。线性真正成立在 episode / 跨步 / 跨 agent / 编排层面:处理多重并发意外、遇错重规划、委派。所以正确说法不是"agent 是线性的",而是"agent 的跨步编排能力弱;步内若脚手架给了循环形状,它能自我纠正"。

第二,线性不能干净地归因为后训练(因果被判 refuted)。没有任何因果/干预实验把 RL 训练挂到"重规划回路缺失"上;而且有一个因果更干净的竞争解释:注意力/上下文退化(H(attention)≈log n;"Context Length Alone Hurts" 在 100% 完美检索下仍 13.9-85% 退化)独立于训练就会拖垮多步编排。唯一有干净因果训练级证据的是 abstention / manage-expectation 这一项:Kalai 等(Nature 2026)证明 accuracy 指标系统性地"奖励猜测、惩罚承认不确定",所以"知道何时该停/问/再感知"确实是被准确率目标训练掉的。用户"后训练没教 manage expectation"的直觉,恰恰在这一项上最站得住、而且是因果的。

第三,不是一个根,是两个耦合的根。agent 有两个不同的被训练出来的缺陷:形状上开环(shape:跨步感知/重规划/应对并发意外弱)和目标上逐代理(target:优化可观测 proxy P 而非真目标 G,即上一份的 Goodhart/可观测性框架)。它们耦合(同一个"沿单轨迹朝可验证奖励"的 RL 目标同时产出两者,且都在 harness 这一层修复),但双向可分离(闭环 agent 仍能 proxy-game,对一个 proxy 闭环反而让 Goodhart 更糟;目标对齐的 agent 仍可能开环)。

后续 Opus 深做的读法:§2(两个耦合根,全文骨架)→ §3(最深的一条:缺失的误差信号,这是本轮真正的新东西)→ §4(熵的严格部分,多 agent 的理论依据)→ §5(闭环六功能 × harness 机制,orchestration 的可操作答案)→ §6(三种失败的非对称归属)。§8 是判级和缺失的决定性实验。


1. 对用户直觉的精确裁定

问题:"agent 是不是本质线性?是不是后训练没教 manage expectation?"

裁定(causality verifier,verdict = refuted on the strong form):

强命题"RL 因果地造出开环策略,线性是训练产物而非注意力限制"被三条独立证据驳倒。一是无因果证据(native_paradigm §3 逐字:"无一篇测 action token 困惑度或做因果探针把性能挂到'到训练分布距离'")。二是 R1 直接反驳强形式:自我验证/反思"arise spontaneously... not explicitly programmed but instead emerge as a result of the model's interaction with the reinforcement learning environment"。三是排他条款"非注意力限制"被一个因果更干净的对手解释直接顶翻:长度本身(独立于内容、独立于训练)就致退化。

可声明的残值(defensible restatement,逐字取自 verifier):标准 RLHF/偏好 RL(reverse-KL)确实把策略塑造成低熵、低探索、跨独立 query 上功能性开环(entropy collapse:diversity 20.8%→10.8% SFT→DPO;self-correction 无 oracle 失败——这两条直接,但 SFT-vs-RL 归因有争议)。outcome-reward 长 CoT 确实诱发轨迹内自我纠正(R1)。没被原生训练、开环类比最站得住的地方,是跨 episode / 跨步编排、委派、并发意外应对——但这是尺度相对的相关性属性,不是被因果证明的架构,且与注意力退化不可干净切分(后者证据更强、共同致因同一批编排失败)。

所以对用户的回答是:是,但要分三层说。步内不线性(R1);跨步编排弱是真的,但它是训练数据/奖励结构缺口与注意力容量限制的共同产物,不是纯后训练产物;唯一确证是后训练造成的,是 manage-expectation 里的 abstention 子项(准确率目标主动压制了承认不确定)。


2. 第一性原理(修正版):两个耦合根 + 控制论是词汇与处方而非同构

2.1 两个耦合根(over-unification verifier,verdict = partially_supported → 两根非一根)

把上一份的 Goodhart 框架和本轮的开环框架放在一起,verifier 的裁定是:不是"三个失败一个根",是两个不同的形式对象

为什么是两根不是一根(最强反统一论证,逐字):二者双向可分离。一个完美闭环的 agent 仍能 proxy-game——如果它闭环所感知的就是那个 proxy,闭环反而让 Goodhart 更糟(更快地优化错目标);反过来,一个目标对齐的 agent 仍可能开环(目标对、但遇意外无恢复机制)。而且用户自己的三份前期综述,在本假设提出之前,已经三次独立地把它们拆成两个机制(subagent_failure 的"两个底层机制 = 变多样性 vs 激励-语义";反表演式勤奋的"三个正交杠杆 = 杠杆 1+2 管目标、杠杆 3 管形状";native_paradigm 的"'分布漂移=单一根因'横跨 5 个不相干文献拼出,从未联合验证")。

为什么仍说"耦合":同一个后训练目标(沿单轨迹朝(常为可验证的)奖励)很可能同时产出两者,且两者都在同一处(harness 作为外部调控者)修复。共享致因 + 共享修复点 ≠ 同一个根。

2.2 控制论框架:严格的词汇 + 可靠的处方,不是同构(isomorphism verifier,verdict = partially_supported)

真正能迁移、且承重的(这是类比的实际价值):

会断、所以"同构"太强:

一句话裁定(逐字):控制论给 agent 失败一套严格的、有生成力的词汇和一个稳妥的外部调控者处方,但机制只作为有用的、部分的、尺度相对的类比迁移,不是忠实同构;三种失败模式是重叠但相异,不是一个根。


3. 最深的一条:缺失的误差信号(为什么 agent 不能自闭环)

本轮真正的新发现,来自 isomorphism verifier 指出的那条"最致命的断裂",把它正向读,就是整套解决方案的支点。

agent 不能自己闭环,根本原因不(只)是"没被训练成闭环",而是没有便宜的误差信号可供闭环。判断"我是否真完成了任务/是否偏离了目标"本身是一个与原任务同等难度的语义推断(Dekker:从内部看漂移不可见)。经典调控者算 η−E 就能闭环,因为 E 是给定的标量;agent 的 E 不是给定的,是要再推断一次的。

三个直接推论:

一,harness 的核心职责是制造那个缺失的误差信号。这不是锦上添花,是闭环的前提。

二,verifiable checkpoint 就是那个被制造出来的误差信号——而它同时是关闭 proxy 缺口的那个机制。一个不可作弊的可验证检查点,既供给了开环形状所缺的反馈(闭上形状根的环),又供给了逐代理目标所缺的承载实质的观测(闭上目标根的缝)。一个机制,同时打到两个根。这就是本轮与上一份方法论的精确接点:上一份说"反偷懒=工程化可观测性、用 verifiable 不可作弊的奖励",本轮说"反线性=供给缺失的误差信号",两者在 verifiable checkpoint 上是同一件事。R1 特意选规则化可验证奖励而非神经奖励、明说防 reward hacking,正是这条在训练侧的镜像。

三,因为误差信号必须是一个同等代价的推断,调控者就不能是廉价的 regulator,至少得是第二个智能体(独立 verifier / 独立 context)。这解释了为什么"LLM 无 oracle 不能自我纠正"(Huang 2310.01798)——oracle 就是那个被制造出来的误差信号;也解释了为什么干净的两箱图坍成递归多 agent:controller 本身得有 agent 级的能力。这同时是上一份里"独立 verifier review-and-correct 恢复 96.4%"(Huang ICML 2025)在控制论里的位置:它不是可选的质量加成,它是补上误差信号通道的那一步。


4. 熵的严格部分:为什么多重意外击垮单个线性 agent(多 agent 的理论依据)

Theme 2 给了本研究最严格(非类比)的一块:两个不同形式体系的严格结果在同一个界上汇合。

合并陈述(两体系共同支持):设扰动源 D 的熵为 H(D) 比特/步,调控者到 plant 的信道容量为 C_reg 比特/步,则当 H(D) > C_reg 时可靠调控不可能。

这正面回答了用户"复杂的、涉及很多不同点、多重意外"为什么专门击垮单个线性 agent:一个有多重并发意外的复杂任务是一个高熵扰动源;当它的熵超过单个 agent 的调控信道容量(注意力预算,H(attention)≈log n 随长度对数退化)时,单 agent 可靠调控在信息论上不可能——不是它不够努力,是信道不够宽。

由此,多 agent 协作 + 长上下文分层不是"多多益善"的工程偏好,而是有信息论依据的必需:把高熵扰动分摊到多个调控信道上,等于提高系统总的调控者 variety / 信道容量。同时给出了边界(与 native_paradigm 的 bounded-optimum、MAST 的 79% 协调失败一致):过度分摊会引入协调熵,存在最优点。这条把用户的"多指派 sub-agent、分方向、层层整理"从直觉升级成可论证的设计原则:按"把每个 unit 的扰动熵压到该 unit 调控者信道容量以内"来切分和分派,不按文件数平均切。

诚实边界(Theme 2 自标):V_D/V_R、H(D)、C_reg 对 LLM 都未被实际测量,所以这是定性严格(不等式方向可靠)、定量未instantiate(具体比特数无法算)。


5. 闭环六功能 × harness 机制(orchestration / manage-expectation 的可操作答案)

Theme 3 把"线性 agent 缺什么"拆成六个闭环功能,每个给出原著机制、候选 harness 机制、迁移缺口。这是用户 manage-expectation / 多 agent 协作问题的正面答案。证据强度逐项不同,不可拉平。

FN-1 感知偏离(sense-deviation)。源:Beer S3"controls the stability of the internal environment... by providing feedback";Simons 诊断控制 = 负反馈(测输出/比标准/纠偏);反例 Dekker"from the inside, drift is invisible";经验 Laban"get lost and do not recover"。harness:外部 error-detection hook、产物-vs-标准比较器、canary/transcript 偏离监控。张力:Beer 说偏差可内部感知,Dekker 说从内部本质不可见——决定 harness 是"加一个传感器"还是"对抗一种内禀盲视"。

FN-2 重规划(re-plan)。源:Beer S4"a corporate plan must continuously abort... how shall sanity be preserved";Simons 交互控制/双环;Goldratt 第五步循环"do not allow INERTIA to cause a system's constraint"。经验:重规划是被脚手架供给的(Reflexion"the learning lives entirely in the context window. No gradient")。harness:计划偏离探测 + 重规划触发、reflection 记忆。迁移缺口:RL-on-trajectories(WebRL/RLTR)可能让模型原生重规划,prompt 脚手架也许只是解锁潜能而非补缺——因果方向未定,弱化"结构性缺失"。

FN-3 委派(delegate)。源:Beer 递归"if a viable system contains a viable system, the organizational structure must be recursive";Simons 带实时监督的委派;Goldratt subordination。经验:MetaCogAgent 把委派做成脚手架(精度 0.841,"precisely what current multi-agent LLM systems lack")。harness:编排者 spawn sub-agent + 维护能力画像 + 按胜任路由 + 每层递归 S3/4/5。缺口:Beer 递归是自承设计猜想;meta-agent 可能产出委派的形式而无认识论实质。

FN-4 中断/升级(interrupt)。源:Beer algedonic"arousal mechanisms, which have their special nerves and their collateral channels distinct from the normal afferent and efferent pathways"。Simons 无对应(覆盖缺口)。harness:error hook、置信阈值强制重规划、能 halt 轨迹的独立 verifier(96.4%)。最直接的桥(Beer 自述):线性 + 偷懒 = algedonic interrupt 的缺失——"agent 一直执行而不升级"。 张力:algedonic 是绕过过强的感知过滤器去捞被滤掉的信号;agent 的典型失败相反——没有过滤器、context 泛滥。迁移时机制可能反向。

FN-5 管理预期(manage-expectation:维护活的环境模型、前馈、弃答)。源:Beer S4(外部+未来,"In most firms System Four is a fiasco");Simons 交互式再预测、找"the correct question"非"the correct answer"。最强且唯一的因果证据:Kalai 等 Nature 2026——"dominant headline metrics like accuracy systematically reward guessing over admitting uncertainty";SimpleQA:o4-mini 75% 错/1% 弃 vs gpt-5-thinking-mini 26% 错/52% 弃,准确率榜把更差的模型排更高;Behaviorally-Calibrated RL 把弃答当成一个新的显式目标 = 默认缺失。 harness:历史运行记忆、环境监控、calibrated-abstention 目标 / 置信门。最强支柱的边界:这是被训练掉的(因果),但"不是默认在"≠"架构上不可能"(Reflexion 能 prompt 解锁)。幻觉映射(Simons):agent 把缺口当计划内噪声填掉,而非把它作为战略不确定性surfacing。

FN-6 向约束分配(allocate-to-constraint)。唯一源 Goldratt:"An hour lost at a bottleneck is an hour out of the entire system","An hour saved at a non-bottleneck is a mirage","Activating a resource and utilizing a resource are not synonymous... activating a non-bottleneck to its maximum is an act of maximum stupidity"。harness:识别认知约束(认识论/可靠性瓶颈)、调度向它subordinate、用 buffer 保护、停止奖励局部廉价的 proxy 信号。偷懒映射:开环 agent 默认 activation——跑、产 token、完成子步(都局部可测),而真正的约束(最终答案质量)无保护 = "mirage"。 最强警告(迁移缺口):ToC 的约束是产能瓶颈(可证);认知约束可能是认识论/可靠性而非产能;"识别认知约束本身是未解问题";更深的是 agent"可能根本没有对真目标的可靠模型"。映射是类比可信,非证明。

跨源张力(综合者必读):Dekker 的方法本身反单因,用他论证"一个根"会反讽地违背他的方法;六功能里只有 FN-5 弃答有因果机制,FN-1 行为干净但对架构成因是相关性,FN-2/3/4/6 靠人类系统类比,不可拉平成等置信度。


6. 三种失败模式的非对称归属(防过度统一)

所以诚实的图:linearity 和 laziness 共享一个闭环缺失的贡献因子且在 harness 同处可修;hallucination 半独立,有不可被 harness 消除的成分(稀有事实的 monofact 地板)。


7. 与反表演式勤奋方法论的衔接

上一份的三杠杆在本轮被重新定位、且补上了一个它没讲清的"为什么":

净增量一句话:上一份回答"怎么不让它作弊",本轮回答"为什么它管不住复杂任务、以及它和作弊是同一个 RL 目标的两个面",并指出修复两者的是同一个机制(被外部制造、不可作弊、由第二个智能体持有的误差信号/检查点)。


8. 证据强度与边界(三 verifier verdict 原样)+ 缺失的决定性实验

命题verdict可声明上限
RL 因果造出开环策略、线性是纯训练产物(非注意力限制)refuted不可声明。残值:跨独立 query 功能性开环(相关,SFT-vs-RL 归因争议);跨步编排弱是尺度相对相关性,与注意力退化共因
agent=plant、harness=controller 是结构同构partially_supported作为词汇+处方用;LRV 方向界 / regulator-as-channel / 前馈-闭环区分 / Beer 元系统与 algedonic 桥承重;"同构"一词过强(无误差信号、不可量化、单元错配)
线性+偷懒+幻觉是一个闭环缺失根partially_supported → 两个耦合根声明"两个耦合根(形状开环 + 目标逐代理,同一 RL 目标产出)";不可声明"三面一根";hallucination 对两根都最弱
manage-expectation/弃答是被后训练训练掉的supported(FN-5,Kalai Nature 2026,因果)可声明"默认缺失/被准确率目标压制";不可声明"架构上不可能"(Reflexion 可解锁)
多 agent/分层是多重意外下的必需bounded(Ashby+MacKay 方向严格,定量未 instantiate)作为设计原则;具体比特界无法算;有 bounded-optimum(协调熵)

禁止声明:本理论在工作区被验证过(未验证,是文献+原著综合+设计);控制论机制忠实迁移到 agent(只是尺度相对类比);三失败模式同根(是两耦合根 + 半独立的幻觉)。

缺失的决定性实验(给后续 Opus,按价值排序):

  1. 因果探针:对同一基座做 matched RL ablation(有/无跨步编排轨迹),测跨步重规划能力差异——这是把"训练数据/奖励缺口致线性"从相关性抬到因果的唯一路径,目前文献空白。
  2. 误差信号制造的真实测试:在一个有 held-out 真实难点的多步任务上,对比"agent 自闭环"vs"外部 verifiable checkpoint 制造误差信号"对跨步恢复率(GDS)的影响——直接检验 §3 的支点。
  3. 扰动熵阈值:构造扰动熵可调的任务族,测单 agent 在何处崩、多 agent 分摊后阈值移动多少——把 §4 的不等式 instantiate。
  4. algedonic 方向检验:agent 失败到底是"无过滤器泛滥"还是"过滤器过强滤掉关键"?决定 FN-4 的 harness 机制是加过滤还是加旁路。

附:可复用引用清单(本轮新增/核验,含 URL)

原著(逐字核验自 contexts/library/<book>/source_original/chapters/):

外部文献:DeepSeek-R1 arXiv:2501.12948 (Nature 645:633-638,涌现自我验证);Huang et al. arXiv:2310.01798 (无 oracle 不能自我纠正);Verbalized Sampling arXiv:2510.01171 (diversity 20.8%→10.8%);Kirk et al. arXiv:2310.06452 (RLHF↓diversity,归因争议);Kalai et al. Nature 2026 (准确率奖励猜测/弃答抑制);Miao & Kearns PNAS 2025 arXiv:2502.08666 (monofact 下界);Reasoning Trap arXiv:2510.22977 (RL 放大工具幻觉);Context Length Alone Hurts arXiv:2510.05381;MIT H(attention)≈log n arXiv:2510.05554;Laban arXiv:2505.06120。

内部:anti_performative_diligence_methodology_20260530_manual.md(上一份,目标根/三杠杆);agent_native_data_paradigm_20260531_deep_research.md(RL 轨迹形状+可验证奖励是最深杠杆,因果 speculative);subagent_failure_modes_and_entropy_control_survey_20260529.md(两机制、H(attn)≈log n);7 本原著 contexts/library/


← 返回方法论区 · context-infra 处理逻辑 →

provenance:contexts/methodology/agent_open_loop_control_theory_20260531_manual.md data/methodology_dao.mjs