agent_task_gap_closure_theorem_20260522_manual
方法论库 · 引用级 · none
本页是 <code>contexts/methodology/agent_task_gap_closure_theorem_20260522_manual.md</code> 的逐字投影(仅隐私清洗,零改写)。
时点提示:本页是仓内文件 contexts/methodology/agent_task_gap_closure_theorem_20260522_manual.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。
报告元数据(frontmatter)
name: agent_task_gap_closure_theorem_20260522_manual
description: Agent/Task/Gap 闭合定理
domain: infra
consumption:
surface: none
trigger: ""
consumer: orchestrator
status: library
promoted_to: nullAgent-Task Gap Closure Theorem:Agent、任务与执行路径的闭包定义
Date: 2026-05-22
Mode: manual synthesis with sub-agent evidence review
Status: v0.1 research note
Version note: 本文件是新增 Y 级调研产物。下游无需改动;新增 Agent、Task、Agent-Task Gap 与 Realization Protocol 的闭包定理,用于后续 Definition Runtime、agent 编排、task contract 与 completion validation 设计。本轮不执行 git tag,因为用户未要求 git 操作,且本文件尚未进入发布载体。
0. 结论
交给 Agent 运行的任务,本质上不是一条指令,也不是一组步骤,而是一个有限调控容量的执行单元面对开放环境时的状态转化闭包问题。Agent 是被管理的执行单元,Task 是可验收状态转化要求,Agent-Task Gap 是二者不能自然闭合的差距;Realization Protocol 是闭合这个 Gap 的算子,Completion Fact 是这个算子的停止谓词。
最终定理可以压缩为:
给定 Agent A 与 Task T,若二者之间存在 Gap Delta(A,T),则可靠执行不是让 A 直接输出答案,而是构造一个 Realization Protocol P,使 P 在外部状态、工具、验证器、治理和人类 gate 的参与下,把 Delta(A,T) 转化为一条可审计轨迹,并收敛到 Completion Fact、bounded_incomplete 或 blocked 三种闭合状态之一。
这个定义的价值在于把碎片概念降维。Prompt、context、tool、sub-agent、harness、ledger、critic、budget、memory、bad behavior 都不是一级本体;它们分别是 Agent 的能力接口、Task 的约束字段、Gap 的子缺口,或 Realization Protocol 的运行部件。
1. Source Boundary
本报告是 synthesis-scale review,不是 full Large Context coverage proof。使用材料:
- 主报告:
methodology/llm_as_probabilistic_system_20260520_manual.md、methodology/agentic_task_ontology_20260521_manual.md、methodology/agentic_task_realization_20260521_manual.md。 - 材料包入口:
adhoc_jobs/agent_task_realization_20260522/notes/SOURCE_MANIFEST.md。 - Bad behavior 与 harness:
adhoc_jobs/llm_harness_kb_20260418/research/bad_behavior/current_integrated_catalog_20260503/00_entrypoints/CANONICAL_BAD_BEHAVIOR_FAMILIES.md、adhoc_jobs/context_compression_agent_books_20260515/reports/harness_management_dimensions_goal.md、rules/harness_guide/OVERVIEW_synth_20260418.md、rules/harness_guide/harness_05_completion_validation_synth_20260418.md、rules/harness_guide/harness_06_intake_runtime_governance_synth_20260418.md、rules/harness_guide/harness_07_task_split_capability_boundary_synth_20260418.md、rules/harness_guide/harness_08_context_injection_synth_20260418.md、rules/harness_guide/harness_12_observability_recovery_synth_20260418.md。 - 书籍 overview 与 draft index:
contexts/library/{sciences_of_the_artificial,human_problem_solving,introduction_to_cybernetics,how_to_solve_it,proofs_and_refutations,thinking_in_systems,brain_of_the_firm,managing_the_unexpected,sources_of_power}/process/BOOK_OVERVIEW.md与对应rules/skills/drafts/*/INDEX.md。 - 实践记录:
contexts/daily_records/claude/2026-05-06.md:28386到28421、contexts/daily_records/codex/2026-05-20.md:344988到346499、当前 Codex raw rollout[codex-path]。
Residual: 本轮没有回读九本原书全文;没有复核每个 IB leaf 的原始 session 证据;没有扫 Antigravity .pb、Cursor 或 search.py 未覆盖的聊天源。书籍证据以本地 distillation overview 和 draft index 为准。
2. 三个一级定义
2.1 Agent
Agent 是由 LLM、上下文、工具、权限、外部状态接口、反馈循环和治理规则组成的受管理执行单元。它能根据当前可见上下文生成候选判断与候选行动,并通过工具改变外部状态;它不能稳定自证事实、不能天然保持长期状态、不能独立承担责任。
形式化表示:
A = <L, C_visible, Tools, Perm, X, Feedback, Gov>含义:
L: LLM 或多模态/工具使用模型,负责候选生成。C_visible: 当前进入 attention 的上下文。Tools: 可调用操作接口。Perm: 权限和禁止动作。X: 外部状态接口,包含 filesystem、scratchpad、database、logs、memory。Feedback: tool observation、test result、critic output、user correction。Gov: runtime governance、safety、human gate、budget policy。
LLM 是 Agent 的生成内核,不是完整 Agent。第一份主报告已经把 LLM 定义为 attention-bounded、近似 stateless、非自证的条件概率 proposal engine;第三份报告把工具、状态、权限、反馈和治理纳入 Agent 定义。
2.2 Task
Task 是人类意图在特定环境中的可验收状态转化要求。它从当前状态出发,在有限预算和无限潜在上下文中选择足够相关的信息、方法和行动,将世界、文件、知识状态或决策状态推进到满足验收阈值的目标区域;若无法完成,则必须形成边界清晰的未完成状态。
形式化表示:
T = <I, S0, G_eta, C_infty, rho, Ops, M, B, V, Risk, Residual>含义:
I: human intent。S0: 当前真实状态。G_eta: 可验收目标区域,不是单点最优。C_infty: 原则上无限的潜在上下文。rho: 相关性选择策略。Ops: 可改变状态的操作。M: 方法论与控制策略。B: token、时间、钱、工具调用、人类注意力和风险预算。V: verifier 和 acceptance test。Risk: 不可逆性、安全性、价值冲突。Residual: 允许保留但必须声明的边界。
任务不是“要做的事列表”。任务只有在目标状态、当前状态、上下文 frontier、可用操作、预算、方法、验证器、风险边界、停止规则被写清后,才成为 Agent 可执行对象。
2.3 Agent-Task Gap
Agent-Task Gap 是某个 Agent 的可见上下文、训练内化能力、工具权限、状态接口、方法能力、验证能力和责任边界,与某个 Task 的目标状态、上下文需求、行动后果、验收标准、风险和资源约束之间的差距。
形式化表示:
Delta(A,T) = Required(T) - Capacity(A)这个差距至少包含:
context_gap
state_gap
method_gap
tool_gap
verification_gap
governance_gap
coordination_gap
memory_gap
budget_gapTraining-Task Gap 只是其中一个子类。真实失败往往发生在部署层:Agent 没有看到最新文件、没有合适工具、没有外部 verifier、没有聚合协议、没有停止条件,或没有把残余状态保存下来。
3. 派生定义:闭合算子与停止谓词
3.1 Realization Protocol
Realization Protocol 是为闭合 Agent-Task Gap 而设计的执行协议。它把 Task 转成任务合约,选择必要上下文和方法,配置 Agent/工具/sub-agent 拓扑,外置状态与证据,在运行中治理漂移与风险,并用独立验证决定完成或边界清晰地停止。
它不是第四个一级对象,而是 Gap 的闭合算子:
P closes Delta(A,T)更精确地说,P 定义一个任务状态转移函数 Phi_P:
z_k = <S_k, C_k, X_k, E_k, L_k, B_k, R_k>
Phi_P(z_k):
select context, action, method
generate candidate
act or observe through tool/agent
verify local effect
update external state, evidence, residuals, budget
return z_{k+1}其中:
S_k: 当前任务状态。C_k: 当前选中的有限上下文。X_k: 外部状态。E_k: evidence。L_k: claim、decision、trace ledger。B_k: 剩余预算。R_k: residual。
3.2 Completion Fact
Completion Fact 是 Task 的目标状态改变、验收证据、独立检查、残余风险声明和外部状态留痕共同成立的事实状态。它不是 Agent 的文本声明,也不是某个中间 artifact 的存在。
停止谓词:
Stop(z*) :=
Done(T,z*) OR B exhausted OR blocked
Done(T,z*) :=
S_k in G_eta
AND V(S_k, G_eta, E_k) = pass
AND independent_or_deterministic_check_performed
AND residuals_declared
AND state_persisted闭合状态只有三类:
complete: Done 谓词成立。bounded_incomplete: 预算或信息不足,但未完成边界、证据和下一步控制点清楚。blocked: 缺少用户授权、外部系统、权限或关键事实,Agent 无法合理继续。
4. Gap Closure Theorem
定理:一个 Agent 对一个 Task 的可靠执行成立,当且仅当系统能识别 Delta(A,T) 的主要分量,并构造 Realization Protocol P,使每轮状态转移满足至少一种收敛信号:Gap 减少、证据增加、不确定性边界变清、预算单调消耗触发停止、或升级到 human gate。若不存在这样的收敛信号,所谓执行只是文本延续或机制堆叠,不构成任务实现。
形式化:
Cl_P(A,T) = least fixed point z* of Phi_P over task state z
where Stop(z*) is true
and z* belongs to {complete, bounded_incomplete, blocked}这个定理把执行路径从 checklist 改成闭包关系。Intake、Task Contract、Context Frontier、Budget Routing、Method Selection、Decomposition、Agent Topology、Runtime Governance、Verification、Observability 都只是 Phi_P 的内部操作。它们是否有价值,取决于它们是否实际减少 Delta(A,T) 或让停止谓词更可判定。
5. 大鱼吃小鱼
本轮应保留的大鱼:
| 层级 | 大鱼 | 吃掉的小鱼 |
|---|---|---|
| 一级本体 | Agent | LLM、role persona、tool user、executor、critic、operator、memory owner |
| 一级本体 | Task | prompt ask、deliverable、context universe、budget、method、risk、acceptance |
| 一级本体 | Agent-Task Gap | training gap、context gap、state gap、method gap、tool gap、verification gap、governance gap、coordination gap、memory gap、budget gap |
| 派生关系 | Realization Protocol | task contract、context frontier、source manifest、sub-agent routing、prompt injection、runtime governance、observability、recovery |
| 停止谓词 | Completion Fact | done claim、PASS、file exists、zip exists、summary exists、self-check |
应降级的概念:
- Prompt 降为 context injection 的载体。Prompt 负责构造局部世界,但不能承担状态、验证、记忆和治理职责。
- Context frontier 降为 Task 的
rho和 Gap 的 context_gap。 - Tool 降为 Agent 的行动接口和 Gap 的 tool_gap。
- Harness 降为 Realization Protocol 的执行环境。
- Bad behavior taxonomy 降为 failure mode library,用来设计 verifier 和 governance。
- Ledger 类文件降为外部状态和审计工件。
- 多 Agent 角色降为 topology 参数。角色名没有意义,输入、权限、输出和验收才有意义。
6. 为什么过度零碎拆分是闭包失败
实践记录显示,过度零碎拆分的主要问题不是“子任务数量太多”,而是分解没有服从信息依赖、验证器和聚合闭包。
2026-05-06 的 bad behavior 目录治理记录显示,关键产物散落在 adhoc_jobs/bias_behavior/... 和 tmp/bad_behavior_organized_20260504.zip(历史路径快照;该主题目录 2026-05-07 已治理合并,本句为历史状态描述,非现行路径声明),主目录里只有旧物和空骨架。也就是说,artifact 已经生成,但 canonical entry、INDEX、版本管理和 single source of truth 没有闭合。这个案例说明:ZIP、文件数、目录清单都不是完成事实;它们只是 E_k 的候选证据,必须回到 Done(T,z*) 判定。
因此,分解必须满足五条硬条件:
decomposable(T) :=
subtask can obtain required context
AND subtask output is verifiable
AND dependencies are explicit
AND recomposition is more reliable than single-agent execution
AND coordination cost is lower than benefit如果拆分不满足这些条件,子任务越多,coordination_gap 和 recomposition_gap 越大。它看似增加执行吞吐,实际扩大了 Delta(A,T)。
7. 方法论来源的收束
书籍方法论不应平铺成九个并列框架。它们可以收束为三组子定理。
第一组是本体骨架:Simon、Newell/Simon、Ashby。
- Simon 提供 inner/outer environment、satisficing、state/process translation。
- Newell/Simon 提供 problem space,即 states、operators、goals、knowledge、tests。
- Ashby 提供 requisite variety,即 regulator capacity 必须覆盖 disturbance variety。
合成后得到:Agent 是接口系统,Task 是状态转化问题,Gap 是目标状态描述和可执行过程描述之间的 capacity mismatch。
第二组是执行协议:Pólya、Lakatos、Klein。
- Pólya 提供 understand、plan、execute、look back 的 phase controller。
- Lakatos 提供反例、guilty lemma、边界修订和 proof residue。
- Klein 提供 recognize、simulate、execute,以及 intent over procedure。
合成后得到:Realization Protocol 应先表征问题,再生成候选,随后通过执行、观测、反例和验收收束,而不是线性执行计划。
第三组是系统 verifier:Meadows、Beer、Weick/Sutcliffe。
- Meadows 检查 feedback、delay、boundary、goal proxy 和 leverage depth。
- Beer 检查 variety bottleneck、递归系统、lateral/vertical coordination、authority follows information。
- Weick/Sutcliffe 检查 weak signal、premature simplification、sensitivity to operations 和 deference to expertise。
合成后得到:复杂任务的 verifier 不只检查产物,还检查反馈结构、权威迁移、异常通道和恢复能力。
8. Bad Behavior 到 Gap 的映射
| 失败机制 | 对应 Gap | Protocol 控制点 |
|---|---|---|
| 目标、权威源、时间锚定失效 | context_gap, governance_gap | intake, task contract, source manifest, re-anchor |
| 完成状态 overclaim | verification_gap | completion validation, independent check |
| 证据替代与 oracle 污染 | verification_gap, method_gap | deterministic verifier, held-out evidence, claim ledger |
| 范围扩张与 silent simplification | governance_gap, budget_gap | non-goals, action boundary, residual ledger |
| 能力路由与任务粒度失配 | method_gap, coordination_gap | capability routing, decomposition test |
| context 注入和 sub-agent 边界失败 | context_gap, coordination_gap | context eligibility, sub-agent prompt contract |
| runtime drift、fallback 隐形化 | governance_gap, observability_gap | runtime governance, fallback ledger |
| artifact/state/recovery 不可见 | state_gap, memory_gap | artifact verification, state persistence, recovery plan |
| 保护性复杂化 | method_gap, budget_gap | root-cause review, mechanism pruning |
这一映射说明 bad behavior 不是一套平行本体,而是 Delta(A,T) 没有被正确识别和闭合时的表现。
9. Definition Runtime 的含义
Definition Runtime 不是把定义写得更完整,而是让定义触发运行规则。
最小运行规则:
When Agent recognized:
identify visible context, tools, permission, state interface, verifier boundary
When Task recognized:
build task contract with S0, G_eta, C_infty, rho, Ops, M, B, V, Risk, Residual
When Gap recognized:
enumerate gap components and bind each to protocol operation
When Realization Protocol starts:
maintain z_k = <S_k, C_k, X_k, E_k, L_k, B_k, R_k>
require convergence signal per meaningful round
When Completion claimed:
evaluate Done(T,z*) rather than accepting the claim
When Done fails:
close as bounded_incomplete or blocked with residual and next control point这套规则把定义变成接口。Agent 不是一个角色名,而是能力与边界的接口;Task 不是一句话,而是状态转化接口;Gap 不是抽象困难,而是 protocol design 的输入;Completion 不是报告语气,而是停止谓词。
10. 实用判定问题
用下面三个问题判断一套 Agent 任务定义是否真的成立:
- Gap 可计算吗?给定具体
A和T,能否列出Delta(A,T)的主要分量,并说明每个分量由哪个 protocol 元件闭合? - Done 可判定吗?能否把
G_eta、V、E_k和 residual 写成可检查条件,区分complete、bounded_incomplete与blocked? - Protocol 会收敛吗?每轮是否至少产生 Gap 减少、证据增加、不确定性边界变清、预算停止或 human gate 升级中的一种?
如果三个问题有任一答不上来,当前方案仍是概念框架、流程清单或 prompt 风格,而不是 Definition Runtime。
11. 最终定义
短定义:
Agent 运行任务的问题,是给定一个能力、上下文、状态、验证和责任都有限的执行单元,面对一个上下文无限、资源有限、目标依赖真实状态改变的任务,如何识别并闭合 Agent-Task Gap,直到形成可验证完成事实或边界清晰的未完成状态。
工程定义:
Agent-Task Gap Closure 是一个可审计的闭包控制过程:它把 Agent 与 Task 的能力差距显式化为上下文、状态、方法、工具、验证、治理、协调、记忆和预算缺口,再通过 Realization Protocol 选择上下文、配置工具和拓扑、外置状态、执行并观测、验证并治理,最终用 Completion Fact 的停止谓词判断 complete、bounded_incomplete 或 blocked。
更短版本:
Prompt 构造局部世界;Definition Runtime 用 Agent、Task、Gap、Protocol 和 Completion 的闭包关系,让局部世界持续接受状态、证据、预算和现实反馈校正。
12. Residual
- 本文件没有把该定理正式晋升为 skill。若后续落地,应创建
workflow_agent_task_gap_closure或并入workflow_controller_loop的 Definition Runtime 章节。 - 本文件没有提供 JSON schema 或工具实现。当前目标是概念闭包和运行语义,不是机械执行器。
- 对“过于零碎”的早期原话没有命中,实践判断来自 ZIP/export 任务、bad behavior 目录漂移、任务分解规则和 current thread 的综合证据。
- Full Large Context proof 仍需 source manifest、token budget、chunk ledger、first-layer reports、coverage audit、second-layer review 和 residual ledger 的完整工件链。