context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

agent_supervision_context_drift_prevention_20260407_manual

Z3 全文↑ Z2 条目

方法论库 · 引用级 · none

← 返回方法论库索引 · 返回方法论区

本页是 <code>contexts/methodology/agent_supervision_context_drift_prevention_20260407_manual.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 contexts/methodology/agent_supervision_context_drift_prevention_20260407_manual.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

报告元数据(frontmatter)
name: agent_supervision_context_drift_prevention_20260407_manual
description: 大上下文 agent 监督机制编目
domain: infra
consumption:
  surface: none
  trigger: ""
  consumer: orchestrator
status: library
promoted_to: null

Agent 监管机制:大 Context 任务中的焦点维持与 Drift 防御

Date: 2026-04-07
Skill: manual (deep research agent)
Topic: Supervision mechanisms for LLM agents in large context tasks


方法论列表(按实用性排序)

1. Attention Budget / Context Engineering(注意力预算)

来源: Anthropic, "Effective Context Engineering for AI Agents", 2025-09
https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents

核心机制: 将 context window 视为有限的注意力预算(attention budget)。Transformer 的 n^2 注意力复杂度意味着每增加一个 token 都会稀释对其他 token 的关注度。核心原则是"找到最小的高信号 token 集合来最大化期望输出的概率"。实操上分三层:compaction(对话摘要压缩)、structured notes(外部持久化存储关键状态)、sub-agent delegation(子任务用独立 agent 处理后只返回浓缩结果)。

适用场景: 所有涉及长时间运行的 agent 任务。尤其适合从大量文件中提取信息时,通过 just-in-time data loading 替代预加载所有文件,保持 context 中每个 token 的信号密度。这是最基础也最普适的机制,其他方法都可以看作在此之上的具体策略。


2. Progressive Checkpointing / Durable Execution(渐进式持久化)

来源:

核心机制: 将 agent 的中间结果在每个有意义的步骤后持久化到外部存储(文件、数据库),而非仅依赖 context window 内的对话历史。核心思想来自分布式系统的 durable execution 模式:每个 tool call 的结果、每个阶段性结论都写入磁盘。这样即使 context 被截断或 session 中断,agent 也能从最后一个 checkpoint 恢复。LangGraph 的 checkpointing 机制和 Temporal 的 durable workflow 是两个主要实现框架。

适用场景: 直接对应"大 context 信息提取"任务中的信息丢失问题。当 agent 读取 50 个文件后,早期文件的提取结果可能因 context 溢出而丢失。将每个文件的提取结果立即写入中间文件(而非仅留在对话历史中),可以完全消除这类丢失。这也是 context-infra 现有的 bestpractice_large_context_extraction 中"分层处理"原则的工程化落地。


3. Task Contract Pattern(任务契约模式)

来源:

核心机制: 在 agent 开始执行前,将任务目标、约束条件和验收标准写成一份结构化"契约"文档。agent 的每一步操作都必须回溯到契约中的某个条目。Self-Contract 变体将契约拆为三个文件:goal.md(目标定义)、constraints.md(约束边界)、status.md(实时状态追踪)。关键洞察是:agent drift 的根因在于 tool output 的即时信息在 context 中的显著度超过了远处的原始目标指令,契约通过周期性 re-injection 对抗这种位置衰减。

适用场景: 与 context-infra 的"以用户核心需求为锚"原则高度吻合。当 agent 处理跨文件依赖分析等复杂任务时,可以在每个 sub-agent 的 prompt 开头注入契约摘要,确保全局目标不被子任务的局部发现覆盖。实施成本低,效果直接。


4. GuardAgent / Guardian Agent Pattern(守卫 Agent 模式)

来源:

核心机制: 一个独立的 agent(Guardian)专门监督另一个 agent(Worker)的行为,验证输出是否符合预设规则。GuardAgent(ICML 2025)的具体做法是:Guardian 读取 Worker 的 action plan,将其与一个 knowledge base 中的安全规则做匹配,用 code-based reasoning 生成验证函数,然后在 Worker 执行前检查合规性。Gartner 的 Guardian Agent 概念更宽泛,核心观点是"人类无法同时监督数百个 agent,需要 AI 来监督 AI"。GUARDRAILS.md 则是一个轻量实现:一个持久化文件记录历史教训,agent 每次执行前必须读取,类似于"跨 session 的记忆"。

适用场景: 适合需要高可靠性的信息提取任务。实际操作中,可以用一个轻量 Haiku agent 作为 Guardian,在 Worker 完成每个阶段后检查输出是否覆盖了原始需求中的所有维度。成本增加约 10-15%,但能有效防止遗漏和 drift。GUARDRAILS.md 模式几乎零成本,适合个人场景。


5. ReCAP: Recursive Context-Aware Reasoning and Planning(递归上下文感知规划)

来源: Zhang et al., Stanford, "ReCAP: Recursive Context-Aware Reasoning and Planning for Large Language Model Agents", NeurIPS 2025
https://arxiv.org/abs/2510.23822 | https://github.com/ReCAP-Stanford/ReCAP

核心机制: 解决 LLM agent 在 long-horizon 任务中因 context 溢出而遗忘早期计划的问题。核心是一个递归分解框架:将大目标分解为子目标树,每层子目标有自己的 context window。当某个子目标执行完毕,只将结果摘要(而非全部 trace)传回父节点。这样每一层的 context 都保持可控,同时全局目标通过树结构持续传递。与 Plan-and-Act(ICML 2025, Erdogan et al.)的区别在于 ReCAP 允许运行时动态调整计划。

适用场景: 适合需要多步推理的大代码库分析、跨文件依赖追踪等任务。树状分解天然契合"先粗后细"的渐进式提取策略。对 context-infra 的启示是:sub-agent 并行时,每个 sub-agent 应该只返回压缩后的结论(而非原始数据),主 agent 在树的根节点做整合。


6. Process Reward Model / Step-Level Supervision(过程奖励模型 / 步骤级监督)

来源:

核心机制: 为 agent 的每个推理步骤(而非仅最终结果)训练一个评分模型(PRM)。MCTS-based 自动标注方案:对每个中间步骤,从该步骤出发用蒙特卡洛搜索生成多条后续路径,如果有路径能到达正确答案,则该步骤被标记为正确。然后用这些标签训练 PRM。在 inference 时,PRM 对 agent 的每一步打分,低分步骤触发回退或重新生成。本质上是将 supervision 从"结果级"下推到"步骤级"。

适用场景: 这是目前学术上最严格的 agent 监督机制,但实施成本高(需要训练专门的 PRM)。在信息提取场景中的简化应用:用 LLM-as-Judge 在每个提取步骤后评估"这一步的输出是否回答了原始问题的某个维度",低分时要求 agent 重新提取。这比全量 PRM 轻量得多,但保留了步骤级监督的核心思想。


7. Multi-Agent Debate / Auditing(多 Agent 辩论与审计)

来源:

核心机制: 多个 agent 对同一任务独立生成输出,然后通过辩论或审计机制交叉验证。2026 年的关键进展是 Reasoning Tree Auditing:不是简单的 majority vote,而是让审计 agent 检查每个 agent 的推理路径树(reasoning tree),找出推理链中的薄弱环节。M3MAD-Bench 的实测结论是:辩论在需要事实验证的任务上有效(提升 5-15%),但在创意性任务上反而有害(因为强迫趋同)。MAST taxonomy 识别了 14 种 MAS 失败模式,其中"task verification failure"和"inter-agent misalignment"是最常见的两类。

适用场景: 适合信息提取中的"双重检查"环节。让两个 sub-agent 用不同策略(如正向提取 vs 逆向扫描)分别处理同一数据源,然后对比差异。差异点即为可能的遗漏或误判。但需注意成本:双 agent 方案的 token 消耗翻倍。建议仅在关键数据源上使用。


8. Periodic Instruction Re-injection(指令周期性重注入)

来源:

核心机制: 在长 session 中每隔 N 轮(或每隔 K tokens)将核心指令(目标、约束、输出格式)重新注入 context。原理是对抗 "context rot":随着 context 增长,早期 token 的影响力因位置衰减而降低(Lost in the Middle 效应),重注入等效于将关键信息从低注意力区域搬回高注意力区域。Shahnovsky and Dror (2026) 在 POMDP 框架下证明了 step-by-step agent 特别容易受 drift 影响,因为每一步的局部 context(上一步的 tool output)会 dominate 远处的全局目标。

适用场景: 实施最简单、成本最低的防 drift 机制。在 sub-agent prompt 的开头和结尾各放一份核心约束摘要(3-5 条),每个 sub-agent 任务切换时重新注入。与 context-infra 的"全局约束显式传递"原则完全一致,只是从隐性最佳实践上升为显式的周期性操作。


与"大 Context 信息提取"任务的映射

方法论对应的现有原则新增价值
Attention Budget分层处理提供了"信号密度"这一量化视角
Progressive Checkpointing分层处理 + 写入磁盘从"最佳实践"升级为"工程框架"
Task Contract以核心需求为锚结构化了锚定机制:goal/constraints/status 三文件
GuardAgent双重检查独立 agent 做验证,而非 self-check
ReCAPAnti-Anchor + 分层递归分解 + 摘要传递的形式化理论
Process Reward Model双重检查步骤级评分替代结果级评审
Multi-Agent Debate双重检查(正向+逆向)推理路径审计优于 majority vote
Instruction Re-injection全局约束传递周期化执行的理论依据(POMDP)

← 返回方法论库索引 · 返回方法论区