context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

llm_constraint_capacity_and_task_decomposition_survey_20260414

Z3 全文↑ Z2 条目

方法论库 · 引用级 · memory_index

← 返回方法论库索引 · 返回方法论区

本页是 <code>contexts/methodology/llm_constraint_capacity_and_task_decomposition_survey_20260414.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 contexts/methodology/llm_constraint_capacity_and_task_decomposition_survey_20260414.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

报告元数据(frontmatter)
name: llm_constraint_capacity_and_task_decomposition_survey_20260414
description: 3-6 约束上限+工作记忆同构
domain: infra
consumption:
  surface: memory_index
  trigger: "记忆索引召回"
  consumer: orchestrator
status: library
promoted_to: null

LLM 约束容量与任务分解:深度调研报告

调研日期: 2026-04-14
调研方法: Deep Research Workflow(Phase 1 扫描 + 4 维度并行调研 + 交叉验证)
Reader Mode: Internal(共享上下文:Transformer 架构、agent 编排、信息论、NightCode)
核心问题: LLM 在单个 context window 中能可靠追踪多少个独立约束?任务分解如何应对这个限制?


结论

LLM 在单个 context window 中能可靠遵循的复杂约束数量约为 3-6 个(取决于模型能力和约束类型),之后性能按指数规律衰减。这个数字与人类 working memory 的容量限制(Cowan 修正后的 4±1 个 chunk)呈功能性同构:机制不同,但退化曲线形状和缓解策略(chunking、分解)高度对称。

减少单次交互的约束数量,对人和 LLM 都有效。这是任务分解的认知科学基础,也是 agent 编排系统设计中最关键的工程约束之一。


一、约束容量的数字

三个独立 benchmark 从不同角度测量了同一现象,数字量级一致:

FollowBench(ACL 2024,语义约束):GPT-4 在基础指令上逐级叠加约束(Content/Style/Format/Example 等),连续满足上限 CSL = 3.3。GPT-3.5 为 2.9,72B 开源模型约 2.4。到第 5 级约束时,GPT-4 的 Hard Satisfaction Rate 降至 61.9%。来源:ACL 2024

ManyIFEval(ICLR 2025 提交,程序可验证约束):发现了"指令诅咒"公式:Prompt-level accuracy(n) = (Instruction-level accuracy(n))^n。如果单条指令遵循率为 90%,10 条指令的全部满足率就是 0.9^10 = 35%。GPT-4o 在 10 条指令下 Prompt-level accuracy 仅 15%(零样本),CoT self-refinement 提升至 31%。来源:OpenReview

IFScale(NeurIPS 2025 Workshop,keyword inclusion 约束):测试 20 个前沿模型在 1-500 条指令下的表现。最强模型在 500 条时仅 68% 准确率。三种退化模式:(1) 阈值崩溃型(o3, Gemini 2.5 Pro),近乎完美直到临界点后急剧崩溃;(2) 线性衰减型(GPT-4.1, Claude Sonnet 4);(3) 指数衰减型(GPT-4o, LLaMA-4)。来源:arXiv:2507.11538

这三组数据的表面差异源于约束复杂度的不同:keyword inclusion(最简单,可撑到数百条但衰减)→ 程序可验证格式约束(中等,10 条时 15-31%)→ 语义/内容约束(最难,3-5 个就显著退化)。指令诅咒公式是统一框架:p 值越高(约束越简单),n 的可容忍范围越大。

Position Bias 加剧了问题。两个独立研究(Order Matters, ACL 2025 + IFScale)确认:多约束场景存在系统性的 primacy bias,模型偏向遵循早期指令。单轮推理约 7% accuracy gap,多轮推理最高 ~26%(LLaMA3-70B,9 约束)。将约束按 hard-to-easy 排序可缓解:IFEval 最难子集上 +4.34% constraint accuracy,纯 prompt 工程无需重训练。来源:ACL 2025


二、Working Memory:比 Context Window 更深层的瓶颈

Context window 是书架大小,working memory 是你能同时翻阅的书本数。即使 1M token 的 context window,模型能活跃追踪的信息量远小于此。

n-back 实验测量:Gong et al.(AAAI 2024)对 ChatGPT 做 n-back 认知任务,发现 working memory 容量约 n=3(detection sensitivity d' 降至临界值 1),与人类均值惊人相似。GPT-4 级模型约 n=5-6。来源:AAAI 2024

机制:Gong & Zhang(NeurIPS 2024 Workshop)证明,self-attention 的注意力熵 H_N 随追踪目标数 N 增大而增加,模型无法将注意力聚焦在目标位置,准确率呈对数线性下降。这是 Transformer attention 架构的固有限制。来源:arXiv:2409.10715

复杂度比长度更关键(C9 已确认)。Hong et al.(IJCNLP 2025)明确发现:"the number and difficulty of tasks in a single input largely strain the working memory of LLMs",任务数量和难度是主要 stressor,原始输入长度的影响相对次要。来源:ACL Anthology

前摄干扰:超越 context 的底层限制。Wang & Sun(arXiv:2506.08184,提交 ICLR 2026)发现 LLM 存在与人类记忆系统类似的前摄干扰效应:早期学到的信息干扰后续相似信息的提取,准确率随干扰积累对数线性降至零。更重要的是,这是"know, cannot do"失败:模型能正确规划应返回什么,但执行时仍检索到已被覆盖的旧值。提示工程的干预效果有限。来源:arXiv:2506.08184


三、任务分解:什么有效,什么无效

有效的方向

MAKER / MDAPs(NeurIPS 2025):Cognizant AI Lab 将任务极限分解为原子子步骤 + SPRT 统计投票,在百万步程序合成任务上实现零错误。这是对 Apple "The Illusion of Thinking"(NeurIPS 2025)的直接回应。关键前提:每步必须有可验证的正确答案。来源:arXiv:2511.09030

LLM-Modulo 框架(ICML 2024 Spotlight):Kambhampati 提出 LLM 作为候选生成器 + 外部验证器的 Generate-Test 闭环。LLM 擅长模式匹配和候选生成,验证交给外部系统。2026 年已扩展为 LLM-Process-Modulo。来源:arXiv:2402.01817

LLM + CP Solver(IJCAI 2025):将约束传播求解器嵌入 token 生成过程,在受控句子生成中接近 100% 约束满足。仅适用于形式可验证的硬约束。来源:IJCAI 2025

分解的边界条件

Select-Then-Decompose(EMNLP 2025):并非所有任务都适合分解。对简单任务或高耦合任务,分解引入的协调错误超过收益。先判断是否需要分解,再决定如何分解。来源:arXiv:2510.17922

When Splitting Makes Stronger(COLM 2025):理论证明 Divide-and-Conquer prompting 有效的充分条件是子问题独立性和复杂度均匀分布。子问题高度耦合时,分解可能引入比不分解更多的错误。来源:OpenReview

过度 chunking 损害大模型:Kramer & Baumann(2024)发现 Cognitive Prompting 在 LLaMA 70B 上 GSM8K 从 0.87 提升至 0.91,但过多 chunking 步骤反而降低性能,论文称其为"resembling overfitting"。来源:arXiv:2410.02953

当前关于最佳粒度的共识

没有跨任务的统一最优数字,但有三条高置信度共识(均为多源确认):

  1. 子任务必须具备可验证性。MAKER、LLM-Modulo、GenCP 三个不同框架的共同前提。没有验证的分解只是把错误从一个地方搬到另一个地方。
  2. 分解粒度受任务耦合度约束。步骤独立、局部可验证、子问题复杂度均匀 → 适合分解。语义全局依赖强、上下文不可切分 → 分解可能有害。
  3. CMU 的经验数字(待验证)。Zhijie Xu(CMU-CS-25-132)研究 Apache 软件工程任务,建议每层分解最多 12 个子任务(对应数据集 P85)。这是目前唯一尝试给出具体数字的研究,但为单源信息。

四、人与 LLM 的认知容量对比

功能性同构,机制分歧

Gong et al.(AAAI 2024)的 n-back 实验直接测量了两者的 working memory 容量,结论是 "strikingly similar"。Ian Bull(2025)的排序实验发现 GPT-5.1 在 10-20 个元素完美,30 个出现首错,40-70 个进入随机区。人类裸 working memory 约 4-7 items。两者在原始数量上 LLM 更大,但复杂约束下 LLM 退化更快。

Springer 2026 综述提出 "bounded agent complementarity" 模型,认为人类与 LLM 共享 "有界工作空间" 和 chunking 机制,但人类拥有 metacognition,LLM 没有。关键摘录:"Human performance often collapses under mental overload... Modern AI systems exhibit boundary phenomena that rhyme with human overload... accuracy holds up to a point, then degrades abruptly." 来源:Springer AI Review 2026

System 1/2 映射的启示

Nature Reviews Psychology 2025 的综述确认:LLM forward pass ≈ System 1,CoT ≈ 外挂 System 2。LLM 表现出与人类 System 1 相同的认知偏误(锚定、框架、可得性),但其"偏差"来自训练数据分布而非认知疲劳,且缺乏人类的自发 System 2 切换能力。来源:Nature Reviews Psychology

对 agent 编排的含义:LLM 的 System 1 能力(快速模式匹配、候选生成)是其优势,System 2 能力(全局一致性检查、约束满足验证)是其短板。Kambhampati 的 LLM-Modulo 框架本质上就是让 LLM 做 System 1,外部验证器做 System 2。

Chunking 对两者都有效

PIC(Liu et al., 2026)明确受人类 chunking 机制启发,通过 block-wise causal masking 将长 context 分块压缩为 soft prompt,64x 压缩比下 QA F1 提升 29.8%。Cognitive Prompting 将认知操作(goal clarification、decomposition、filtering)系统化为 prompt 结构。两者都证明:将信息 chunk 化(每个 chunk 内聚、chunk 间解耦)比平铺多条指令更有效。

但过度 chunking 损害大模型(Kramer 2024),与人类认知超载现象对称。


五、对 Agent 编排设计的实践启示

基于以上研究,几个对 NightCode 和 context-infra 直接相关的工程建议:

每次 sub-agent 调用的约束预算约 3-5 个复杂语义约束。这是 FollowBench CSL=3.3 和 n-back n=3-5 的直接推论。如果一个任务有 10 个需要同时满足的约束,分成 2-3 个子任务更可靠。

指令诅咒公式可以用于分解决策。P(n) = p^n。估算单条约束的遵循率 p(通过小规模测试),算出 n 条约束的全满足率,设定可接受阈值(比如 70%),反算出 n 的上限。

利用 position bias 而不是对抗它。将最重要/最难的约束放在 prompt 开头,利用 primacy bias。或者用 hard-to-easy 排序(Order Matters 的发现),在 IFEval 最难子集上直接 +4.34%。

分解的前提是子任务可验证。MAKER 的核心不是"分得更细",而是"每步有验证"。对于无法外部验证的创意/语义任务,分解的收益有限,甚至可能因为协调成本而有害。

复杂度比长度更关键。一个包含 3 个高度耦合约束的 1K token prompt 比一个包含 1 个简单约束的 100K token prompt 更容易出错。设计 sub-agent prompt 时优先降低约束间耦合度,其次才是控制 token 量。


六、未验证/仅 Vendor Source 的判断

以下判断在调研中找不到 Tier 3+ 独立证据支撑,使用时需注意:


七、Claim 验证状态汇总

Claim内容来源验证状态置信度
C1500 指令下 68%IFScale数字准确,方法论局限Medium
C2P(n)=p^n 指令诅咒ManyIFEval受限条件下成立High
C3CSL ≈ 3FollowBench已验证High
C4变量追踪 5-10 个二手转述需修正为 n=2-3 到 n=5-6Medium
C5中段 30%+ 下降Lost in the Middle原始成立,顶级模型部分缓解High
C6百万步零错误MAKER成立但仅限可验证任务High
C712 子任务/P85CMU-CS-25-132单源Low
C8LLM+CP 100% 满足IJCAI 2025成立但极窄High
C9复杂度 > 长度IJCNLP 2025已确认High
C10有效 context 60-70%多来源广泛支持Medium
C11Position bias 偏向早期Order Matters + IFScale多源确认Very High

完整来源索引

约束容量量化(D1)

Working Memory 机制(D2)

任务分解方法论(D3)

人-LLM 认知对比(D4)


调研工件目录: tmp/llm_constraint_capacity/
Sub-agent 中间报告: methodology/llm_constraint_capacity_20260414_deep_research.md, methodology/llm_task_decomposition_20260414_deep_research.md


← 返回方法论库索引 · 返回方法论区