llm_constraint_capacity_and_task_decomposition_survey_20260414
方法论库 · 引用级 · memory_index
本页是 <code>contexts/methodology/llm_constraint_capacity_and_task_decomposition_survey_20260414.md</code> 的逐字投影(仅隐私清洗,零改写)。
时点提示:本页是仓内文件 contexts/methodology/llm_constraint_capacity_and_task_decomposition_survey_20260414.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。
报告元数据(frontmatter)
name: llm_constraint_capacity_and_task_decomposition_survey_20260414
description: 3-6 约束上限+工作记忆同构
domain: infra
consumption:
surface: memory_index
trigger: "记忆索引召回"
consumer: orchestrator
status: library
promoted_to: nullLLM 约束容量与任务分解:深度调研报告
调研日期: 2026-04-14
调研方法: Deep Research Workflow(Phase 1 扫描 + 4 维度并行调研 + 交叉验证)
Reader Mode: Internal(共享上下文:Transformer 架构、agent 编排、信息论、NightCode)
核心问题: LLM 在单个 context window 中能可靠追踪多少个独立约束?任务分解如何应对这个限制?
结论
LLM 在单个 context window 中能可靠遵循的复杂约束数量约为 3-6 个(取决于模型能力和约束类型),之后性能按指数规律衰减。这个数字与人类 working memory 的容量限制(Cowan 修正后的 4±1 个 chunk)呈功能性同构:机制不同,但退化曲线形状和缓解策略(chunking、分解)高度对称。
减少单次交互的约束数量,对人和 LLM 都有效。这是任务分解的认知科学基础,也是 agent 编排系统设计中最关键的工程约束之一。
一、约束容量的数字
三个独立 benchmark 从不同角度测量了同一现象,数字量级一致:
FollowBench(ACL 2024,语义约束):GPT-4 在基础指令上逐级叠加约束(Content/Style/Format/Example 等),连续满足上限 CSL = 3.3。GPT-3.5 为 2.9,72B 开源模型约 2.4。到第 5 级约束时,GPT-4 的 Hard Satisfaction Rate 降至 61.9%。来源:ACL 2024
ManyIFEval(ICLR 2025 提交,程序可验证约束):发现了"指令诅咒"公式:Prompt-level accuracy(n) = (Instruction-level accuracy(n))^n。如果单条指令遵循率为 90%,10 条指令的全部满足率就是 0.9^10 = 35%。GPT-4o 在 10 条指令下 Prompt-level accuracy 仅 15%(零样本),CoT self-refinement 提升至 31%。来源:OpenReview
IFScale(NeurIPS 2025 Workshop,keyword inclusion 约束):测试 20 个前沿模型在 1-500 条指令下的表现。最强模型在 500 条时仅 68% 准确率。三种退化模式:(1) 阈值崩溃型(o3, Gemini 2.5 Pro),近乎完美直到临界点后急剧崩溃;(2) 线性衰减型(GPT-4.1, Claude Sonnet 4);(3) 指数衰减型(GPT-4o, LLaMA-4)。来源:arXiv:2507.11538
这三组数据的表面差异源于约束复杂度的不同:keyword inclusion(最简单,可撑到数百条但衰减)→ 程序可验证格式约束(中等,10 条时 15-31%)→ 语义/内容约束(最难,3-5 个就显著退化)。指令诅咒公式是统一框架:p 值越高(约束越简单),n 的可容忍范围越大。
Position Bias 加剧了问题。两个独立研究(Order Matters, ACL 2025 + IFScale)确认:多约束场景存在系统性的 primacy bias,模型偏向遵循早期指令。单轮推理约 7% accuracy gap,多轮推理最高 ~26%(LLaMA3-70B,9 约束)。将约束按 hard-to-easy 排序可缓解:IFEval 最难子集上 +4.34% constraint accuracy,纯 prompt 工程无需重训练。来源:ACL 2025
二、Working Memory:比 Context Window 更深层的瓶颈
Context window 是书架大小,working memory 是你能同时翻阅的书本数。即使 1M token 的 context window,模型能活跃追踪的信息量远小于此。
n-back 实验测量:Gong et al.(AAAI 2024)对 ChatGPT 做 n-back 认知任务,发现 working memory 容量约 n=3(detection sensitivity d' 降至临界值 1),与人类均值惊人相似。GPT-4 级模型约 n=5-6。来源:AAAI 2024
机制:Gong & Zhang(NeurIPS 2024 Workshop)证明,self-attention 的注意力熵 H_N 随追踪目标数 N 增大而增加,模型无法将注意力聚焦在目标位置,准确率呈对数线性下降。这是 Transformer attention 架构的固有限制。来源:arXiv:2409.10715
复杂度比长度更关键(C9 已确认)。Hong et al.(IJCNLP 2025)明确发现:"the number and difficulty of tasks in a single input largely strain the working memory of LLMs",任务数量和难度是主要 stressor,原始输入长度的影响相对次要。来源:ACL Anthology
前摄干扰:超越 context 的底层限制。Wang & Sun(arXiv:2506.08184,提交 ICLR 2026)发现 LLM 存在与人类记忆系统类似的前摄干扰效应:早期学到的信息干扰后续相似信息的提取,准确率随干扰积累对数线性降至零。更重要的是,这是"know, cannot do"失败:模型能正确规划应返回什么,但执行时仍检索到已被覆盖的旧值。提示工程的干预效果有限。来源:arXiv:2506.08184
三、任务分解:什么有效,什么无效
有效的方向
MAKER / MDAPs(NeurIPS 2025):Cognizant AI Lab 将任务极限分解为原子子步骤 + SPRT 统计投票,在百万步程序合成任务上实现零错误。这是对 Apple "The Illusion of Thinking"(NeurIPS 2025)的直接回应。关键前提:每步必须有可验证的正确答案。来源:arXiv:2511.09030
LLM-Modulo 框架(ICML 2024 Spotlight):Kambhampati 提出 LLM 作为候选生成器 + 外部验证器的 Generate-Test 闭环。LLM 擅长模式匹配和候选生成,验证交给外部系统。2026 年已扩展为 LLM-Process-Modulo。来源:arXiv:2402.01817
LLM + CP Solver(IJCAI 2025):将约束传播求解器嵌入 token 生成过程,在受控句子生成中接近 100% 约束满足。仅适用于形式可验证的硬约束。来源:IJCAI 2025
分解的边界条件
Select-Then-Decompose(EMNLP 2025):并非所有任务都适合分解。对简单任务或高耦合任务,分解引入的协调错误超过收益。先判断是否需要分解,再决定如何分解。来源:arXiv:2510.17922
When Splitting Makes Stronger(COLM 2025):理论证明 Divide-and-Conquer prompting 有效的充分条件是子问题独立性和复杂度均匀分布。子问题高度耦合时,分解可能引入比不分解更多的错误。来源:OpenReview
过度 chunking 损害大模型:Kramer & Baumann(2024)发现 Cognitive Prompting 在 LLaMA 70B 上 GSM8K 从 0.87 提升至 0.91,但过多 chunking 步骤反而降低性能,论文称其为"resembling overfitting"。来源:arXiv:2410.02953
当前关于最佳粒度的共识
没有跨任务的统一最优数字,但有三条高置信度共识(均为多源确认):
- 子任务必须具备可验证性。MAKER、LLM-Modulo、GenCP 三个不同框架的共同前提。没有验证的分解只是把错误从一个地方搬到另一个地方。
- 分解粒度受任务耦合度约束。步骤独立、局部可验证、子问题复杂度均匀 → 适合分解。语义全局依赖强、上下文不可切分 → 分解可能有害。
- CMU 的经验数字(待验证)。Zhijie Xu(CMU-CS-25-132)研究 Apache 软件工程任务,建议每层分解最多 12 个子任务(对应数据集 P85)。这是目前唯一尝试给出具体数字的研究,但为单源信息。
四、人与 LLM 的认知容量对比
功能性同构,机制分歧
Gong et al.(AAAI 2024)的 n-back 实验直接测量了两者的 working memory 容量,结论是 "strikingly similar"。Ian Bull(2025)的排序实验发现 GPT-5.1 在 10-20 个元素完美,30 个出现首错,40-70 个进入随机区。人类裸 working memory 约 4-7 items。两者在原始数量上 LLM 更大,但复杂约束下 LLM 退化更快。
Springer 2026 综述提出 "bounded agent complementarity" 模型,认为人类与 LLM 共享 "有界工作空间" 和 chunking 机制,但人类拥有 metacognition,LLM 没有。关键摘录:"Human performance often collapses under mental overload... Modern AI systems exhibit boundary phenomena that rhyme with human overload... accuracy holds up to a point, then degrades abruptly." 来源:Springer AI Review 2026
System 1/2 映射的启示
Nature Reviews Psychology 2025 的综述确认:LLM forward pass ≈ System 1,CoT ≈ 外挂 System 2。LLM 表现出与人类 System 1 相同的认知偏误(锚定、框架、可得性),但其"偏差"来自训练数据分布而非认知疲劳,且缺乏人类的自发 System 2 切换能力。来源:Nature Reviews Psychology
对 agent 编排的含义:LLM 的 System 1 能力(快速模式匹配、候选生成)是其优势,System 2 能力(全局一致性检查、约束满足验证)是其短板。Kambhampati 的 LLM-Modulo 框架本质上就是让 LLM 做 System 1,外部验证器做 System 2。
Chunking 对两者都有效
PIC(Liu et al., 2026)明确受人类 chunking 机制启发,通过 block-wise causal masking 将长 context 分块压缩为 soft prompt,64x 压缩比下 QA F1 提升 29.8%。Cognitive Prompting 将认知操作(goal clarification、decomposition、filtering)系统化为 prompt 结构。两者都证明:将信息 chunk 化(每个 chunk 内聚、chunk 间解耦)比平铺多条指令更有效。
但过度 chunking 损害大模型(Kramer 2024),与人类认知超载现象对称。
五、对 Agent 编排设计的实践启示
基于以上研究,几个对 NightCode 和 context-infra 直接相关的工程建议:
每次 sub-agent 调用的约束预算约 3-5 个复杂语义约束。这是 FollowBench CSL=3.3 和 n-back n=3-5 的直接推论。如果一个任务有 10 个需要同时满足的约束,分成 2-3 个子任务更可靠。
指令诅咒公式可以用于分解决策。P(n) = p^n。估算单条约束的遵循率 p(通过小规模测试),算出 n 条约束的全满足率,设定可接受阈值(比如 70%),反算出 n 的上限。
利用 position bias 而不是对抗它。将最重要/最难的约束放在 prompt 开头,利用 primacy bias。或者用 hard-to-easy 排序(Order Matters 的发现),在 IFEval 最难子集上直接 +4.34%。
分解的前提是子任务可验证。MAKER 的核心不是"分得更细",而是"每步有验证"。对于无法外部验证的创意/语义任务,分解的收益有限,甚至可能因为协调成本而有害。
复杂度比长度更关键。一个包含 3 个高度耦合约束的 1K token prompt 比一个包含 1 个简单约束的 100K token prompt 更容易出错。设计 sub-agent prompt 时优先降低约束间耦合度,其次才是控制 token 量。
六、未验证/仅 Vendor Source 的判断
以下判断在调研中找不到 Tier 3+ 独立证据支撑,使用时需注意:
- "指令诅咒"公式在复杂语义约束下是否同样成立(仅在程序可验证约束上验证)
- CMU "12 个子任务/P85" 的具体数字(单源)
- "模型有效上下文为标称值的 60-70%"(来源混杂,缺乏统一方法论)
- "人-LLM 功能性同构"是综合推断,没有单篇论文做过直接的同任务、同约束条件下的人机对比实验
七、Claim 验证状态汇总
| Claim | 内容 | 来源 | 验证状态 | 置信度 |
|---|---|---|---|---|
| C1 | 500 指令下 68% | IFScale | 数字准确,方法论局限 | Medium |
| C2 | P(n)=p^n 指令诅咒 | ManyIFEval | 受限条件下成立 | High |
| C3 | CSL ≈ 3 | FollowBench | 已验证 | High |
| C4 | 变量追踪 5-10 个 | 二手转述 | 需修正为 n=2-3 到 n=5-6 | Medium |
| C5 | 中段 30%+ 下降 | Lost in the Middle | 原始成立,顶级模型部分缓解 | High |
| C6 | 百万步零错误 | MAKER | 成立但仅限可验证任务 | High |
| C7 | 12 子任务/P85 | CMU-CS-25-132 | 单源 | Low |
| C8 | LLM+CP 100% 满足 | IJCAI 2025 | 成立但极窄 | High |
| C9 | 复杂度 > 长度 | IJCNLP 2025 | 已确认 | High |
| C10 | 有效 context 60-70% | 多来源 | 广泛支持 | Medium |
| C11 | Position bias 偏向早期 | Order Matters + IFScale | 多源确认 | Very High |
完整来源索引
约束容量量化(D1)
- IFScale: How Many Instructions Can LLMs Follow at Once? — Jaroslawicz et al., Distyl AI, NeurIPS 2025 Workshop
- Curse of Instructions: ManyIFEval — Harada et al., ICLR 2025 submission
- When Instructions Multiply (ManyIFEval 扩展) — Harada et al., 2025-09
- FollowBench — Jiang et al., ACL 2024
- Order Matters: Position Bias — Zeng et al., ACL 2025 Findings
- IFScale Medium 独立评论 — Cahit Barkin Ozer, 2025-07
Working Memory 机制(D2)
- Working Memory Capacity of ChatGPT — Gong et al., AAAI 2024
- Self-Attention Limits Working Memory — Gong & Zhang, NeurIPS 2024 Workshop
- N-Back Paradigm Challenge — Hu & Lewis, ACL Findings 2025
- Exploring Working Memory Capacity — Hong et al., IJCNLP 2025
- Unable to Forget: Proactive Interference — Wang & Sun, ICLR 2026 submission
- Lost in the Middle — Liu et al., TACL 2024
- Found in the Middle: Calibrating Bias — Hsieh et al., 2024
- BAPO: Bounded Attention Prefix Oracle — Tomlinson et al., Microsoft Research, 2026
任务分解方法论(D3)
- MAKER: Solving a Million-Step Task — Meyerson et al., Cognizant, NeurIPS 2025
- The Illusion of Thinking — Apple MLR, NeurIPS 2025
- LLM-Modulo Framework — Kambhampati et al., ICML 2024 Spotlight
- LLM Meets Constraint Propagation — Bonlarron & Régin, IJCAI 2025
- Select-Then-Decompose — Liu et al., EMNLP 2025
- When Splitting Makes Stronger — Zhang et al., COLM 2025
- CMU Task Decomposition — Zhijie Xu, CMU-CS-25-132, 2025-08
- maker-rs GitHub — SPRT voting 独立实现
人-LLM 认知对比(D4)
- Dual-Process Theory and LLMs — Brady et al., Nature Reviews Psychology, 2025-11
- Overloaded Minds and Machines — Springer AI Review, 2026-01
- Cognitive Chunking for Soft Prompts (PIC) — Liu et al., 2026
- Cognitive Prompting — Kramer & Baumann, 2024
- Working Memory Cliff: GPT-5.1 — Ian Bull, 2025
- From System 1 to System 2 — Zhang et al., 2025
调研工件目录: tmp/llm_constraint_capacity/
Sub-agent 中间报告: methodology/llm_constraint_capacity_20260414_deep_research.md, methodology/llm_task_decomposition_20260414_deep_research.md