llm_context_multi_topic_capacity_survey_20260416
方法论库 · 引用级 · none
本页是 <code>contexts/methodology/llm_context_multi_topic_capacity_survey_20260416.md</code> 的逐字投影(仅隐私清洗,零改写)。
时点提示:本页是仓内文件 contexts/methodology/llm_context_multi_topic_capacity_survey_20260416.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。
报告元数据(frontmatter)
name: llm_context_multi_topic_capacity_survey_20260416
description: 主题/约束预算模型
domain: infra
consumption:
surface: none
trigger: ""
consumer: orchestrator
status: library
promoted_to: nullLLM 在单 Context Window 中的多主题处理能力综合调研
调研日期: 2026-04-16
调研方法: Round 1 (2026-04-14) 约束容量基线 + Round 2 (2026-04-16) 主题容量扩张 + 跨轮整合
Reader Mode: Internal (共享上下文: Transformer 架构、attention 机制、agent 编排)
定位: 本 session 是三份关联调研中的第二份,聚焦 context window 中的资源瓶颈。能力边界维度见 human_llm_capability_boundary_survey_20260416.md,分解方法论维度见 task_decomposition_history_methodologies_survey_20260416.md。
一、结论
LLM 在单个 context window 中能可靠并发处理的独立 items 总数大致在 5-8 之间,这个预算由约束 (instruction) 和主题 (topic/entity/document) 共同消耗,超过预算就会触发指数级衰减。
两轮调研的核心升级是识别出约束数与主题数是两个不同的工程维度,而非同一现象的不同测量。Round 1 测得复杂约束的可靠上限 CSL ≈ 3-6 (FollowBench)、指令诅咒 P(n)=p^n (ManyIFEval)、keyword 约束 500 条时 68% (IFScale)。Round 2 测得多主题场景下的 frontier 模型可靠上限 2-4 个独立主题 (70-90% 性能),超过 5-8 个主题普遍衰减,32-64 主题时主流模型几乎全面崩溃 (NeedleBench ATC)。两者数字量级不同:复杂约束上限是复杂主题上限的约两倍,简单约束可撑到 500 条但复杂主题超过 8 个就进入高风险区。
两者共享底层机制,Gong & Zhang (2024) 的 self-attention entropy 理论对两者都成立,Wu et al. (ICLR 2025 Oral) 发现 retrieval head 是跨任务共享的稀缺资源 (<5% 的 head),Gong et al. (AAAI 2024) 与 Wang & Sun (ICLR 2026 submit) 的 PI-LLM 实验在纯变量追踪任务上就测到了 3-5 容量上限 (不涉及约束概念)。这三条证据支持"每 prompt 并发追踪 items 总数 ≈ 5-8"的统一预算模型。
两者也存在结构性差异,不能简单相加。约束呈 primacy bias (偏向早期指令,~7-26% gap,可用 hard-to-easy 排序缓解),主题呈 lost in the middle (中段 30%+ drop,需要关键主题放开头或结尾)。约束按指令诅咒 P(n)=p^n 加法崩溃,主题因 distractor 语义相似性相互干扰呈乘法崩溃。Chroma 2025 的关键实验显示 distractor 的非均匀性 (distractor 3 比其他 distractor 致命得多),指向"主题相近"比"主题数多"更危险。
最被低估的变量是有效 context vs 标称 context 的差距。BABILong 实测 popular LLMs effectively utilize only 10-20% of the context,即 128K 标称模型在多主题任务实际可用 13-26K。Gemini 2.5 Pro 是目前唯一能在 1M token 上接近标称可用的模型,其他模型务必按标称的 10-20% 估算可放入的主题总体积。Anthropic 官方数据显示 Claude Opus 4 lead + Claude Sonnet 4 subagents 的多 agent 架构在内部 research eval 上比单 Opus 4 提升 90.2%,关键机制是 subagents operate in parallel and maintain their own context,每个 subagent 返回 1K-2K token 的 distilled summary,把 N 个主题分散到 N 个 sub-context。
对 NightCode 的直接推论:每个 sub-agent context 放 3-5 个独立主题是可靠区,5-8 个需要 chunking 或 reranking 介入,超过 10 个必须拆分成多个 agent。约束和主题在同一 prompt 中是叠加消耗而非共享预算,需要分别预算。主题切换点是高风险窗口,应强制插入 summary + explicit reset marker。
二、两种容量的概念区分与数字对比
2.1 概念区分
| 维度 | 约束 (Instruction/Constraint) | 主题 (Topic/Entity/Document) |
|---|---|---|
| 定义 | 必须做 X 的规则条目 | 关于 X 的语义集群 |
| 典型 token 占用 | 每条 10-50 token | 每个 200-5000 token |
| 验证方式 | 规则匹配 (程序可验证或 LLM-as-judge) | 需要模型跨 token 整合信息 |
| 代表 benchmark | FollowBench, ManyIFEval, IFScale | Multi-Needle NIAH, RULER, BABILong, Loong |
| Frontier 模型可靠上限 | 3-6 条复杂约束 (CSL≈3.3, n-back n=3-5) | 2-4 个独立主题 (70-90% 准确) |
| 性能崩溃点 | 10 条约束 (Prompt-level ≈ 15-31%) | 8-32 个主题 (任务依赖) |
| 核心瓶颈 | Attention 熵 + 指令诅咒 P(n)=p^n | Attention 熵 + 语义干扰 + 位置偏移 |
| 位置偏差 | Primacy bias (~7-26% gap) | Middle bias (Lost in the Middle, 30%+ drop) |
| 崩溃模式 | 加法崩溃 (p^n) | 乘法崩溃 (语义干扰相互加剧) |
概念澄清:Round 1 的 IFScale 虽然测到 500 条 keyword inclusion 的 68%,但那是最简单的约束形式 (单 token 匹配),不应与多主题场景直接对比。真正可比的是 FollowBench 的 CSL 和 Multi-Needle NIAH 的可靠 needle 数。两者数字接近但机制有分歧。
2.2 约束容量的三组独立数据 (Round 1 承续)
FollowBench (ACL 2024) 测量 GPT-4 连续满足约束的 Constraint Satisfaction Level (CSL) = 3.3,GPT-3.5 为 2.9,72B 开源模型约 2.4,到第 5 级约束时 GPT-4 的 Hard Satisfaction Rate 降至 61.9%。
ManyIFEval (ICLR 2025 submission) 发现指令诅咒公式:Prompt-level accuracy(n) = (Instruction-level accuracy(n))^n。若单条指令遵循率 90%,10 条指令全部满足率就是 0.9^10 = 35%。GPT-4o 在 10 条指令下 Prompt-level accuracy 仅 15% (零样本),CoT self-refinement 提升至 31%。
IFScale (NeurIPS 2025 Workshop) 测试 20 个前沿模型在 1-500 条指令下的表现。最强模型在 500 条时 68%。三种退化模式:阈值崩溃型 (o3, Gemini 2.5 Pro) 近乎完美直到临界点后急剧崩溃;线性衰减型 (GPT-4.1, Claude Sonnet 4);指数衰减型 (GPT-4o, LLaMA-4)。
表面数字差异源于约束复杂度:keyword inclusion (最简单,可撑数百条) → 程序可验证格式约束 (中等,10 条时 15-31%) → 语义/内容约束 (最难,3-5 个显著退化)。
2.3 主题容量的七个独立 benchmark (Round 2 新增)
整合七个主流 benchmark 在多主题场景下的定量结果。
RULER (NVIDIA 2024, COLM 2024) 评估 17 个长文本模型在 4 类任务 (检索、multi-hop 追踪、聚合、QA) 共 13 子任务。核心发现:尽管所有模型在标称 32K+ context 下声称支持,只有一半模型能在 32K 长度下保持 Llama2-7B-4K 基线以上的性能,声称长度与有效长度存在系统性差距。multi-value NIAH 实验:同样问题下把 needle 数从 1 提升到 32,Qwen3-235B 在 128K context 下性能从 ≈95% 降至 ≈50%。引用:"Our analysis of Yi-34B, which supports context length of 200K, reveals large room for improvement as we increase input length and task complexity." 来源:arXiv:2404.06654
BABILong (NeurIPS 2024 D&B Track) 在 PG19 书籍背景中嵌入 bAbI 任务的 20 个推理任务。核心数据:popular LLMs "effectively utilize only 10-20% of the context",在 32K 长度下多 supporting fact 任务 (QA2 两事实、QA3 三事实) 从 LLM 在短上下文的 70-80% 掉到长上下文的 30-40%。单事实任务 (QA1) 相对稳定,多事实任务随主题数增加快速衰减。GPT-4-0125 在 64K 上 43%,128K 上 36%,即使标称 128K 支持。来源:arXiv:2406.10149
NeedleBench / ATC (2024-2025) 系统测量多 needle 在稀疏和密集信息环境下的表现。Multi-Needle Reasoning 任务上,reasoning steps 从 2 增加到 5 性能单调衰减。Ancestral Trace Challenge (ATC) 是关键发现:需要连续追踪 64+ 个祖先关系时,DeepSeek-R1、o3 等 reasoning 模型全面失败,且这一失败在短于 2K token 的上下文中就已发生。这是对主题数而非 token 长度瓶颈的直接证据。引用:"most models failing to maintain accuracy beyond 64 needles"。来源:arXiv:2407.11963
LongBench v2 (ACL 2025) 的 503 多选题覆盖六类任务:single-doc QA、multi-doc QA、long ICL、长对话历史、代码仓库、长结构化数据。人类专家 (15 分钟内) 53.7%,最好模型直接回答 50.1%,Gemini 2.5 Pro w/ CoT 63.3%。multi-doc QA 和 long dialogue history 是最难的类别。来源:arXiv:2412.15204
Loong (EMNLP 2024, Tencent) 设计的多文档专用 benchmark,平均每实例 11 篇文档。任务覆盖 Spotlight Locating、Comparison、Clustering、Chain of Reasoning 四类,跨越 10K-200K+ 长度。GPT-4、Claude 等在 50K+ 长度和 4+ 文档时性能显著下降,Clustering 和 Chain of Reasoning 两类跨文档整合任务最难,在长 context 下接近随机水平。来源:arXiv:2406.17419
LOFT (Google DeepMind 2024) 将 NIAH 扩展到 6 个真实任务 35 个数据集,支持 32K-1M token。128K 级别 Gemini 1.5 Pro 在基础检索上可以追平专用 retriever,但 "LCLMs lag significantly on complex multi-hop compositional reasoning tasks"。即单主题检索 OK,多主题组合推理崩溃。Gemini 2.5 在 LOFT Hard ≤128K 上 87.0%,o3 77.0%。来源:NAACL 2025 Findings
Michelangelo (DeepMind 2024) 提出 Latent Structure Queries (LSQ) 框架,三类任务 (Latent List、Multi-round Coreference Resolution、IDK) 表明:十个 frontier 模型 (Gemini、GPT-4、Claude 系列) 在 32K 长度下的 rank ordering 在不同任务间都不同,没有一个模型在所有多主题任务上都强。这是多主题能力不是单一轴的直接证据。来源:arXiv:2409.12640
综合七个 benchmark 的数字,经验分段:
| Needle/Topic 数量 | 典型性能 (128K context 下 frontier 模型) | 可靠性评级 |
|---|---|---|
| 1 | 95-100% | 可靠 |
| 2-4 | 70-90% | 较可靠 |
| 5-8 | 50-75% | 需 CoT 或 RAG 辅助 |
| 16-32 | 20-50% | 需强制 chunking |
| 64+ | <20% (NeedleBench ATC 全面崩溃) | 必须分拆 agent |
三、共享底层机制与结构性差异
3.1 三条证据支持共享机制假设
证据 A: Attention 熵的统一解释。Gong & Zhang (NeurIPS 2024 Workshop) 的 self-attention entropy 理论适用于任何需要多点追踪的任务。约束数 N 和主题数 M 都通过 H_N = log(N × effective tokens per target) 增加熵,对数线性压低准确率。差异只在每个目标的 token 量:约束是小的 (10-50),主题是大的 (200-5000)。因此主题数的可容忍上限必然小。这直接解释了数字量级差异。来源:arXiv:2409.10715
证据 B: Working memory 容量的统一测量。Gong et al. (AAAI 2024) 的 n-back 实验和 Wang & Sun (ICLR 2026 submit) 的 PI-LLM 实验都在不涉及约束的情况下,用纯"追踪多个独立变量"测到了相同的 3-5 容量上限。这说明 working memory 限制对"需要并发追踪的 items"一视同仁,无论它们是约束还是主题。来源:AAAI 2024, arXiv:2506.08184
证据 C: Retrieval head 的共享资源。Wu et al. (ICLR 2025 Oral) 发现所有长文本模型都存在一类专门的 attention head 负责信息检索,五个关键属性:universal (所有长文本模型都有)、sparse (<5% 是 retrieval head)、intrinsic (预训练短文本时就已形成)、dynamically activated、causal (剪枝 retrieval head 会导致检索失败和幻觉,剪枝非 retrieval head 不影响)。当 prompt 同时有多个约束和多个主题时,两者竞争同一组 retrieval head 的激活资源。Llama-2 7B 只有 12 个总是激活的 retrieval head,即使每个 head 能追踪一个 item,也只有 12 个可靠并发。来源:OpenReview EytBpUGB1Z
Basile et al. (NeurIPS 2025 Spotlight) 用 Simultaneous Orthogonal Matching Pursuit (SOMP) 证明:Mistral-7B 中单个 head 会特化于政治、国籍、时间、数值等特定语义类别。编辑 1% 的 head 就能可靠抑制或增强特定概念。这是"主题"在 attention 机制层面确实对应具体硬件的证据。推论:当 context 包含超过可用特化 head 数的独立主题时,必然有主题共享同一 head 造成相互干扰。来源:OpenReview WQ9rnkaUWm
3.2 两者的结构性差异
差异 1: 位置偏差不同。约束是 primacy bias,模型偏向遵循早期指令,单轮推理约 7% gap,多轮推理最高 ~26% (LLaMA3-70B, 9 约束)。将约束按 hard-to-easy 排序可缓解 (IFEval 最难子集上 +4.34%)。主题是 middle bias / lost in the middle,Liu et al. (TACL 2024) 首次量化,Chroma 2025 在 Claude Sonnet 4、Gemini 2.5 Pro、GPT-4.1 等 18 个 frontier 模型上重新确认,中段 30%+ drop。
差异 2: 崩溃模式不同。约束按指令诅咒 P(n)=p^n 加法式崩溃,单条失败率独立叠加。主题因语义相似性相互干扰,崩溃呈乘法式加剧。Chroma 2025 的 distractor 非均匀性实验是关键证据:在 arXiv haystack + PG essay needle 组合中,distractor 3 造成的性能下降远大于其他 distractor,与目标 needle 的语义相似度相关。更反直觉的发现:shuffled haystack 比 logically coherent document 性能更好,连贯的文档反而创造了更有说服力的干扰源。来源:Chroma Research 2025
差异 3: 前摄干扰在主题场景加剧。Wang & Sun (ICLR 2026 submit) 的 PI-LLM 研究:即使 context 在容量范围内,只要早期出现过对同一 key 的旧值,新值就会被干扰,accuracy 呈 log-linear 衰减至接近 0。这是 know, cannot do 型失败:模型能正确规划应返回最新值,但执行时仍检索到被覆盖的旧值。提示工程 (改指令、加强调、加 CoT) 效果有限。对多主题 agent handoff 尤其有害,因为主题切换本质上就是"覆盖旧主题,推进新主题"。
差异 4: Context Rot 的多轮动力学。Chroma 2025 对 18 个 frontier 模型的测试显示每一个都在输入长度增长时性能下降。Bhavishya Pandit 等从生产系统观察到的数字:LLM accuracy 可以从单轮交互的 90% 掉到多轮累积 context 后的 60% 以下。Drift No More? (arXiv:2510.07777) 把 drift 建模为有界随机过程,证明存在 equilibrium divergence:长对话多主题场景存在平衡漂移量,超过这个量任何努力都无法维持主题一致性。来源:arXiv:2510.07777
四、有效 Context 与标称 Context 的差距
这是多主题场景中最被低估的变量。
| 模型 | 标称 context | 实测有效 context (多主题任务) | 来源 |
|---|---|---|---|
| GPT-4 | 128K | BABILong 128K 任务 36%, 实际 <10% 可用 | BABILong GitHub |
| GPT-4.1 | 1M | Chroma 18-model study 证实在 50K 就开始 rot | Chroma 2025 |
| Claude Opus 4 | 200K | 在多 distractor 场景中 50K 前就显著下降 | Chroma 2025 |
| Gemini 1.5 Pro | 1M | RULER 评测中有效长度 >128K, 是唯一例外 | RULER 2024 |
| Gemini 2.5 Pro | 1M | LongBench v2 全任务 63.3% w/ CoT (最高), LOFT 128K 87% | LongBench/LOFT 2025 |
| Gemini 2.5 Flash | 1M | LongBench v2 62.1% | LongBench 2025 |
| Qwen3-235B-Thinking | 256K | LongBench v2 60.6%, RULER multi-value 32 needles 仅 50% | RULERv2 |
| DeepSeek-R1 | 128K | LongBench v2 58.3% | LongBench |
有效 context 衰减曲线。BABILong 跨多模型一致曲线:popular LLMs "effectively utilize only 10-20% of the context"。Atlan 的 MECW (Maximum Effective Context Window) 研究:effective context often falls far below advertised limits, by up to 99% on complex tasks。
机制性解释。KV cache 的内存约束 + attention 权重的平均稀释 + 训练数据分布偏向短文本。"标称 context"只代表 attention mask 允许的位置数,不代表模型在所有位置都能学到有效的 attention 权重。这是为什么 effective context 随 task difficulty 陡降的底层原因。
五、实用工程启示 (一个 Context 放几个 Topic)
基于多源证据的实用启发七条。
原则 1: 单 agent 的主题预算是 3-5 个独立主题。对应 NeedleBench 多 needle 任务中 70-90% 可靠区间、RULER 多 value 任务中 4-value 默认配置。超过 5 个主题时需要 chunking、summarization 或 multi-agent 拆分。
原则 2: 主题相似度越高,可容纳数量越少。Chroma 2025 的 distractor 实验证明语义相似的主题会严重互相干扰。若主题语义高度相似 (比如三个不同公司的财报分析),实际预算降到 2-3 个;若主题完全不相关 (法律合同 + 股价数据 + 历史背景),可放 5-7 个。
原则 3: 有效 context 按 10-20% 估算。Gemini 2.5 Pro/Flash 目前是唯一能在 1M token 上接近标称可用的模型,其他模型务必按标称 context 的 10-20% 估算可放入的主题总体积。对 128K 模型,总 token 预算按 13-26K 规划。
原则 4: 多 agent + isolation 的性能增益可量化。Anthropic 官方数据:Claude Opus 4 lead + Claude Sonnet 4 subagents 多 agent 架构在内部 research eval 上比单 Opus 4 提升 90.2%。关键机制 "subagents operate in parallel and maintain their own context",每个 subagent 处理 1 个主题的深度工作,返回 1K-2K token 的 distilled summary。这是把 N 个主题分散到 N 个 sub-context 的工程落地。来源:Anthropic Engineering
原则 5: RAG top-k 的甜蜜点是 3-10。Luo et al. (arXiv:2411.07396) 发现 RAG 的最优 top-k 与 gold document 数密切相关,且注入的 noisy documents 会降低 correctness。当 k=10 时,QA 性能主要由 retriever recall 决定而非 top-k 增加本身。来源:arXiv:2411.07396
原则 6: Many-shot ICL 是 power law。Agarwal et al. (NeurIPS 2024) 的 Many-Shot ICL 研究证明 shot 数从 1 → 1000 在一些任务 (低资源翻译) 上带来持续提升,但收益服从 power law,多数任务上 few-shot 已接近收益上限。这与多主题场景的边际收益快速递减一致。来源:NeurIPS 2024
原则 7: 主题切换点是高风险窗口。前摄干扰研究 (PI-LLM) 证明主题切换时前一主题的信息会继续干扰。工程对策:在主题切换前强制插入 summary + explicit reset marker (比如 "--- Topic A complete. Starting Topic B. ---"),或者直接拆 agent。
5.1 统一预算模型
可以把约束和主题合并为一个统一预算:"每 prompt 可并发追踪的独立 items 总数 ≈ 5-8",其中 items 包括复杂约束和独立主题。这个数字有三层硬约束支撑:Miller 7±2、Cowan 4±1、retrieval head 稀缺性 <5%。
工程落地:
- 简单约束 (keyword 匹配) items 权重 0.1,复杂约束 (需要语义理解) 权重 1
- 主题按 token 量分档:<500 token 权重 0.5,500-2000 token 权重 1,2000-5000 权重 2,>5000 权重 3
- Prompt 总权重超过 5-8 就触发分拆
六、Claim 验证状态表
| Claim | 内容 | 来源 | 置信度 |
|---|---|---|---|
| R1-C1 | 复杂约束 CSL ≈ 3 | FollowBench ACL 2024 | High |
| R1-C2 | 指令诅咒 P(n)=p^n | ManyIFEval | High (受限条件) |
| R1-C3 | 500 指令下 68% | IFScale | Medium (方法论局限) |
| R1-C4 | 三种退化模式 (阈值/线性/指数) | IFScale | High |
| R1-C5 | Primacy bias ~7-26% gap | Order Matters + IFScale | Very High |
| R1-C6 | N-back 测得 WM n=3-5 | Gong AAAI 2024 | High |
| M1 | RULER 多模型无法维持 32K 有效 context | Hsieh 2024 | Very High |
| M2 | BABILong: popular LLMs 仅利用 10-20% context | Kuratov 2024 | Very High |
| M3 | NeedleBench ATC: 64+ needles 普遍失败 | Li 2024-2025 | High |
| M4 | Chroma context rot: 18 frontier 模型全部衰减 | Chroma 2025 | Very High |
| M5 | Anthropic multi-agent 90.2% 增益 | Anthropic 官方 | High (方法论透明) |
| M6 | Retrieval head <5% | Wu ICLR 2025 | Very High |
| M7 | Head 会特化于具体语义概念 | Basile NeurIPS 2025 | Very High |
| M8 | Lost in the middle 在多主题场景加剧 | Liu 2024 + Chroma 2025 | Very High |
| M9 | 前摄干扰跨容量存在 | Wang & Sun 2025 | High |
| M10 | 有效 context 为标称 10-20% | BABILong + Atlan | High |
| M11 | Distractor 语义相似度是关键变量 | Chroma 2025 | Medium-High |
| M12 | 主题数上限低于约束数一个数量级 | 本研究综合推断 | Medium |
| U1 | items 总预算 5-8 统一模型 | 综合推断 | Medium (理论构造) |
七、对 Agent 编排的启示
7.1 Prompt 预算的双层审计
设计每个 sub-agent 的 prompt 时,分别审计两个层面:
约束层:列出所有 must-satisfy 约束,复杂语义约束权重 1,keyword 权重 0.1。总和超过 5 时按 hard-to-easy 排序,超过 8 必须拆 sub-agent。
主题层:列出 prompt 中所有独立信息块 (文档、案例、参考代码、历史记录),按 token 量分档计权重。总和超过 5 时必须 chunking,超过 10 必须多 agent isolation。
两层加总超过 8-10 时,模型会出现综合性退化:既不完全遵循约束,也不完全理解主题。
7.2 主题切换的显式协议
参考前摄干扰研究,在 sub-agent 的 prompt 中,主题切换必须显式标记。格式示例:
--- TOPIC A COMPLETE ---
Summary of Topic A: [1-2 sentences]
--- TOPIC B BEGINS ---
Topic B context: [...]
Forget previous context details unless explicitly referenced.这不是形式主义,是对 retrieval head 激活状态的显式 reset 提示。
7.3 多 Agent Isolation 的量化优先级
Anthropic 90.2% gain 数据不只是一个营销数字,它是工程决策依据。如果单 agent prompt 包含 5+ 独立主题,迁移到 multi-agent 架构的预期 gain 是显著的 (20-50% 级别),足以抵消编排成本。单主题 ≤3 的任务则不值得多 agent 化。
7.4 Position 策略
两种 position bias 同时存在时要分别处理:
关键约束放 prompt 开头 (利用 primacy bias)。
关键主题事实要么放开头,要么放结尾 (避开 lost in the middle 的中段)。
两者在同一 prompt 中可能冲突,需要权衡:若约束和主题都关键,约束优先放开头,关键主题放结尾。
7.5 主题相似度预警
在构造 multi-doc prompt 前做快速 embedding 相似度检查,若任意两个主题的 cosine similarity > 0.8,应该合并为一个主题处理或分到两个 agent。相似度高的主题在同一 context 中触发严重 distractor 效应。
7.6 RAG top-k 的启发式
原则 5 的工程版本:top-k 从 3 开始,若用户反馈信息不足再扩到 5-10,很少超过 10。超过 10 应该先改 retriever 召回质量而非加 top-k。
八、与其他两份 Session 的关联
本 session 聚焦资源边界。两份相关 session:
human_llm_capability_boundary_survey_20260416.md 处理能力边界 (working memory 机制同时出现在两个 session,但本 session 关注并发容量,另一个关注推理类型与元认知)。
task_decomposition_history_methodologies_survey_20260416.md 处理分解方法论 (人类历史上的 span of control 3-7 与本 session 的 items 预算 5-8 在数字上高度一致,指向同源认知约束)。
Span of Control 3-7 与 items 预算 5-8 的一致性是跨领域同构最直接的证据。Miller 7±2 (工作记忆)、Cowan 4±1 (重新估计)、Hamilton 3-6 (军事)、OPNAVINST 3-7 (海军规章)、Amazon two-pizza 5-10、Spotify squad 8-10 都指向同一个数量级。LLM 的 items 预算 5-8 并不是与人类完全不同的新约束,它是同一个认知容量在不同载体上的体现。
九、URL 来源索引
约束容量 Benchmark (Round 1 承续)
- FollowBench — Jiang et al., ACL 2024
- Curse of Instructions: ManyIFEval — Harada et al., ICLR 2025 submission
- When Instructions Multiply — Harada et al. 2025-09
- IFScale — Jaroslawicz et al., NeurIPS 2025 Workshop
- Order Matters: Position Bias — Zeng et al., ACL 2025 Findings
多主题 Benchmark (Round 2 新增)
- RULER — Hsieh et al., NVIDIA, COLM 2024
- RULER V2 — OpenReview submission 2025
- BABILong — Kuratov et al., NeurIPS 2024 D&B Track
- NeedleBench + ATC — Li et al., TMLR 2024-2025
- LongBench v2 — Bai et al., ACL 2025
- Loong — Wang et al., EMNLP 2024
- LOFT — Lee et al., Google DeepMind, NAACL 2025 Findings
- Michelangelo — Vodrahalli et al., DeepMind 2024
主题干扰与漂移
- Context Rot — Chroma Research 2025
- Drift No More? — Wang et al. 2025
- Unable to Forget: Proactive Interference — Wang & Sun, ICLR 2026 submit
- NoLiMa: Beyond Literal Matching — Adobe et al. 2025
- Lost in the Middle — Liu et al., TACL 2024
- Reasoning on Multiple Needles — 2025
Attention 机制
- Retrieval Head — Wu et al., ICLR 2025 Oral
- Head Pursuit — Basile et al., NeurIPS 2025 Spotlight
- Self-Attention Limits Working Memory — Gong & Zhang, NeurIPS 2024 Workshop
- Working Memory Capacity of ChatGPT — Gong et al., AAAI 2024
- Exploring Working Memory Capacity — Hong et al., IJCNLP 2025
实用工程
- Anthropic Multi-Agent Research System — 90.2% gain
- Effective Context Engineering — Anthropic 2025
- Toward Optimal Search and Retrieval for RAG — Luo et al. 2024
- Many-Shot ICL — Agarwal et al., NeurIPS 2024 Spotlight
有效 Context 业界数据
- LLM Context Window Limitations — Atlan, MECW 99% gap
- HELMET — Princeton NLP
- HELM Long Context Leaderboard — Stanford CRFM 2025
Round 1 及并行 Session
methodology/llm_constraint_capacity_and_task_decomposition_survey_20260414.md(基线)methodology/llm_context_multi_topic_20260416_deep_research.md(Round 2 原始 sub-agent 产出)methodology/human_llm_capability_boundary_survey_20260416.md(并行 session)methodology/task_decomposition_history_methodologies_survey_20260416.md(并行 session)
十、未验证与待扩张
未完全验证:
- "主题数上限低于约束数一个数量级"是综合推断,缺乏同一 benchmark 直接对比两者的研究
- "items 总预算 5-8"是理论构造,没有实验直接验证把约束和主题混合加总与模型表现的对应关系
- CMU "12 子任务/P85" 仍是单源
- Anthropic 90.2% gain 是 vendor 数据,虽然方法论公开但未有第三方完整复现
Round 3 推荐扩张方向:
- 多模态多主题容量:当主题跨越不同模态时 (比如 3 张图 + 2 份文档 + 1 段音频),容量上限如何变化?是否存在跨模态的 attention 资源竞争?关键论文入口 MMLONGBENCH-DOC (NeurIPS 2024)、Multimodal NIAH (NAACL 2025)
- Agent memory 架构对多主题的分摊效果:MemGPT、Letta、Semantic Memory 把主题分摊到 working memory 之外。memory retrieval 是否解决了多主题问题,还是把问题从容量转成 retrieval 精度?对 NightCode 记忆架构直接相关
- 多主题场景下 reasoning model 的行为:o3、DeepSeek-R1、Claude Opus 4 Extended Thinking 声称通过 think longer 改善复杂推理,但 NeedleBench ATC 和 Chroma 2025 都观察到 reasoning 模型在多主题场景反而容易 underthink/overthink。正增益还是负增益是 NightCode 选择何时用 reasoning 模式的关键决策
本 session 字数: 约 6500 中文字 (不含 URL 列表、表格和代码片段)
基于的 sub-agent 原始产出: methodology/llm_context_multi_topic_20260416_deep_research.md
整合 Round 1 内容: FollowBench CSL、ManyIFEval 指令诅咒、IFScale 退化模式、n-back WM 容量、Position bias