context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

llm_context_inertia_and_task_allocation_20260429_manual

Z3 全文↑ Z2 条目

方法论库 · 引用级 · none

← 返回方法论库索引 · 返回方法论区

本页是 <code>contexts/methodology/llm_context_inertia_and_task_allocation_20260429_manual.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 contexts/methodology/llm_context_inertia_and_task_allocation_20260429_manual.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

报告元数据(frontmatter)
name: llm_context_inertia_and_task_allocation_20260429_manual
description: 注入 vs 基线 vs 注意力偏置机理
domain: infra
consumption:
  surface: none
  trigger: ""
  consumer: orchestrator
status: library
promoted_to: null

LLM Context 惯性与跨领域讲解任务分配调研

调研日期:2026-04-29
调研方式:6 个 sub-agent 并行调研(Opus × 3,Sonnet × 3),主 agent 综合分析
子报告tmp/survey_llm_inertia/A-F_*.md(保留完整证据链)


0. 调研缘起

用户在做完一次微信文章 capture 后引出三个嵌套的疑问:

第一,他观察到一个反常识现象——即使把 context "完全刷新",LLM 的表现也并不和上一次完全一样。他怀疑模型存在某种"隐性 state"或"context 中的惯性",并把它类比成人类的隐性知识。

第二,他从这个观察延伸出对任务分配中的惯性的好奇——讲解类任务在跨多个领域的知识下能否保持统一风格?这种风格统一是 priming 还是 explicit instruction 在起作用?

第三,他想从原理性角度理解:在讲解类任务里,给 LLM 不同领域的知识时,LLM 内部的"激活权重"是否真的存在差异?如果存在,这种差异如何影响"如何分配任务"的工程决策?

这三层问题分别落在机制层、行为层、工程层。用户是跨域同构的思考者,要求调研同时给出原理判断和可操作的工程建议。


1. 核心结论(一段话版本)

用户感受的"context 惯性"是真实的,但机制不在他怀疑的方向——transformer 推理过程是 stateless 的,没有跨调用的隐性 state;他感受到的"刷新后表现仍不同"主要由三层叠加产生:harness 在用户视野外持续注入 system prompt + CLAUDE.md + <system-reminder> + MEMORY 的"持续隐性 context"(最大贡献),weights 中由 RLHF 编码的 baseline 行为先验(这才是真正的"隐性知识"),以及 attention 在 context 早期位置上的结构性偏好(primacy bias + attention sink)。在 mech interp 层面,"不同领域走不同 circuit"的猜想方向正确但版本过强——真实结构是"大量共享的抽象 circuit + domain-specific feature 选择性激活",跨领域 feature 同时激活时确实存在结构化干扰(Polysemantic Interference 已实证可跨模型迁移)。在任务分配层面,"≤2 个原子任务"找不到原始研究依据,是 Anthropic Zack Witten "do one thing" 原则的中文社区放宽版,但其背后的多任务密度衰退现象有断崖式实证;同领域并列讲解的隐性细节污染风险高于跨领域并列,这是用户最容易忽略的方向。对应到工程:4 个独立领域的讲解任务最优结构不是"单 context 全做"也不是"完全拆开各做各的",而是 Hybrid Orchestration——orchestrator 先生成 300-500 字的风格样本落盘,4 个并行 sub-agent 各自以该样本为锚点生产内容,orchestrator 只做轻量拼接(Anthropic Multi-Agent Research System 在内部 eval 提升 90.2% 背后的同一个结构原则)。


2. "Context 惯性"的三层拆解

把用户的直觉切成三个互相独立的来源,是这次调研最大的认知收益。混在一起的时候像"一个奇怪的现象",分开看是三个完全不同的问题。

Layer A — 用户感知层:同一 prompt 在不同 session 跑两次,输出本身就有自然方差。用户回忆"上一次"时已经把输出压缩成印象,差异容易被解读为"惯性"。这一层很大程度是 confirmation bias 加上输出本身的 stochastic 性。它不假,但也不重要——因为它主要是认知归因偏差,不是模型行为的真实属性。

Layer B — Harness 隐性输入层:用户以为"刷新 context" = 清空对话窗口,但 Claude Code 这类 harness 在每次请求时都会重新拼装 system prompt、CLAUDE.md、<system-reminder>、MCP tool list、MEMORY index、injected hooks。用户能"刷新"的只是用户消息,不是真实 prompt。dbreunig 2026-04 的拆解显示 Claude Code 的 system prompt 是 110+ 条 conditional 模板拼装,CLAUDE.md 不进 system prompt(system prompt 在所有用户间共享走 prompt cache),而是通过 <system-reminder> XML tag attach 到 message 上被模型当 high-priority 上下文。MEMORY.md 前 25KB 在每个 session 启动时自动注入。这一层是真实存在的"惯性",但本质是 harness 工程造成,不是模型机制。用户感受的大部分"惯性"应该归到这里

Layer C — 机制真实层:weights 中固化的先验、attention 在 context 上的位置偏好、softmax/floating-point 的非确定性、attention sink、induction head circuit 的激活模式。这一层是模型本体的"惯性",即使在零 harness、纯 API 调用下也存在。

这一层细分看,证据强度不一:

这层拆解的工程含义:如果用户想验证"context 惯性"到底来自哪里,最直接的实验是用纯 API(绕开所有 harness)以同一 fresh prompt 在固定 batch 下重复调用,再对比走 harness 调用的输出分布——这能直接拆出 B 层(harness 注入)和 C 层(模型本体)的相对贡献。在用户日常感受里,B 层是大头,但 C 层中的 RLHF baseline 是不可消除的、最持久的"惯性源"。


3. 不同领域知识在 LLM 内部是否激活不同?

用户的猜想——"讲解 transformer 走的 circuit 和讲解组织管理学走的 circuit 不一样"——方向正确,强度版本过强。Mech interp 这三年的主线变化(从 neuron 到 SAE feature 到 attribution graph)正好回答这个问题。

强对应的证据:Li/Tegmark et al. (2410.19750) 的 The Geometry of Concepts 发现 SAE feature 在中间尺度上具有显著空间模块性——math + code features 聚成一个"功能脑叶",对话/短文本聚成另一个,科学论文聚成第三个,空间聚集程度远超随机基线。这是迄今最直接的"不同领域走不同地方"的几何证据。Tang et al. (ACL 2024, 2402.16438) 在 LLaMA-2 / BLOOM / Mistral 上找到 language-specific neurons 集中在顶部和底部层,激活/关闭它们能 steer 输出语言。Namazifard & Galke (IJCNLP 2025) 进一步分离出与 language neurons 正交的 culture neurons 集中在 upper layer。

强对应于"feature 干扰":Polysemantic Interference 论文 (2505.11611, 2025) 证明在 Pythia-70M / GPT-2-Small 上找到的 polysemantic 干扰对,能可靠迁移到 LLaMA-3.1-8B/70B 和 Gemma-2-9B 上预测行为偏移——feature 干扰不是噪声,而是有结构的、跨规模稳定的内在性质。这直接对应用户的"激活权重抢占"直觉,但机理是 superposition 下非正交方向的结构化冲突,不是用户想象的标量级权重竞争。

弱对应、应该被修正的部分:Anthropic 的 Tracing the thoughts of a Large Language Model(2025-03,针对 Claude 3.5 Haiku)显示模型有一个"language-of-thought"——同一个抽象 feature 同时被英文/法文/中文激活,3.5 Haiku 跨语言共享 feature 比例是更小模型的两倍以上。配合 On the Biology of an LLM 里发现的"capital of state containing Dallas → Texas → Austin"两跳推理 supernode、诗歌时模型在 <newline> token 提前激活 rhyming feature 做 forward planning(注入 rhyming feature 70% 概率改写结尾),可以推论:底层抽象推理 circuit 大量共享,差异更可能体现在 SAE feature 的不同激活组合,而不是不同的物理 circuit

关键 gap:现有 mech interp 工作的 domain 维度集中在 language / culture / code-vs-text / safety 四类,没有论文做学科粒度对比(法律 vs 医学 vs 物理 vs 管理学)。用户关心的"切换成本/惯性"在 feature-level 也几乎没人系统研究。所以"讲解 transformer vs 讲解管理学"在内部具体长什么样,目前只能基于 Tegmark lobe + Sonnet feature catalog 推断,没有直接实证。

更细的一个发现是 A is for Absorption(Chanin et al., ICLR 2025, 2409.14507)——SAE 在优化稀疏性时,父 feature(如"math")会被子 feature(如"algebra")"吸走",导致父 feature 在 algebra 输入上不激活。这意味着即使存在"领域 feature",它在具体子领域输入上的激活模式也可能反直觉。

对用户工程问题的含义:跨领域处理的真实代价更可能体现在 feature 干扰hierarchy 吸收,而非 circuit 切换。"讲解任务本身"很可能是一个 cross-domain feature(类似 sycophancy 那样的元行为 feature),不同领域内容只是改变它接的下游 feature 集合——这反而支持了"统一风格 + 切换内容"在原理上是可行的。


4. 多任务在单 context 中的干扰:从"≤2 原子任务"说起

"≤2 原子任务"找不到原始来源。Anthropic 官方 prompt engineering 文档反复说 "each subtask should have a single, clear objective",但没有给出具体数字。Anthropic Multi-Agent Research System 给的是 agent 数(1 agent + 3-10 tool calls 处理简单查询、2-4 subagents 处理对比查询),关心的是 agent 数量不是单 prompt 任务数。最接近的原始表述是 Anthropic prompt doctor Zack Witten 的 "each prompt should do one thing and do it well"——比"≤2"更严格。中文 AI 工程社区可能在传播过程中把这条放宽到"≤2"形成了民间法则。这是经验法则的工程化表述,不是某 paper 的实验阈值。

它背后的现象有充分实证,强度甚至超过用户预期:

ManyIFEval (2509.21051) 做了 1 到 10 条指令的精细测量——GPT-4o 从 94%(n=1)掉到 21%(n=10),Claude 3.5 Sonnet 从 95% 掉到 48%,o3-mini 从 100% 掉到 78%。衰退在前 10 条指令内就已经是断崖式的,这与"两个原子任务"的工程经验数值相当吻合。

IFScale (2507.11538) 把规模拉到 500 个 keyword-inclusion 指令,在 20 个前沿模型上发现三种衰退模式:reasoning 模型(o3、gemini-2.5-pro)在 ~150 个指令前接近完美呈 threshold decay;中等模型(gpt-4.1、claude-sonnet-4)从 50 到 500 大致线性下降到 ~52%;非 reasoning 模型(gpt-4o、llama-4-scout)50 个指令就掉到 80%、100 个仅 49%。

更值得注意的是 LLM Task Interference (2402.18216, EMNLP 2024) 的发现——在对话历史中插入不同任务对当前任务的干扰:典型幅度 10-22%,且模型规模(7B 到 175B)不是决定因素,Llama-7B 经常比大模型更敏感。任务距离与性能下降只是弱相关。

但 MTI Bench (2402.11597) 给出了一个反直觉发现:强模型把多个任务合到一次推理后 accuracy 不降反升——GPT-4 在 Multi-Step 上从 30.8% 升到 43.2%,Llama-2-70B +7.3%。两个看似矛盾的研究的化解关键是:任务是被显式声明还是隐式残留。Task Interference 里干扰来自前一个任务的"残留 task representation"污染了后一个任务的解码(不需要的上下文);MTI Bench 里多任务有用是因为所有任务同时被显式列出,模型可以并行处理。

机制层有 Hendel, Geva, Globerson (EMNLP 2023, 2310.15916) 的 In-Context Learning Creates Task Vectors——ICL 在中间层凝结出 task vector,多任务并存会让 task vectors 相互稀释或纠缠。结合 §3 的 Polysemantic Interference 证据,可以拼出一个统一图景:多任务在 prompt 内对应多个同时激活的 task vector / SAE feature 组合,它们之间的非正交干扰是结构化的、跨规模稳定的衰退源

同质 vs 异质多任务:用户最容易忽略的方向

这是用户问题中最有价值的一个具体子问题。结论与直觉相反:同领域并列讲解的隐性风险高于跨领域并列

理由有三个层次:

Task vector 重叠污染:当任务都来自同一领域(讲 transformer、讲 RNN、讲 attention),它们激活的语义子空间高度重叠,task vector 之间的余弦相似度高——模型可能把"讲 RNN"的解释路径污染到"讲 attention"的解释(如把 RNN 的串行特点错误归到 attention 上)。这是隐性的细节交叉污染,外观上输出仍然流畅、专业、看起来对,但具体细节会张冠李戴。

Feature 共享的副作用:§3 的 Polysemantic Interference 证据显示,feature 间的干扰在跨模型间是稳定的——同领域多任务恰好是 feature 共享度最高、干扰最严重的场景。

异质多任务可借 task superpositionEverything Everywhere All at Once (2410.05603) 发现 LLM 能在单次推理内并行 ICL 多个计算独立的任务(同一 prompt 里既算数学又翻译)——只要计算路径不重叠,跨领域并列反而干扰小。MTI Bench 上强模型 +7~12% 的提升大概率来自这条路径。

但跨领域有 task switching cost:LLM Task Interference 论文里"Gigaword → MMLU"(新闻摘要切到学术问答,跨领域)下降幅度 19-22%,比"Rotten Tomatoes → MMLU"(影评切学术,部分跨领域)的 13% 更大。这与 Monsell (2003) 的人类 task-switching cost 模式一致。

综合判断:同领域并列的风险是细节交叉污染(隐蔽、难发现),跨领域并列的风险是task switching cost(明显、可预防)。用户场景里,"讲解神经网络 + 信息论 + 组织管理学 + 命理学"的领域跨度足够大,反而是相对"安全"的跨域并列;但如果任务变成"讲解 transformer + 讲解 attention + 讲解 RoPE + 讲解 KV cache",这种同领域并列才是真正高风险的——这是这次调研最反常识的发现之一。


5. 风格一致性:威胁不在领域跨度,在内容具体性

用户的具体场景是要求统一风格(务实克制、不堆 bullet、以思考深度体现专业)做跨领域讲解。这一节给出三个反常识的判断。

第一,风格漂移是当前 Transformer 架构的系统性特征,不是某个模型的缺陷。Chroma 2025 对 18 个前沿模型(GPT-4.1、Claude Opus 4、Gemini 2.5)的 context rot 研究发现所有模型在输入 token 增加时输出质量都连续下降。MultiChallenge (ACL 2025) 显示当前最强前沿模型(Gemini 2.5 Pro)在多轮指令保留任务上得分仅 51.91%。NeurIPS 2025 Consistently Simulating Human Personas with Multi-Turn RL 系统化测量了三类 persona 漂移度量。SPASM 综述指出模型越大 drift 倾向反而越明显——更大的模型对 user cue 和上下文响应更敏感,容易向对话方风格收敛("echoing"现象)。

第二,跨领域不是最大威胁,"内容具体性"才是。当话题从抽象(价值观、风格)切到具体(代码、数学推导、命理排盘),模型会进入"功能模式",风格层被压制。在用户场景里,讲解神经网络(涉及矩阵运算、attention 计算公式)和讲解命理学(涉及干支排盘、十神判断)这种内容具体性高的领域,风格压制会比讲解组织管理学(叙述性强、抽象)严重得多。这意味着风格保护的关键不是按"领域"切分,而是按"内容具体性"切分——具体内容前后要有更明显的风格 anchor。

第三,手段有效性的排序不是按"看起来精确"排,而是按"行为约束的具体程度"排

短期单次生成(一次 API 调用内)的有效性排序:

长期跨轮次维持:

没有任何单一手段在长轮次中免疫 persona drift。组合策略(system prompt + 定期重注入 + 每次讲解前附一个高质量示例段落)优于任何单独手段。


6. 跨域同构:用户直觉哪些是真同构、哪些是表面相似

用户的核心认识论是"如果两个事物在某些表面相似,底层一定共享某种结构"。这次调研把"context 惯性"在人类认知里的对应物拆出来,结论分两类。

真同构层(机制不同但功能等价)

语义 priming 的输出行为同构。Meyer & Schvaneveldt (1971) 发现"bread → butter"的识别加速,CLIC 2025 实验性地验证了 GPT-4o 在词汇判断任务中表现出与人类相似的语义 priming 效应。但机制不同——人类靠扩散激活(动态语义网络的传播),LLM 靠训练权重的概率估计(静态压缩的统计规律)。两者功能上做的是同一件事(对语言共现统计的压缩表示),物理基底完全不同。

Bartlett 式图式激活与 ICL 的框架固化在功能上同构。NAACL 2025 Is In-Context Learning a Type of Error-Driven Learning? 实验证实 LLM 存在结构 priming 效应——先前句子的句法结构会影响后续输出的句法倾向,且效应在更大模型中更强。两者都表现为用先激活的框架重构新信息,都会引入框架偏差。关键差异是 LLM 没有"顺应"机制——人类遭遇不能同化的信息时会修改图式(Piaget 的 accommodation),LLM 在推理时权重不变,框架固化更彻底。

表面相似但不同构

Einstellung 效应(Luchins 1942 的水壶问题、Bilalić et al. 2008 的国际象棋专家研究)vs LLM 的 context 惯性。表面上都是"先激活的框架占据资源、压制其他可能",但人类的 Einstellung 源于竞争性抑制(有限的注意力资源主动压制其他图式),LLM 的"风格惯性"源于 causal attention 的概率延续——前文词语在 context window 中被自注意力机制赋权,风格一致性只是高概率路径的延续,没有"抑制"机制。LLM 也没有疲劳、没有认知负荷限制——"惯性"强度随 context 长度连续变化,可以被显式的反提示打断(人类的 Einstellung 不容易被言语指令打断)。

类比推理也只是表面相似。Gentner (1983) 的结构映射理论要求有意识地对齐关系结构,Gick & Holyoak (1980, 1983) 证明跨域迁移在人类身上默认不发生——必须显式提示。LLM 能生成"流水是电流的类比"更可能是训练语料中存在大量"电流就像水流一样……"的模板句被直接召回,不是结构映射。

这一节对工程的含义:用户的"context 惯性"直觉在统计层面(priming)是真同构、有理由复用人类认知的策略;但在结构层面(Einstellung、类比)是表面相似、不能直接套用人类经验。显式框架重置 prompt 是对 Einstellung 的功能借鉴(人类需要意识干预才能打破定势,对应在 LLM 是显式注入"以下问题与上文无关"),异域类比需要显式桥接(仅并列两段内容不够,必须用"将 A 中的 X 机制对应到 B 的场景"的指令),这些都是从人类认知科学到 LLM 工程的有效迁移。


7. 工程结论:4 个领域的讲解任务怎么分配

把前面所有分析收敛到用户的具体问题:4 个独立领域(神经网络、信息论、组织管理学、命理学)的讲解任务、要求统一风格、每个领域 1500-2500 字。

四种候选方案对比(数据综合自 Anthropic Multi-Agent Research System 实证 + Claude Agent SDK 文档 + 用户场景的具体估算):

方案Token 预估风格一致性错误隔离速度适用条件
A. 单 agent 单 context 全做~80k-120k最高(自然一致)慢(串行)≤2 领域、总长 <3000 字
B. 单 agent 多 context(每领域一个 session)~20k-32k依赖 system prompt 质量风格容忍度高
C. 4 个并行 sub-agent + orchestrator 综合~28k-40k最难保证最好最快时间敏感、各领域专业深度高
D. Hybrid(先生成风格样本 + 4 并行 sub-agent)~25k-32k高(artifact 锚定)用户场景的最优配置

推荐方案 D,理由是这次调研里几条独立证据线收敛到同一个结构:

第一,Anthropic Multi-Agent Research System 在内部 eval 上比单 agent 高出 90.2%,正是因为"多个独立方向并行探索"的结构优势。Opus 4 lead + Sonnet 4 sub-agents 是已被实证的最佳分工。

第二,Anthropic Effective Context Engineering 明确指出"每个 sub-agent 可能探索数万 token,但只向 lead agent 返回 1000-2000 token 的精炼摘要"——sub-agent 的探索过程不应污染主 context,这是 §2 中 context rot 现象的工程对策。

第三,Latitude "How Examples Improve LLM Style Consistency" 实证 example-based prompting 比抽象 style guide 有效。Jemama et al. 2025 实测 completion prompt 让 4/5 模型达到 99.9% 风格匹配度。把 orchestrator 先生成的 300-500 字风格样本写入文件作为 artifact,sub-agent 在 prompt 中要求"对齐此风格样本",比让每个 sub-agent 各自解读"务实克制"四个字有效得多。

第四,单 context 方案的 token 经济性差——做到第 4 个领域时已经背负了前 3 个领域的全部内容在 context 里,模型的注意力会被稀释(context rot),每个领域的 cost 还在涨。这种结构是 §5 风格漂移最严重的场景。

第五,4 个领域内容彼此独立(神经网络/信息论/组织管理学/命理学),没有跨领域的叙述依赖,从 §4 的同质 vs 异质分析看,这种异质并列恰好是 task superposition 能发挥优势的场景。

实施细节

反直觉的不要做


8. 不确定性与下一步可验证的实验

这次调研里被反复发现的 gap

几个保留的不确定结论


9. 给 NightCode 系统设计的引申启示

用户的 NightCode 项目(多 agent 编排系统、希腊神话命名)和这次调研的结论有几个具体的对应:

Sub-agent context 隔离是 Anthropic 90.2% 提升的核心机制——NightCode 如果还在用"agent 之间共享 context"的设计,应该参考 Claude Agent SDK 的 AgentTool 模式(sub-agent 完全隔离的 context window,子任务结束后 context 全部丢弃,只有最终消息返回父 agent)。

风格统一应该靠 artifact 而不是 system prompt——orchestrator 生产的"风格样本"作为 artifact 落盘,sub-agent 通过文件路径引用,比反复在每个 sub-agent 的 system prompt 里写抽象风格指令有效。这也对应 Anthropic 的"避免传话游戏"原则——结构化输出 + 文件引用 > 对话历史复制。

任务分配要按"task vector 重叠度"而非"任务数量"切——同领域并列的隐性细节污染风险高于跨领域并列,这意味着 orchestrator 在分发任务时应该优先把结构相似的任务分到不同 context(让它们不互相干扰),而不是把"看起来相关"的任务塞给同一个 sub-agent。

讲解类元任务有 cross-domain feature 共性——§3 的推论"讲解任务本身是一个 cross-domain feature"意味着 NightCode 可以把"讲解 agent"做成一个共享的元 agent,然后通过任务参数注入具体领域,而不需要为每个领域训/写一个专门讲解 agent。这种 cross-domain feature + domain-specific feature 选择性激活的结构,正好对应了 LLM 内部的真实工作方式。


参考文献(精选,完整列表见各子报告)

Context 惯性机制

多任务密度与干扰

Mech interp 领域激活

风格一致性

Agent orchestration

人类认知对照


← 返回方法论库索引 · 返回方法论区