context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

llm_capability_boundary_20260417_deep_research

Z3 全文↑ Z2 条目

方法论库 · 引用级 · none

← 返回方法论库索引 · 返回方法论区

本页是 <code>contexts/methodology/llm_capability_boundary_20260417_deep_research.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 contexts/methodology/llm_capability_boundary_20260417_deep_research.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

报告元数据(frontmatter)
name: llm_capability_boundary_20260417_deep_research
description: L0-L3×S0-S3 能力边界框架
domain: infra
consumption:
  surface: none
  trigger: ""
  consumer: orchestrator
status: library
promoted_to: null

大语言模型能力边界的系统性刻画

调研日期:2026-04-17
调研方法:4+1 维度并行调研 + 3 份前置报告基座 + 交叉验证 + 激励感知验证
Reader Mode:Internal(张乐轩;共享 Transformer 底层、NightCode 架构、三份前置调研)
预置调研


核心结论

  1. 用户的直觉基本正确,但需要两处修正。"定位"擅长、"关系/记录/方法论"困难这个分层成立。但"定位"里只有 narrative event segmentation 达到人类水平,wiki 类 topic segmentation 仍落后 supervised SOTA。"关系/记录/方法论"里三者的困难程度差异很大,方法论更新接近不可能(KUP 间接推理 <2%)。
  1. 能力边界的真正分界线是"是否需要跨 forward pass 维持被写入的状态",不是"任务是否复杂"。LLM 在单次 forward 内能做非常复杂的模式匹配(定位、segmentation、event boundary),但跨 forward 维持被写入的 state 是架构级的不可行:Tang & Xie (2026) 形式化证明 Transformer 的 KV-cache 是 write-once 矩阵($arXiv:2603.19272$)。"持续记录"和"方法论更新"之所以困难,根源就是这一点。
  1. Relation extraction 的 57 F1 gap 是支撑用户直觉的最清晰数字。DocRED 上 LLM zero-shot F1 = 10-23,supervised SOTA ≈ 80,绝对差距 57 F1 点。即使 supervised 模型,inter-sentence RE 也比 intra-sentence 低 13-14 F1。"找位置"和"找位置之间的关系"不是同一类任务。
  1. Perplexity 不是最佳的统一信息论解释,但用户的底层直觉方向正确。Schaeffer "Mirage" 证明 emergence 的锐利性是非线性指标的人工产物,打断了"perplexity 高 = 困惑 = 能力差"这条因果链。LongPPL (ICLR 2025) 发现 standard perplexity 与 LongBench 相关系数 r = -0.18(近 0),key-token 加权后 r = -0.96。Attention entropy 与 per-token perplexity 在多追踪任务下确实耦合(Gong & Zhang NeurIPS 2024),但这个耦合属于 Shannon entropy 在不同层次的实例化,更强的候选框架是 epiplexity($arXiv:2601.03220$,2026),它把 learnable structure 与 time-bounded entropy 区分开来。
  1. 可操作的决策框架:判断一个任务对 LLM 的难度,用"是否需要跨 step 可靠地覆写 state × 每 step 需要追踪的独立 item 数"这两个维度。前者是架构级 hard wall,后者是 attention-entropy 驱动的软衰减(~3-5 item 是可靠区)。

能力边界决策框架

把任务沿两个正交轴划分:

X 轴 — 单 forward 内需要 multi-hop 整合的程度

Y 轴 — 是否需要跨 forward 维持被覆写的 state

LLM 在四象限的表现(基于本次调研 + 三份基座):

S0 statelessS1 append-onlyS2 overwriteS3 closed-loop
L0 单点✅✅ 擅长(topic segmentation narrative ≈ human;zero-shot classification F1 0.67-0.72)✅ 可行(context-engineered RAG)⚠️ 脆弱(core_memory_replace 静默停止)❌ 崩溃(specification drift 100%,11 sessions 0% 收敛)
L1 短程✅ 可行(intra-sentence RE supervised ~67 F1)✅ 可行⚠️ 脆弱❌ 崩溃
L2 多跳⚠️ 显著困难(DocRED zero-shot F1 10-23 vs 80 supervised;inter-sentence gap 13-14 F1)⚠️ 需外部 scaffold❌ 崩溃❌ 崩溃
L3 反事实⚠️ 需 CoIn 类外挂 scaffold(CounterBench 提升 20pp 才能到 90%)❌ 崩溃❌ 崩溃❌ 崩溃

两条硬边界

用户问题中的四类任务,在这个框架里的坐标分别是:

用户描述坐标判断
"找教科书中不同领域对应位置"L0 × S0✅✅ 擅长区
"段落之间的关系"L2 × S0⚠️ DocRED 57 F1 gap,明显困难但不是崩溃
"做具体的记录"L0-L1 × S2-S3❌ Claude Code 跨 session specification drift 100%
"根据内容更新现有方法论"L3 × S3❌ KUP 间接推理 <2%,接近不可能

分维度证据展开

Dim A — 定位与分类是擅长的,但"定位"本身也有细分

经典 topic segmentation benchmark(Wiki-727K)的 supervised SOTA 是 P_k = 13.89(Yu et al. EMNLP 2023,$https://huggingface.co/papers/2310.11772$)。LLM 在此上的表现分成两档:

narrative event segmentation 已经达到人类水平。Patel et al. 2025 在 Communications Psychology($https://www.nature.com/articles/s44271-025-00359-7$)给出严格实验:GPT-4 (temperature=0.5) 与人类标注者之间的边界一致性,与两组人类之间的一致性无统计显著差异(t=0.47, p=0.96)。而 Michelmann et al. (Behavior Research Methods 2025) 更发现 GPT-3 标注的边界比单个人类标注者更接近群体共识。这是最强的"LLM 擅长定位"证据。

Wiki-style topic segmentation 仍有差距。Mackenzie et al. (arXiv:2601.03276, 2026-01) 的 GPT-3.5 zero-shot boundary similarity 只有 0.35-0.63。"Context is the Key for LLM-Based Text Segmentation"(NLDB 2025)发现在提供 preceding context 后 open LLM 可以超越部分 supervised 方法,但这依赖 context-engineering。

Classification 上 LLM 好但不过 80%。BTZSC benchmark(ICLR 2026,$arXiv:2603.11991$)给出 zero-shot 最佳数字:instruction-tuned LLM macro F1 = 0.67,Qwen3-Reranker-8B 0.72。用户"F1 > 80%"的预期要靠 fine-tuning 或特定 reranker 才能达到。原文强调:"instruction-tuned LLMs at 4-12B parameters achieve competitive performance (macro F1 up to 0.67), excelling particularly on topic classification but trailing specialized rerankers"。

关系抽取是 sharpest gap。DocRED 的 supervised SOTA(ATLOP + DREEAM)F1 ≈ 80-82。同一数据集上 LLM zero-shot:PromptRE (GPT-3.5) Re-DocRED F1 = 10.56,DocGNRE 11.73,Only-LLM(NAACL 2025)22.68。最好的 LLM zero-shot 方法还比 supervised 低 57 F1 点。即使在 supervised 的世界里,inter-sentence relation F1 比 intra-sentence 低 13-14 点(DocuNet 67.0 vs 53.1,NCRL 67.5 vs 53.8,源 $arXiv:2406.07444$)。这直接解释了用户"找段落间关系很难"的直觉:不是 LLM 的局限,是 document-level relation 本身的复杂度。

Dim B — 持续性记录为何难:架构级的 write-once

用户问"为什么做具体记录这件事对 LLM 很难"。答案分三层:

架构层(hard wall):Tang & Xie 2026 在 Transformers are Stateless Differentiable Neural Computers($arXiv:2603.19272$)给出形式化推导,因果 Transformer 层等同于 stateless DNC,其中 external memory 是 write-once matrix of value vectors。内容寻址的 attention 是读操作,没有对应的原地更新写操作。这不是实现缺陷,是架构定义的一部分。

系统层(失败模式分类):本次调研整理了 12 类 state maintenance 失败,覆盖 MemGPT/Letta、Claude Code、Voyager、LangGraph、AutoGen:

失败类型代表证据
写操作触发崩溃Letta #953:写入 core_memory 后 assertion error,agent 永久不可用
写操作超界腐化Letta #1567(cpacker 本人报告):agent 自主写入超过 2000 字符限制,reload 时 ValidationError
Post-compaction stalenessClaude Code #33850:context 压缩后 agent 自信声明 git 状态错误、架构过时
Plan compliance decay$arXiv:2604.12147$:16,991 轨迹分析,SWE-bench Pro 上 plan 合规率降 13%
State driftSingh 2026 (Preprints doi:10.20944/preprints202601.0910):drift 随步骤单调累积,且与 context 长度无关
Zombie stateAutoGen #7043:状态转换非原子性,"有剩余工作但 ready queue 为空"
Specification drift(最刺痛的证据)Claude Code #19739:跨 11 个 session,format string 精确匹配率 0%,"iterations to convergence: Never achieved"

最后一条里有一个 meta-failure 特别值得引用:被要求分析自己的失败模式时,agent 正确识别了 specification drift 问题、准确记录了 root cause,然后立即在同一次对话里重现了它刚刚记录的失败。self-awareness ≠ prevention

记忆系统层(问题转化而非解决):MemGPT 论文自己承认 "The document QA task is challenging for all methods due to the limitations of embedding-based similarity search"($arXiv:2310.08560$)。向量存储的写入是 append,覆写要靠 delete + re-insert,相同 key 的多次更新导致多个版本共存于 embedding space。Unified Review 2026($arXiv:2604.08224$)的诊断最精确:"Memory externalizes state across time and converts long-horizon continuity into selective retrieval" —— 外部 memory 不是解决了状态可写性问题,是把它转化为检索精度问题。

Dim C — 方法论更新为何几乎不可能:三层全线失守

把"更新方法论"这个能力分成三层评估,每一层都有清晰的负面证据。

Level 1 In-context(单 prompt 内更新规则):可行但脆弱。MOSAIC benchmark($arXiv:2601.18554$)发现约束数超过 15 时几乎所有模型出现 compliance 下降,reasoning 模型(DeepSeek-R1 8B、Qwen3)衰减更严重。RULEARENA(ACL 2025,95 条中等复杂度规则)显示非 reasoning 模型在复杂问题上 Acc <10%,o1-preview 也 "fails most of them"。失败机制是三重的:从大量相似规则中召回正确规则的 recall 低 + 无关规则的干扰强 + 数值计算精度不足。

Level 2 Fine-tuning(参数更新):catastrophic forgetting 没有被 PEFT 方法根本解决。TRACE benchmark($arXiv:2310.06762$)数字:LLaMA-2-chat 13B 在 continual fine-tuning 后 GSM8K 从 28.8% 崩到 2%(降幅 93%)。FAPM(EMNLP 2025)记录全参数 SFT 后 Llama3-8B 通用任务准确率维持约 0.15,"almost loses all generalization capability"。arXiv:2601.18699(2026-01,mechanistic analysis)在 LLaMA 4 Maverick 上测得连续训练 3 个任务后首任务准确率从 89.3% 降到 67.2%,低相似度任务序列降幅 31.7%。LoRA 的 forgetting profile:FAPM 明确在 MedQA/SQuAD 上观察到 LoRA CF;OPLoRA(AAAI 2026)用正交投影缓解但"cannot eliminate"。

Level 3 Meta-learning(学会更新框架本身):理论与实证双重受限。$arXiv:2510.10981$ 把 ICL 形式化为 Bayesian inference over pre-training task family,泛化受限于 pretraining prior。ICLR 2025 In-context vs. In-weight 显示 ICL 的更新能力持续被 in-weight bias 干扰。KUP benchmark(ACL Findings 2025,$https://aclanthology.org/2025.findings-acl.1326$)是最直接的证据:最好的 continual pretraining 方法在"间接推理"(用新知识推导结论)上准确率 <2%。论文原话:"all methods primarily learn to memorize updates and fail to reason over their implications"。

"方法论更新"没有 well-established benchmark。目前最接近的 proxy 是 KUP(<2%)、TRACE(-93%)、RULEARENA(<10%)。Production 观察:Copilot / Cursor / Claude Code 的"方法论学习"完全依赖人工维护 context 文件(CLAUDE.md、copilot-instructions.md),没有一个是真正的 in-model 参数更新。

Self-correction 的信息论上界($arXiv:2601.0892$, 2026-01)给出最终诊断:"correlated error between generation and self-evaluation: LLMs can correct identical errors when presented as external input but fail to correct those same errors when they appear in their own output"。生成器和评估器共享参数,意味着自我更新在理论上不可靠。

Dim D — 困惑度的信息论视角:部分成立,方向正确

用户的核心猜想是:"LLM 的困惑行为本质上是 perplexity 的统一现象"。这个猜想在 pretraining 层面完全成立,在 downstream/capability 层面部分失效,在 attention/state 层面通过 Shannon entropy 的底层结构连接起来。

成立的部分。Kaplan (2020) 和 Chinchilla (2022) 的 scaling laws 完全以 cross-entropy loss(即 $\log \text{PP}$)为核心因变量。Chinchilla 公式 $L(N,D) = E + AN^{-\alpha} + BD^{-\beta}$ 中 $E \approx 1.817$ 是语言真实熵的下界,数学严格地对应 perplexity 的不可减少项。Delétang et al. (ICLR 2024) 的 Language Modeling Is Compression 把 perplexity 的下降直接等价于压缩率的提升:"a model that compresses well generalizes well"。

断裂的部分。Schaeffer et al. 2023(NeurIPS)的 Are Emergent Abilities a Mirage? 给出数学证明:emergence 的锐利性是非线性下游指标(accuracy over sequence $= p_{\text{token}}^L$)的人工产物,底层 per-token perplexity 始终平滑。"perplexity 高 = 困惑 = 能力差"这条因果链在 emergence 维度被打断。Lourie et al. (EMNLP 2025 Findings) 在 46 个下游任务上重新分析:只有 39% 呈现可预测的 scaling,其余 61% 呈 emergence / inverse scaling / U-shape;更刺痛的是"choosing a different dataset for the validation perplexity can flip scaling trends"。

长上下文场景的诊断。Fang et al. (ICLR 2025) 的 LongPPL 论文给出精确数字:standard perplexity 与 LongBench 性能的 Pearson 相关 r = -0.18(近 0),而 LongPPL(只在 key tokens 上计算的 perplexity)r = -0.96。Key token 通过 Long-Short Difference $\text{LSD}_\theta(x_i) = \log P_\theta(x_i | l_i) - \log P_\theta(x_i | s_i)$ 识别,即"哪些 token 在长上下文下才能被准确预测"。Standard perplexity 把这些 key token 的信号稀释在所有 token 的平均里。

与 attention entropy 的耦合(用户猜想的机制层面)。Gong & Zhang NeurIPS 2024 Workshop 实验确认:N-back 任务中 attention score matrix 的总熵 $H = -\sum_{i,j} p_{i,j} \log p_{i,j}$ 随 N 增加而增加,熵增与准确率下降强相关。arXiv:2602.13699 (2026-02) 进一步用 per-head 2-Rényi entropy 做稀疏逻辑回归,在回答生成之前就能从 attention pattern 预测答案正确性(+17.7% AUROC)。这两篇实证显示 attention entropy(追踪侧)和 per-token perplexity(输出侧)在能力边界处联动,共享 Shannon entropy 的底层结构。

更强的候选框架。Finzi et al. 2026 的 From Entropy to Epiplexity($arXiv:2601.03220$)提出 epiplexity $S_T(X) := |P^{\star} - H_T(X)|_+$,把总信息量拆成可学习结构 $P^\star$ 与 time-bounded entropy $H_T$(不可学习的随机噪声)。Shannon entropy 对"AlphaZero 从自我对弈产生新知识"、"LLM 正向英语训练比反向更好"、"LLM 生成比训练集更复杂的程序"这三个悖论无法解释,epiplexity 通过"计算有界"这个额外约束解决了它们。这是 2026 年新论文,尚未经同行评审,但理论动机和实验(cellular automata、chess、LLM 的 OOD 泛化)都很干净。

综合评估:perplexity 是最好的 pretraining-level 指标,是任何精细度量(LongPPL、semantic entropy、epiplexity)的起点,但不是统一的能力边界解释。用户的认识论判断"两个广泛认可的事物在底层共享结构"在 perplexity ↔ attention entropy 这对概念上成立(都是 Shannon entropy 的不同层次实例化),但"最强版本"的共享结构是 Information Bottleneck 或 epiplexity 框架。


信息论视角的能力边界统一解释

把前面四个维度合成一个公式:

$$\text{Capability}(\text{task}) \propto \frac{I(\text{context}; \text{answer}) \cdot \mathbb{1}[\text{state writable}]}{H(\text{answer}|\text{context}) \cdot N_{\text{hops}} \cdot T_{\text{horizon}}}$$

各项的机制对应:

这个公式的两个预测都能从已有数据验证:

首先,L0 × S0 类任务(topic segmentation narrative)$N_{\text{hops}}=1, T_{\text{horizon}}=1, \mathbb{1}=1$,$I$ 高 $H$ 低 → 性能接近人类(Patel et al. 2025)。

其次,L3 × S3 类任务(methodology update)$N_{\text{hops}}$ 高、$T_{\text{horizon}}$ 高、$\mathbb{1}=0$ → 性能坍塌(KUP <2%)。

用户直觉里的"困惑"现象对应 $H(\text{answer}|\text{context})$ 上升 + $N_{\text{hops}}$ 超过 working memory 限制,这两个因素都可以在 attention entropy 上观察到(Gong & Zhang 2024)。但用 sequence-level perplexity 观察不到,因为 average 稀释了 key-token 的信号(LongPPL 的发现)。


Claim 验证状态表

#Claim来源置信度
C1GPT-4 在 narrative event segmentation 达到人类水平Patel et al. 2025 Communications Psychology✅✅ Very High
C2GPT-3 比单个人类标注者更接近群体共识Michelmann et al. 2025 BRM✅✅ High
C3Wiki topic segmentation LLM zero-shot 仍落后 supervised SOTA(P_k 13.89)Yu EMNLP 2023 + Mackenzie 2026✅✅ High
C4Zero-shot topic classification macro F1 ≈ 0.67-0.72BTZSC ICLR 2026✅✅ High
C5DocRED LLM zero-shot F1 10-23 vs supervised ≈80(gap 57)NAACL 2025 + Nature SR 2024✅✅ Very High
C6Intra- vs inter-sentence RE gap 13-14 F1(supervised)arXiv:2406.07444✅✅ High
C7Transformer 是 stateless DNC,KV-cache 为 write-once matrixTang & Xie 2026 arXiv:2603.19272✅✅ Very High(形式证明)
C8MemGPT/Letta 写入触发 agent 不可用GH #953, #1567(cpacker 本人报告)✅✅ High
C9Claude Code 跨 11 session specification 精确匹配率 0%GH #19739✅✅ High
C10Plan compliance 在 SWE-bench Pro 上降 13%arXiv:2604.12147(16991 轨迹)✅✅ Very High
C11State drift 随步骤累积,与 context 长度无关Singh 2026 Preprints✅ High(控制实验,未 peer review)
C12Catastrophic forgetting TRACE GSM8K 28.8% → 2%arXiv:2310.06762✅✅ High
C13KUP indirect reasoning <2%(methodology update 的 proxy)ACL Findings 2025✅✅ Very High
C14LoRA / PEFT 不能根本消除 catastrophic forgettingFAPM EMNLP 2025, OPLoRA AAAI 2026✅✅ High
C15ICL 是 Bayesian inference over pretraining task familyarXiv:2510.10981✅ High(理论)
C16Self-correction 无外部反馈不可靠(correlated error 上界)Huang ICLR 2024 + arXiv:2601.0892✅✅ Very High
C17Schaeffer Mirage 打断 perplexity-emergence 因果链NeurIPS 2023✅✅ Very High
C18LongPPL:standard PPL vs LongBench r=-0.18;key-token r=-0.96ICLR 2025✅✅ Very High
C19Attention entropy 与 N-back 准确率下降联动Gong & Zhang NeurIPS 2024 Workshop✅✅ High
C20Epiplexity 作为替代统一框架arXiv:2601.03220 (2026-01)⚠️ Medium(新论文,未 peer review)

对用户直觉的裁决

用户的四段直觉分别评估:

"找教科书不同领域对应位置,是否是 LLM 擅长的" — 基本正确。narrative event segmentation 已经达到人类水平,topic classification 在 macro F1 0.67 级别。但"擅长"的边界要加两个限定:narrative 比 wiki 类更容易,classification 比精确 boundary detection 更容易。给定的任务如果是"找出教科书中哪些章节属于代数、哪些属于几何",这是最擅长的那一档。如果要求"精确定位代数章节的起始 token",性能下降。

"建立位置之间的关系困难" — 非常正确,有最清晰的数字支撑。DocRED 上 57 F1 点的 zero-shot vs supervised gap 是本次调研里最大的单一 gap。即使是 supervised 模型,intra- 到 inter-sentence 之间还有 13-14 F1 的稳定落差。这个困难不是 LLM 特有,是 document-level relation extraction 本身的复杂度。LLM 在这个问题上没有特别好也没有特别差,只是比 supervised 方法明显弱。

"做具体的记录困难" — 正确,而且根源比想象中更深。架构级的 write-once 属性(Tang & Xie 2026)意味着这个困难无法靠 prompt engineering 或更大 context 解决。Singh 2026 的反直觉发现是决定性的:state drift 随步骤累积,与 context 长度无关。所以更大的 context window 不是这个问题的解药。实际证据最刺痛的是 Claude Code issue #19739 里的 meta-failure:agent 能准确识别和记录 specification drift,却在同一次对话里立即重现它刚记录的失败。

"更新方法论困难" — 非常正确,这是最困难的一档。三个层面(in-context / fine-tuning / meta-learning)全线受限。KUP 上最好方法的间接推理准确率 <2% 是整个调研里最低的数字。这个困难有两个独立的锁:参数更新会引入 catastrophic forgetting(TRACE 93% 降幅),in-context 更新受 pretraining task family prior 约束(arXiv:2510.10981)。Self-correction 的信息论上界(correlated error)把这个门关得更死。

"这跟困惑度有关" — 方向正确,但具体形式需要修正。Perplexity 是最好的 pretraining-level 指标,但在 downstream 和 capability 层面 61% 的任务不可预测。更精细的版本(LongPPL、token-level entropy、epiplexity)在各自场景下是有效的能力边界指标。用户的底层认识论(跨概念共享 Shannon entropy 结构)是对的,但 perplexity 这个具体指标本身不是最强的统一框架。Epiplexity(2026)更有希望,不过需要 2-3 年的同行验证。


对 NightCode 的工程含义

本次调研有 7 条可以直接影响 NightCode 架构决策:

一、把任务沿决策框架的两轴预先分类。L0 × S0 的任务可以用单 agent 单 call,L1-L2 × S0-S1 用 sub-agent 并行 + 轻量 memory,L2-L3 × S2+ 的任务默认不可靠,需要显式外挂验证器(LLM-Modulo 范式)而非期望 LLM 自主完成。

二、维护 methodology 文档这类任务要重新设计交付模式。不要让一个 agent 跨 session 维护方法论 MD 文件(specification drift 100%)。改为:每次 session 从文件读取(read-only),在 session 内做更新决策,让用户或外部 validator 批准后提交。写操作不走 agent 自主路径。

三、Compaction 是 state corruption 的高风险窗口。Claude Code #33850 和 #19739 都显示 post-compaction 的 staleness 最严重。NightCode 如果要做 context compaction,需要在 compaction 前强制触发"key invariant snapshot"并在 compaction 后对比 snapshot 与重建后的 state。

四、区分"状态的可写性"和"状态的可检索性"。MemGPT-style 的 vector store 解决的是后者。NightCode 如果需要真正的 writable state,应该把 state 放在关系数据库或 JSON file 里,让 agent 通过显式 tool call 写入,不把 state 语义嵌入 context window。

五、Plan reminder 的频率决策。arXiv:2604.12147 的发现是 plan compliance 随 trajectory 长度降 13%,但 periodic plan reminder 能缓解。NightCode 的 coordinator agent 可以在每 N 步强制注入 plan recap,N 的选择参考 attention entropy 熵增规律(等价于每 5-8 个复杂 action 重新 recap)。

六、Methodology update 要走人类 in-the-loop。KUP <2% 意味着 agent 自主从阅读内容更新方法论的能力接近零。NightCode 的 skill library 和方法论更新必须有人类审核步骤,不能让 coordinator 自主改 SOUL.md / CLAUDE.md / skill 文件。

七、困惑度作为 uncertainty signal 要用 token-level 而非 sequence average。生产监控里如果要用 perplexity 做幻觉检测,应该用 RePPL 或 LongPPL 类的加权版本(AUC ≈ 0.833),不要用 sequence-level perplexity(LongBench 相关系数近 0)。更好的路径是 attention-based UQ(RAUQ、TokUR)。


仍未确认的点 / 未覆盖的维度


完整引用索引

Topic Segmentation & Classification(Dim A)

Stateful Maintenance(Dim B)

Continual Learning / Methodology Update(Dim C)

Perplexity Theory(Dim D)

基座调研(前置)


调研工件


← 返回方法论库索引 · 返回方法论区