large_context_final_methodology_20260408_manual
方法论库 · 实跑 · none
本页是 <code>contexts/methodology/large_context_final_methodology_20260408_manual.md</code> 的逐字投影(仅隐私清洗,零改写)。
时点提示:本页是仓内文件 contexts/methodology/large_context_final_methodology_20260408_manual.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。
报告元数据(frontmatter)
name: large_context_final_methodology_20260408_manual
description: 信息瓶颈框架+验证原则
domain: infra
consumption:
surface: none
trigger: ""
consumer: orchestrator
status: library
promoted_to: null大规模信息提炼方法论:从 Prompt 溯源到最终综合
Date: 2026-04-08
Skill: manual (cross-session prompt analysis + methodology synthesis)
Topic: Distilling the user's core intent across all large-context sessions, evaluating existing reports, and producing the final methodology
一、Prompt 溯源与核心意图分析
数据来源
从 4 个 JSONL session 中提取了 7 条核心用户 prompt,跨 3 轮迭代:
| 轮次 | Session | 时间 | 核心意图 |
|---|---|---|---|
| Round 1 | 7f2906ef | 2026-04-06T22:14 | 发起:找大 context 信息提取方法论,启动 24 sub-agents |
| Round 1 续 Msg 1 | 0c44242f | 2026-04-06T22:54 | 重发 + 追加:批判性检查、autoresearch loop、多场景验证 |
| Round 1 续 Msg 2 | 0c44242f | 2026-04-07T07:54 | 关键纠正:去掉分级评分机制,维护核心,独立 sub-agent 审查 |
| Round 1 续 Msg 3/4 | 0c44242f | 2026-04-07T08:18 | 整理:写入 config how-to,拆分 survey session 和 skill |
| Round 2 Msg 1 | 941bb137 | 2026-04-07T14:15 | 评判已有成果 + 追加:大模型如何守住核心不被冗余 context 影响的监管机制 |
| Round 2 Msg 3 | 941bb137 | 2026-04-07T14:52 | 延伸:chaos to order 方法论,Caro 总统文档整理,自我监管链 |
| Round 2 Msg 4 | 941bb137 | 2026-04-07T15:46 | 批判转折:AI 方案不可信,要找真正成功案例,核心是语义压缩 |
| Round 2 综合 | bc4b5951 | 2026-04-07T22:54 | 提取所有 prompt 的 taste,筛选有用内容,输出最终方法论 |
关键 Prompt 原文摘录
Round 1 初始(定义问题):
面对这种架构的重构,它其实就是一个很重要的在这种大 context 里面去寻找每一个目录它的作用是什么……这些东西都是很重要的信息,而且很多时候这个东西还是隐式的,并不是这种明面上的东西。那我们如何让大模型在这个运行过程中真正找到这些信息呢?
你面对的这项任务本身它就是一个在大 context 中如何去提取有效信息的一个任务。……我希望你仔细地去思考,然后仔细地去想你需要的信息是哪些。然后你要时刻记住我的要求是什么,你要在每一步的思考的时候都要去想一想我的核心要求是什么样的。
Round 1 续 Msg 2(关键纠正,定义品味):
我觉得这些并没有必要。我们在做调研的时候,应该时刻维护一个核心,也就是用户要求的、想要了解或实现的内容。针对这种隐性的关键信息,我们要找到它们,并以其为核心开展调研。调研后的结果也不要忘了核心是什么,要主动排除没用的东西,只留下最相关、与核心相符的内容。
Round 2 Msg 4(批判转折,重新定义方向):
我真的觉得,现在很多方案都没有一个能真正在海量 context 中完成有效提取的成功案例。
我觉得人类在漫长的历史中有很多瑰宝,你需要在现实历史中去找到那些可能有效的方法。针对大 context 场景,如何真正提取出精华,归根结底其实就是做"语义压缩"这个任务。
我希望你能找到这些真正成功的案例,而不是找一些没有经过验证的方法论,那些其实没有意义。我们要找的是那些真正像瑰宝一样的具体实现。
二、用户核心意图诊断
问题重构
纵观所有 prompt,用户问的问题不是"如何让 AI agent 处理长 context"。这是现有 skill 滑向的方向,但不是原始意图。
用户问的根本问题是:当面对远超处理能力的信息量时,如何可靠地提炼出与特定目的相关的精华?
进一步精确:用户发现的核心失败模式不是"信息找不到",而是"在处理过程中丢失了你要找的东西"。所有反转案例(f0187cfb 的三次重复纠正、b82728dc 的 SOP 擅自删除、9f57f10f 的过度工程化)都不是 agent 缺少信息,而是 agent 在处理过程中丢失了约束。
用信息论的语言:保护 Y 变量(提取目标)在大规模 X(输入数据)处理过程中不发生漂移。 Y 的漂移,而非 X 的遗漏,是大 context 场景中最致命的失败模式。
用户品味(Taste)
从 prompt 中提炼出六条品味标准,任何不符合这些标准的内容都应被排除:
| 标准 | Prompt 证据 |
|---|---|
| 验证优先于理论 | "找到那些真正成功的案例,而不是找一些没有经过验证的方法论" |
| 核心约束不可丢失 | "时刻维护一个核心""时刻记住我的要求是什么"(出现在所有主要 prompt 中) |
| 去除形式化包装 | "不要分级评分机制""评分分析只是大模型的陷阱,后训练的毒药" |
| 从人类历史找答案 | 主动将调研方向从 AI 论文转向 Caro、乾嘉学派、OED、Dead Sea Scrolls |
| 反向证据同等重要 | "反向证据也确实很重要""AI 到现在还是面临很多没有解决的问题" |
| 方法论必须能自我应用 | "这件事情本身就是一个在大 context 中如何去提取有效信息的任务" |
用户想要构建的东西
一套以历史验证案例为根基的语义压缩方法论,回答:给定特定目的(Y),如何从海量信息(X)中可靠地提炼精华——同时诚实标注哪些步骤 AI 可以做、哪些不能。
它不是 AI agent 的操作手册,而是理解"从混沌到秩序"这个永恒问题的认知框架。AI agent 的 skill 是这个框架的一个应用实例,而非框架本身。
三、现有调研报告评估
直接可用(构成方法论骨架)
| 报告 | 可用部分 | 理由 |
|---|---|---|
chaos_to_order_round2_synthesis Section I + IV | 5 个历史验证案例 + 最终综合 | 满足"验证优先":校勘四法(300 年验证)、Murray 鸽笼架(71 年、40 万词条)、Stegemann 公式(独立验证)、Darwin 文件夹(23 年)、ICIJ(法律检验) |
chaos_to_order_knowledge_distillation_synthesis 六个同构模式 | 模式 2(Y 决定收获)、模式 3(外化)、模式 4(断裂点)、模式 6(框架先于数据) | 跨域同构精华,6 个领域独立收敛到相同模式 |
reversal_moments 8 个反转案例 | 全部 | 一手经验证据,精确到 JSONL 行号和用户原话 |
chaos_to_order_round2_synthesis Section II + III | AI 真实边界 + 6 个失败模式 | 满足"反向证据":长 context 24.2% 退化、幻觉不可消除、自动评估 r=0.11 |
有参考价值(不构成方法论核心)
| 报告 | 可用部分 | 不可用部分 |
|---|---|---|
large_context_information_extraction_deep_research | Lost in the Middle 机理解释、三噪声框架 | 大量 AI 论文合集(用户明确说 AI 方案没有成功案例) |
large_context_extraction_methodology | F1-F5 失败模式的案例级证据 | 占比百分数(用户拒绝伪精确)、四阶段流水线(用户拒绝 SOP 化) |
large_context_extraction_v2_cross_validation | 交叉验证矩阵、v1 批判 | v2 改进本身是过度工程化的产物 |
archival_science_methodology | MPLP、Finding Aids | 部分内容缺少独立验证 |
对方法论无直接价值
| 报告 | 理由 |
|---|---|
large_context_information_extraction_methodologies | AI/ML 论文合集,重复 Lost in the Middle 解决方案 |
large_context_extraction_improvement_proposal | "三层防御架构"方向对但执行偏 SOP 化 |
Skill 文件 bestpractice_large_context_extraction.md(2026-07-08 已归档至 adhoc_jobs/redundant_archive/skills_dedup_20260708/) | Build Log 记录了 5 个自身问题,是妥协产物 |
四、最终方法论
核心问题
面对大规模无序信息,可靠地提炼出与特定目的相关的精华。"可靠"的含义:提炼结果忠实于提取目标(Y),而非忠实于数据中最显眼的内容。
本质是语义压缩。Information Bottleneck 的形式化表述:在保持对目标变量 Y 的信息量的前提下,最大程度压缩输入 X。Y 的定义决定了什么被保留、什么被丢弃。
整个方法论围绕一个核心:定义 Y、保护 Y、用 Y 驱动压缩。
经过验证的五条原则
原则一:框架先于数据。没有 Y 就不要碰 X。
历史验证:
- Caro 花数年读二手文献建立"权力运作"框架后才碰档案箱。3200 万页总统文档中,同样的箱子之前几十个历史学家都翻过,但 Caro 的 Y 不同(权力运作 vs 事件编年),提炼出的知识完全不同。
- Darwin 在 Malthus 提供因果框架前已积累 20 年数据但无法形成理论。框架到来的那一刻,已有数据瞬间从混沌变为有序。
- 校勘四法中"对校"排第一,因为它依赖已有版本(外部框架),而非推理。
- ICIJ 在 1150 万份文档到达前就准备好了种子名单和调查框架。
- 四库全书的四部分类在文献到达前就确定。
AI 失败印证:
- Session f0187cfb:Agent 先读了用户已有实现(大量 context),锚定在旧实现上,忽视了"以鸭哥架构为准"。方向完全反了。用户发了三次同一条消息才纠正。
- Build Log 记录:v1 创建过程中 Agent 先读内部数据再做外部研究,违反了自己的 Anti-Anchor 原则。
操作含义:在接触源数据之前,先用独立材料建立提取目标的清晰认知模型。如果你发现自己在说"源数据里有 X,所以结果也应该有 X",Y 已经被 X 污染了。
原则二:确定性操作优先于概率操作。能对校就不要理校。
历史验证:
- 乾嘉学派 150 年实践的可靠性排序:对校(机械比对)> 本校(内部一致性)> 他校(外部交叉引用)> 理校(推理判断)。陈垣原话:"理校最高妙亦最危险。"
- 阎若璩用对校和他校花 38 年列举 128 条证据证伪《古文尚书》,300 年后清华简从物质层面再次证实。
- Stegemann 将 Dead Sea Scrolls 25,000 个碎片的重建转化为数学公式,独立于语义理解。1989 年 Puech 独立验证,2020 年 DNA 分析进一步确认。
AI 失败印证:
- LLM 本质上在做"理校",但不知道自己在做理校,也不标注推断的置信度。
- BooookScore 与人类判断相关性 r=0.11。Claude 对摘要忠实度的自动评估比人类判断高估 3 倍。
- CE 的 LLM Judge 做 spot-check 2-3 个文件宣布 30/30 PASS,实际 21/37 缺少数据流章节。
操作含义:能用 grep、diff、正则、路径筛选、版本对比的地方,不用 LLM 推理。LLM 推理的结果标注为"推断"而非"确证"。全量验证用确定性脚本,不用 LLM spot-check。
原则三:外化为可审查的物理结构。看不见的东西无法纠正。
历史验证:
- Murray 的鸽笼架:1,029 个格子将 350 万张卡片转化为一次处理一个格子的可管理规模。前任 Furnivall 无系统化基础设施,21 年失败。Murray 的关键改进:系统化的收集指南 + 物理分类基础设施。知识提炼的可靠性来自系统,不来自个人。
- Darwin 的文件夹系统:读书 → 标注 → 摘要 → 拆成纸条 → 归入文件夹。跨越 23 年保持认知连贯性。
- Heuer(CIA 分析方法论):"分析失败的根源不是信息不足,而是认知机制本身的局限。'想得更仔细'不可靠,必须用流程约束。"
- ICIJ 的 Neo4j 图数据库让 80 个国家 400 名记者共享发现。
AI 失败印证:
- Sub-agent 上下文断裂(F5):合规率仅 40%。约束只存在于主 agent 的 context 中而没有外化到 sub-agent 的 prompt 中。
- LLM 的 thinking 过程不可见。context 衰减不外化就不可检测。
- InfiAgent 实证:将中间结果持久化到文件的 agent 比不持久化的表现好 21 倍。
操作含义:每个中间结论写入文件。分割子任务时,将 Y(提取目标)和全局约束显式写入子任务 prompt 开头。目的不是备份,是让不可见的漂移变成可审查的信号。
原则四:断裂点是最高价值信号。意外之处信息密度最高。
历史验证:
- 信息论形式化:self-information = -log P(x),越意外的事件携带越多信息。在 Zipf 分布的世界中,大部分文档是"预期中的"(低信息量),少数异常文档携带不成比例的信息。
- Caro 的 Turn Every Page 有效不是因为读得多,而是穷尽阅读确保了不遗漏稀有的高信息量断裂点。
- ICIJ 的双信号检测:异常信号(不该出现的关联)+ 连接信号(隐藏的网络路径)。
- 情报分析的 Red Team / Devil's Advocacy:系统性关注与主流假设矛盾的证据。
AI 失败印证:
- 用户对 agent 的每次纠正("不对")都是断裂点。f0187cfb session 的三次纠正精确标记了 Y 与执行之间的偏差。
- Agent 倾向于平滑处理意外("承认错误"但 thinking 未真正切换视角),而非将意外作为最高优先级信号。
操作含义:正向扫描(我认为重要的)完成后,做一次逆向扫描(什么被我跳过了),对比发现盲区。用户纠正是最高优先级信号——在执行修复之前先记录原话、被纠正的行为、应该怎么做。
原则五:两阶段选择。先粗后精,粗筛质量决定上限。
历史验证:
- 所有领域的专家都先做粗粒度范围选择,然后在选定范围内做穷尽式细粒度分析:
- Caro:二手文献 → 识别关键时段 → 在选定箱子内 Turn Every Page
- MPLP:全部馆藏建 Series 级可检索性 → 按需深入到文件夹/文档级
- ICIJ:机器批处理(OCR + 索引)→ 图数据库穷尽探索
- HGP:层级鸟枪法
- 粗筛阶段的质量决定整个过程的效率上限。Caro 花大量时间读二手文献不是偷懒,是在投资粗筛。
AI 失败印证:
- F2(信息衰减):Agent 对所有文件做均匀浅层扫描然后声称完成。
- F3(浅尝辄止):Observer 补录只补 3 天就报告完成。
- 两种做法都遗漏了高信息量断裂点。
操作含义:先用确定性方法(grep 关键词、路径筛选、Token 预估)缩小范围。在缩小后的范围内做语义级穷尽分析。不要对全量数据做均匀处理。
已证明不可靠的方法
| 方法 | 反面证据 | 为什么不可靠 |
|---|---|---|
| 纯 LLM 推理不标注置信度 | 乾嘉学者自承"理校最危险";LLM 幻觉在数学上不可避免(Xu 2024, Karpowicz 2025) | 理校产出看起来和对校一样确定,但可靠性差一个量级 |
| LLM spot-check 代替全量验证 | CE Judge 30/30 全假(21/37 实际缺失);BooookScore 与人类判断 r=0.11 | LLM 评估系统性高估质量 |
| 单一来源结论直接采信 | Caro 三个不实轶事;四库全书的系统性删改 | 没有独立来源确认的结论只是假设 |
| 声称快速完成大规模知识提炼 | OED 71 年、HGP 13+19 年、Caro 50+ 年、阎若璩 38 年 | 大规模知识提炼是长周期工程 |
| "想得更仔细"代替流程约束 | Heuer 核心论点;f0187cfb 前两次"承认错误"但 thinking 未切换视角 | 认知偏见不会因为意识到它而消失 |
| AI agent context 超过有效区后继续处理 | 长 context 仅长度导致 24.2% 准确率下降;77% 后出现乱码和重复 | 物理上不可行,不是"建议分割" |
AI 在此框架中的诚实定位
用校勘四法映射 AI 当前的可靠角色:
| 校勘层级 | AI 胜任度 | 说明 |
|---|---|---|
| 对校(机械比对) | 完全胜任 | diff、grep、格式验证、全量一致性检查 |
| 本校(内部一致性检测) | 基本胜任 | 前后文矛盾检测、引用链验证 |
| 他校(交叉引用验证) | 部分胜任 | 多源检索可以,判断外部源质量需要领域知识 |
| 理校(凭学识推理) | 可以做但必须标注为推断 | 幻觉在数学上不可避免,长 context 退化是架构固有属性 |
AI 在大 context 提取中的最佳角色是执行确定性操作(对校、本校)和辅助概率操作(他校),而非独立完成推理操作(理校)。最终的知识判断仍需人类介入。
五原则的统一图景
五条原则不是孤立的,它们构成一个围绕 Y 守恒的闭环:
原则一(框架先于数据)→ 定义 Y
↓
原则五(两阶段选择)→ 用 Y 做粗筛,缩小 X
↓
原则二(确定性优先)→ 先用对校/本校处理可确定的维度
↓
原则四(断裂点检测)→ 在穷尽分析中捕获高信息量事件
↓
原则三(外化)→ 将发现写入可审查的物理结构
↓
回到原则一 → 基于外化结果检验 Y 是否需要受控演化贯穿全过程的核心:Y 的质量决定整个循环的产出质量。Y 漂移时循环失效。原则三(外化)是检测 Y 漂移的唯一可靠机制——看不见的东西无法纠正。
五、文件索引
完整的证据链和调研材料分布:
| 文件 | 在本方法论中的角色 |
|---|---|
| 本文件 | 最终综合:prompt 溯源 + 意图诊断 + 报告评估 + 方法论 |
chaos_to_order_round2_synthesis_20260407_manual.md | 核心证据:5 个历史验证案例 + AI 真实边界 + 6 个失败模式 |
chaos_to_order_knowledge_distillation_synthesis_20260407_manual.md | 核心证据:6 个跨域同构模式 |
reversal_moments_large_context_extraction_20260407_manual.md | 核心证据:8 个反转案例(一手经验) |
large_context_extraction_methodology_20260407_manual.md | 参考:19 个内部实践案例的失败模式分析 |
large_context_information_extraction_20260407_deep_research.md | 参考:50 个外部来源的技术文献综述 |
large_context_extraction_v2_cross_validation_20260407_manual.md | 参考:12+3 agent 交叉验证 |
archival_science_methodology_chaos_to_order_20260407_manual.md | 参考:档案学方法论(MPLP、Finding Aids) |
config/LARGE_CONTEXT_EXTRACTION_GUIDE.md | 参考:Skill 构建过程和问题复盘 |
adhoc_jobs/redundant_archive/skills_dedup_20260708/bestpractice_large_context_extraction.md(原 rules/skills/drafts/ 件,2026-07-08 去重归档) | 本框架的一个 AI agent 操作层应用实例 |