context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

large_context_final_methodology_20260408_manual

Z3 全文↑ Z2 条目

方法论库 · 实跑 · none

← 返回方法论库索引 · 返回方法论区

本页是 <code>contexts/methodology/large_context_final_methodology_20260408_manual.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 contexts/methodology/large_context_final_methodology_20260408_manual.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

报告元数据(frontmatter)
name: large_context_final_methodology_20260408_manual
description: 信息瓶颈框架+验证原则
domain: infra
consumption:
  surface: none
  trigger: ""
  consumer: orchestrator
status: library
promoted_to: null

大规模信息提炼方法论:从 Prompt 溯源到最终综合

Date: 2026-04-08
Skill: manual (cross-session prompt analysis + methodology synthesis)
Topic: Distilling the user's core intent across all large-context sessions, evaluating existing reports, and producing the final methodology


一、Prompt 溯源与核心意图分析

数据来源

从 4 个 JSONL session 中提取了 7 条核心用户 prompt,跨 3 轮迭代:

轮次Session时间核心意图
Round 17f2906ef2026-04-06T22:14发起:找大 context 信息提取方法论,启动 24 sub-agents
Round 1 续 Msg 10c44242f2026-04-06T22:54重发 + 追加:批判性检查、autoresearch loop、多场景验证
Round 1 续 Msg 20c44242f2026-04-07T07:54关键纠正:去掉分级评分机制,维护核心,独立 sub-agent 审查
Round 1 续 Msg 3/40c44242f2026-04-07T08:18整理:写入 config how-to,拆分 survey session 和 skill
Round 2 Msg 1941bb1372026-04-07T14:15评判已有成果 + 追加:大模型如何守住核心不被冗余 context 影响的监管机制
Round 2 Msg 3941bb1372026-04-07T14:52延伸:chaos to order 方法论,Caro 总统文档整理,自我监管链
Round 2 Msg 4941bb1372026-04-07T15:46批判转折:AI 方案不可信,要找真正成功案例,核心是语义压缩
Round 2 综合bc4b59512026-04-07T22:54提取所有 prompt 的 taste,筛选有用内容,输出最终方法论

关键 Prompt 原文摘录

Round 1 初始(定义问题)

面对这种架构的重构,它其实就是一个很重要的在这种大 context 里面去寻找每一个目录它的作用是什么……这些东西都是很重要的信息,而且很多时候这个东西还是隐式的,并不是这种明面上的东西。那我们如何让大模型在这个运行过程中真正找到这些信息呢?

你面对的这项任务本身它就是一个在大 context 中如何去提取有效信息的一个任务。……我希望你仔细地去思考,然后仔细地去想你需要的信息是哪些。然后你要时刻记住我的要求是什么,你要在每一步的思考的时候都要去想一想我的核心要求是什么样的。

Round 1 续 Msg 2(关键纠正,定义品味)

我觉得这些并没有必要。我们在做调研的时候,应该时刻维护一个核心,也就是用户要求的、想要了解或实现的内容。针对这种隐性的关键信息,我们要找到它们,并以其为核心开展调研。调研后的结果也不要忘了核心是什么,要主动排除没用的东西,只留下最相关、与核心相符的内容。

Round 2 Msg 4(批判转折,重新定义方向)

我真的觉得,现在很多方案都没有一个能真正在海量 context 中完成有效提取的成功案例。

我觉得人类在漫长的历史中有很多瑰宝,你需要在现实历史中去找到那些可能有效的方法。针对大 context 场景,如何真正提取出精华,归根结底其实就是做"语义压缩"这个任务。

我希望你能找到这些真正成功的案例,而不是找一些没有经过验证的方法论,那些其实没有意义。我们要找的是那些真正像瑰宝一样的具体实现。


二、用户核心意图诊断

问题重构

纵观所有 prompt,用户问的问题不是"如何让 AI agent 处理长 context"。这是现有 skill 滑向的方向,但不是原始意图。

用户问的根本问题是:当面对远超处理能力的信息量时,如何可靠地提炼出与特定目的相关的精华?

进一步精确:用户发现的核心失败模式不是"信息找不到",而是"在处理过程中丢失了你要找的东西"。所有反转案例(f0187cfb 的三次重复纠正、b82728dc 的 SOP 擅自删除、9f57f10f 的过度工程化)都不是 agent 缺少信息,而是 agent 在处理过程中丢失了约束。

用信息论的语言:保护 Y 变量(提取目标)在大规模 X(输入数据)处理过程中不发生漂移。 Y 的漂移,而非 X 的遗漏,是大 context 场景中最致命的失败模式。

用户品味(Taste)

从 prompt 中提炼出六条品味标准,任何不符合这些标准的内容都应被排除:

标准Prompt 证据
验证优先于理论"找到那些真正成功的案例,而不是找一些没有经过验证的方法论"
核心约束不可丢失"时刻维护一个核心""时刻记住我的要求是什么"(出现在所有主要 prompt 中)
去除形式化包装"不要分级评分机制""评分分析只是大模型的陷阱,后训练的毒药"
从人类历史找答案主动将调研方向从 AI 论文转向 Caro、乾嘉学派、OED、Dead Sea Scrolls
反向证据同等重要"反向证据也确实很重要""AI 到现在还是面临很多没有解决的问题"
方法论必须能自我应用"这件事情本身就是一个在大 context 中如何去提取有效信息的任务"

用户想要构建的东西

一套以历史验证案例为根基的语义压缩方法论,回答:给定特定目的(Y),如何从海量信息(X)中可靠地提炼精华——同时诚实标注哪些步骤 AI 可以做、哪些不能。

它不是 AI agent 的操作手册,而是理解"从混沌到秩序"这个永恒问题的认知框架。AI agent 的 skill 是这个框架的一个应用实例,而非框架本身。


三、现有调研报告评估

直接可用(构成方法论骨架)

报告可用部分理由
chaos_to_order_round2_synthesis Section I + IV5 个历史验证案例 + 最终综合满足"验证优先":校勘四法(300 年验证)、Murray 鸽笼架(71 年、40 万词条)、Stegemann 公式(独立验证)、Darwin 文件夹(23 年)、ICIJ(法律检验)
chaos_to_order_knowledge_distillation_synthesis 六个同构模式模式 2(Y 决定收获)、模式 3(外化)、模式 4(断裂点)、模式 6(框架先于数据)跨域同构精华,6 个领域独立收敛到相同模式
reversal_moments 8 个反转案例全部一手经验证据,精确到 JSONL 行号和用户原话
chaos_to_order_round2_synthesis Section II + IIIAI 真实边界 + 6 个失败模式满足"反向证据":长 context 24.2% 退化、幻觉不可消除、自动评估 r=0.11

有参考价值(不构成方法论核心)

报告可用部分不可用部分
large_context_information_extraction_deep_researchLost in the Middle 机理解释、三噪声框架大量 AI 论文合集(用户明确说 AI 方案没有成功案例)
large_context_extraction_methodologyF1-F5 失败模式的案例级证据占比百分数(用户拒绝伪精确)、四阶段流水线(用户拒绝 SOP 化)
large_context_extraction_v2_cross_validation交叉验证矩阵、v1 批判v2 改进本身是过度工程化的产物
archival_science_methodologyMPLP、Finding Aids部分内容缺少独立验证

对方法论无直接价值

报告理由
large_context_information_extraction_methodologiesAI/ML 论文合集,重复 Lost in the Middle 解决方案
large_context_extraction_improvement_proposal"三层防御架构"方向对但执行偏 SOP 化
Skill 文件 bestpractice_large_context_extraction.md(2026-07-08 已归档至 adhoc_jobs/redundant_archive/skills_dedup_20260708/Build Log 记录了 5 个自身问题,是妥协产物

四、最终方法论

核心问题

面对大规模无序信息,可靠地提炼出与特定目的相关的精华。"可靠"的含义:提炼结果忠实于提取目标(Y),而非忠实于数据中最显眼的内容。

本质是语义压缩。Information Bottleneck 的形式化表述:在保持对目标变量 Y 的信息量的前提下,最大程度压缩输入 X。Y 的定义决定了什么被保留、什么被丢弃。

整个方法论围绕一个核心:定义 Y、保护 Y、用 Y 驱动压缩。

经过验证的五条原则

原则一:框架先于数据。没有 Y 就不要碰 X。

历史验证

AI 失败印证

操作含义:在接触源数据之前,先用独立材料建立提取目标的清晰认知模型。如果你发现自己在说"源数据里有 X,所以结果也应该有 X",Y 已经被 X 污染了。


原则二:确定性操作优先于概率操作。能对校就不要理校。

历史验证

AI 失败印证

操作含义:能用 grep、diff、正则、路径筛选、版本对比的地方,不用 LLM 推理。LLM 推理的结果标注为"推断"而非"确证"。全量验证用确定性脚本,不用 LLM spot-check。


原则三:外化为可审查的物理结构。看不见的东西无法纠正。

历史验证

AI 失败印证

操作含义:每个中间结论写入文件。分割子任务时,将 Y(提取目标)和全局约束显式写入子任务 prompt 开头。目的不是备份,是让不可见的漂移变成可审查的信号。


原则四:断裂点是最高价值信号。意外之处信息密度最高。

历史验证

AI 失败印证

操作含义:正向扫描(我认为重要的)完成后,做一次逆向扫描(什么被我跳过了),对比发现盲区。用户纠正是最高优先级信号——在执行修复之前先记录原话、被纠正的行为、应该怎么做。


原则五:两阶段选择。先粗后精,粗筛质量决定上限。

历史验证

AI 失败印证

操作含义:先用确定性方法(grep 关键词、路径筛选、Token 预估)缩小范围。在缩小后的范围内做语义级穷尽分析。不要对全量数据做均匀处理。


已证明不可靠的方法

方法反面证据为什么不可靠
纯 LLM 推理不标注置信度乾嘉学者自承"理校最危险";LLM 幻觉在数学上不可避免(Xu 2024, Karpowicz 2025)理校产出看起来和对校一样确定,但可靠性差一个量级
LLM spot-check 代替全量验证CE Judge 30/30 全假(21/37 实际缺失);BooookScore 与人类判断 r=0.11LLM 评估系统性高估质量
单一来源结论直接采信Caro 三个不实轶事;四库全书的系统性删改没有独立来源确认的结论只是假设
声称快速完成大规模知识提炼OED 71 年、HGP 13+19 年、Caro 50+ 年、阎若璩 38 年大规模知识提炼是长周期工程
"想得更仔细"代替流程约束Heuer 核心论点;f0187cfb 前两次"承认错误"但 thinking 未切换视角认知偏见不会因为意识到它而消失
AI agent context 超过有效区后继续处理长 context 仅长度导致 24.2% 准确率下降;77% 后出现乱码和重复物理上不可行,不是"建议分割"

AI 在此框架中的诚实定位

用校勘四法映射 AI 当前的可靠角色:

校勘层级AI 胜任度说明
对校(机械比对)完全胜任diff、grep、格式验证、全量一致性检查
本校(内部一致性检测)基本胜任前后文矛盾检测、引用链验证
他校(交叉引用验证)部分胜任多源检索可以,判断外部源质量需要领域知识
理校(凭学识推理)可以做但必须标注为推断幻觉在数学上不可避免,长 context 退化是架构固有属性

AI 在大 context 提取中的最佳角色是执行确定性操作(对校、本校)和辅助概率操作(他校),而非独立完成推理操作(理校)。最终的知识判断仍需人类介入。

五原则的统一图景

五条原则不是孤立的,它们构成一个围绕 Y 守恒的闭环:

原则一(框架先于数据)→ 定义 Y
    ↓
原则五(两阶段选择)→ 用 Y 做粗筛,缩小 X
    ↓
原则二(确定性优先)→ 先用对校/本校处理可确定的维度
    ↓
原则四(断裂点检测)→ 在穷尽分析中捕获高信息量事件
    ↓
原则三(外化)→ 将发现写入可审查的物理结构
    ↓
回到原则一 → 基于外化结果检验 Y 是否需要受控演化

贯穿全过程的核心:Y 的质量决定整个循环的产出质量。Y 漂移时循环失效。原则三(外化)是检测 Y 漂移的唯一可靠机制——看不见的东西无法纠正。


五、文件索引

完整的证据链和调研材料分布:

文件在本方法论中的角色
本文件最终综合:prompt 溯源 + 意图诊断 + 报告评估 + 方法论
chaos_to_order_round2_synthesis_20260407_manual.md核心证据:5 个历史验证案例 + AI 真实边界 + 6 个失败模式
chaos_to_order_knowledge_distillation_synthesis_20260407_manual.md核心证据:6 个跨域同构模式
reversal_moments_large_context_extraction_20260407_manual.md核心证据:8 个反转案例(一手经验)
large_context_extraction_methodology_20260407_manual.md参考:19 个内部实践案例的失败模式分析
large_context_information_extraction_20260407_deep_research.md参考:50 个外部来源的技术文献综述
large_context_extraction_v2_cross_validation_20260407_manual.md参考:12+3 agent 交叉验证
archival_science_methodology_chaos_to_order_20260407_manual.md参考:档案学方法论(MPLP、Finding Aids)
config/LARGE_CONTEXT_EXTRACTION_GUIDE.md参考:Skill 构建过程和问题复盘
adhoc_jobs/redundant_archive/skills_dedup_20260708/bestpractice_large_context_extraction.md(原 rules/skills/drafts/ 件,2026-07-08 去重归档)本框架的一个 AI agent 操作层应用实例

← 返回方法论库索引 · 返回方法论区