chaos_to_order_round2_synthesis_20260407_manual
方法论库 · 实跑 · none
本页是 <code>contexts/methodology/chaos_to_order_round2_synthesis_20260407_manual.md</code> 的逐字投影(仅隐私清洗,零改写)。
时点提示:本页是仓内文件 contexts/methodology/chaos_to_order_round2_synthesis_20260407_manual.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。
报告元数据(frontmatter)
name: chaos_to_order_round2_synthesis_20260407_manual
description: 第二轮综合+失败案例批判
domain: distillation
consumption:
surface: none
trigger: ""
consumer: orchestrator
status: library
promoted_to: null从混沌到秩序:Round 2 综合 — 历史瑰宝、反面证据与 AI 的真实边界
Date: 2026-04-07
Skill: manual (Round 2 synthesis)
Topic: Proven methods from history, failure cases, and critical evaluation of AI capabilities
Round 2 的调研方向和数据来源
| Agent | 方向 | 报告路径 |
|---|---|---|
| historical-treasures | OED、四库全书、HGP、Darwin、Dead Sea Scrolls | (inline in synthesis) |
| chinese-textual-criticism | 乾嘉学派校勘四法、辨伪学 | chinese_textual_criticism_kaozheng_methodology_20260407_manual.md |
| yage-critic | 鸭哥《凡人修仙传》知识图谱批判评估 | (inline in synthesis) |
| ai-quality-critic | AI 大规模提取的真实质量数据 | (inline in synthesis) |
| failure-cases | Caro 批判、四库全书销毁、WMD 情报失败、GT 可重复性 | (inline in synthesis) |
一、经过历史验证的"瑰宝"方法
以下方法不是理论提案,而是人类花了巨大代价、在具体项目中确实做到了的知识提炼方法。
瑰宝 1:校勘四法(乾嘉学派,~1700-1850)
陈垣 1931 年在《校勘学释例》中将 150 年的考据实践系统化:
| 方法 | 操作 | 可靠性 | 现代对应 |
|---|---|---|---|
| 对校 | 多版本逐字比对 | 最高(纯机械) | diff / 文本对齐 |
| 本校 | 以本书前后文互证 | 高(内部一致性) | 内部一致性检测 |
| 他校 | 以其他书的引用校勘 | 中高(依赖外部源质量) | 交叉引用 / RAG 多源检索 |
| 理校 | 凭学识推理判断 | "最高妙亦最危险"(陈垣原话) | LLM 推理 |
为什么是瑰宝:(1) 陈垣用五种版本与沈家本刻本《元典章》对勘,校出错误 12,000 余条。这是经过全量验证的结果。(2) 阎若璩花 38 年考证《古文尚书》为伪书,列举 128 条证据,2008 年清华简的出土从物质层面再次证实了他的结论。跨越 300 年的验证。(3) 方法的可靠性排序是显式的:对校最可靠,理校最危险。这种对方法本身可靠性的元认知是极其稀缺的品质。
对 AI 的直接启示:LLM 做的事情本质上是"理校"——凭训练获得的"学识"进行推理。而理校恰恰是四法中可靠性最低的一种。乾嘉学者的智慧在于:理校只在前三法都无法适用时才使用,且结果必须标注为"推断"而非"确证"。当前 AI 系统缺少的正是这种元认知:它不知道自己在做理校,也不标注推断的置信度。
瑰宝 2:Murray 的鸽笼架系统(OED,1879-1928)
James Murray 为编纂 OED 建造了一个物理系统:Scriptorium 中的 1,029 个鸽笼式分格架(pigeonholes),每个格子对应一个字母范围。数千名志愿者寄来的 350 万张引用卡片按词条归入格子。编写某个词条时,取出对应格子中的全部卡片,按时间排列,追溯语义演变。
为什么是瑰宝:(1) 它成功了。400,000+ 词条,每条追溯到最早已知用法,71 年完成。(2) 它的前任失败了。Furnivall 用了 21 年,志愿者"训练不足、选择随意",导致罕见词 abusion 的引用数量是常用词 abuse 的十倍。Murray 的关键改进:系统化的收集指南 + 物理分类基础设施。(3) 方法论的核心不是 Murray 个人的学识,而是系统设计——任何人拿到格子里的卡片,都能按时间排列出一个词的演变轨迹。知识提炼的可靠性来自系统,不来自个人。
对 AI 的直接启示:Murray 的鸽笼架是一个物理版的"中间表示层"。它把 350 万张卡片这个不可处理的规模,转化为一次处理一个格子的可处理规模。这与 InfiAgent 的文件持久化(21x 差异)、context-infra 的 INDEX.md 路由体系在结构上同构。
瑰宝 3:Stegemann 的卷轴物理公式(Dead Sea Scrolls,1963-至今)
Hartmut Stegemann 将 25,000 个碎片的重建问题转化为数学问题:卷轴是螺旋管,损伤在各层留下数学相关的图案。他推导出公式计算碎片在原始卷轴中的相对位置。1989 年 Puech 独立验证了这一方法。2020 年 DNA 分析进一步证伪了此前的错误归属。
为什么是瑰宝:(1) 从直觉到公式的跳跃。Milik 在 1950 年代就注意到了损伤模式的规律性,但没有形式化。Stegemann 的贡献不是发现新事实,而是把模糊的直觉变成可验证的数学。(2) 方法论是独立于内容的。你不需要读懂希伯来文就能使用这个公式。物理约束比语义约束更可靠。
对 AI 的直接启示:在可以使用确定性方法(物理约束、数学公式、正则匹配)的地方,不要用概率方法(LLM 推理)。这与现有 skill 的"全量验证 > spot-check"原则以及考据学的"对校 > 理校"是同一个思想。
瑰宝 4:Darwin 的文件夹系统(1836-1859)
Darwin 维护 30-40 个按主题标记的大型文件夹。每读一本书:页边铅笔标记 → 书末列出页码 → 写摘要 → 按主题拆分到纸条 → 归入文件夹。写某章时打开对应文件夹,重排纸条形成大纲。
为什么是瑰宝:(1) 23 年从观察到理论。不是灵光一闪,是系统积累。(2) Malthus 时刻揭示了"框架先于数据"的力量:Darwin 已有全部数据和"生命树"直觉,但缺因果机制。Malthus 提供了框架,瞬间让既有数据从混沌变为有序。(3) 他的数据来源极广:学术文献 + 园丁 + 农夫 + 动物园管理员 + 狗繁殖者的印刷问卷。多源交叉验证。
瑰宝 5:ICIJ 的 Panama Papers 处理(2015-2016)
1150 万份文档,2.6TB 数据,80 个国家 400 名记者。四层处理:机器批处理(Nuix OCR + Tika) → Solr + Blacklight 索引 → Neo4j 图数据库 → 人类图探索。
为什么是瑰宝:(1) 确实揭露了大量之前不为人知的离岸金融网络,导致多国领导人辞职。结果经过法律检验。(2) "用已知撬未知"的核心方法——种子名单 + 图遍历——是一个可复制的操作流程。(3) 异常信号 + 连接信号的双信号检测机制是具体的、可操作的。
二、AI 的真实边界(用数据说话)
已解决(有限场景下有效)
| 场景 | 最佳表现 | 条件 |
|---|---|---|
| 结构化表格 KG 提取 | F1 = 0.93-1.0 | Schema 预定义,领域受限 |
| 简单 PICO 变量提取 | 幻觉率 < 3% | 变量定义明确 |
| 临床文本摘要 | 幻觉率 1.47% | 经迭代优化,但 44% 幻觉属重大错误 |
未解决(根本性问题)
| 问题 | 证据 |
|---|---|
| 长 context 性能退化 | 仅长度本身导致 24.2% 准确率下降(EMNLP 2025) |
| 幻觉不可消除 | 数学层面不可避免(Xu 2024, Karpowicz 2025, OpenAI 确认) |
| 自动评估不可信 | BooookScore 与人类判断 r=0.11;Claude 评估忠实度 3 倍高估 |
| 开放域 KG 质量 | 最佳学术成绩 66%(KGGen, NeurIPS 2025) |
| 语义压缩保真度 | 任务间差异极大,无统一度量(TU Dresden 2026) |
鸭哥《凡人修仙传》项目的评估
方法论设计合理(线性扫描 + 语义检索 + 知识飞轮 + 本地模型),但没有提供任何验证数据(无准确率/召回率/F1,无人工抽样,无与粉丝社区已有资料的对比,代码未开源)。文章更接近方法论提案而非完成报告。参照学术基准(KGGen 在维基百科上最佳 66%),对千万字小说的知识图谱提取质量存疑。
三、6 个共性失败模式(从反面证据中提炼)
| 模式 | 案例 | 核心机制 | 防御 |
|---|---|---|---|
| 叙事吞噬事实 | Caro 三个不实轶事、四库全书 | 编纂的框架反过来扭曲内容 | 独立于叙事的事实校验层 |
| 不可证伪的先验 | 伊拉克 WMD | 证据缺失被框架吸收 | 显式建模替代假设 + 负面证据系统关注 |
| 规模与质量不可兼得 | ICIJ 数据错误、AI 幻觉累积 | 验证能力跟不上处理规模 | 透明纠错机制 + 标记验证状态 |
| 提取者的隐含框架 | Grounded Theory 低可重复性 | "客观涌现"是幻觉 | 多人独立提取 + 交叉比较 |
| 自信填补空白 | RAG "自信撒谎者"、LLM 幻觉 | 系统默认编造而非标记无知 | "不知道"作为第一公民 |
| 权力塑造标准 | 四库全书"寓禁于征" | 筛选标准受权力结构影响 | 筛选标准透明可审计 |
四、最终综合:什么才是经过验证的方法论?
把 Round 1 的 6 个跨域同构模式和 Round 2 的实证案例合在一起,只有以下方法是同时满足两个条件的:(a) 在具体项目中确实被使用过,(b) 项目的最终结果经过了独立验证。
确证有效的方法(历史验证 + 独立确认)
1. 分层处理 + 确定性优先
- 验证:校勘四法的可靠性排序(对校 > 本校 > 他校 > 理校),Stegemann 公式,HGP 的层级鸟枪法
- 核心原则:能用确定性方法(版本对比、物理约束、正则匹配)的地方,不用概率方法。概率方法(推理、理校、LLM)只在确定性方法不适用时使用,且结果标注为"推断"
2. 物理/外部分类基础设施先于知识提炼
- 验证:Murray 的鸽笼架、Darwin 的文件夹、ICIJ 的 Neo4j、四库全书的四部分类
- 核心原则:没有容器就没有秩序。先建分类系统,再开始提炼。分类系统的质量决定提炼的效率上限(Furnivall 的 21 年失败 vs Murray 的成功)
3. 从直觉到形式化的跳跃
- 验证:Milik → Stegemann 公式、陈垣将散碎考证归纳为校法四例、Darwin 读 Malthus
- 核心原则:直觉可以引导搜索方向,但只有形式化的方法才能产生可验证、可复制的知识
4. 多源交叉验证
- 验证:校勘四法同时使用、ICIJ 的多国团队独立验证、HGP 的两种竞争性测序方法、阎若璩 128 条证据 + 300 年后清华简物质确认
- 核心原则:单一来源的结论只是假设。只有经过独立来源确认的结论才能标注为"已确证"
5. 时间尺度的诚实预期
- 验证:OED 71 年、HGP 13 年(加上后续 19 年才真正无间隙)、Caro 50+ 年、阎若璩 38 年
- 核心原则:大规模知识提炼是十年尺度的工程。声称快速完成的项目(如鸭哥的凡人修仙传)需要格外严格的验证标准
有理论支撑但缺少独立验证的方法
- Information Bottleneck 的 Y 变量框架(形式化很优美,但没有具体的历史案例证明"锁定 Y"比"不锁定 Y"在效果上有可量化的差异)
- Cynefin 的域分类(广泛使用但缺少对照实验)
- Task Contract 模式(理论来源清晰但 2026 年才提出,尚无大规模验证)
已被证明不可靠的方法
- 纯推理/理校而不标注置信度(乾嘉学者自己也承认风险)
- LLM spot-check 代替全量验证(CE 30/30 全假事件)
- 自动评估指标作为质量判据(BooookScore r=0.11)
- 单一来源的结论直接采信(Caro 三个不实轶事)
五、更新的覆盖矩阵
| 案例研究 | 专业学科 | 认知理论 | AI 实测 | 信息论 | 跨域类比 | 反面证据 | |
|---|---|---|---|---|---|---|---|
| 分层/确定性优先 | R1+R2(Caro,HGP) | R1+R2(MPLP,校勘) | R1(Cynefin) | R2(F1数据) | R1(R-D) | R1+R2 | R2(理校风险) |
| 分类基础设施 | R2(Murray,Darwin) | R2(四库) | R1+R2 | R2(Furnivall失败) | |||
| Y/问题决定收获 | R1(Caro) | R1(Finding Aids) | R1(Dervin,IB) | R1(IB) | R1+R2 | R2(WMD先验) | |
| 断裂点/异常检测 | R1(Caro) | R1(GT) | R1(Weick) | R1(surprise) | R1+R2 | ||
| 外化机制 | R1+R2(Murray,Darwin) | R2(校勘记录) | R1(Nonaka) | R1(中间表示) | R1+R2 | ||
| 多源交叉验证 | R2(阎若璩128条+清华简) | R2(校勘四法) | R2(对比数据) | R1+R2 | R2(GT可重复性) | ||
| AI 质量边界 | R2(全面) | R2(全面) | |||||
| 失败模式 | R2(Caro批判) | R2(四库销毁) | R2(WMD) | R2(幻觉数据) | R2 | R2(全面) |
Round 1 的主要空白(反面证据、AI 实测)已在 Round 2 中填补。
六、对 context-infra 方法论体系的修正建议
基于两轮调研的全部发现,对现有 bestpractice_large_context_extraction skill 的修正建议:
- 将"理校危险"写入 skill。当前 skill 没有区分确定性操作和概率操作的可靠性差异。校勘四法的可靠性排序应该成为 AI agent 选择工具的指导原则。
- 将"不知道"设计为第一公民。当前 skill 关注如何提取信息,但没有关注如何标记信息的缺失。失败案例反复证明:系统在不知道时默认编造是最危险的失败模式。
- 降低对 AI 独立完成大规模提取的期望。数据清楚表明:在开放域非结构化场景,AI 最好成绩 66%(KGGen),长 context 仅长度本身导致 24.2% 退化。大规模知识提炼仍然是十年尺度的人机协作工程,不是 AI 能独立完成的任务。
- 增加"筛选标准透明可审计"原则。四库全书和 WMD 情报失败都证明:筛选标准受权力/偏见影响时,产出的"知识"可能系统性失真。AI agent 的提取标准(Y 变量)应该被显式记录和可审计。