context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

chaos_to_order_round2_synthesis_20260407_manual

Z3 全文↑ Z2 条目

方法论库 · 实跑 · none

← 返回方法论库索引 · 返回方法论区

本页是 <code>contexts/methodology/chaos_to_order_round2_synthesis_20260407_manual.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 contexts/methodology/chaos_to_order_round2_synthesis_20260407_manual.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

报告元数据(frontmatter)
name: chaos_to_order_round2_synthesis_20260407_manual
description: 第二轮综合+失败案例批判
domain: distillation
consumption:
  surface: none
  trigger: ""
  consumer: orchestrator
status: library
promoted_to: null

从混沌到秩序:Round 2 综合 — 历史瑰宝、反面证据与 AI 的真实边界

Date: 2026-04-07
Skill: manual (Round 2 synthesis)
Topic: Proven methods from history, failure cases, and critical evaluation of AI capabilities


Round 2 的调研方向和数据来源

Agent方向报告路径
historical-treasuresOED、四库全书、HGP、Darwin、Dead Sea Scrolls(inline in synthesis)
chinese-textual-criticism乾嘉学派校勘四法、辨伪学chinese_textual_criticism_kaozheng_methodology_20260407_manual.md
yage-critic鸭哥《凡人修仙传》知识图谱批判评估(inline in synthesis)
ai-quality-criticAI 大规模提取的真实质量数据(inline in synthesis)
failure-casesCaro 批判、四库全书销毁、WMD 情报失败、GT 可重复性(inline in synthesis)

一、经过历史验证的"瑰宝"方法

以下方法不是理论提案,而是人类花了巨大代价、在具体项目中确实做到了的知识提炼方法。

瑰宝 1:校勘四法(乾嘉学派,~1700-1850)

陈垣 1931 年在《校勘学释例》中将 150 年的考据实践系统化:

方法操作可靠性现代对应
对校多版本逐字比对最高(纯机械)diff / 文本对齐
本校以本书前后文互证高(内部一致性)内部一致性检测
他校以其他书的引用校勘中高(依赖外部源质量)交叉引用 / RAG 多源检索
理校凭学识推理判断"最高妙亦最危险"(陈垣原话)LLM 推理

为什么是瑰宝:(1) 陈垣用五种版本与沈家本刻本《元典章》对勘,校出错误 12,000 余条。这是经过全量验证的结果。(2) 阎若璩花 38 年考证《古文尚书》为伪书,列举 128 条证据,2008 年清华简的出土从物质层面再次证实了他的结论。跨越 300 年的验证。(3) 方法的可靠性排序是显式的:对校最可靠,理校最危险。这种对方法本身可靠性的元认知是极其稀缺的品质。

对 AI 的直接启示:LLM 做的事情本质上是"理校"——凭训练获得的"学识"进行推理。而理校恰恰是四法中可靠性最低的一种。乾嘉学者的智慧在于:理校只在前三法都无法适用时才使用,且结果必须标注为"推断"而非"确证"。当前 AI 系统缺少的正是这种元认知:它不知道自己在做理校,也不标注推断的置信度。

瑰宝 2:Murray 的鸽笼架系统(OED,1879-1928)

James Murray 为编纂 OED 建造了一个物理系统:Scriptorium 中的 1,029 个鸽笼式分格架(pigeonholes),每个格子对应一个字母范围。数千名志愿者寄来的 350 万张引用卡片按词条归入格子。编写某个词条时,取出对应格子中的全部卡片,按时间排列,追溯语义演变。

为什么是瑰宝:(1) 它成功了。400,000+ 词条,每条追溯到最早已知用法,71 年完成。(2) 它的前任失败了。Furnivall 用了 21 年,志愿者"训练不足、选择随意",导致罕见词 abusion 的引用数量是常用词 abuse 的十倍。Murray 的关键改进:系统化的收集指南 + 物理分类基础设施。(3) 方法论的核心不是 Murray 个人的学识,而是系统设计——任何人拿到格子里的卡片,都能按时间排列出一个词的演变轨迹。知识提炼的可靠性来自系统,不来自个人。

对 AI 的直接启示:Murray 的鸽笼架是一个物理版的"中间表示层"。它把 350 万张卡片这个不可处理的规模,转化为一次处理一个格子的可处理规模。这与 InfiAgent 的文件持久化(21x 差异)、context-infra 的 INDEX.md 路由体系在结构上同构。

瑰宝 3:Stegemann 的卷轴物理公式(Dead Sea Scrolls,1963-至今)

Hartmut Stegemann 将 25,000 个碎片的重建问题转化为数学问题:卷轴是螺旋管,损伤在各层留下数学相关的图案。他推导出公式计算碎片在原始卷轴中的相对位置。1989 年 Puech 独立验证了这一方法。2020 年 DNA 分析进一步证伪了此前的错误归属。

为什么是瑰宝:(1) 从直觉到公式的跳跃。Milik 在 1950 年代就注意到了损伤模式的规律性,但没有形式化。Stegemann 的贡献不是发现新事实,而是把模糊的直觉变成可验证的数学。(2) 方法论是独立于内容的。你不需要读懂希伯来文就能使用这个公式。物理约束比语义约束更可靠。

对 AI 的直接启示:在可以使用确定性方法(物理约束、数学公式、正则匹配)的地方,不要用概率方法(LLM 推理)。这与现有 skill 的"全量验证 > spot-check"原则以及考据学的"对校 > 理校"是同一个思想。

瑰宝 4:Darwin 的文件夹系统(1836-1859)

Darwin 维护 30-40 个按主题标记的大型文件夹。每读一本书:页边铅笔标记 → 书末列出页码 → 写摘要 → 按主题拆分到纸条 → 归入文件夹。写某章时打开对应文件夹,重排纸条形成大纲。

为什么是瑰宝:(1) 23 年从观察到理论。不是灵光一闪,是系统积累。(2) Malthus 时刻揭示了"框架先于数据"的力量:Darwin 已有全部数据和"生命树"直觉,但缺因果机制。Malthus 提供了框架,瞬间让既有数据从混沌变为有序。(3) 他的数据来源极广:学术文献 + 园丁 + 农夫 + 动物园管理员 + 狗繁殖者的印刷问卷。多源交叉验证。

瑰宝 5:ICIJ 的 Panama Papers 处理(2015-2016)

1150 万份文档,2.6TB 数据,80 个国家 400 名记者。四层处理:机器批处理(Nuix OCR + Tika) → Solr + Blacklight 索引 → Neo4j 图数据库 → 人类图探索。

为什么是瑰宝:(1) 确实揭露了大量之前不为人知的离岸金融网络,导致多国领导人辞职。结果经过法律检验。(2) "用已知撬未知"的核心方法——种子名单 + 图遍历——是一个可复制的操作流程。(3) 异常信号 + 连接信号的双信号检测机制是具体的、可操作的。


二、AI 的真实边界(用数据说话)

已解决(有限场景下有效)

场景最佳表现条件
结构化表格 KG 提取F1 = 0.93-1.0Schema 预定义,领域受限
简单 PICO 变量提取幻觉率 < 3%变量定义明确
临床文本摘要幻觉率 1.47%经迭代优化,但 44% 幻觉属重大错误

未解决(根本性问题)

问题证据
长 context 性能退化仅长度本身导致 24.2% 准确率下降(EMNLP 2025)
幻觉不可消除数学层面不可避免(Xu 2024, Karpowicz 2025, OpenAI 确认)
自动评估不可信BooookScore 与人类判断 r=0.11;Claude 评估忠实度 3 倍高估
开放域 KG 质量最佳学术成绩 66%(KGGen, NeurIPS 2025)
语义压缩保真度任务间差异极大,无统一度量(TU Dresden 2026)

鸭哥《凡人修仙传》项目的评估

方法论设计合理(线性扫描 + 语义检索 + 知识飞轮 + 本地模型),但没有提供任何验证数据(无准确率/召回率/F1,无人工抽样,无与粉丝社区已有资料的对比,代码未开源)。文章更接近方法论提案而非完成报告。参照学术基准(KGGen 在维基百科上最佳 66%),对千万字小说的知识图谱提取质量存疑。


三、6 个共性失败模式(从反面证据中提炼)

模式案例核心机制防御
叙事吞噬事实Caro 三个不实轶事、四库全书编纂的框架反过来扭曲内容独立于叙事的事实校验层
不可证伪的先验伊拉克 WMD证据缺失被框架吸收显式建模替代假设 + 负面证据系统关注
规模与质量不可兼得ICIJ 数据错误、AI 幻觉累积验证能力跟不上处理规模透明纠错机制 + 标记验证状态
提取者的隐含框架Grounded Theory 低可重复性"客观涌现"是幻觉多人独立提取 + 交叉比较
自信填补空白RAG "自信撒谎者"、LLM 幻觉系统默认编造而非标记无知"不知道"作为第一公民
权力塑造标准四库全书"寓禁于征"筛选标准受权力结构影响筛选标准透明可审计

四、最终综合:什么才是经过验证的方法论?

把 Round 1 的 6 个跨域同构模式和 Round 2 的实证案例合在一起,只有以下方法是同时满足两个条件的:(a) 在具体项目中确实被使用过,(b) 项目的最终结果经过了独立验证。

确证有效的方法(历史验证 + 独立确认)

1. 分层处理 + 确定性优先

2. 物理/外部分类基础设施先于知识提炼

3. 从直觉到形式化的跳跃

4. 多源交叉验证

5. 时间尺度的诚实预期

有理论支撑但缺少独立验证的方法

已被证明不可靠的方法


五、更新的覆盖矩阵

案例研究专业学科认知理论AI 实测信息论跨域类比反面证据
分层/确定性优先R1+R2(Caro,HGP)R1+R2(MPLP,校勘)R1(Cynefin)R2(F1数据)R1(R-D)R1+R2R2(理校风险)
分类基础设施R2(Murray,Darwin)R2(四库)R1+R2R2(Furnivall失败)
Y/问题决定收获R1(Caro)R1(Finding Aids)R1(Dervin,IB)R1(IB)R1+R2R2(WMD先验)
断裂点/异常检测R1(Caro)R1(GT)R1(Weick)R1(surprise)R1+R2
外化机制R1+R2(Murray,Darwin)R2(校勘记录)R1(Nonaka)R1(中间表示)R1+R2
多源交叉验证R2(阎若璩128条+清华简)R2(校勘四法)R2(对比数据)R1+R2R2(GT可重复性)
AI 质量边界R2(全面)R2(全面)
失败模式R2(Caro批判)R2(四库销毁)R2(WMD)R2(幻觉数据)R2R2(全面)

Round 1 的主要空白(反面证据、AI 实测)已在 Round 2 中填补。


六、对 context-infra 方法论体系的修正建议

基于两轮调研的全部发现,对现有 bestpractice_large_context_extraction skill 的修正建议:

  1. 将"理校危险"写入 skill。当前 skill 没有区分确定性操作和概率操作的可靠性差异。校勘四法的可靠性排序应该成为 AI agent 选择工具的指导原则。
  1. 将"不知道"设计为第一公民。当前 skill 关注如何提取信息,但没有关注如何标记信息的缺失。失败案例反复证明:系统在不知道时默认编造是最危险的失败模式。
  1. 降低对 AI 独立完成大规模提取的期望。数据清楚表明:在开放域非结构化场景,AI 最好成绩 66%(KGGen),长 context 仅长度本身导致 24.2% 退化。大规模知识提炼仍然是十年尺度的人机协作工程,不是 AI 能独立完成的任务。
  1. 增加"筛选标准透明可审计"原则。四库全书和 WMD 情报失败都证明:筛选标准受权力/偏见影响时,产出的"知识"可能系统性失真。AI agent 的提取标准(Y 变量)应该被显式记录和可审计。

← 返回方法论库索引 · 返回方法论区