agent_native_data_paradigm_20260531_deep_research
方法论库 · 实跑 · memory_index
本页是 <code>contexts/methodology/agent_native_data_paradigm_20260531_deep_research.md</code> 的逐字投影(仅隐私清洗,零改写)。
时点提示:本页是仓内文件 contexts/methodology/agent_native_data_paradigm_20260531_deep_research.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。
报告元数据(frontmatter)
name: agent_native_data_paradigm_20260531_deep_research
description: LLM 原生数据范式
domain: infra
consumption:
surface: memory_index
trigger: "记忆索引召回"
consumer: orchestrator
status: library
promoted_to: nullAgent 的"原生数据范式":贴合什么、怎么贴合
调研日期:2026-05-31
产出方式:8 线程并行 deep-research workflow(检索 → 精读 → Opus 对抗式证据分级),run ID wf_f48f015c-14d,24 个 sub-agent / 约 120 万 token / 645 次工具调用。每条核心数字经独立分级 agent 对抗式核验,多数逐字对照原文。
应用 skill:workflow_solid_decision_review(五级证据定 claim ceiling)+ workflow_what_to_how_execution_bridge(输出契约写"怎么做")。
关联前期成果:reference_llm_constraint_capacity(约束容量)、anti_performative_diligence_methodology_20260530_manual.md(反表演式勤奋)。
0. 起点问题
用户假设:对人类,图像/架构图比纯文字直观,因为有专门的视觉皮层。类比到 LLM/Agent,是否存在一种模型"天生更熟悉"的原生数据范式(训练里见得最多、困惑度最低、最能激活已有回路的结构)?若设计任务和 skill 时贴合它,是否能让模型表现更好、更少偷懒和幻觉?两个子命题:(1) 任务建模——把复杂度/推理长度调到接近模型推理训练(CoT/RLVR)建构的长度分布;(2) 效果优化——这种贴合能否减少 shortcut 和 hallucination。
1. 结论先行
存在这样的"原生范式",但形态和朴素设想不同,而且最朴素的版本被这批证据里最硬的一条直接证伪:强制模型用它最熟悉的结构化格式 JSON 去承载推理过程,GSM8K 上 Claude-3-Haiku 准确率从 86.5% 崩到 23.4%(arXiv:2408.02442,逐字核实)。"熟悉即更好"在推理面和输出面是反的。
站得住的版本三句话:
- 模型内部确实有"原生回路"。function vector 的因果中介实验证明存在一个紧凑、可因果干预的任务表示,zero-shot 迁移 57–84% vs 基线 5–8%(arXiv:2310.15213,ICLR 2024)。这是"人类熟悉图像"在 LLM 里最接近的客观对应物:一条被训练铺好、一激活就能跑的计算回路。但它不可读(解码成乱码 token)、模型族特定(不存在跨模型通用的"原生格式",Sclar 2310.11324 证模型间格式偏好弱相关)。
- 起作用的是结构与组合,不是表面 token 的熟悉度。把代码去掉控制流只留"代码字符串",相对 JSON 的优势消失(CodeAct atomic-API 消融,直接证否"模型见过更多代码所以代码赢")。
- 这是一个有最优点的区间,不是越贴合越好。推理长度、格式约束、对齐强度三个维度,过少过多都掉点。
对 agent 最锋利的答案:你能设计的那一层,最贴近"熟悉图像"的不是某种魔法格式,而是模型被 RL 训练时所在的轨迹形状 + 可验证奖励结构(DeepSeek-R1 是干净的存在性证明)。
2. 三个修正(把假设改成站得住的形式)
修正一:不是一个范式,是三个行为相反的"格式面"
证据要求把"格式"切三层,对齐方向彼此相反:
| 格式面 | 对齐方向 | 证据 |
|---|---|---|
| 输入面(问题表示) | 上结构:带计算/状态/条件逻辑的问题用代码/伪代码/流程图承载 | 自然语言→代码输入(不执行)GPT-3.5 条件推理 +22.5pp(2401.10065,back-translation 消融);3331 次受控实验证"结构>语义"、伪代码≈代码(2509.21499) |
| 推理过程面 | 绝不上结构:留在模型原生自由 CoT | 推理过程强加 JSON,GSM8K Claude-3-Haiku 86.5→23.4,Last-Letter −31.5pp(2408.02442) |
| 输出面 | 末端再格式化:先自由推理再单独格式化 | 两阶段 NL-to-Format / CRANE 恢复 +6.8~9.2pp(2408.02442 / CRANE 2025) |
可执行版本:结构化输入、自由化推理、末端格式化输出。朴素的"把 prompt 调成模型最熟悉格式"若落在推理或输出面,是净负。
修正二:困惑度测的是流畅不是正确
熵/困惑度直觉方向对——低困惑度弱相关于更好性能(Gonen 2023,平均仅 +1.8~2.3pp,且 IMDB/Cola 反向)。但硬约束:困惑度对流畅的胡说也赋低值(2601.22950 指出它在事实准确性/推理质量上不可靠)。困惑度是"在不在流形上"的弱探针,不是质量探针。这条直接限制"用贴合分布防幻觉"的力度。
修正三:bounded optimum,不是单调
8 个线程最一致的结构。每个维度两头都掉点:
| 维度 | 太少→掉点 | 太多→掉点 |
|---|---|---|
| 结构 | 裸 shell 当 agent 接口、拼接式轨迹训练 | 推理过程强加 JSON(−27 到 −63pp) |
| 推理长度 | underthinking,难题上半途切换路径 | overthinking,过拐点放弃已对的答案 |
| 对齐强度 | 格式敏感性发作(最坏 76pp) | safety 数据对齐反损推理 4–33%(Poison of Alignment 2308.13449) |
处方永远是"落进区间",不是"最大化贴合"。
3. 证据分层(Solid Decision,用最弱相关证据定 claim ceiling)
Solid / well-supported(多篇独立 + 多数已发表 + 逐字核实,可直接用于设计)
- 格式敏感性是真实一阶因果变量,语义等价的格式微变可造成显著差异,不随规模/few-shot/instruction-tuning 消失(Sclar 2310.11324,ICLR)。边界:最坏 76pp 对应中位仅 6.4pp,大数字只当"最坏情况存在性",不当"典型收益"。
- 推理过程上的结构约束伤推理、助分类,二分法稳健;解法是推理与格式解耦(2408.02442,EMNLP;CRANE)。DDXPlus 分类任务上 JSON 反而 +11~19pp。
- 结构化中间表示 > 自然语言散文,用于带计算/状态/条件逻辑的任务;起效的是结构不是代码本身(2401.10065 + 2509.21499 + PoT 2211.12588 / PAL 2211.10435,+12%)。对常识/语义任务(StrategyQA)不适用。
- 推理长度倒 U 最优,最优长度随难度上升、随模型能力下降(1.5B 约 14 步 vs 72B 约 4 步),RLVR 自发收敛向更短(simplicity bias,2502.07266 形式化证明 + ICLR;2506.04210 GSM-8K 82.2→87.3→70.3,NeurIPS)。
- Task/function vector 真实且因果存在(2310.15213),但只到"存在+因果",不到"可读"或"可组合"(组合代数坍到 0.07,top-100 重构 4.8%)。最强在 70B。
- 幻觉有硬下界(monofact bound)(2502.08666,PNAS):对训练里只见过一次的事实,任何格式/对齐都无法降低幻觉,只对高频知识有效。
- Shortcut learning 是 in-distribution vs OOD 的真实裂缝(HANS 1902.01007,非蕴含掉到 4%,逐字核实);且更大的模型更依赖 shortcut(Yuan 2024)。
- Agent scaffold/ACI 是一阶杠杆,常压过 backbone 选择(SWE-agent 2405.15793,ACI 约三倍 solve rate,+10.7pt over 裸 shell,跨模型迁移)。但论文把原因归于工效学和 context 效率,不是训练分布对齐。
- DeepSeek-R1 的"最小结构容器 + 规则化可验证奖励"是干净存在性证明(2501.12948,Nature):
<think>/<answer>标签 + 规则化奖励(特意不用神经奖励,明说防 reward hacking)+ 让模型自我发现推理,涌现有效长推理。
Bounded / partial(方向可信,域窄或单篇,带边界用)
- ICL = 隐式贝叶斯推断(Xie 2022):只在 HMM 合成集证明,真实模型上"贴近预训练分布"无法操作化。竞争机制还有 induction heads、gradient-descent-in-context、task vector。
- 困惑度作 proxy(Gonen 2023):弱信号、会反向、测流畅非正确。
- RLVR "放大已有基元非植入新能力"(2602.08281 / 2502.03373 / 2603.12875):合成域,作者自承"新技能 vs 锐化"边界未决。
- Min "labels don't matter"(2022):contested,大模型反转(Wei 2023:code-davinci-002 翻转标签 90→22.5%),同期反例(Kim/Yoo 2205.12685,差距达 80%)+ 后续(Chen 2605.26350,SST-2 96.4→56.9)。引用须带"仅小/中模型 + 仅分类/多选"双重限定,且核心量级无第一手数字。
Speculative(用户两个核心子命题恰好落在这里,因果链缺关键一环)
- 子命题 (1) "刻意把任务推理长度对齐到 RLVR 训练分布 → 更好":方向被支持(最优长度存在、两头都坏),但"训练分布就是那个杠杆"从未被直接测过。无任何论文做"匹配 vs 不匹配训练长度→测性能/幻觉"的对照。最优点是移动靶(随难度差约 5 倍、随能力变、base 与 RL 模型曲线形状都不同,2602.09591:base 单调 vs distilled 非单调),推理时无 ground truth 无法定位自己在曲线哪。
- 子命题 (2) "贴合分布 → 减少偷懒和幻觉":speculative 偏 contested。"分布漂移=单一根因"横跨 5 个不相干文献拼出,从未联合验证。反向硬证据:RL 增强推理放大工具幻觉(Reasoning Trap 2510.22977,且在无关数学任务上训练也会);对齐一个分布属性会损伤另一个(Poison of Alignment −4~−33%)。
- 核心机制 "性能提升是因为更接近训练分布/更低困惑度/激活已有回路":speculative。无一篇测 action token 困惑度或做因果探针把性能挂到"到训练分布距离"。最干净的自然实验(CodeAct atomic-API 消融)反向证否 token 熟悉度叙事:优势来自组合结构;CodeAct 把闭源模型 JSON 强能力归于针对性微调——"原生格式"是供应商可主动搬动的后训练产物,不是固定预训练范式。
4. 两个子命题的精确回应
子命题 (1):贴合的不是"训练长度",是"模型的能力带"
证据把"对齐到训练推理长度"替换成更站得住、更可操作的提法:让每步落进模型既非 0% 也非 100% 的难度带,且推理长度不超过该难度的拐点。理由:最优长度随能力下降(72B 只要 4 步),RLVR 把模型推向更短——"贴合模型训练建构的长度"这个目标本身不稳定,强模型的舒适长度在变短。给 skill 配过长强制思考预算是对抗训练动态,引入更多错误中间步、甚至让模型放弃已对的答案。
这条和约束容量成果是同一东西的两面。3–6 复杂约束上限、P(n)=p^n curse,和文献的倒 U/overthinking,都在说"每步留在工作容量带内"。合起来的任务建模规则:分解到每步携带 ≤3–6 个约束,且推理长度落在该步难度的拐点以内。"context diversity > context length"在这里也对上——竞争性认知框架(advisory 规则和核心任务抢 3–6 预算)才是 drift 源,不是 token 数。
可操作杠杆不是固定 token 预算(移动靶),而是 overthinking 检测 / 早停信号:答案振荡是实时预测器;函数调用类任务 32 个推理 token 把 Qwen2.5-1.5B 从 44% 抬到 64%,256 token 掉到 25% 并带 18% 函数幻觉(2604.02155)。工具型 agent 短 CoT 赢,长 CoT 诱发幻觉。
子命题 (2):贴合分布是必要不充分,主杠杆是可观测性
证据和反表演式勤奋成果高度收敛。该框架说偷懒=可观测性条件化优化(Goodhart 变体),能控杠杆是 harness 的可观测性结构。文献从三个独立方向印证"分布对齐不是主杠杆":
- DeepSeek-R1 特意选规则化可验证奖励而非神经奖励,明说防 reward hacking——防偷懒的设计落在奖励可验证性上。
- 幻觉有 monofact 硬下界,任何对齐搬不动稀有事实的幻觉。
- 格式税机制是格式指令在解码前就把注意力从推理上抢走(constraint attention,2505.11423)——可观测性/注意力问题,修复靠解耦不靠"更熟悉格式"。
诚实结论:贴合分布能降低 OOD 带来的 shortcut 压力(真实但部分),但偷懒和幻觉主因是激励结构和可观测性。把工作做成可验证、奖励做成不可作弊,比把任务调得更"熟悉"杠杆大得多。
5. 对 Agent 而言最贴近"熟悉图像"的是什么
机制层:function vector / 已铺好的任务回路——客观存在、可因果激活,但不可读、模型族特定、无法靠"重复格式"可靠触发(induction head 是不是 ICL 操作回路本身有争议:2502.14010 说大模型主要靠 FV head,2407.07011 说消融 induction head 仍掉 ICL 达 32%,两边都有 confound)。"用魔法格式激活原生回路"在机制上没有落点。
部署层(你真正能设计的那层):最贴近的"熟悉图像"是模型被 RL 训练时的轨迹形状 + 可验证奖励结构。DeepSeek-R1 存在性证明给的精确启示:提供最小结构脚手架(agentic 循环形状:分析→行动→观察→反思),让模型在里面用原生方式推理,用可验证检查点锚住——而不是把结构灌进推理本身。chat template 的 system/user/assistant/tool 角色之所以"原生"同理:它是每条后训练样本的骨架,顺着走在流形上,塞进巨型 user turn 是离流形。
诚实标注:"因为匹配训练分布所以有效"这个因果说法仍 speculative;scaffold 论文自己把 SWE-agent 增益归于工效学。这层是"有行为证据、机制未证"的工作假说。
6. 具体怎么做(What2How 执行桥)
目标。 当前:skill/prompt 凭直觉写,偶尔踩格式税和 overthinking,不知哪些设计真贴合了模型认知。目标:skill 遵循"结构化输入/自由化推理/末端格式化输出"+"每步落能力带内"+"可验证检查点锚定",且这些原则在真实任务上被对照测过。验收:改造后相对改造前,在效果面(完成质量)和控制面(偷懒/幻觉/早停命中)都有可测改善。不能支持的更强声明:不能称"贴合分布"普遍提升所有任务、不能称它解决了偷懒/幻觉、不能把数学域数字外推到开放任务。
方法族。 primary = architecture_risk(What 大致清楚,真风险是"哪面的对齐真有因果效应",用最便宜对照打掉);secondary = means_ends(命名当前设计与对齐设计的差异,逐个连到动作)。
命名差异 → 动作。
- 推理被结构污染(skill 要求边推理边产 JSON)→ 推理步 prompt 完全不提最终格式,格式化交末端单独一步或确定性后处理。[well-supported,优先]
- 每步约束超载(单步 >6 个语义约束)→ 按约束容量切 unit,每步 ≤3–6 约束,advisory 规则用 hook/外部检查承载而非塞进 prompt 占注意力。
- 推理预算与难度不匹配(统一配长思考预算)→ 不设固定 token 预算,接 overthinking 早停信号(答案振荡);难任务才放长,工具型步骤用短 CoT。
- 输入用散文承载结构化逻辑 → 带状态/条件的子任务用伪代码或结构化模板表示输入(结构即可,不必可执行)。
- 靠"更熟悉"防偷懒 → 换可观测性杠杆:验收信号做成实质、不可廉价满足;关键判断走独立 verifier;按反表演式勤奋三杠杆。
首个真实切片(也是该补的实验)。 选一个最常用、且同时含推理和结构化输出的 skill(最易踩格式税),做 A/B:原版 vs 推理-格式解耦版,在真实任务历史样本上跑,测三量:完成质量、偷懒/幻觉出现、早停信号命中率。切片小、穿过已知难点(推理+格式同时在场是格式税高发区)、能产生下一步反应。
验证(效果面 vs 控制面分开)。 效果面:解耦版完成质量不低于、最好高于原版。控制面:trace 里是否真发生"先自由推理再格式化",还是模型仍偷偷边推边格式化(后者让效果改善是假象)。两面都过才算这条原则在本域成立。声明上限:通过只能说"在这个 skill、这类任务上,推理-格式解耦有 bounded 收益",不能升成"贴合原生范式普遍有效"。
下一步反应。 通过→抽成可复用骨架推广到同型 skill,依次测差异 2–5。部分通过→定位是效果面还是控制面没过。变差→很可能你的任务在前沿模型上根本没格式税(Format Tax 发现 claude-haiku-4.5/gpt-5.4-nano 级格式税趋零),说明对你部署的模型这条已过期,转去测子命题 (1) 长度校准。受阻→缺真实任务历史样本,先攒。
7. 边界与最该先回答的问题
三条必须随结论带走的边界:
- 代际:几乎所有强证据来自 2023–2024 中等模型和 open-weight 模型;Format Tax(2604.03616)发现近期前沿闭源模型格式税已近零——同时削弱反方证据和正方核心(增益和惩罚可能都被后训练抹平)。日常用 Opus/Sonnet 档,很多 2024 老模型失败模式可能不发作,所有 76pp/63pp 数字不能不加代际限定往当代部署套。
- 域:强证据集中在数学/代码这种二元可验证域;skill 设计、写作、多步规划这种无可验证奖励的开放任务几乎没直接验证,"贴合分布→减少偷懒/幻觉"在开放任务上是合理外推非已证。
- 机制未证:CodeAct 消融反向证否 token 熟悉度叙事,起作用的是结构和组合;把"原生范式"理解成"结构脚手架 + 可验证锚点"安全,理解成"喂模型见得多的表面格式"会出错。
最该先回答的决定性实验(整批文献缺的那个):当 prompt 推理长度匹配 vs 不匹配模型 RLVR 训练分布时,任务性能、幻觉率、shortcut 率各怎么变。无任何论文做过,它正是子命题 (1)(2) 的因果缺口。手上有现成测试基建(workflow_real_task_test_case_design + SpecBench 类 visible-vs-held-out oracle),可把"推理-格式解耦"最便宜的切片先做成第一个对照,用结果决定要不要继续投长度校准实验。现象层证据已够多,缺的是在自己的域和模型上的因果验证。
8. 可靠性与归因校正(分级 agent 主动捕获)
- 作者归因纠错:"Format Tax"(2604.03616)是 Lee/D'Antoni/Berg-Kirkpatrick(UCSD),不是 "Tam et al.";"Tam et al." 指 2024 "Let Me Speak Freely"(2408.02442)。两篇须分开。
- 公式纠错:reward overoptimization(Gao/Schulman/Hilton,ICML 2023)的 RL 形式是 R(d)=d(α−β·log d),不是 α·√KL−β·KL(后者是 best-of-n 形式);RL 下 α 恒定只有 β 随 RM 规模变。别用错曲线推"最优 KL 预算"。
- 未在源头核到的数字(引用须带 qualifier):sycophancy 95/98/45/35%(PDF 渲染为二进制,摘要无);overthinking 的 7.55x/r=0.78(单篇 2604.10739 内部测量,未复现);Min 2022 量级(PDF 抽取失败);PoT 失败 47/33/15/5% 四分解(HTML 未取到段落)。
- 数字陷阱:Sclar 76pp 是最大值(中位 6.4pp);2401.10065 +22.5pp 是 GPT-3.5 上界(Mixtral 仅 7.75pp);Aryabumi +8.2% 是 relative 非绝对 pp。大数字作"最坏情况/存在性",不作"典型收益"。
- 选择性引用风险:Aryabumi 代码→世界知识 +4.2% 必须与 Petty(2409.04556)反向负迁移并列。
- 无幻觉/编造引用:分级 agent 报告全部核心论文真实存在、arXiv ID 正确(2602/2603/2604 因当前 2026 年中而合法);额外挖到一条原检索未收录的同期反例(Kim/Yoo 2205.12685)。
9. 参考文献(arXiv ID 经对抗式核验;经典工作按题名引用)
格式/分布对齐:Sclar et al. FormatSpread 2310.11324(ICLR 2024);Tam et al. "Let Me Speak Freely?" 2408.02442(EMNLP 2024 Industry);Lee/D'Antoni/Berg-Kirkpatrick "The Format Tax" 2604.03616(preprint);Xie et al. "ICL as Implicit Bayesian Inference"(2022);Min et al. "Rethinking the Role of Demonstrations"(2022);Wei et al. "Larger LMs do ICL differently"(2023);Kim/Yoo "Ground-Truth Labels Matter" 2205.12685;Chen et al. task-preserving perturbation 2605.26350;Gonen et al. perplexity proxy(2023);"Perplexity Cannot Always Tell Right from Wrong" 2601.22950。
代码作为基质:code-format input 2401.10065(EMNLP 2024);"On Code-Induced Reasoning" 2509.21499;PoT 2211.12588;PAL 2211.10435;Aryabumi code-in-pretraining 2408.10914;Petty code negative transfer 2409.04556(TMLR 2025)。
推理长度/test-time compute:"When More is Less"/Wu et al. 2502.07266(ICLR 2025);overthinking 2412.21187;underthinking+TIP 2501.18585;"Don't Overthink It" 2505.17813;"When More Thinking Hurts" 2604.10739;Chen inverted-U 2506.04210(NeurIPS 2025);function-calling brief-CoT 2604.02155;length-penalty 2602.09591;Su error-length 2505.00127;TOPS 2502.18080;TRACE 2510.07880;"Demystifying Long CoT RL" 2502.03373(ICML 2025);sharper-primitives 2602.08281;TTRA 2603.12875。
Agentic 格式/scaffold:ReAct 2210.03629;Toolformer 2302.04761;AgentTuning 2310.12823;AgentRefine 2501.01702;ReflAct 2505.15182;"Reasoning Trap" 2510.22977(ACL 2026);Diversity Collapse 2505.18949;DeepSeek-R1 2501.12948(Nature 2025);"Understanding R1-Zero-Like Training" 2503.20783(COLM 2025);SWE-agent 2405.15793(NeurIPS 2024);SWE-Gym 2412.21139(ICML 2025);real-vs-synthetic trajectories 2510.11701;Life-Harness 2605.22166;CodeAct "Executable Code Actions";Deco-G 2510.03595。
偷懒/幻觉/对齐:HANS/McCoy et al. 1902.01007;Du shortcut survey 2208.11857;Sharma sycophancy 2310.13548(Anthropic 2023);Gao/Schulman/Hilton reward-overoptimization(ICML 2023);McKenna hallucination-NLI 2305.14552(EMNLP 2023);"The Poison of Alignment" 2308.13449;"When Thinking Fails" 2505.11423(NeurIPS 2025)。
机制/认知基础:Function Vectors/Todd et al. 2310.15213(ICLR 2024);FV-heads-vs-induction 2502.14010;induction-head ablation 2407.07011(NAACL);Olsson et al. "In-context Learning and Induction Heads"(Anthropic 2022);monofact bound/Miao&Kearns 2502.08666(PNAS 2025);spec-heavy ICL failure 2311.08993。