context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

agent_native_data_paradigm_20260531_deep_research

Z3 全文↑ Z2 条目

方法论库 · 实跑 · memory_index

← 返回方法论库索引 · 返回方法论区

本页是 <code>contexts/methodology/agent_native_data_paradigm_20260531_deep_research.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 contexts/methodology/agent_native_data_paradigm_20260531_deep_research.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

报告元数据(frontmatter)
name: agent_native_data_paradigm_20260531_deep_research
description: LLM 原生数据范式
domain: infra
consumption:
  surface: memory_index
  trigger: "记忆索引召回"
  consumer: orchestrator
status: library
promoted_to: null

Agent 的"原生数据范式":贴合什么、怎么贴合

调研日期:2026-05-31

产出方式:8 线程并行 deep-research workflow(检索 → 精读 → Opus 对抗式证据分级),run ID wf_f48f015c-14d,24 个 sub-agent / 约 120 万 token / 645 次工具调用。每条核心数字经独立分级 agent 对抗式核验,多数逐字对照原文。

应用 skill:workflow_solid_decision_review(五级证据定 claim ceiling)+ workflow_what_to_how_execution_bridge(输出契约写"怎么做")。

关联前期成果:reference_llm_constraint_capacity(约束容量)、anti_performative_diligence_methodology_20260530_manual.md(反表演式勤奋)。

0. 起点问题

用户假设:对人类,图像/架构图比纯文字直观,因为有专门的视觉皮层。类比到 LLM/Agent,是否存在一种模型"天生更熟悉"的原生数据范式(训练里见得最多、困惑度最低、最能激活已有回路的结构)?若设计任务和 skill 时贴合它,是否能让模型表现更好、更少偷懒和幻觉?两个子命题:(1) 任务建模——把复杂度/推理长度调到接近模型推理训练(CoT/RLVR)建构的长度分布;(2) 效果优化——这种贴合能否减少 shortcut 和 hallucination。

1. 结论先行

存在这样的"原生范式",但形态和朴素设想不同,而且最朴素的版本被这批证据里最硬的一条直接证伪:强制模型用它最熟悉的结构化格式 JSON 去承载推理过程,GSM8K 上 Claude-3-Haiku 准确率从 86.5% 崩到 23.4%(arXiv:2408.02442,逐字核实)。"熟悉即更好"在推理面和输出面是反的。

站得住的版本三句话:

  1. 模型内部确实有"原生回路"。function vector 的因果中介实验证明存在一个紧凑、可因果干预的任务表示,zero-shot 迁移 57–84% vs 基线 5–8%(arXiv:2310.15213,ICLR 2024)。这是"人类熟悉图像"在 LLM 里最接近的客观对应物:一条被训练铺好、一激活就能跑的计算回路。但它不可读(解码成乱码 token)、模型族特定(不存在跨模型通用的"原生格式",Sclar 2310.11324 证模型间格式偏好弱相关)。
  2. 起作用的是结构与组合,不是表面 token 的熟悉度。把代码去掉控制流只留"代码字符串",相对 JSON 的优势消失(CodeAct atomic-API 消融,直接证否"模型见过更多代码所以代码赢")。
  3. 这是一个有最优点的区间,不是越贴合越好。推理长度、格式约束、对齐强度三个维度,过少过多都掉点。

对 agent 最锋利的答案:你能设计的那一层,最贴近"熟悉图像"的不是某种魔法格式,而是模型被 RL 训练时所在的轨迹形状 + 可验证奖励结构(DeepSeek-R1 是干净的存在性证明)。

2. 三个修正(把假设改成站得住的形式)

修正一:不是一个范式,是三个行为相反的"格式面"

证据要求把"格式"切三层,对齐方向彼此相反:

格式面对齐方向证据
输入面(问题表示)上结构:带计算/状态/条件逻辑的问题用代码/伪代码/流程图承载自然语言→代码输入(不执行)GPT-3.5 条件推理 +22.5pp(2401.10065,back-translation 消融);3331 次受控实验证"结构>语义"、伪代码≈代码(2509.21499)
推理过程面绝不上结构:留在模型原生自由 CoT推理过程强加 JSON,GSM8K Claude-3-Haiku 86.5→23.4,Last-Letter −31.5pp(2408.02442)
输出面末端再格式化:先自由推理再单独格式化两阶段 NL-to-Format / CRANE 恢复 +6.8~9.2pp(2408.02442 / CRANE 2025)

可执行版本:结构化输入、自由化推理、末端格式化输出。朴素的"把 prompt 调成模型最熟悉格式"若落在推理或输出面,是净负。

修正二:困惑度测的是流畅不是正确

熵/困惑度直觉方向对——低困惑度弱相关于更好性能(Gonen 2023,平均仅 +1.8~2.3pp,且 IMDB/Cola 反向)。但硬约束:困惑度对流畅的胡说也赋低值(2601.22950 指出它在事实准确性/推理质量上不可靠)。困惑度是"在不在流形上"的弱探针,不是质量探针。这条直接限制"用贴合分布防幻觉"的力度。

修正三:bounded optimum,不是单调

8 个线程最一致的结构。每个维度两头都掉点:

维度太少→掉点太多→掉点
结构裸 shell 当 agent 接口、拼接式轨迹训练推理过程强加 JSON(−27 到 −63pp)
推理长度underthinking,难题上半途切换路径overthinking,过拐点放弃已对的答案
对齐强度格式敏感性发作(最坏 76pp)safety 数据对齐反损推理 4–33%(Poison of Alignment 2308.13449)

处方永远是"落进区间",不是"最大化贴合"。

3. 证据分层(Solid Decision,用最弱相关证据定 claim ceiling)

Solid / well-supported(多篇独立 + 多数已发表 + 逐字核实,可直接用于设计)

  1. 格式敏感性是真实一阶因果变量,语义等价的格式微变可造成显著差异,不随规模/few-shot/instruction-tuning 消失(Sclar 2310.11324,ICLR)。边界:最坏 76pp 对应中位仅 6.4pp,大数字只当"最坏情况存在性",不当"典型收益"。
  2. 推理过程上的结构约束伤推理、助分类,二分法稳健;解法是推理与格式解耦(2408.02442,EMNLP;CRANE)。DDXPlus 分类任务上 JSON 反而 +11~19pp。
  3. 结构化中间表示 > 自然语言散文,用于带计算/状态/条件逻辑的任务;起效的是结构不是代码本身(2401.10065 + 2509.21499 + PoT 2211.12588 / PAL 2211.10435,+12%)。对常识/语义任务(StrategyQA)不适用。
  4. 推理长度倒 U 最优,最优长度随难度上升、随模型能力下降(1.5B 约 14 步 vs 72B 约 4 步),RLVR 自发收敛向更短(simplicity bias,2502.07266 形式化证明 + ICLR;2506.04210 GSM-8K 82.2→87.3→70.3,NeurIPS)。
  5. Task/function vector 真实且因果存在(2310.15213),但只到"存在+因果",不到"可读"或"可组合"(组合代数坍到 0.07,top-100 重构 4.8%)。最强在 70B。
  6. 幻觉有硬下界(monofact bound)(2502.08666,PNAS):对训练里只见过一次的事实,任何格式/对齐都无法降低幻觉,只对高频知识有效。
  7. Shortcut learning 是 in-distribution vs OOD 的真实裂缝(HANS 1902.01007,非蕴含掉到 4%,逐字核实);且更大的模型更依赖 shortcut(Yuan 2024)。
  8. Agent scaffold/ACI 是一阶杠杆,常压过 backbone 选择(SWE-agent 2405.15793,ACI 约三倍 solve rate,+10.7pt over 裸 shell,跨模型迁移)。论文把原因归于工效学和 context 效率,不是训练分布对齐。
  9. DeepSeek-R1 的"最小结构容器 + 规则化可验证奖励"是干净存在性证明(2501.12948,Nature):<think>/<answer> 标签 + 规则化奖励(特意不用神经奖励,明说防 reward hacking)+ 让模型自我发现推理,涌现有效长推理。

Bounded / partial(方向可信,域窄或单篇,带边界用)

Speculative(用户两个核心子命题恰好落在这里,因果链缺关键一环)

4. 两个子命题的精确回应

子命题 (1):贴合的不是"训练长度",是"模型的能力带"

证据把"对齐到训练推理长度"替换成更站得住、更可操作的提法:让每步落进模型既非 0% 也非 100% 的难度带,且推理长度不超过该难度的拐点。理由:最优长度随能力下降(72B 只要 4 步),RLVR 把模型推向更短——"贴合模型训练建构的长度"这个目标本身不稳定,强模型的舒适长度在变短。给 skill 配过长强制思考预算是对抗训练动态,引入更多错误中间步、甚至让模型放弃已对的答案。

这条和约束容量成果是同一东西的两面。3–6 复杂约束上限、P(n)=p^n curse,和文献的倒 U/overthinking,都在说"每步留在工作容量带内"。合起来的任务建模规则:分解到每步携带 ≤3–6 个约束,且推理长度落在该步难度的拐点以内。"context diversity > context length"在这里也对上——竞争性认知框架(advisory 规则和核心任务抢 3–6 预算)才是 drift 源,不是 token 数。

可操作杠杆不是固定 token 预算(移动靶),而是 overthinking 检测 / 早停信号:答案振荡是实时预测器;函数调用类任务 32 个推理 token 把 Qwen2.5-1.5B 从 44% 抬到 64%,256 token 掉到 25% 并带 18% 函数幻觉(2604.02155)。工具型 agent 短 CoT 赢,长 CoT 诱发幻觉。

子命题 (2):贴合分布是必要不充分,主杠杆是可观测性

证据和反表演式勤奋成果高度收敛。该框架说偷懒=可观测性条件化优化(Goodhart 变体),能控杠杆是 harness 的可观测性结构。文献从三个独立方向印证"分布对齐不是主杠杆":

诚实结论:贴合分布能降低 OOD 带来的 shortcut 压力(真实但部分),但偷懒和幻觉主因是激励结构和可观测性。把工作做成可验证、奖励做成不可作弊,比把任务调得更"熟悉"杠杆大得多。

5. 对 Agent 而言最贴近"熟悉图像"的是什么

机制层:function vector / 已铺好的任务回路——客观存在、可因果激活,但不可读、模型族特定、无法靠"重复格式"可靠触发(induction head 是不是 ICL 操作回路本身有争议:2502.14010 说大模型主要靠 FV head,2407.07011 说消融 induction head 仍掉 ICL 达 32%,两边都有 confound)。"用魔法格式激活原生回路"在机制上没有落点。

部署层(你真正能设计的那层):最贴近的"熟悉图像"是模型被 RL 训练时的轨迹形状 + 可验证奖励结构。DeepSeek-R1 存在性证明给的精确启示:提供最小结构脚手架(agentic 循环形状:分析→行动→观察→反思),让模型在里面用原生方式推理,用可验证检查点锚住——而不是把结构灌进推理本身。chat template 的 system/user/assistant/tool 角色之所以"原生"同理:它是每条后训练样本的骨架,顺着走在流形上,塞进巨型 user turn 是离流形。

诚实标注:"因为匹配训练分布所以有效"这个因果说法仍 speculative;scaffold 论文自己把 SWE-agent 增益归于工效学。这层是"有行为证据、机制未证"的工作假说。

6. 具体怎么做(What2How 执行桥)

目标。 当前:skill/prompt 凭直觉写,偶尔踩格式税和 overthinking,不知哪些设计真贴合了模型认知。目标:skill 遵循"结构化输入/自由化推理/末端格式化输出"+"每步落能力带内"+"可验证检查点锚定",且这些原则在真实任务上被对照测过。验收:改造后相对改造前,在效果面(完成质量)和控制面(偷懒/幻觉/早停命中)都有可测改善。不能支持的更强声明:不能称"贴合分布"普遍提升所有任务、不能称它解决了偷懒/幻觉、不能把数学域数字外推到开放任务。

方法族。 primary = architecture_risk(What 大致清楚,真风险是"哪面的对齐真有因果效应",用最便宜对照打掉);secondary = means_ends(命名当前设计与对齐设计的差异,逐个连到动作)。

命名差异 → 动作。

  1. 推理被结构污染(skill 要求边推理边产 JSON)→ 推理步 prompt 完全不提最终格式,格式化交末端单独一步或确定性后处理。[well-supported,优先]
  2. 每步约束超载(单步 >6 个语义约束)→ 按约束容量切 unit,每步 ≤3–6 约束,advisory 规则用 hook/外部检查承载而非塞进 prompt 占注意力。
  3. 推理预算与难度不匹配(统一配长思考预算)→ 不设固定 token 预算,接 overthinking 早停信号(答案振荡);难任务才放长,工具型步骤用短 CoT。
  4. 输入用散文承载结构化逻辑 → 带状态/条件的子任务用伪代码或结构化模板表示输入(结构即可,不必可执行)。
  5. 靠"更熟悉"防偷懒 → 换可观测性杠杆:验收信号做成实质、不可廉价满足;关键判断走独立 verifier;按反表演式勤奋三杠杆。

首个真实切片(也是该补的实验)。 选一个最常用、且同时含推理和结构化输出的 skill(最易踩格式税),做 A/B:原版 vs 推理-格式解耦版,在真实任务历史样本上跑,测三量:完成质量、偷懒/幻觉出现、早停信号命中率。切片小、穿过已知难点(推理+格式同时在场是格式税高发区)、能产生下一步反应。

验证(效果面 vs 控制面分开)。 效果面:解耦版完成质量不低于、最好高于原版。控制面:trace 里是否真发生"先自由推理再格式化",还是模型仍偷偷边推边格式化(后者让效果改善是假象)。两面都过才算这条原则在本域成立。声明上限:通过只能说"在这个 skill、这类任务上,推理-格式解耦有 bounded 收益",不能升成"贴合原生范式普遍有效"。

下一步反应。 通过→抽成可复用骨架推广到同型 skill,依次测差异 2–5。部分通过→定位是效果面还是控制面没过。变差→很可能你的任务在前沿模型上根本没格式税(Format Tax 发现 claude-haiku-4.5/gpt-5.4-nano 级格式税趋零),说明对你部署的模型这条已过期,转去测子命题 (1) 长度校准。受阻→缺真实任务历史样本,先攒。

7. 边界与最该先回答的问题

三条必须随结论带走的边界:

最该先回答的决定性实验(整批文献缺的那个):当 prompt 推理长度匹配 vs 不匹配模型 RLVR 训练分布时,任务性能、幻觉率、shortcut 率各怎么变。无任何论文做过,它正是子命题 (1)(2) 的因果缺口。手上有现成测试基建(workflow_real_task_test_case_design + SpecBench 类 visible-vs-held-out oracle),可把"推理-格式解耦"最便宜的切片先做成第一个对照,用结果决定要不要继续投长度校准实验。现象层证据已够多,缺的是在自己的域和模型上的因果验证。

8. 可靠性与归因校正(分级 agent 主动捕获)

9. 参考文献(arXiv ID 经对抗式核验;经典工作按题名引用)

格式/分布对齐:Sclar et al. FormatSpread 2310.11324(ICLR 2024);Tam et al. "Let Me Speak Freely?" 2408.02442(EMNLP 2024 Industry);Lee/D'Antoni/Berg-Kirkpatrick "The Format Tax" 2604.03616(preprint);Xie et al. "ICL as Implicit Bayesian Inference"(2022);Min et al. "Rethinking the Role of Demonstrations"(2022);Wei et al. "Larger LMs do ICL differently"(2023);Kim/Yoo "Ground-Truth Labels Matter" 2205.12685;Chen et al. task-preserving perturbation 2605.26350;Gonen et al. perplexity proxy(2023);"Perplexity Cannot Always Tell Right from Wrong" 2601.22950。

代码作为基质:code-format input 2401.10065(EMNLP 2024);"On Code-Induced Reasoning" 2509.21499;PoT 2211.12588;PAL 2211.10435;Aryabumi code-in-pretraining 2408.10914;Petty code negative transfer 2409.04556(TMLR 2025)。

推理长度/test-time compute:"When More is Less"/Wu et al. 2502.07266(ICLR 2025);overthinking 2412.21187;underthinking+TIP 2501.18585;"Don't Overthink It" 2505.17813;"When More Thinking Hurts" 2604.10739;Chen inverted-U 2506.04210(NeurIPS 2025);function-calling brief-CoT 2604.02155;length-penalty 2602.09591;Su error-length 2505.00127;TOPS 2502.18080;TRACE 2510.07880;"Demystifying Long CoT RL" 2502.03373(ICML 2025);sharper-primitives 2602.08281;TTRA 2603.12875。

Agentic 格式/scaffold:ReAct 2210.03629;Toolformer 2302.04761;AgentTuning 2310.12823;AgentRefine 2501.01702;ReflAct 2505.15182;"Reasoning Trap" 2510.22977(ACL 2026);Diversity Collapse 2505.18949;DeepSeek-R1 2501.12948(Nature 2025);"Understanding R1-Zero-Like Training" 2503.20783(COLM 2025);SWE-agent 2405.15793(NeurIPS 2024);SWE-Gym 2412.21139(ICML 2025);real-vs-synthetic trajectories 2510.11701;Life-Harness 2605.22166;CodeAct "Executable Code Actions";Deco-G 2510.03595。

偷懒/幻觉/对齐:HANS/McCoy et al. 1902.01007;Du shortcut survey 2208.11857;Sharma sycophancy 2310.13548(Anthropic 2023);Gao/Schulman/Hilton reward-overoptimization(ICML 2023);McKenna hallucination-NLI 2305.14552(EMNLP 2023);"The Poison of Alignment" 2308.13449;"When Thinking Fails" 2505.11423(NeurIPS 2025)。

机制/认知基础:Function Vectors/Todd et al. 2310.15213(ICLR 2024);FV-heads-vs-induction 2502.14010;induction-head ablation 2407.07011(NAACL);Olsson et al. "In-context Learning and Induction Heads"(Anthropic 2022);monofact bound/Miao&Kearns 2502.08666(PNAS 2025);spec-heavy ICL failure 2311.08993。


← 返回方法论库索引 · 返回方法论区