优化阶段方法论
方法论道层 · Career/竞赛方法论
优化阶段方法论
viewtype=循环图 · 答:优化阶段前置三件与七步迭代循环如何咬合 · 不答:具体榜面数字
前置三件 + 七步迭代循环 × 证据四级 × R3 delta
真源路径:career/methodology/METHODOLOGY_OPTIMIZATION_PHASE_v1.md · 图型:循环图 · 域:Career/竞赛方法论
真源正文
报告元数据(frontmatter)
schema_version: fa-3
slot: methodology
doc: optimization-phase-direction-and-effect-accuracy
program: job_search_program_20260716
version: SOP tag 0.3(2026-07-19 打于 997fb12f 收口 commit;unversioned-draft 状态终止——原判据「无下游被迫改动」已失效:E1-E26 两轮修订含序7 当日制收口反转、断言等级制强制 DECISIONS §5 重写、每周期测点升义务,X 级,判定依据 workflow_version_evolution.md §2/§6,version-manager 收口校核)
requirement_anchor: ../requirement_records/JS-20.md + 用户 2026-07-18 逐字指令(见 §1.0)
author: session 7f6b652a 接续 750276f6 收口成文(判断与写作主 agent 亲做;输入=五模型独立评审 + 全历程考古 + 优化路径台账两波修正)
created_at: 2026-07-19
revised_at: 2026-07-19(修订 E1-E13:触发=用户 07-19 晨四锚[逐字见 career/ORIGINAL_PROMPT.md 末段消息3];审查=Fable meth-review agent[scratchpad/METHODOLOGY_REVIEW_20260719.md,四缺口+断言硬化链六段考古];回填=Orchestrator 亲笔)
status: bounded(证据基座=单一竞赛周期 AFAC A 榜段;claim ceiling 见 §8)
sibling: METHODOLOGY_COMPLEX_TASK_COMPETITION_v1.md(生命周期总纲;本文是其 §4 本地验证闭环 / §8 防自欺在「优化阶段」的实战深化模块,总纲不动、本文独立演进)
promotion_trigger: 与总纲同(第二竞赛周期 dogfood,或出现非本 program 的真实消费者;晋升前先与既有道 skill 去重)
consumption_boundary: 回答「优化阶段怎么保证方向准确、效果真实、不陷局部最优」。不管赛前信息战与报名(总纲 §3/§7)、不管具体赛事评分细则(各赛 TASK_CARD)、不管提交操作路径(COMPETITION_OPS_SOP)。优化阶段方法论 v1:方向准确性、效果真实性、反局部最优
一句话:优化阶段的头号风险不是做得不够多,而是方向建立在未核实的假设上、效果建立在会说谎的指标上。本文把 AFAC 赛题四约 71 小时、4 个榜面数据点、18 条失败记录、台账两波共 9 条修正里付过学费的教训,收敛成一套可跨赛复用的思考路径与保障机制。
消费时刻表
| 时刻 | 读哪节 |
|---|---|
| 优化阶段开工(拿到第一个真实分数后) | §3 第 0-2 步 |
| 每个优化动作立项前 | §5 前置五问 |
| 每次真实出分后 | §5 出分四问 + 台账登记 |
| 要预测一个测不到的未来状态(B 榜 / 新分布 / 上线后) | §3 第 6 步外推纪律 |
| 怀疑陷入局部最优,或指标一片繁荣但心里不踏实 | §2 失败机制自查 + §5 独立挑战 |
| 新赛 / 新优化任务开工要复用本方法论 | §6 迁移层 |
| 要呈报优化目标,或要写「当前最佳 / 刷新 / 提升」 | §3 第 0a 步 + 第 5 步主指标条款 |
| 要登记 / 引用对手、官方、平台的行为断言 | §5 断言随行等级四条 |
§1 证据基座
§1.0 需求锚(用户逐字,2026-07-18)
「我们需要检查并明确后续在此类任务中应当采取的方法论,以避免在局部最优的地方持续卡住,或者忽略掉比赛中真正重要的关键部分。我们不能让一些次要的干扰因素(比如指标上的"虚假繁荣"或噪音)淹没掉我们真正应该做的事情」;方法论须涵盖「方向与效果的准确性」与「思考路径」,并「梳理复杂难题的解决顺序」、「构建通用的方法论……应用到其他类似的比赛和问题中」。
§1.1 数据
| 数据点 | 值 | 含义 |
|---|---|---|
| 榜面四点(天池 A 榜实测) | v1 朴素 54.98 / v2 保守 50.14 / v3 保守+事实库 52.85 / noid 去-ID 41.86 | 两轮精巧优化全部负收益;去-ID 掉 13.1 分 |
| 单跑解码噪声 | ±1.5 分/次(temperature=0 仍在,6 题复跑探针 4 题翻回坐实) | 两个单跑差的 σ_diff≈2.12 分;v1−v3=2.13 仅 1.0σ 不显著;唯一稳健差 v1−v2=4.84(2.3σ) |
| 线性外推证伪 | 估 47-53,实测 41.86 | 偏离约为最悲观估计的 1.7 倍;三重机制复合放大 |
| 中间指标 vs 真实瓶颈 | doc 粗排召回 0.99(top-15)看起来健康;42% 题官方 doc 零正文进 prompt(noid 条件) | 虚假繁荣的实体样本 |
| 失败全名录 | 18 条失败/作废/中断 + 11 个 agent 完整转录 | competitions/afac2026_task4_memory_qa/research/SESSION_ARCHAEOLOGY_20260718.md |
| 五模型独立评审 | DeepSeek/GLM/Kimi/Fable/Codex 各自独立挑战台账 | 触发台账两波共 9 条修正;评审原文在 research/multi_model_review_20260718/ |
| 跨任务佐证 | 硅碳254 双 seed 防 sim 过拟合(样本 overlap=0);工作区开环控制理论、反表演式勤奋、从众防御 | 方法论不是 AFAC 孤例的推广 |
§1.2 一句话版本
四轮优化里,唯一榜面显著的信号是「保守组装显著变差」;所有「聪明优化有效」的证据要么落在噪声里、要么停在离线中间指标;对不可测状态的线性估计被实测证伪;连专门为反局部最优建的台账,初版也两次把 bounded 当 solid 用。本文的全部内容,就是把这些错误变成可机械检查的纪律。
§2 优化阶段的八个失败机制(自查表)
每条给三样东西:机制、AFAC 实证、你正在犯它的信号。
FM1 方向建立在未核实的假设上。 v2 的保守组装规则源自「多选无部分分」这个从未向官方核实的赛制假设,立项时被标为「最高杠杆」,次日榜面证实是最大单一失分源(-4.84,台账 N1/N3)。信号:你的优化动作依赖一个「大家都觉得是这样」但没有原文出处的前提;规则、评分、接口语义靠猜。
FM2 中间指标的虚假繁荣。 文档召回率 0.89/0.94 让所有人庆祝检索地基牢固,但没人算过官方文档正文真正进 prompt 的比例:42% 的题至少一个官方 doc 零 chunk 进入(noid 条件)。E2-E5 四条检索优化全部停在离线指标,端到端价值至今未验证。信号:你在为一个中间指标的改善高兴,却说不出它到最终目标之间每一层的转换率;「XX 已经 0.9+ 了」被当成不用再看的理由。
FM3 噪声当信号。 qwen-plus temperature=0 仍有 ±1.5 分/次的服务端解码噪声,而 v1/v2/v3 全是单次提交。v1−v3 的 2.13 分差只有 1.0σ,团队却把「朴素基线打败所有优化」当核心叙事写进台账(后被三个模型独立抓出、降级为 partial)。信号:两次测量的差值小于噪声量级还被当结论;比较双方的测量次数都是 1。
FM4 用线性外推预测系统性退化。 对 B 榜的估计用「每题 0.3 分 × 分歧题数」线性叠加得 47-53,实测 41.86。去-ID 的伤害是三重机制复合放大(检索硬伤 + 证据变弱触发自发保守漏选 + distractor 事实污染),不是逐题独立;0.3 分/题这个均摊损失率来自同制度内的答案扰动,跨制度迁移直接失效(台账 N6)。信号:你的预测公式里有「× 题数」;预测场景与测量场景在制度层面不同(有无 ID、分布、评分方式)。
FM5 单因归因钟摆与最大失分块免检。 第一轮全部注意力在答题策略,归因后钟摆甩到「检索是胜负手」;但满分 100 只得 54.98 的那约 45 分残差,从头到尾没有任何条目分析过,研报域 20 个文档在全部报告里零出现(台账 W7)。同时,台账自己最得意的核心叙事恰恰是证据最弱、最晚被挑战的。信号:你能对 ±5 分的差异说出三层机制,却答不出「距离满分的最大一块丢在哪」;最自信的结论从没被独立检验过。
FM6 过程记录幻觉。 v4 的 progress log 段头时间是恢复后按想象补写的(写 14:2x,文件系统证据全在 18:53 之后);「硬停生效」是假 claim(worker 又干了 11 分钟,用未验证错误事实重跑了 20 题);98ec606f 在工具刚返回真相后 3 分钟输出编造数字。优化决策建立在被污染的过程记录上,方向判断跟着被污染(台账修正 9)。信号:关键判断的依据是 agent 自报或 progress log,而不是文件 mtime、外部平台记录、原始转录;「停止」发出后没有查过磁盘验证。
FM7 断言在复述链中硬化。 疑问句或单例推测经跨文档、跨 session 复述,逐跳升级为陈述式事实,且断言范围随行突变(单例→全场)。实证:「label-probing」六段链——起点是单个公开仓库的 README 自认(bounded,范围仅该队)+ 用户的疑问句分析指令(「是否是…Label 堆砌」),经范围外推、疑问转陈述、台账制度化、总纲引用,四天后被当「已知事实」向用户呈报,全程没有任何一跳附带重核(考古全链 file:line 见 ../competitions/afac2026_task4_memory_qa/research/METHODOLOGY_REVIEW_20260719.md §B.1;关键跳=「某队 80-86 能力带」突变为「全场真实能力天花板」)。信号:你在引用一条说不出原始出处的「已知事实」;一个「是否 X」在下游文档里变成了「X」;对手的动机被当成结论使用。
FM8 目标锚定漂移。 目标声明缺位时,优化目标被最近可得的数字默认占位——对手水平带、自身历史最佳、可行性假设(「可能撞能力上限」)事实上起了目标折扣作用。实证:80-86 对手带(本身是 FM7 链的产物)被隐式当成目标呈报用户,遭用户驳回(「如果我们只是想达到别人的状态就停下来,那如何在这个比赛中脱颖而出」);45 分最大残差块在目标真空下零分解(W7 拖延)。信号:说不出「阶段目标是多少、谁定的」;残差讨论总以对手或自身历史为参照,而不是任务上限。FM8 的上游往往是 FM7——堵断言硬化才能防目标误锚复发。
§3 思考路径:优化循环八步
这不是可重排的清单,是有依赖顺序的循环:第 0-2 步是开工前置(做一次,制度变化时重做),第 3-7 步每轮迭代都走。
第 0 步:规则元博弈先行。 优化发生在一个由评分公式、提交额度、制度差异定义的博弈场里;场的参数每条都数小时可查,每条都能改写整个计划。AFAC 里「额度是每日还是总量」「multi 有无部分分」「evidence 是否计分」「B 榜给不给域信息」四个未知全部影响策略,而 N3 假设未核实就上规则已经付了 4.84 分学费。另一半是分清目标函数:A/B 双榜赛制下真战场是 B 榜,A 榜只是测量仪器;把仪器读数当优化对象,就会为 A 榜过拟合(台账修正 7)。判据:列出所有影响策略的规则未知,每条标「核实成本 / 门控哪些决策」;存在「数小时可查且门控一类优化」的未知时,它先于一切实做。
第 0a 步:目标锚定声明(phase 级,开工设一次、制度变化或用户改锚时重设)。 三层缺一不可:①恒定锚=任务上限(AFAC:100 题全对),永不因可行性叙事下调;②阶段目标=用户定、逐字记录(AFAC 当前:无-ID 条件 90% 准确率,用户 2026-07-19 锚),agent 可以报告可行性证据,无权改写目标;③主指标定义=目标条件下的真实读数(AFAC:无-ID 答对题数 C,现值 45)。配套对手情报用途白名单:对手信息只允许流入机制情报(如公开仓库的负向实验清单)与规则推断两个用途;禁止流入目标函数、节奏函数、动机归因——「不能让别人的实现方式影响我们自己的节奏」(用户逐字)。
第 0b 步:侦察债 TTL。 已识别的门控未知(第 0 步清单上的条目)超过一个迭代周期仍未核实且仍在门控决策,自动升为当前最高优先任务。实证:X0 额度语义拖三天、X2 评分公式拖延被台账自评「排序错误」——两条都是数小时可查、门控整类决策的侦察,拖延的代价是整个花期的预算排程建立在错误假设上。
第 1 步:全链路损失分解。 从满分到当前分,沿「题目→检索→证据→推理→组装→评分」逐层量化真实损失,先找最大失分块,再决定修哪。分解默认在目标条件下做(AFAC=无-ID),残差统一表述为「距任务上限差多少」(AFAC:无-ID 条件距 100 题差 55 题),不用「距对手/距自身最佳」表述——参照系错了,最大失分块的定位跟着错。AFAC 的教训是反着来的:45 分残差从未被分解,注意力全在能解释 ±5 分的层(FM5)。判据:能列出「每层丢多少分」的表且各层之和约等于总损失;最大的一块有归因,或有「暂无法归因」的显式标注。
第 2 步:基线理解与冻结。 朴素基线是必须先理解、再超越的对象,不是待优化的起点。理解=组件级消融:v1 为什么强,答案必须落到可单独开关的组件上,不能停在「隐含贴合出题机理」的定性故事(Codex 评审指出这是 v2/v3 负收益的结构性根源:在黑箱上叠东西)。冻结=代码+prompt+输出三件套在产生当刻入版本控制:v1 的 prompt 原文因迟一步 commit 永久丢失,54.98 的确切实现只能反推(台账 X5)。判据:基线每个组件可单独开关;基线可从冻结物逐字节复现。
第 3 步:噪声地板先行。 任何比较之前,先测单次运行的方差(重跑同版本探针题看翻转率;AFAC 用 6 题复跑发现 4 题翻回,坐实 ±1.5 分)。此后:两版本差小于 1.5×σ_diff(AFAC 即约 3 分)不当信号,≥2×σ_diff(约 4 分)才可标 solid;重要提交用 majority-N 去噪;同时警惕去噪自身的成本混杂:majority-3 抬高 token 上报(noid_stable 约 v1 的 2 倍),若评分含 token 项,去噪本身有分数代价(台账 X6)。判据:说「A 比 B 好」之前能报出噪声地板数值;所有 solid 级结论的差值过阈。
第 4 步:假设显式化的单变量迭代。 每个优化动作立项时登记:依赖什么假设(链到第 0 步的规则未知)、动哪个单一变量、预期效果的可证伪数字、适用边界(带-ID/去-ID、域已知/无域)。AFAC 两条反例:v2 与 v3 两个方向叠着上,-4.84 与 +2.71 混在一起要靠事后 MD5 对比才拆开;实体 rerank 不写边界,从域已知 +0.03 变无域 -9(N5)。加法(叠新东西)与减法(回基线单独验证一个组件)要区分:四轮优化全是加法,没有一轮减法对照。判据:§5 前置五问全过。
第 5 步:端到端验证与证据分级。 证据四级:solid(榜面/真实端到端)> bounded(离线评测)> partial(诊断推断)> observational(冷读/静态)。中间指标到最终目标每一层都可能漏水(召回→chunk→prompt→答案→分数),bounded 永远不能当 solid 引用;结论层也要过分级,尤其自己最得意的叙事(台账初版在 §0 结论和 W1 优先级上两次中招,是「连反局部最优工具自己都会犯」的活证据)。比较用配对差分设计:v4_stable 带-ID 实测之所以关键,因为它与 41.86 构成同管线配对,是分离「管线差异 vs ID 差异」混杂的唯一手段。判据:台账每条有证据等级和测量条件;行动决策引用的依据 ≥ bounded。主指标条款:「当前最佳」「刷新」「提升」这些词保留给主指标(目标条件读数);非目标条件读数一律称「仪器读数」并显式标测量条件——W2 回填曾庆祝「A 榜最佳刷新」,但那是带-ID 仪器读数,主指标(无-ID C=45)当时纹丝未动,奖励信号错位会把主轨道悄悄拖离目标条件。
第 6 步:外推纪律(预测测不到的状态)。 五个动作:①原样模拟目标条件——升级为每周期义务:每个优化周期至少一个目标条件真实测点(真实提交或离线全量),不等闭榜才发现(noid 离线跑与 07-19 03:14 的 noid 提交就是做对的部分;用户逐字「既然 B 榜没有 Doc ID,我们完全可以在 A 榜里做这种模拟」);②按失效机制取条件概率、不用均摊(饥饿型失效的 P(答对)≈猜测率,给悲观界);③报区间不报点;④尽早用一次真实测量校准「离线→真实」的映射(41.86 这次提交本身是正确动作,错的是之前的换算方法);⑤预测必须留可证伪的具体数字:N6 的全部方法论价值来自它留了 47-53 这个可被 41.86 证伪的数字,没有这个数字连「估计方法错了」都无从得知。每拿到一个真实点,立即把它变成新锚、从锚出发增量修正,不再从旧模型整体外推。判据:预测有区间、有机制假设清单、有预定的校准时点。
第 7 步:台账与独立挑战。 每轮迭代无论成败落一条进优化路径台账(有效/无效/待验证 + 证据等级 + 测量条件 + 证据路径);无效路径不删除,显式标注为何无效,防止换了 context 的自己重走。重大方向决策前,把台账交给 ≥2 个独立模型评审,专门问「哪些被当成结论但证据不足」;自己最确信的结论显式标出来供攻击。AFAC 实测:五模型评审抓出单 context 漏掉的统计功效问题、W1 高估、token 混杂;同时两个模型(DeepSeek/Codex)因台账条目缺「测量条件」字段而误读同一处,证明 factpack 的表述质量本身决定评审有效性。判据:台账条目四字段齐全;最近一次重大转向前有独立评审记录。
§4 复杂难题的解决顺序
顺序不是固定清单,由三个判据决定:信息价值/成本比(便宜且能改写计划的先做)、门控关系(决定别的事能不能做的先做)、不可逆性(消耗额度或截止窗口的动作最后做,做之前榨干免费信息)。
标准序(AFAC 校准版):
- 零成本侦察:规则、评分、额度、制度未知全部清一遍(§3 第 0 步)。
- 端到端最小闭环:Day-1 打通「跑通→产出→提交格式合法」,拿到第一个真实分数。AFAC v1 第一晚全量跑完并尝试提交,这步做对了,54.98 成为后面一切判断的锚。
- 真实误差信号定标:确认本地 oracle 与真实分数的映射关系。硅碳254 的双 seed 不相交样本防 sim 过拟合,是这一步在自建仿真器场景的变体。
- 全链路损失分解,定位最大失分层(§3 第 1 步)。
- 杠杆排序:按「预期增益 × 证据等级 ÷ 成本」排;门控未解的路径(如依赖域信息的实体 rerank)排在其门控核实之后。
- 单变量迭代 + 去噪验证(§3 第 3-5 步循环)。
- 收口(按额度语义分叉):总量制=提交预算永远留最后一次给「验证最重要假设」,不留给「赌一把新想法」。当日制(AFAC 实测口径)=当日窗口默认花满于「当前最优候选的目标条件验证」(候选选择仍按信息价值序);空过的窗口过期作废、不产生未来预算,空窗是需要事前记录理由的例外(合法理由白名单:无任何新信息可测;单变量序真实阻塞;候选未过机械门);当日最后一个窗口优先给验证性提交而非赌博性提交。用户锚:「提交本身就是为了验证方向是否正确」「不能因为谨慎就不提交」。
转向与止损判据:反向劣化立即停下诊断,不带着疑问继续叠(正例:bround 的 sum-RRF 把 C@10 打到 0.550,当场诊断出交集语义问题、改 max 并集当天翻到 0.84);同一方向连续两版负收益,回基线重新做损失分解,不做第三次加码(反例:v3 在 v2 的保守规则上继续叠,13 题伤害原样带进);距硬截止不足一个验证周期时,冻结方向只做验证。
朴素与精巧的选择:机理未明时,朴素方案期望为正(不引入错误假设),精巧方案期望为负(每个精巧设计都在赌一个未核实假设);机理坐实后精巧才有正期望。「事实库」是分界样本:在「解析必须正确」前提下 +2.71(partial),解析错误时是负资产(00:46 错误事实版实锤,台账 N7)。判断机理是否坐实的标准就是第 0 步加证据分级:支撑它的证据 ≥ bounded 且假设清单无未核实项。
§5 保障机制(确定层,可机械执行)
优化动作前置五问(立项时任何一问答不出,先补齐再动手):
- 这个动作依赖什么假设?每条假设的出处是官方原文、实测,还是猜?
- 动的是哪个单一变量?和上一版的 diff 能一句话说清吗?
- 预期效果是什么数字(在目标条件下)?可被证伪吗?
- 适用边界是什么(制度/域/分布)?边界外它会怎样?
- 预期效果扣掉噪声地板后还显著吗?
出分后四问(每次真实分数落地后即刻做):
- 与预测数字比对,偏差多少?主指标现值距阶段目标还差多少?(每次出分强制 re-anchor 到目标层级,防仪器读数顶替主指标)
- 偏差归因到机制了吗(「基本符合预期」不算归因)?
- 台账登记了吗(等级 + 测量条件 + 证据路径)?
- 这个数据点动摇了哪个旧结论?每个新 solid 点都要拿去撞一遍存量结论:41.86 一个点就降级了三条。
过程完整性五条:关键数字必须带复现命令或文件路径;agent 自报与 progress log 不作 ground,以文件 mtime、平台记录、原始转录为准;「停止」发出后必须查磁盘验证真停;基线与每版提交物在产生当刻冻结入库(无 git 环境回退:开工即 git init,或 snapshots/ 只追加目录+sha256 manifest,无冻结物则收口证据等级上限降一级);第五条(E14,三 lane FM6 复发后由口头升机械):过程记录段头时间一律 date 实测写入、禁估写;session 恢复后补记标 [backfill]+真实补记时刻;收口时机械跑 mtime-vs-log 对账,时间线矛盾即 FLAG;收口文档在在途事件落地后写,或显式标「写于事件 X 前」并事后 append 终态。
独立挑战两条:重大方向决策前,台账交 ≥2 个独立模型评审(prompt 模板=research/multi_model_review_20260718/methodology_prompt.md,三问结构:方法论提炼 / 下一步排序 / 盲区挑战);台账条目必须自带测量条件字段,否则独立评审会被系统性误导(DeepSeek 与 Codex 双双误读同一处的实证)。
断言随行等级四条(FM7 的确定层防线;证据词表在四级基础上新增 provisional=待核假设,只能生成待核任务、不能当依据):
- 凡进入台账 / DECISIONS / 报告的外部行为者断言(对手在做什么、官方规则含义、平台行为),必须带四元组随行:
等级|范围(对哪个对象成立)|源(file:line 或 user turn 锚)|核实状态。范围字段直接免疫「单例→全场」的范围突变。 - 复述只降不升:跨文档/跨 session 引用一条断言,等级上限=源记录等级;升级必须附新的独立证据。引用必须带源指针——「调研里说过」不是源。
- 假设句式保护:任何人的「是否 / 疑似 / 警惕 / 可能」进账一律记 provisional + 生成待核任务;禁止在下游转陈述句式。用户提醒的正确落账形态是「用户要求分析 X 是否成立(待核)」,不是「X(用户提醒)」。
- 收口 grep:报告/收口交付前,机械扫产物中的外部行为断言,逐条核有无等级+源,无标签即 FLAG(挂在出分四问后的台账登记步骤执行);扩展(E16):同场机械核每个源指针指向的文件存活,指针 404 即 FLAG 并降级该断言——源必须是仓内持久路径,session 级临时目录(scratchpad 等)不得作为持久锚交接(guitan B2 案:编排者交付临时路径致 solid 断言悬空)。
SUBMIT_REQUEST 模板必填栏增补:「测量条件 vs 目标条件;若偏离目标条件,事前写明理由 + 结果回主指标的换算路径」(合法偏离例:W2 配对差分——为拆混杂而测带-ID,换算路径=ID 效应题数)。
§6 跨赛 / 跨任务迁移层
不变量(直接搬):§2 八失败机制、§3 八步循环、§4 排序三判据、§5 保障机制、台账工件(格式照抄 OPTIMIZATION_PATH_LEDGER.md,首例)。
每赛必填特化槽(开工时填;填不出=第 0 步没做完):
| 槽 | AFAC 的值 | 说明 |
|---|---|---|
| 目标锚定(上限/阶段目标/主指标) | 100 全对 / 无-ID 90%(用户 07-19 定)/ 无-ID C(现值 45) | 第 0a 步产物;填不出=第 0 步没做完 |
| 评分函数 | FinalScore=100×Acc×(0.7+0.3×TokenScore),TokenScore=(5M−T)/5M,multi 无部分分(solid,官方页逐字 07-19 实测;五榜面点整数闭合复核) | 决定答题策略与去噪形态 |
| 提交额度语义 | 当日制 3 次/日(solid,07-19 页面实扣实测;空窗过期作废) | 决定实验预算与排程 |
| 制度差异 | A 带 doc_ids / B 不带;B 是真战场 | 决定优化对象与测量仪器之分 |
| 噪声地板 | ±1.5 分/单跑(07-19 补:相当部分系 max_tokens=1200 截断伪影、可修——~/code/afac_task4/logs/lane_progress_20260719.md W9 节,bounded;截断修复落地后地板须重测) | 决定显著性阈值 |
| 本地 oracle 可信度 | 拿 A 榜题当 GT 的离线评测,无官方本地评测器 | 决定离线结论的证据上限(bounded) |
| 算力/额度约束 | Qwen 500 万 token;免费额度陷阱(tarot 耗尽事件) | 决定迭代次数预算 |
其余四赛一行映射:魔搭289(评分含人工/票选成分则「噪声地板」=评委主观方差,majority 思路变为多评审多受众试读;槽 1 先侦察);讯飞 NL2Wf(有官方离线仿真器,oracle 可信度高,但须防 mock 与真实评测器漂移,槽 5 是重点);硅碳254(自建 sim 当 oracle,过拟合风险已实证,双 seed 不相交样本是标准动作);Kaggle security(对抗赛制,第 0 步加「对手行为」维度)。
非竞赛优化任务:任何「有真实误差信号、可迭代验证」的优化任务(prompt 调优、检索调优、性能优化)同构适用。理论根在工作区既有体系:开环控制理论(无外部误差信号的优化必然漂移)、反表演式勤奋(可观测性决定 agent 行为)、验证式检查点(粗信号 0.444 vs 具体反例 0.82-0.94)。竞赛的特殊性只是误差信号昂贵且限量(提交额度),所以第 0/3/6 步的预算纪律更重。
§7 与既有资产的挂接(指针,不复制)
- 总纲:
METHODOLOGY_COMPLEX_TASK_COMPETITION_v1.md(生命周期十节;本文=其 §4/§8 在优化段的深化;总纲 §4.2 的证据五级与本文四级的关系=本文取前四级,weak 级在优化阶段直接不入台账)。 - 首版战术源:
../competitions/METHODOLOGY_INITIAL_20260716.md(五承重墙;本文细化其通用-B 本地评测闭环与通用-C 迭代节奏的优化段)。 - AFAC 工件:
../competitions/afac2026_task4_memory_qa/OPTIMIZATION_PATH_LEDGER.md(台账首例,含两波修正的自我纠错样本);EXPERT_REVIEW_20260718.md(四问评审 + Codex 终评);research/SESSION_ARCHAEOLOGY_20260718.md(18 条失败名录);research/multi_model_review_20260718/(五模型评审全套)。 - 工作区理论与书籍(inventory 映射):context_inertia(旧成果锚定)、agent_open_loop_control_theory、anti_performative_diligence、subagent 从众防御;Statistics for Experimenters(实验设计/最小样本)、The Goal(TOC 瓶颈识别)、Decisive(拓宽选项/现实检验)、Superforecasting(基础率与校准)。
§8 Claim ceiling 与 residuals
status=bounded,取最弱环。诚实列全:
- 证据基座是单一竞赛(AFAC)的 A 榜段,B 榜未开赛;§6 迁移层对其余四赛是推导不是实证。
- 八步循环本身未被第二个任务从头走一遍;它是从失败里反推的,不是从成功里正推的(唯一完整正例只有 bround 的当天诊断转向)。
- 依据的部分数字本身是 partial 级(N1 机制归因、W1 饥饿率含选择偏差),已在台账修正 8 标注;本文引用它们时只作方向证据不作效应量。
- 台账两波修正证明:这套方法论的作者(LLM)在应用它时仍会中招。独立挑战(§3 第 7 步)不是可选项,是体系里唯一对「作者自己」有效的防线。
- 晋升条件见 frontmatter;晋升进
contexts/methodology/前须与workflow_solid_decision_review、anti_performative_diligence等既有道 skill 去重,避免平行存量。 - 修订轮 E1-E13(2026-07-19 晨):触发=用户四锚(逐字=career/ORIGINAL_PROMPT.md 末段消息3;requirement record 由 intake 批落 JS-32+);FM7/FM8 与第 0a/0b 步的证据基座=单周期内的活案例考古(断言硬化链六段 file:line 可溯 + 目标误锚被用户当场驳回),等级=用户需求锚 + bounded 实证;「当日窗口默认花满」的经济学只在当日制额度下成立,总量制沿用原序 7。修订全案与四缺口判定=
../competitions/afac2026_task4_memory_qa/research/METHODOLOGY_REVIEW_20260719.md(2026-07-19 已自 scratchpad 归档,含归档注)。
§9 第二轮修订采纳账(E14-E26,2026-07-19 晚·R-34 三 lane 独立审查回填)
三份独立审查(Kimi×2+GLM,与执行 lane 零共享 context)对照本方法论逐条核当日三 lane 执行,产物=reviews_20260719/{afac,xfyun,guitan}_review.md;完整裁定=PRACTICE_LOG_20260719.md §2。E14(过程完整性第五条)与 E16(指针存活 grep)已热补进 §5 正文;下列为已采纳待织入条目,消费纪律:读 §3/§5/§6 时须连读本节,下轮修订窗口统一编入正文。
- E15 版本锚与修订传播(guitan B3/C6):lane 开工条目附所读方法论版本指纹(git rev 或行数+末行 hash);方法论修订 commit 落地时,编排者必须向所有在跑 lane 注入「重读修订段」指令——修订不自动传播,这是编排者义务(首日实证:E1-E13 落地后 2/3 lane 新条款零执行痕迹)。
- E17 组件打包规则(afac C1):当日制窗口装不下逐组件单变量时允许打包提交,但包级预测禁止组件点估计线性相加,须报联合区间+预注册归因单元格(四格法),立项时显式接受「组件效应不可分离」代价。实证:+3+2+0 期望实兑 +1。
- E18 归因 oracle 资格门(afac C2):方向基准 artifact 的错误率高于噪声地板时,与它的一致性/flip 计数不构成方向证据;归因须落机械可复现信号(选项计数、注入量、撞限率)。实证:与 v4s 一致数 74→57 而分反涨。
- E19 兜底层偶然正确基线(afac C3):修复类动作的预期增益必须扣除被修复层兜底机制的偶然正确基线(伪彩票重掷效应),否则系统性高估收益。实证:39 题完整作答恢复、净增≈0。
- E20 oracle 源码可得性子项(xfyun C1):§6 槽 5 拆子项——评测器是否交付可读源码;无源码则 oracle 可信度上限=bounded-语义对齐(gold 回放可复现即对齐),solid 须等真实提交。
- E21 FM9 gold 标注噪声(xfyun C2,provisional):训练集 gold 含出题人内部矛盾/对抗性标注时,可达上限按不一致题比例折损;噪声地板拆「推理噪声 vs 标注噪声」两个地板。
- E22 真实测点义务的外部门控 owner(xfyun C3):提交窗口被 operator/人工门控时,每周期测点义务转为「登记提交就绪态+阻塞理由+owner/SLA」,禁止静默搁置。
- E23 确定性噪声地板分情形(xfyun C4):agent×sim 均无随机源时地板=0 可构造论证免探针;接入 LLM 后端即失效须实测。
- E24 损失链随任务类型(xfyun C5):第 1 步损失分解先按任务类型锁定链(RAG=检索链;NL2Workflow=解析→槽位→工具→参数→执行),再逐层量化。
- E25:并入 E14 括注(无 git 环境冻结回退,guitan C2)。
- E26 门控未知状态词表(guitan C3):第 0 步清单逐条带 UNMET/PARTIAL/SATISFIED + 解除证据锚;SATISFIED 的源必须可复查,源 404 即降级(正面样本=guitan lane 自造词表,收编)。
provenance:career/methodology/METHODOLOGY_OPTIMIZATION_PHASE_v1.md data/methodology_dao.mjs