context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

llm_task_decomposition_20260414_deep_research

Z3 全文↑ Z2 条目

方法论库 · 引用级 · memory_index

← 返回方法论库索引 · 返回方法论区

本页是 <code>contexts/methodology/llm_task_decomposition_20260414_deep_research.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 contexts/methodology/llm_task_decomposition_20260414_deep_research.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

报告元数据(frontmatter)
name: llm_task_decomposition_20260414_deep_research
description: 任务拆解 claim 验证
domain: infra
consumption:
  surface: memory_index
  trigger: "记忆索引召回"
  consumer: orchestrator
status: library
promoted_to: null
superseded_by: contexts/methodology/llm_constraint_capacity_and_task_decomposition_survey_20260414.md

LLM 任务分解方法论深度调研报告

调研日期: 2026-04-14
调研方法: 多维并行搜索 + 激励感知验证 + 原始论文溯源
调研范围: C6/C7/C8 三个 claim 验证 + 任务分解方法论综述
Reader Mode: Internal


核心结论

  1. C6 基本成立,但适用范围极窄 — MAKER 论文真实存在,"百万步零错误"在可验证的规则式任务上成立,SPRT 投票机制有理论保证,但"百万步"实为程序合成/符号推理任务,不适用于开放域生成。
  2. C7 来源真实,但"12个子任务"细节无法独立核实 — CMU-CS-25-132 是真实的 CMU 硕士论文(2025年8月),研究 Apache 软件工程任务分解,但"P85 对应 12 个子任务"这一具体数字仅见于论文全文,未在可访问的摘要或引用中出现,⚠️ 单源信息。
  3. C8 论文真实,"GenCP"命名有误,适用域极窄 — 实际论文是"Large Language Model Meets Constraint Propagation"(IJCAI 2025),作者为 Bonlarron & Régin 等,约束满足率接近 100% 的结论仅针对受限句子生成(letter/word constraints),不可泛化到一般文本生成任务。

分维度详细调研结果

维度 A:C6 验证 — MAKER 框架

来源:Tier 1(作者机构 Cognizant AI Lab)+ Tier 3(Reddit、独立博客)+ Tier 4(GitHub 实现)

原始论文:Meyerson et al., "Solving a Million-Step LLM Task with Zero Errors"

方法论细节

MAKER 框架的核心概念是 MDAPs(Massively Decomposed Agentic Processes),其机制包含三层:

  1. 极限分解(Maximal Decomposition):将任务分解为尽可能细小的、彼此独立的原子子步骤
  2. SPRT 投票(Sequential Probability Ratio Test voting):对每个子步骤的 LLM 输出进行多次独立采样,用统计检验(SPRT)确定哪个答案在置信度上超过预设阈值后才接受
  3. 错误传播阻断:每一步都经过统计验证后才推进,从理论上将每步出错概率压低到极小值,从而在长链推理中实现零错误率

"百万步"任务是什么

该任务属于程序合成/规则遵循类任务,每一步有可验证的正确答案(类似于数学证明或符号推理步骤)。这是关键限制:MAKER 不是在开放域写作或自然语言任务上实现零错误,而是在每步输出可被外部规则系统验证的任务上。

独立博主 Rakshit Kalra(ZeroShot, Tier 3)指出:

"Under sane assumptions, the error rate per step is reduced below 1 in a million — but this requires the task to be verifiable at each step."(来源: https://zeroshot.it.com/smashing-intelligence-into-a-million-pieces-maker-and-million-step-llm-reliability/)

GitHub Rust 实现(Tier 4 行为证据)直接命名为"Zero-error LLM execution via SPRT voting",证实了投票机制的核心性:https://github.com/zircote/maker-rs

与 Apple "Illusion of Thinking" 的关系

Apple 论文(arXiv: https://arxiv.org/abs/2506.06941,NeurIPS 2025)发现"frontier LRMs face a complete accuracy collapse beyond certain complexity thresholds"。MAKER(2025年11月)被社区定位为对 Apple 论文的直接回应(标题即为"Shattering the Illusion"),其思路是:与其用单一 LLM 处理复杂任务,不如通过分解 + 投票将复杂任务变为大量简单子任务的串联。

C6 验证结论:✅ 基本成立,但严格限定在可验证的规则式任务上。"百万步零错误"有统计理论支撑(SPRT),投票机制真实,但不是通用方案。


维度 B:C7 验证 — CMU-CS-25-132

来源:Tier 1(CMU 技术报告全文)+ Tier 3(CMU 日历页面)

原始来源

已确认的事实

无法独立核实的细节

论文 PDF 可访问但 highlights 只展示封面信息,独立博客或引用中未出现"12"这一数字。这是⚠️ 单源信息——数字本身来自 C7 claim 的原始 LinkedIn 帖子或转述,而非从论文中独立核实。

C7 验证结论:⚠️ 论文来源真实,但"12个子任务"的具体数字无法独立验证。如需使用这一数字,需直接阅读 PDF 原文确认。


维度 C:C8 验证 — LLM + CP Solver

来源:Tier 1(IJCAI 2025 论文集)+ Tier 1(arXiv)

实际论文:Alexandre Bonlarron, Florian Régin, Elisabetta De Maria, Jean-Charles Régin, "Large Language Model Meets Constraint Propagation"

方法:将 CP(Constraint Propagation,约束传播)求解器嵌入 LLM 的 token 生成过程,在每个生成步骤实时检查和修剪违反约束的候选 token。

命名问题:C8 中称为"GenCP"——这一名称未在论文中出现,可能是 LinkedIn 帖子或二次传播的概括称呼。前驱工作(IJCAI 2024,同一作者)有时被称为 CP+NLP 框架。

实验范围:约束文本生成(Constrained Text Generation),具体约束类型包括:

这些是形式可验证的硬约束,与需要语义判断的软约束完全不同。

关于"100%约束满足":论文确实报告了在多类受限句子生成测试中接近或达到 100% 的约束满足率。但:

  1. 测试集为学术 benchmark,非开放域
  2. 生成文本质量(流畅度、语义)在强约束下会下降
  3. 不适用于通用对话或文档生成任务

C8 验证结论:✅ 论文真实,100%约束满足在受限句子生成任务上成立,但"GenCP"命名有误,且适用域极窄(形式可验证约束 + 短文本),不可泛化。


维度 D:分解方法论全景与最佳粒度共识

核心调研发现(✅✅ 多源确认):

1. LLM-Modulo 框架(Kambhampati, ICML 2024 Spotlight)

来源: https://arxiv.org/abs/2402.01817

核心主张:"LLMs can't plan autonomously but can help planning in LLM-Modulo frameworks"。LLM 在 Generate-Test 循环中扮演候选解生成器,外部验证器(人类或形式系统)扮演过滤器。2026年3月已扩展为"LLM-Process-Modulo"(LinkedIn, Kambhampati, 2026-03-21)。理论贡献:将 LLM + 外部验证的组合从经验技巧提升为框架原则。

2. Select-Then-Decompose(EMNLP 2025)

来源: https://arxiv.org/abs/2510.17922

关键发现:并非所有任务都适合分解——对于简单任务,分解反而引入额外错误。该论文提出"先判断是否需要分解,再决定如何分解"的自适应策略,在多个推理基准上优于统一分解方法。

3. When Splitting Makes Stronger(COLM 2025)

来源: https://openreview.net/pdf?id=rAR7iPI8Kh

理论分析:证明了 Divide-and-Conquer prompting 在哪些条件下有效(子问题独立性、子问题复杂度均匀分布)以及何时失效(子问题间高度耦合、协调成本超过收益)。

4. 过度分解的代价(✅ 双源确认)


关于最佳分解粒度的当前共识

⚠️ 尚无跨任务的统一最优粒度数字。以下是目前的共识方向:

结论置信度来源
子任务应具备"可验证性"(至少语义可验证)✅✅MAKER, LLM-Modulo, CRANE
分解粒度受任务耦合度约束,非越细越好✅✅COLM 2025, EMNLP 2025
适合分解的任务:步骤独立、局部可验证✅✅多篇 survey
不适合分解的任务:语义耦合强、上下文全局依赖Select-Then-Decompose
CMU-CS-25-132 建议的 12 子任务上限(软工任务)⚠️单源,待验证

缺口分析

缺口严重程度建议
CMU-CS-25-132 中"12个子任务/P85"的确认Serious直接读 PDF 第几章原文
MAKER 的任务类型详细说明(具体是哪类程序合成)Moderate读 arXiv HTML 全文
GenCP 名称的实际出处Low搜索 LinkedIn 原帖

完整引用列表

C6 — MAKER 框架

Apple Illusion of Thinking(背景)

C7 — CMU-CS-25-132

C8 — LLM + Constraint Propagation

方法论综述


← 返回方法论库索引 · 返回方法论区