context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

workflow_knowledge_flywheel

Z3 全文↑ Z2 条目

道-方法 · 道层 skill 全文

← 返回道层 skill 索引 · 返回方法论区

本页是 <code>rules/skills/workflow_knowledge_flywheel.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 rules/skills/workflow_knowledge_flywheel.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

知识飞轮设计模式

元数据


核心公式

笨数据 + 笨方法 + 笨模型 = 精知识

接受起点数据的不完美,通过可迭代系统逐步提升知识纯度。


为什么选择"笨方法"?

闭源 API 的双重枷锁

  1. 成本焦虑:按 token 计费导致不敢尝试计算密集型笨方法
  2. 节奏拖累:批处理请求响应时间以小时计,打断"思考-验证-调整"的流畅节奏

本地部署的解放

转向本地部署开源模型后:


飞轮四步循环

触发 → 调用基础模块 → 产生微小进步 → 精炼
  ↑                                      ↓
  ←←←←←←←←←←←←←←←←←←←←←←←←←←←←←←←←←←←←←←

1. 触发

识别一个微小、可验证的子问题。

2. 调用基础模块

使用简单、可靠的原子操作:

3. 产生微小进步

每次循环必须有可衡量的产出:

4. 精炼

将进步固化到知识库,成为下一轮的基础模块。


设计原则

1. 问题分解

将宏大问题分解为无数微小、可验证的子问题。

2. 独立性

每次循环是独立、逻辑清晰的过程,不依赖复杂状态。

3. 高成功率

每个子任务设计为必然成功,避免挫败感。

4. 收敛性

飞轮方向明确,每次迭代都在向目标靠近。

5. 静止点突破策略

数据飞轮"静止点"(极稀有数据)突破方法:
利用 VLM 进行初步收割
通过 Human-in-the-loop 纠偏
形成冷启动种子数据


基础模块示例

线性扫描

# 不要过度设计索引,先用线性扫描跑起来
for chunk in text_chunks:
    if is_relevant(chunk, query):
        yield extract_info(chunk)

语义检索

# embedding + cosine similarity 足够处理大多数场景
def semantic_search(query, corpus, top_k=10):
    query_emb = embed(query)
    scores = [cosine(query_emb, doc_emb) for doc_emb in corpus_embs]
    return top_k_indices(scores)

结构化输出

# 强制 JSON 输出,便于后续处理
prompt = """
从以下文本提取人物关系,输出 JSON 格式:
{"relations": [{"person_a": "...", "relation": "...", "person_b": "..."}]}
"""

模型选择建议

推荐:可控的本地模型

不推荐


避免的陷阱

  1. 过度设计索引:先用笨方法跑起来,再考虑优化
  2. 追求完美数据:接受起点不完美,靠飞轮迭代
  3. 复杂 Pipeline:每增加一个环节就增加一个失败点
  4. 过早优化:先有 1.0,再谈优化

实际案例

示例:结构化知识图谱


参见


变更日志

日期变更
2026-02-21从 OBSERVATIONS.md 晋升,整理为独立 skill

← 返回道层 skill 索引 · 返回方法论区