context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

LLM Radar — AI 生态时效性调研

Z3 全文↑ Z2 条目

术-内容 · 术层 skill 全文

← 返回术层 skill 索引 · 返回方法论区

本页是 <code>rules/skills/workflow_llm_radar.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 rules/skills/workflow_llm_radar.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

LLM Radar — AI 生态时效性调研

元数据

定位

在通用调研方法论基础上,叠加 AI 领域的时效性验证能力×价格矩阵领域特定数据源

存在理由:AI 信息老化极快(模型每周更新、价格频繁变动),通用调研方法论无法覆盖新鲜度验证和 AI 特有的矛盾模式。

When to Use

核心差异化(相对通用工作流)

1. 时效优先(第一原则)

AI 领域的信息有效期可能只有几周。每个 claim 都必须验证信息新鲜度:

直接 API 查询:

GitHub API:  https://api.github.com/repos/{owner}/{repo}  → pushed_at
npm:         https://registry.npmjs.org/{package}          → time.modified
PyPI:        https://pypi.org/pypi/{package}/json          → urls[].upload_time

⚠️ 警告: GitHub 仓库 30+ 天未更新 = 🟡 黄色警报

2. 信息源 4 层映射(AI 领域)

TierAI 领域具体来源
Tier 1 厂商叙事模型提供商官方页面、官方 benchmark、官方 blog
Tier 2 市场叙事Artificial Analysis、科技媒体(36kr、TechCrunch)、sponsored review
Tier 3 独立信号Reddit r/LocalLLaMA、知乎、独立开发者 blog、HN
Tier 4 行为证据LiveCodeBench、TerminalBench(独立 benchmark)、GitHub issues、production post-mortem

3. AI 特有矛盾模式

矛盾处理方式
高 benchmark ≠ 真实性能标注差距,引用 SWE-bench 游戏化问题
高用量 ≠ 高质量检查是否由免费层或营销驱动
官方声明 vs 独立测试优先独立测试,标注差异
速度/成本 vs 准确性/幻觉作为权衡呈现,而非单一排名

4. 核心输出模板

必须包含两张表:

能力对比表:编程(SWE-bench) | 推理(AIME) | 多模态 | 上下文 | Agentic | 综合评分

价格对比表:输入($/M) | 输出($/M) | 缓存价格 | 免费层 | 成本评级

加上场景化推荐(按任务类型 + 按预算)。

REFERENCE.md 内容概要

CC Skill 的 REFERENCE.md 包含:


← 返回术层 skill 索引 · 返回方法论区