LLM Radar — AI 生态时效性调研
Z3 全文↑ Z2 条目
术-内容 · 术层 skill 全文
本页是 <code>rules/skills/workflow_llm_radar.md</code> 的逐字投影(仅隐私清洗,零改写)。
时点提示:本页是仓内文件 rules/skills/workflow_llm_radar.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。
LLM Radar — AI 生态时效性调研
元数据
- 类型: Workflow(领域特化)
- 基础方法论: 深度调研工作流
- CC Skill 位置:
~/.claude/skills/research/llm-radar/SKILL.md+REFERENCE.md - 输出位置:
contexts/survey_sessions/<topic>_YYYYMMDD_llm_radar.md - 创建日期: 2026-03-09
- 最后更新: 2026-03-28
定位
在通用调研方法论基础上,叠加 AI 领域的时效性验证、能力×价格矩阵和领域特定数据源。
存在理由:AI 信息老化极快(模型每周更新、价格频繁变动),通用调研方法论无法覆盖新鲜度验证和 AI 特有的矛盾模式。
When to Use
- 对比 LLM 模型能力(benchmark、pricing、agentic 特性)
- 评估 MCP 工具/服务器
- 调研 AI 框架、SDK、开发者工具
- AI 模型市场分析(OpenRouter 排行、adoption trends)
- AI 工具选型
核心差异化(相对通用工作流)
1. 时效优先(第一原则)
AI 领域的信息有效期可能只有几周。每个 claim 都必须验证信息新鲜度:
- 模型: 发布日期、版本号、是否已过期
- MCP/工具: GitHub
pushed_at、npm 最新版本日期 - 定价: 价格变动日期(标注"截至 YYYY-MM-DD")
直接 API 查询:
GitHub API: https://api.github.com/repos/{owner}/{repo} → pushed_at
npm: https://registry.npmjs.org/{package} → time.modified
PyPI: https://pypi.org/pypi/{package}/json → urls[].upload_time⚠️ 警告: GitHub 仓库 30+ 天未更新 = 🟡 黄色警报
2. 信息源 4 层映射(AI 领域)
| Tier | AI 领域具体来源 |
|---|---|
| Tier 1 厂商叙事 | 模型提供商官方页面、官方 benchmark、官方 blog |
| Tier 2 市场叙事 | Artificial Analysis、科技媒体(36kr、TechCrunch)、sponsored review |
| Tier 3 独立信号 | Reddit r/LocalLLaMA、知乎、独立开发者 blog、HN |
| Tier 4 行为证据 | LiveCodeBench、TerminalBench(独立 benchmark)、GitHub issues、production post-mortem |
3. AI 特有矛盾模式
| 矛盾 | 处理方式 |
|---|---|
| 高 benchmark ≠ 真实性能 | 标注差距,引用 SWE-bench 游戏化问题 |
| 高用量 ≠ 高质量 | 检查是否由免费层或营销驱动 |
| 官方声明 vs 独立测试 | 优先独立测试,标注差异 |
| 速度/成本 vs 准确性/幻觉 | 作为权衡呈现,而非单一排名 |
4. 核心输出模板
必须包含两张表:
能力对比表:编程(SWE-bench) | 推理(AIME) | 多模态 | 上下文 | Agentic | 综合评分
价格对比表:输入($/M) | 输出($/M) | 缓存价格 | 免费层 | 成本评级
加上场景化推荐(按任务类型 + 按预算)。
REFERENCE.md 内容概要
CC Skill 的 REFERENCE.md 包含:
- 4 种 Sub-Agent Prompt 模板(编程能力 / 定价市场 / 推理逻辑 / 多模态Agentic)
- MCP 评估模板(4 个 Agent:Token成本 / 输出Schema / 集成工作流 / 社区生态)
- 数据源端点速查(OpenRouter / Artificial Analysis / SWE-bench / LiveCodeBench)
- Benchmark 可靠性评级表
- 定价对比方法论(含 PPR 公式)
- MCP 评估框架(5 维度加权)
- Overlap 设计示例
- Troubleshooting