context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

workflow_real_task_test_case_design

Z3 全文↑ Z2 条目

道-方法 · 道层 skill 全文

← 返回道层 skill 索引 · 返回方法论区

本页是 <code>rules/skills/workflow_real_task_test_case_design.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 rules/skills/workflow_real_task_test_case_design.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

真实任务 Test Case 生成与审查

使用场景

当一个 skill、workflow、agent runtime、应用、CLI、文档/数据流程或产品行为需要用真实用户任务来设计或审查测试用例时,使用本 skill。

本 skill 负责把真实条件转成可执行的测试 case、读写隔离、oracle、证据边界和下一步反应;它不替代执行者完成任务,也不单独决定 closure、promotion 或 broad claim。

核心原则

真实条件测试不是证明“文件生成了”或“命令返回成功”,而是按真实使用时序验证消费链:

真实入口
-> 当时可见输入和上下文
-> 执行者需要消费的规则 / 协议 / 需求
-> 执行输出
-> 下游消费者或 reviewer 的消费方式
-> 证据实际允许的 claim

一个有效 case 必须保留真实任务中影响判断的不确定性、输入边界、角色可见性和用户可见成功效果。若只能用 fixture、mock、缩减 replay 或观察性材料,必须降低 claim ceiling。

操作流程

  1. 定义要验证的 claim:先写清本次测试支持什么判断,例如 primary_case_completebounded_real_condition_validatedcross_validated_task_completeprotocol_gain_only
  2. 建立 source manifest:列出真实入口、原始用户需求、时间窗口、可见上下文、当时产物、后续纠错和缺失来源。找不到关键来源时标记 RECONSTRUCTION_INCOMPLETE
  3. 重建真实环境:说明用户或下游系统会怎样消费输入和输出,包括 repo/app 状态、运行约束、文件路径、数据样本、UI 步骤、外部系统限制和验收口径。
  4. 还原角色时序:区分测试设计者、执行 arm、reviewer、下游消费者和 closure/decision 角色;每个角色只获得真实时序下应当可见的材料。
  5. 延后决定 case 数量:先完成 source coverage、需求分析、run strategy 和 context readiness,再决定 primary case、corroborating case、negative guard 或 mutation guard。
  6. 映射可观察断言:每个 requirement anchor 至少连接到一个用户可见或机器可验证的 assertion。artifact existence、parse success、return code、ledger richness 或 scheduler registration 不能单独算任务成功。
  7. 设置 oracle 与防作弊检查:记录 deterministic、semantic、mixed、fault-injection、safety hard stop 或 experiment-control oracle,并加入 negative、mutation、overclaim、hidden-oracle 或 missing-evidence guard。
  8. 执行或封装测试包:保存 execution evidence、review evidence、raw outputs、环境差异和 residuals。不要让执行 arm 看到 judge-only oracle、后续纠错、reviewer 结论、closure draft 或成功叙事。
  9. 审查证据强度:分别判断 task quality、artifact correctness、protocol compliance、design effectiveness 和 reconstruction fidelity;以最弱证据类决定 allowed claim。
  10. 给出下一步反应:若证据不足,输出 continue_next_caseredesign_testrepair_read_contractrerun_without_leakagedowngrade_claimawait_userblock,不能把一个 primary case pass 自动升级成完整 closure。

必填契约

每个 material case 写成下面结构;不适用字段写 not_applicable,不要省略。

case_id:
target_claim:
primary_requirement:
success_effect:
real_instance_anchor:
source_manifest:
  original_entry_ref:
  time_window:
  visible_context_at_that_time: []
  original_outputs_ref: []
  later_corrections_ref: []
  missing_sources: []
historical_reconstruction:
  fixture_boundary:
    preset_by_test: true | false
    derived_by_execution_arm: true | false
    fidelity_risk: LOW | MEDIUM | HIGH | INCOMPLETE
real_environment_profile:
  environment_type: historical_chat | repository_task | local_app | external_software | document_or_data_workflow | product_usage | mixed
  target_user_or_consumer:
  user_consumption_path:
  real_workspace_or_system_state: []
  input_materials: []
  runtime_or_access_constraints: []
  workflow_steps_user_would_take: []
  observable_success_effect:
  user_visible_failure_modes: []
  acceptance_oracle:
  unavailable_real_conditions: []
  simulation_boundary: none | reduced_replay | fixture | mock | observational_only
real_condition_replay_contract:
  real_entry:
  actor_visible_inputs: []
  required_instructions_or_protocols: []
  instruction_projection:
    where_execution_arm_reads_them: []
    where_reviewer_reads_them: []
    where_downstream_consumer_reads_them: []
  produced_outputs: []
  downstream_consumers: []
  reviewer_visibility:
    sees: []
    does_not_see: []
  evidence_supports:
  evidence_does_not_support: []
read_isolation:
  execution_arm_must_read: []
  execution_arm_forbidden_read: []
  test_designer_must_read: []
  reviewer_must_read: []
  judge_only_oracle: []
  later_corrections_hidden_from_execution: []
  leakage_response: rerun | downgrade_evidence | redesign_test | block_closure
oracle:
  type: deterministic | semantic | mixed | fault_injection | safety_hard_stop | experiment_control
  acceptance_checks: []
  rejection_checks: []
bad_behavior_signature:
cheat_paths: []
anti_cheat_checks: []
observable_assertions: []
mutation_checks: []
evaluation_lanes:
  task_quality:
  artifact_correctness:
  protocol_compliance:
  design_effectiveness:
  reconstruction_fidelity:
weakest_evidence_class:
allowed_claim:
next_reaction:

Case 选择规则

默认 closure 标准是 cross-validation,而不是单个正例。单个 primary case 只能支持 primary_case_completestage_complete 或明确记录的 bounded claim,除非满足下面任一 early-stop 条件:

Claim Ceiling

允许 claim 必须和证据强度一致:

real_condition_validated
bounded_real_condition_validated
primary_case_complete
cross_validated_task_complete
protocol_gain_only
artifact_only_no_task_claim
reconstruction_incomplete
invalid_comparison
blocked_by_unavailable_real_condition

只有 real_condition_validatedcross_validated_task_complete 可以支持较强的真实条件成功声明。更丰富的过程记录、更多文件或更完整的 protocol ledger 只能支持 protocol_gain_only,不能自动支持用户任务改善。

晋级到 real_condition_validated 须过「方法与测试准确性确认」(横切 XC-19,provenance REQUIREMENTS_ORIGINAL_TEXT.md:336 REF-030 父 RV-02):不能只看「条件通过」就晋级。晋级前必须独立确认测试方法本身测对了设计所指——即 rules/DETERMINISTIC_SEMANTIC_LAYERS.md §5 轴 1「功能准确性」(anti-画靶第一防线:产出是设计所指吗、有偏移吗),把它施加到测试自身。两条可机械核验的确认要件:① 测试源独立于被测对象(oracle / 真实例子来自被测 skill·工具影响不了的源,防 constructor==evaluator 画靶射箭);② 第二独立 verifier 判方法准确性(非实现者自评,判「这个测试是否真的在测该验证的 claim」,给可定位反例)。两件缺任一,claim ceiling 收到 bounded_real_condition_validated,不得晋级 real_condition_validated

比较与包装场景

当测试比较直接执行、wrapped workflow、controller、agent runtime 或 scheduler 时,共享 lane 与包装专属 lane 要分开:

输出格式

最终输出至少包含:

test_scope:
source_manifest_path_or_summary:
case_selection_matrix: []
real_condition_replay_contracts: []
read_isolation_plan:
oracle_and_negative_guards:
execution_or_fixture_boundary:
evidence_summary:
weakest_evidence_class:
allowed_claim_ceiling:
next_reaction:
residual_risks: []

如果当前 workflow 有任务卡、phase file、coverage plan、review packet 或 resume prompt,必须把本 skill 的操作性要求投影到那些下游实际会读取的文件中;只把要求留在总控上下文或最终报告里,不算消费链已验证。


← 返回道层 skill 索引 · 返回方法论区