编程

测试专家评审

试用

当 AI 生成的测试用例已经过输出评审和盲区补盲、准备终审上线时使用此技能。由资深测试对 AI 输出的用例做人工抽样校验,从业务有效性、场景完整性、可执行性三个维度做最后把关。⚠️ 如果发现系统性问题(比如遗漏了某个关键模块),需要回退修正并记录到 Prompt 优化反馈库。专家评审不是走形式——发现的问题必须闭环。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

它能做什么

当 AI 生成的测试用例已经过输出评审和盲区补盲、准备终审上线时使用此技能。由资深测试对 AI 输出的用例做人工抽样校验,从业务有效性、场景完整性、可执行性三个维度做最后把关。⚠️ 如果发现系统性问题(比如遗漏了某个关键模块),需要回退修正并记录到 Prompt 优化反馈库。专家评审不是走形式——发现的问题必须闭环。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

技能文档

专家评审与元学习

核心原则

专家评审不是挑错,而是建立"AI生成→专家校验→持续优化"的正向循环。

评审流程

第1步:抽样策略

抽样方法:
├─ 随机抽样:10-20%的用例
├─ 分层抽样:P0用例100%覆盖,P1抽样50%,P2抽样20%
├─ 风险抽样:高风险用例100%覆盖
└─ 新功能抽样:新功能用例100%覆盖

抽样公式:
总用例数 < 50 → 全量评审
总用例数 50-200 → 20%抽样
总用例数 > 200 → 10%抽样 + P0全量

第2步:评审维度

维度检查点权重
完整性是否覆盖所有需求点?30%
准确性测试步骤和预期结果是否正确?25%
可执行性步骤是否清晰可执行?20%
风险覆盖高风险区域是否深测?15%
规范性格式是否符合标准?10%

第3步:校正标记

校正标记格式:
├─ [C-001] 问题类型:描述问题
├─ [C-002] 问题类型:描述问题
└─ ...

问题类型:
├─ MISSING:缺失场景
├─ WRONG:步骤/预期错误
├─ VAGUE:描述模糊
├─ REDUNDANT:冗余用例
├─ RISK:风险覆盖不足
└─ FORMAT:格式不规范

第4步:输出评审报告

# 专家评审报告

## 评审摘要
- 评审ID:REV-XXXX
- 评审日期:YYYY-MM-DD
- 评审专家:[姓名]
- 用例总数:XX条
- 抽样数量:XX条(抽样比例XX%)

## 评审结果
| 维度 | 评分 | 问题数 |
|------|------|--------|
| 完整性 | X/10 | X个 |
| 准确性 | X/10 | X个 |
| 可执行性 | X/10 | X个 |
| 风险覆盖 | X/10 | X个 |
| 规范性 | X/10 | X个 |
| 综合评分 | X/10 | - |

## 问题清单
| 用例编号 | 问题类型 | 问题描述 | 校正建议 |
|---------|---------|---------|---------|
| TC_XXX_001 | MISSING | 缺少并发场景 | 补充并发测试用例 |
| TC_XXX_002 | VAGUE | 步骤描述模糊 | 明确操作步骤 |

## 学习要点
1. 高频问题:[问题模式]
2. 改进方向:[具体建议]
3. Prompt优化:[优化建议]

## 元学习建议
- 更新checklist:[新增检查项]
- 优化prompt:[提示词调整]
- 补充技能:[需要增强的技能]

评审维度速查

各维度典型问题速查

维度常见问题现象重点关注通过标准
完整性缺少某个需求点/场景需求追溯ID是否全部覆盖每个需求点≥1条用例
准确性预期结果与实际不符业务规则是否正确应用预期结果=需求定义
可执行性步骤模糊/依赖不明确新人能否按步骤执行按步骤可复现
风险覆盖高风险区域用例不够深资金/安全/并发是否深测高风险区域≥3条用例
规范性格式不统一/字段缺失是否使用标准模板模板字段完整率100%

常见问题严重度判定

问题类型严重一般轻微
MISSING核心功能缺失非核心功能缺失边缘场景缺失
WRONG预期结果方向错误步骤顺序错误步骤表述不精确
VAGUE完全无法执行需少量猜测措辞可优化
RISK资金/安全未覆盖非功能未覆盖兼容性/体验未覆盖
REDUNDANT完全重复且P0场景重叠边界略有重叠
FORMAT完全无格式部分字段缺失格式可微调

元学习机制

校正数据收集

收集内容:
├─ 问题类型分布
├─ 高频问题模式
├─ 专家校正建议
├─ 用例质量趋势
└─ 改进效果跟踪

存储格式:
{
  "review_id": "REV-001",
  "date": "2024-01-01",
  "issues": [
    {
      "type": "MISSING",
      "count": 5,
      "pattern": "缺少并发场景",
      "correction": "补充并发测试"
    }
  ],
  "learning_points": [...]
}

模式识别

识别方法:
├─ 问题聚类:识别相似问题
├─ 趋势分析:问题数量变化
├─ 根因分析:为什么会出现这个问题
└─ 改进验证:改进措施是否有效

输出:
├─ 高频问题TOP5
├─ 问题趋势图
├─ 改进建议
└─ 效果评估

Prompt优化

优化流程:
1. 分析校正数据
2. 识别Prompt不足
3. 生成优化建议
4. 测试优化效果
5. 持续迭代

优化示例:
原Prompt:"生成登录模块的测试用例"
优化后:"生成登录模块的测试用例,需覆盖:
1. 正常登录流程
2. 异常场景(密码错误、账号锁定)
3. 边界条件(密码长度、特殊字符)
4. 并发场景(多设备同时登录)
5. 安全场景(SQL注入、XSS)"

应用场景

AI生成了20条登录模块测试用例 → 抽样策略:按风险分层抽8条(P0全抽、P1抽50%、P2抽20%) → 评审维度:

  • 功能覆盖:登录成功/失败/锁定(完整✅)
  • 异常覆盖:密码错误/账号锁定(完整✅)
  • 安全覆盖:SQL注入/XSS(遗漏❌) → 校正标记:补充安全测试场景 + 更新Prompt:新增"必须包含SQL注入和XSS测试" → 元学习:将安全场景缺失模式加入checklist

用户说"评审一下这个AI生成的用例" → 自动化评审流程:抽样→校验→校正→输出评审报告+Prompt优化建议

自检清单

评审完成后检查:

  • 抽样策略是否合理?
  • 评审维度是否覆盖?
  • 校正标记是否规范?
  • 评审报告是否完整?
  • 学习要点是否提炼?
  • Prompt优化建议是否具体?

检查清单

  • 抽样是否覆盖高风险区域?
  • 评审维度是否完整?
  • 系统性问题是否识别?
  • 改进建议是否可行?
  • 评审报告是否生成?

相关技能

对AI生成的测试用例进行八维评审(完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度),是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是"看起来不错"时,应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审(跳过追溯性、简化完整性)。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

2 次安装

在最终输出前对测试用例做最后一轮防幻觉验证:事实核查(引用的需求ID是否存在)、一致性检查(用例之间是否矛盾)、可执行性验证(步骤是否能实际操作)、来源追溯(每个用例是否能追溯到具体需求)。当测试用例已经生成完毕、准备输出了,但你不确定AI有没有编造不存在的功能或需求时,应当使用此技能。这是整个工作流的最终质量守门——如果验证失败,必须返回问题清单要求修正,不得跳过。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

1 次安装

根据不同的测试目标和上下文,选择最佳的提示词模式来驱动AI生成高质量的测试用例。当AI输出的测试用例质量不够好、太泛泛、或者深度不够时,问题往往不在AI而在提示词。此技能提供结构化提示词模板,注入前面步骤产出的分析结果,输出包含角色定义、输出格式规范和约束条件的优化提示词。⚠️ 作为工作流的必过步骤,不得跳过。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

2 次安装

当开发提了 PR、代码变更需要确定测试范围、或者想通过分析代码来预测可能出 Bug 的区域时使用此技能。从测试视角分析代码变更的影响范围、识别高危模式和典型风险区域。不要看完整代码逻辑——你只需要关注变更类型(新增/修改/删除/重构)、影响范围(接口定义/数据库字段/业务逻辑)和相关依赖,据此确定最小回归测试范围。输出代码变更影响分析报告。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

2 次安装

从完整性、清晰性、一致性、可测试性、可实现性五个维度系统化评审需求文档质量。当用户要求"评审这份需求"、"看看这个PRD写得怎么样"、或者测试用例设计前需要先评估需求质量时,应当使用此技能。如果需求本身有问题(模糊/矛盾/不可测试),后续的测试设计都是徒劳。不要只在用户明确说"需求评审"时才用——任何涉及需求文档的测试任务都应先过一遍需求评审。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

1 次安装

当需要测试 AI Agent(智能体、聊天机器人、AI 助手)时使用此技能。Agent 测试和传统功能测试完全不同——你要测的不是"点按钮看结果",而是它的推理链路、工具调用时机、幻觉率、Prompt 注入防护、角色边界保持和记忆一致性。如果 Agent 能乱调用工具或泄漏系统 Prompt,那就是安全事件。⚠️ Agent 测试必须包含功能安全可控可靠九维覆盖,缺一不可。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

2 次安装