当 AI 生成的测试用例已经过输出评审和盲区补盲、准备终审上线时使用此技能。由资深测试对 AI 输出的用例做人工抽样校验,从业务有效性、场景完整性、可执行性三个维度做最后把关。⚠️ 如果发现系统性问题(比如遗漏了某个关键模块),需要回退修正并记录到 Prompt 优化反馈库。专家评审不是走形式——发现的问题必须闭环。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills
编程
AI 测试输出评审
试用对AI生成的测试用例进行八维评审(完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度),是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是"看起来不错"时,应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审(跳过追溯性、简化完整性)。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills
它能做什么
对AI生成的测试用例进行八维评审(完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度),是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是"看起来不错"时,应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审(跳过追溯性、简化完整性)。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills
技能文档
⚠️ 安全警告:本技能的示例可能涉及测试用例整理、合并或删除建议。 实际使用时请勿直接执行批量删除操作,先备份原数据并确认非关键用例。 本技能仅在 workspace/ 输出评估文件,不持久化、不外传、不跨会话复用。
AI 输出评审
使用逻辑
本技能分为四个阶段,按顺序执行:
阶段一:评审框架(八维评审法)
│
│ 使用八维评审法对AI输出进行系统打分
│ 输出:评审报告(评分 + 问题清单)
│
▼
阶段二:报告模板(输出格式)
│
│ 按标准格式输出评审结果
│ 输出:结构化评审报告
│
▼
阶段三:追问问法(深入挖掘)
│
│ 使用追问技巧引导发现问题
│ 输出:更深层的质量洞察
│
▼
阶段四:辅助工具(假设挖掘/反驳机制/投入产出评估)
│
│ 补充评审维度,提升评审深度
│ 输出:完整评审结论
关键点:阶段三的"追问问法"是在评审报告输出后使用的,用于引导发现更深层的问题,不是独立的评审体系。
输入要求
必填输入
- AI生成的测试用例
推荐输入(提供则评审更准确)
- 场景树(来自qa-scenario-tree):用于完整性评审,判断场景覆盖率
- 风险清单(来自qa-risk-intuition):用于风险覆盖评审,判断高风险区域是否深测
- 需求ID列表:用于追溯性评审,判断用例是否可追溯
降级策略
如果缺少推荐输入:
| 缺少的输入 | 评审策略 | 降级处理 |
|---|---|---|
| 场景树 | 完整性评审 | 基于通用场景清单(主流程/分支/异常/边界) |
| 风险清单 | 风险覆盖评审 | 基于默认风险类型(资金/安全/并发/数据一致性) |
| 需求ID列表 | 追溯性评审 | 跳过,标记为"需补充追溯信息" |
评审模式
模式A:完整评审(有场景树和风险清单)
- 八维评审全部启用
- 输出完整评审报告
- 适用场景:工作流中的标准评审
模式B:快速评审(无上游数据)
- 启用六维评审(跳过追溯性,简化完整性)
- 输出简化评审报告
- 标注"建议补充场景树后重新评审"
- 适用场景:独立使用、快速检查
模式选择规则
有场景树 AND 有风险清单 → 模式A(完整评审)
否则 → 模式B(快速评审)
核心原则
AI输出看起来都对,但专家能看出哪里不够。
八维评审法速查
评分标准:每维度10分,总分≥64分为合格。详见 references/review-dimensions.md。
| 维度 | 评分核心 | 核心关注 |
|---|---|---|
| 完整性 | 场景覆盖是否完整 | 主路径+分支+异常+边界 |
| 正确性 | 业务规则和预期是否正确 | 内容正确性 |
| 可执行性 | 步骤是否清晰可执行 | 可操作性 |
| 风险覆盖 | 高风险区域是否深测 | 资金/安全/并发/数据 |
| 规范性 | 格式是否符合标准 | 编号/表格/字段 |
| 追溯性 | 需求/风险ID是否完整 | 需求追溯链 |
| 一致性 | 用例间是否自相矛盾 | 前置与步骤匹配 |
| 冗余度 | 是否有无价值用例 | 重复/低价值用例 |
每维度的详细评分标准、评审清单和追问问法参见
references/review-dimensions.md。
评审报告模板
详见 references/report-templates.md,包含三种模板:
- 完整评审报告(模式A):八维评分 + 问题清单 + 改进方向
- 简化评审报告(模式B):六维评分 + 降级标注
- 快速评审模板:星级评价 + 主要问题 + 迭代方向
假设挖掘
AI输出中常见的隐含假设:
| 假设类型 | 示例 | 验证方法 |
|---|---|---|
| 用户行为假设 | "用户会正常输入" | 追问:用户误输入怎么办? |
| 环境假设 | "网络正常" | 追问:网络异常时会怎样? |
| 数据假设 | "数据格式正确" | 追问:格式错误时怎么处理? |
| 时序假设 | "操作按顺序执行" | 追问:乱序执行会怎样? |
| 依赖假设 | "第三方服务正常" | 追问:第三方挂了怎么办? |
挖掘问法:
请列出你在输出中做的所有假设
哪些假设可能不成立?
如果假设不成立,测试场景会有什么变化?
迭代决策树
当AI输出不满意时:
输出不满意
│
├── 完整性不够?
│ └── 补充场景:请补充[缺失的场景类型]
│
├── 深度不够?
│ └── 深入分析:请按[具体维度]深入分析
│
├── 风险覆盖不足?
│ └── 重点强化:请对[高风险区域]做专项测试
│
├── 有矛盾?
│ └── 修正一致性:请修正[具体矛盾点]
│
├── 冗余过多?
│ └── 精简用例:请合并或删除[低价值用例]
│
└── 不可执行?
└── 调整可行性:请确保[测试步骤]可实际执行
AI反驳机制
让AI挑战你的假设,而不是迎合你。
反驳问法模板
模式1:质量负责人视角
"请站在质量负责人角度,指出可能遗漏的业务风险、过度测试的地方,
以及上线前还需要确认的问题。"
模式2:故障反推视角
"请假设这个功能上线后出现严重问题,反推我现在的测试方案
可能漏掉了什么。"
模式3:资源约束视角
"测试资源有限,请评估这些用例的投入产出比,
哪些是必须测的,哪些可以简化或跳过。"
模式4:竞品对比视角
"如果竞争对手的同类功能比我们更稳定,可能是因为
他们多测了哪些我们没覆盖的场景?"
反驳检查清单
- 是否要求AI挑战你的假设?
- 是否让AI从反面看问题?
- 是否评估了投入产出比?
- 是否识别了过度测试的区域?
投入产出评估
评估维度
| 维度 | 评估标准 | 权重 |
|---|---|---|
| 业务价值 | 影响用户数×影响程度 | 40% |
| 风险等级 | 发生概率×影响程度 | 30% |
| 测试成本 | 用例数×执行时间 | 20% |
| 自动化潜力 | 是否适合自动化 | 10% |
评估矩阵
| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |
|---|---|---|---|---|
| P0+高风险 | 高 | 高 | 中 | 必须测试,优先自动化 |
| P0+低风险 | 高 | 低 | 低 | 必须测试,手动即可 |
| P1+高风险 | 中 | 高 | 中 | 必须测试,考虑自动化 |
| P1+低风险 | 中 | 低 | 低 | 选择性测试 |
| P2+高风险 | 低 | 高 | 中 | 评估后决定 |
| P2+低风险 | 低 | 低 | 低 | 可跳过或简化 |
ROI计算公式
ROI = (业务价值 × 风险等级) / 测试成本
示例:
用例A:业务价值=5, 风险等级=5, 测试成本=2
ROI = (5×5)/2 = 12.5 → 高ROI,优先测试
用例B:业务价值=2, 风险等级=2, 测试成本=5
ROI = (2×2)/5 = 0.8 → 低ROI,可简化
检查清单
评审完成后检查:
- 是否识别了AI的隐含假设?
- 是否评估了覆盖完整性?
- 是否检查了一致性?
- 是否评估了冗余度?
- 是否有明确的迭代方向?
- 评审报告是否可执行?
- 是否标注了降级模式(如适用)?
相关技能
在最终输出前对测试用例做最后一轮防幻觉验证:事实核查(引用的需求ID是否存在)、一致性检查(用例之间是否矛盾)、可执行性验证(步骤是否能实际操作)、来源追溯(每个用例是否能追溯到具体需求)。当测试用例已经生成完毕、准备输出了,但你不确定AI有没有编造不存在的功能或需求时,应当使用此技能。这是整个工作流的最终质量守门——如果验证失败,必须返回问题清单要求修正,不得跳过。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills
根据不同的测试目标和上下文,选择最佳的提示词模式来驱动AI生成高质量的测试用例。当AI输出的测试用例质量不够好、太泛泛、或者深度不够时,问题往往不在AI而在提示词。此技能提供结构化提示词模板,注入前面步骤产出的分析结果,输出包含角色定义、输出格式规范和约束条件的优化提示词。⚠️ 作为工作流的必过步骤,不得跳过。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills
将前面所有分析步骤(需求解构、场景树、边界清单、风险评估等)打包成一个结构化的AI上下文包,确保AI在生成测试用例时拥有完整的业务上下文、功能上下文和技术上下文。当已经完成了需求分析、场景构建和深度设计,即将进入提示词生成阶段时,必须经过此步骤。上下文包的完整度直接决定了AI生成用例的质量——输入垃圾,输出也是垃圾。当上游分析缺失时,本技能会读取用户上传的需求文件或fetch用户提供的URL以补充上下文,并对原始描述做结构化解析后并入上下文包,但不会替代上游分析步骤——缺失项仍需标注并建议回退补充。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills
当需要测试 AI Agent(智能体、聊天机器人、AI 助手)时使用此技能。Agent 测试和传统功能测试完全不同——你要测的不是"点按钮看结果",而是它的推理链路、工具调用时机、幻觉率、Prompt 注入防护、角色边界保持和记忆一致性。如果 Agent 能乱调用工具或泄漏系统 Prompt,那就是安全事件。⚠️ Agent 测试必须包含功能安全可控可靠九维覆盖,缺一不可。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills
从完整性、清晰性、一致性、可测试性、可实现性五个维度系统化评审需求文档质量。当用户要求"评审这份需求"、"看看这个PRD写得怎么样"、或者测试用例设计前需要先评估需求质量时,应当使用此技能。如果需求本身有问题(模糊/矛盾/不可测试),后续的测试设计都是徒劳。不要只在用户明确说"需求评审"时才用——任何涉及需求文档的测试任务都应先过一遍需求评审。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills