Coding

AI 测试输出评审

Try it

对AI生成的测试用例进行八维评审(完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度),是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是"看起来不错"时,应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审(跳过追溯性、简化完整性)。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

What it does

对AI生成的测试用例进行八维评审(完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度),是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是"看起来不错"时,应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审(跳过追溯性、简化完整性)。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

The skill document

⚠️ 安全警告:本技能的示例可能涉及测试用例整理、合并或删除建议。 实际使用时请勿直接执行批量删除操作,先备份原数据并确认非关键用例。 本技能仅在 workspace/ 输出评估文件,不持久化、不外传、不跨会话复用。

AI 输出评审

使用逻辑

本技能分为四个阶段,按顺序执行:

阶段一:评审框架(八维评审法)
    │
    │  使用八维评审法对AI输出进行系统打分
    │  输出:评审报告(评分 + 问题清单)
    │
    ▼
阶段二:报告模板(输出格式)
    │
    │  按标准格式输出评审结果
    │  输出:结构化评审报告
    │
    ▼
阶段三:追问问法(深入挖掘)
    │
    │  使用追问技巧引导发现问题
    │  输出:更深层的质量洞察
    │
    ▼
阶段四:辅助工具(假设挖掘/反驳机制/投入产出评估)
    │
    │  补充评审维度,提升评审深度
    │  输出:完整评审结论

关键点:阶段三的"追问问法"是在评审报告输出后使用的,用于引导发现更深层的问题,不是独立的评审体系。

输入要求

必填输入

  • AI生成的测试用例

推荐输入(提供则评审更准确)

  • 场景树(来自qa-scenario-tree):用于完整性评审,判断场景覆盖率
  • 风险清单(来自qa-risk-intuition):用于风险覆盖评审,判断高风险区域是否深测
  • 需求ID列表:用于追溯性评审,判断用例是否可追溯

降级策略

如果缺少推荐输入:

缺少的输入评审策略降级处理
场景树完整性评审基于通用场景清单(主流程/分支/异常/边界)
风险清单风险覆盖评审基于默认风险类型(资金/安全/并发/数据一致性)
需求ID列表追溯性评审跳过,标记为"需补充追溯信息"

评审模式

模式A:完整评审(有场景树和风险清单)

  • 八维评审全部启用
  • 输出完整评审报告
  • 适用场景:工作流中的标准评审

模式B:快速评审(无上游数据)

  • 启用六维评审(跳过追溯性,简化完整性)
  • 输出简化评审报告
  • 标注"建议补充场景树后重新评审"
  • 适用场景:独立使用、快速检查

模式选择规则

有场景树 AND 有风险清单 → 模式A(完整评审)
否则 → 模式B(快速评审)

核心原则

AI输出看起来都对,但专家能看出哪里不够。

八维评审法速查

评分标准:每维度10分,总分≥64分为合格。详见 references/review-dimensions.md

维度评分核心核心关注
完整性场景覆盖是否完整主路径+分支+异常+边界
正确性业务规则和预期是否正确内容正确性
可执行性步骤是否清晰可执行可操作性
风险覆盖高风险区域是否深测资金/安全/并发/数据
规范性格式是否符合标准编号/表格/字段
追溯性需求/风险ID是否完整需求追溯链
一致性用例间是否自相矛盾前置与步骤匹配
冗余度是否有无价值用例重复/低价值用例

每维度的详细评分标准、评审清单和追问问法参见 references/review-dimensions.md

评审报告模板

详见 references/report-templates.md,包含三种模板:

  • 完整评审报告(模式A):八维评分 + 问题清单 + 改进方向
  • 简化评审报告(模式B):六维评分 + 降级标注
  • 快速评审模板:星级评价 + 主要问题 + 迭代方向

假设挖掘

AI输出中常见的隐含假设:

假设类型示例验证方法
用户行为假设"用户会正常输入"追问:用户误输入怎么办?
环境假设"网络正常"追问:网络异常时会怎样?
数据假设"数据格式正确"追问:格式错误时怎么处理?
时序假设"操作按顺序执行"追问:乱序执行会怎样?
依赖假设"第三方服务正常"追问:第三方挂了怎么办?

挖掘问法

请列出你在输出中做的所有假设
哪些假设可能不成立?
如果假设不成立,测试场景会有什么变化?

迭代决策树

当AI输出不满意时:

输出不满意
    │
    ├── 完整性不够?
    │       └── 补充场景:请补充[缺失的场景类型]
    │
    ├── 深度不够?
    │       └── 深入分析:请按[具体维度]深入分析
    │
    ├── 风险覆盖不足?
    │       └── 重点强化:请对[高风险区域]做专项测试
    │
    ├── 有矛盾?
    │       └── 修正一致性:请修正[具体矛盾点]
    │
    ├── 冗余过多?
    │       └── 精简用例:请合并或删除[低价值用例]
    │
    └── 不可执行?
            └── 调整可行性:请确保[测试步骤]可实际执行

AI反驳机制

让AI挑战你的假设,而不是迎合你。

反驳问法模板

模式1:质量负责人视角
"请站在质量负责人角度,指出可能遗漏的业务风险、过度测试的地方,
以及上线前还需要确认的问题。"

模式2:故障反推视角
"请假设这个功能上线后出现严重问题,反推我现在的测试方案
可能漏掉了什么。"

模式3:资源约束视角
"测试资源有限,请评估这些用例的投入产出比,
哪些是必须测的,哪些可以简化或跳过。"

模式4:竞品对比视角
"如果竞争对手的同类功能比我们更稳定,可能是因为
他们多测了哪些我们没覆盖的场景?"

反驳检查清单

  • 是否要求AI挑战你的假设?
  • 是否让AI从反面看问题?
  • 是否评估了投入产出比?
  • 是否识别了过度测试的区域?

投入产出评估

评估维度

维度评估标准权重
业务价值影响用户数×影响程度40%
风险等级发生概率×影响程度30%
测试成本用例数×执行时间20%
自动化潜力是否适合自动化10%

评估矩阵

用例类型业务价值风险等级测试成本建议
P0+高风险必须测试,优先自动化
P0+低风险必须测试,手动即可
P1+高风险必须测试,考虑自动化
P1+低风险选择性测试
P2+高风险评估后决定
P2+低风险可跳过或简化

ROI计算公式

ROI = (业务价值 × 风险等级) / 测试成本

示例:
用例A:业务价值=5, 风险等级=5, 测试成本=2
ROI = (5×5)/2 = 12.5 → 高ROI,优先测试

用例B:业务价值=2, 风险等级=2, 测试成本=5
ROI = (2×2)/5 = 0.8 → 低ROI,可简化

检查清单

评审完成后检查:

  • 是否识别了AI的隐含假设?
  • 是否评估了覆盖完整性?
  • 是否检查了一致性?
  • 是否评估了冗余度?
  • 是否有明确的迭代方向?
  • 评审报告是否可执行?
  • 是否标注了降级模式(如适用)?

Related skills

当 AI 生成的测试用例已经过输出评审和盲区补盲、准备终审上线时使用此技能。由资深测试对 AI 输出的用例做人工抽样校验,从业务有效性、场景完整性、可执行性三个维度做最后把关。⚠️ 如果发现系统性问题(比如遗漏了某个关键模块),需要回退修正并记录到 Prompt 优化反馈库。专家评审不是走形式——发现的问题必须闭环。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

2 installs

在最终输出前对测试用例做最后一轮防幻觉验证:事实核查(引用的需求ID是否存在)、一致性检查(用例之间是否矛盾)、可执行性验证(步骤是否能实际操作)、来源追溯(每个用例是否能追溯到具体需求)。当测试用例已经生成完毕、准备输出了,但你不确定AI有没有编造不存在的功能或需求时,应当使用此技能。这是整个工作流的最终质量守门——如果验证失败,必须返回问题清单要求修正,不得跳过。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

1 installs

根据不同的测试目标和上下文,选择最佳的提示词模式来驱动AI生成高质量的测试用例。当AI输出的测试用例质量不够好、太泛泛、或者深度不够时,问题往往不在AI而在提示词。此技能提供结构化提示词模板,注入前面步骤产出的分析结果,输出包含角色定义、输出格式规范和约束条件的优化提示词。⚠️ 作为工作流的必过步骤,不得跳过。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

2 installs

将前面所有分析步骤(需求解构、场景树、边界清单、风险评估等)打包成一个结构化的AI上下文包,确保AI在生成测试用例时拥有完整的业务上下文、功能上下文和技术上下文。当已经完成了需求分析、场景构建和深度设计,即将进入提示词生成阶段时,必须经过此步骤。上下文包的完整度直接决定了AI生成用例的质量——输入垃圾,输出也是垃圾。当上游分析缺失时,本技能会读取用户上传的需求文件或fetch用户提供的URL以补充上下文,并对原始描述做结构化解析后并入上下文包,但不会替代上游分析步骤——缺失项仍需标注并建议回退补充。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

2 installs

当需要测试 AI Agent(智能体、聊天机器人、AI 助手)时使用此技能。Agent 测试和传统功能测试完全不同——你要测的不是"点按钮看结果",而是它的推理链路、工具调用时机、幻觉率、Prompt 注入防护、角色边界保持和记忆一致性。如果 Agent 能乱调用工具或泄漏系统 Prompt,那就是安全事件。⚠️ Agent 测试必须包含功能安全可控可靠九维覆盖,缺一不可。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

2 installs

从完整性、清晰性、一致性、可测试性、可实现性五个维度系统化评审需求文档质量。当用户要求"评审这份需求"、"看看这个PRD写得怎么样"、或者测试用例设计前需要先评估需求质量时,应当使用此技能。如果需求本身有问题(模糊/矛盾/不可测试),后续的测试设计都是徒劳。不要只在用户明确说"需求评审"时才用——任何涉及需求文档的测试任务都应先过一遍需求评审。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

1 installs