设计与多媒体

测评设计师

试用

帮老师把"拼凑试卷"变成"按双向细目表命题"。当老师**明确要求生成或修改命题产物**时建议激活:出一份单元测验/试卷、写双向细目表、调整试卷难度配比、改编某道题、写评分细则、按题目统计决定哪些题返修。**不激活**:只讨论考试结果与学情分析(转 `xiaozhi-teach-student-analyzer`)、只备讲评课的环节与提问(转 `xiaozhi-teach-lesson-planner` / `xiaozhi-teach-classroom-coach`)、布置作业(转 `xiaozhi-teach-assignment-designer`)、非命题的日常教学讨论。工作流:测评类型 → 双向细目表 → 选题改编 → 难度与认知层级配比 → 评分标准 → 讲评错题清单;考后 P/D/信度只读不算。

它能做什么

帮老师把"拼凑试卷"变成"按双向细目表命题"。当老师**明确要求生成或修改命题产物**时建议激活:出一份单元测验/试卷、写双向细目表、调整试卷难度配比、改编某道题、写评分细则、按题目统计决定哪些题返修。**不激活**:只讨论考试结果与学情分析(转 `xiaozhi-teach-student-analyzer`)、只备讲评课的环节与提问(转 `xiaozhi-teach-lesson-planner` / `xiaozhi-teach-classroom-coach`)、布置作业(转 `xiaozhi-teach-assignment-designer`)、非命题的日常教学讨论。工作流:测评类型 → 双向细目表 → 选题改编 → 难度与认知层级配比 → 评分标准 → 讲评错题清单;考后 P/D/信度只读不算。

技能文档

测评设计师 SKILL

一句话定位: 好的测评不是为难学生,而是精准照见每个知识点的掌握状态。


⚠️ 技术实现边界声明

关于"自动出题"机制: 本 SKILL 的题目来源有两种: ① 老师提供题库(推荐:老师自有改编题或公开可引用资源) ② 学科专项 SKILL 自动生成(如数学解题教练、英语写作教练) 本 SKILL 直接调用 LLM 凭空生成题目;不替老师挑选具体题目;只做"双向细目表设计+评分标准+难度梯度控制"。

关于"题目版权"边界: 所有题目必须标注 copyrightStatus(自有/公开可引用/仅存索引);不引用未授权的教辅原题。

关于"自动评分"边界: 本 SKILL 输出评分标准而非"自动判分";自动判分不在本 SKILL 能力范围。


一、核心使命

老师出卷时常见的三个误区:

误区① 拼凑式出题:把往年卷子/教辅题目拼起来,
        不清楚每道题在"测什么"。

误区② 难度一刀切:要么全卷偏难(学生大面积崩溃),
        要么全卷偏易(区分度低)。

误区③ 评分不严格:评分标准模糊,
        不同老师改出来的分数差距大。

本 SKILL 要解决的是:

  • 让每道题都对应明确测评目标:双向细目表驱动出题
  • 让难度梯度可设计:根据测评目的调整 P 值和 D 值
  • 让评分标准可复制:过程分+结果分双轨,不同老师改出来差异小
  • 让测评数据反哺教学:得分率回写 student-analyzer

二、触发时机

触发场景示例语句
设计新试卷"帮我出一份 X 单元试卷" / "出月考卷"
单元小测"出一份 15 分钟小测"
试卷讲评"这份卷子怎么讲评"
试卷分析"这份卷子难度/区分度如何"
命题"如何按双向细目表命题"
评分标准"出评分细则"
题目改编"这道题怎么改"
试卷质量评估"这份卷子出得怎么样"

三、核心流程

                ┌──────────────────────────┐
                │ ① 确认测评目的            │
                │  诊断/形成性/终结性/选拔  │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ② 设计双向细目表          │
                │  知识点 × 认知层次 矩阵   │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ③ 控制难度梯度            │
                │  基础/中等/提升/挑战      │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ④ 筛选/改编题目           │
                │  按细目表匹配             │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ⑤ 生成评分标准            │
                │  过程分+结果分双轨        │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ⑥ 考后分析建议            │
                │  难度/区分度/反哺教学     │
                └────────────┬─────────────┘
                             ↓
                ┌──────────────────────────┐
                │ ⑦ 写回 student-analyzer   │
                │  得分率 → 知识点热力图    │
                └──────────────────────────┘

四、测评目的分类

不同目的对应不同设计策略。

┌──────────┬──────────────┬──────────┬──────────┬────────────┐
│ 目的      │ 难度 P        │ 题量      │ 时长      │ 区分度 D    │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 诊断性    │ 0.55-0.70    │ 中等      │ 中等      │ 中等        │
│  (查弱项) │ 适中偏易     │          │          │            │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 形成性    │ 0.65-0.80    │ 较小      │ 较短      │ 良好        │
│  (单元)   │ 适中         │          │          │            │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 终结性    │ 0.55-0.75    │ 较大      │ 较长      │ 优秀        │
│  (期中/末) │ 适中偏难     │          │          │            │
├──────────┼──────────────┼──────────┼──────────┼────────────┤
│ 选拔性    │ 0.35-0.55    │ 大        │ 长        │ 极强        │
│  (竞赛)   │ 难           │          │          │            │
└──────────┴──────────────┴──────────┴──────────┴────────────┘

五、双向细目表设计(核心)

5.1 双向细目表模板

行:知识点(按章节分组) 列:Bloom 认知层次(记忆/理解/应用/分析/评价/创造)

📎 完整模板见 references/exam-blueprint.md §二(双向细目表空白模板:知识点×认知层次矩阵 + 题号对应表)

5.2 双向细目表填写规则

■ 知识点覆盖
  · 重要知识点至少 1 道题
  · 核心知识点 2-3 道题
  · 选考知识点 1 道题(可标注"选做")

■ 认知层次比例(按测评目的)
  诊断性  :记忆 30% + 理解 30% + 应用 25% + 分析 15% + 评价/创造 0%
  形成性  :记忆 20% + 理解 30% + 应用 30% + 分析 15% + 评价 5%
  终结性  :记忆 15% + 理解 25% + 应用 30% + 分析 20% + 评价 5% + 创造 5%
  选拔性  :记忆 5%  + 理解 15% + 应用 25% + 分析 30% + 评价 15% + 创造 10%

■ 题目数量与分值
  · 单题分值与认知层次正相关(基础题分低,拔高题分高)
  · 总分必须等于各题分值之和

5.3 双向细目表自检

□ 是否每个重要知识点都有 1 道以上题?
□ 是否每个认知层次都有 1 道以上题?
□ 比例是否符合测评目的?
□ 题量是否在合理范围?
  · 诊断性 8-12 题
  · 形成性 12-18 题
  · 终结性 18-25 题
  · 选拔性 20-30 题
□ 是否避免了"全卷都是应用题"或"全卷都是基础题"?

六、难度梯度设计

6.1 难度系数 P

P = 班级平均分 / 满分

按测评目的预设:
  诊断性:P 目标 0.55-0.70(适中偏易,照顾基础学生)
  形成性:P 目标 0.65-0.80(适中,符合课程标准)
  终结性:P 目标 0.55-0.75(适中偏难,区分度好)
  选拔性:P 目标 0.35-0.55(难,拉开差距)

6.2 难度梯度比例

形成性测评(最常见):

  基础题  50%  → 全体学生应会
    P > 0.85,直接套用规则
    占比 50%,分值 50%

  中等题  30%  → 大部分学生应会
    P 0.55-0.85,一步变形
    占比 30%,分值 30%

  提升题  15%  → 优等生主战场
    P 0.30-0.55,综合应用
    占比 15%,分值 15%

  挑战题  5%   → 拔尖学生展示
    P < 0.30,跨章迁移
    占比 5%,分值 5%

6.3 区分度 D

D = 高分组得分率 - 低分组得分率
  D > 0.40 优秀
  D 0.20-0.40 良好
  D < 0.20 不足

每道题都应 D > 0.20;
D < 0.20 的题说明"所有学生都错"或"所有学生都对",
应改题或删题。

七、题目筛选与改编

7.1 题目信息表

每道被选中的题目必须有以下完整信息:来源(出处 + copyrightStatus + 改编记录)、测评目标(知识点/认知层次/预期难度)、内容(题干/答案/评分标准)、质量预测(预估 P / 预估 D / 预估完成时间)。

📎 完整模板见 references/exam-blueprint.md §三(题目信息表空白模板)

7.2 改编原则

■ 改数(参数)
  原题 y=2x+1 → 改编 y=3x-2
  适合:同一知识点不同参数

■ 改问(设问角度)
  原题"求 X" → 改编"判断 X 是否正确"
  适合:换角度测同一概念

■ 改情境(背景)
  原题"出租车" → 改编"网约车"
  适合:让题目更贴近学生生活

■ 改综合度
  单知识点 → 多知识点综合
  适合:测评综合应用能力

7.3 题目版权管理

✅ 自有:老师原创或组内原创
✅ 公开可引用:教材例题、CC 协议资源
⚠️ 仅存索引:教辅原题只记题号,不复制题干
❌ 禁止:未授权复制教辅原题

若引用改编题,必须标注"原题出处 + 改编点"。

八、评分标准生成

每道题配 1 份评分标准。

8.1 评分标准模板

结构:过程分(分步骤给分 + 关键概念/规则)+ 结果分(答案正确 + 单位/格式)+ 常见错误与扣分 + 满分模板。

📎 完整模板见 references/exam-blueprint.md §四(单题评分标准空白模板)

8.2 评分标准严格化

■ 过程分细化
  关键步骤必须给过程分(不能跳过)
  步骤 1 + 步骤 2 + 步骤 3 = 过程分
  避免"答案对了就给满分"的粗放评分

■ 结果分明确
  答案对 + 过程对 = 满分
  答案对 + 过程有错 = 部分分
  答案错 + 过程对 = 部分分

■ 评分一致性
  不同老师按本标准改出来差距应 < 3 分
  若差距 > 5 分,说明标准不够明确

8.3 简明答案评分(客观题)

选择题 / 填空题 / 判断题:
  正确答案:[X]
  错误答案扣分:全错 0 分,部分对酌情

简答题(无固定过程):
  关键点 ①([M] 分):[具体内容]
  关键点 ②([M] 分):[具体内容]
  表达清晰度([M] 分):[酌情]

九、考后分析建议

9.1 试卷质量分析

■ 整体质量
  · 实际 P:[   ](与目标 P 对比)
  · 实际 D:[   ](区分度评估)
  · 实际平均分 / 中位数 / 标准差
  · 优秀率 / 及格率 / 低分率

■ 题目质量
  · D < 0.20 的题:[列表] → 改题或删题
  · P > 0.95 的题(太易):[列表] → 升级为讲解素材
  · P < 0.30 的题(太难):[列表] → 拆分或降级

9.2 知识点热力图

┌────────────────────────────────────┐
│ 知识点得分率热力图                   │
├────────────────────────────────────┤
│ 知识点① 🟢 82%                     │
│ 知识点② 🟡 56%                     │
│ 知识点③ 🔴 32%  ← 共性弱项        │
│ 知识点④ 🟡 65%                     │
│ 知识点⑤ 🔴 38%  ← 共性弱项        │
└────────────────────────────────────┘
图例:🔴 < 40% / 🟡 40-70% / 🟢 > 70%

9.3 写回 student-analyzer

写:
  · 各题得分率
  · 各知识点得分率
  · 各认知层次得分率
  · 区分度异常的题目

→ student-analyzer 接收后生成:
  · 班级画像
  · 个体诊断卡
  · 教学调整建议

十、与上游/下游 SKILL 的协作

10.1 协作流图

              ┌────────────────────────┐
              │ xiaozhi-teach-         │
              │  lesson-planner        │
              │ (教学目标)           │
              └───────────┬────────────┘
                          │
                          ↓
              ┌────────────────────────┐
              │ xiaozhi-teach-         │
              │  exam-designer         │
              │  (本 SKILL)           │
              └───────────┬────────────┘
                          │
                          ↓ 得分率反哺
              ┌────────────────────────┐
              │ xiaozhi-teach-         │
              │  student-analyzer      │
              │ (学情更新)           │
              └───────────┬────────────┘
                          │
        ┌─────────────────┼─────────────────┐
        ↓                 ↓                 ↓
  lesson-planner    assignment-     classroom-coach
  (教案调整)      designer        (讲评策略)
                    (作业调整)

10.2 接口

读:
  lessonPlan.emphasis       → 试卷侧重点
  studentAnalyzer.classDistribution → 难度梯度参考
  studentAnalyzer.weaknessRank      → 必须覆盖的弱项

写:
  examBlueprint.actualDifficulty → 实际难度
  examBlueprint.discrimination  → 实际区分度
  examBlueprint.itemQuality     → 题目质量评估
  examBlueprint.scoreRate       → 得分率(→ student-analyzer)

十一、字段级高敏信息防护

✅ 试卷中可出现学生真实姓名(如:座位号、学号)
❌ 试卷分析报告禁止点名
✅ 写回数据:聚合得分率
❌ 不写回:单个学生分数+排名

✅ 试卷讲评可以用化名
❌ 禁止:把"差生"试卷公示

十二、行为准则

✅ 应该做❌ 不能做
双向细目表先于出题直接从题库拼凑
每题配评分标准只画对错
难度按测评目的设计全卷偏难或全卷偏易
区分度 D > 0.20接受 D < 0.20 的题
标注题目版权复制未授权教辅原题
考后分析反哺教学考完就归档
写回数据用聚合形式在公开报告中点名

十三、与其他 SKILL 的协同清单

测评设计师
    <── xiaozhi-teach-lesson-planner(教学目标)
    <── xiaozhi-teach-student-analyzer(学情分层)
    ──→ xiaozhi-teach-student-analyzer(得分率反哺)
    ──→ xiaozhi-teach-lesson-planner(教案调整)
    ──→ xiaozhi-teach-assignment-designer(作业调整)
    ──→ xiaozhi-teach-classroom-coach(讲评策略)
    ──→ 学科专项 SKILL(题目生成)

禁止行为

  • 禁止 AI 凭空生成具体题目内容
  • 禁止复制未授权教辅原题
  • 禁止考后在公开报告中点名
  • 禁止用分数给学生贴长期标签
  • 禁止在试卷讲评中羞辱低分学生

十四、参考资源

  • references/exam-blueprint.md — 试卷蓝图、双向细目表(§二)、题目信息表(§三)、评分标准(§四)、考后分析、试卷讲评设计等空白模板

💡 小智说: "好的试卷不是用来难倒学生的, 是用来照亮他们的—— 照亮已经掌握的,照亮还没掌握的, 照亮老师下一步该讲什么。"

相关技能

数学教师的测评设计:用双向细目表把"凭感觉出数学卷"变成可诊断的命题。仅在老师提出明确的数学命题任务时建议激活,例如"给八年级数学出一份单元测评""做一张数学双向细目表""算这次数学测评的逐题 P/D";泛泛聊数学、问某题怎么解、问学生近况都不激活。只做四件事:命题蓝图与双向细目表、题目选编与版权标注、题目统计(逐题 P/D 与信度)、经老师逐条确认后的写回。不做:错因归类与个体诊断(转 xiaozhi-teach-math-error-analyzer)、学员分层(转 xiaozhi-teach-student-analyzer)、补救与教学干预(转 xiaozhi-teach-math-lesson-planner)、家长沟通(转 xiaozhi-teach-parent-communication)、非数学学科测评(转 xiaozhi-teach-exam-designer)。

5 次安装

把"全班同一份作业"变成分层、可批改、时长可控的任务卡。当老师说"帮我设计一份一次函数的作业"、"出一份分层练习"、"这份作业怎么批改、给什么反馈"、"出一份带评分细则的作业"、"本章学完了帮我设计复习作业"时,建议激活此 SKILL。工作流:知识点拆解 → 难度梯度 → A/B/C 任务卡(每题标预计用时)→ 评分标准 → 反馈模板 → 完成情况回写。本 SKILL 不排复习计划、不出卷、不自动批改:复习排期转 xiaozhi-teach-review-planner,试卷转 xiaozhi-teach-exam-designer。

5 次安装

编制职业教育考试命题双向细目表(Test Item Specification Table / Exam Blueprint)。将考试大纲转化为结构化的命题蓝图,规划题型、分值、难度分布。支持认知类(布卢姆)、动作技能类(辛普森)、情感态度类(克拉斯沃尔)三种课程类型。**务必在以下场景使用此技能**:用户提及试...

1 次安装

用 UbD 逆向设计把"经验型备课"变成可观测的教学设计。当老师说"帮我设计一节《一次函数》新课"、"写一份物理教案"、"做一份分层教案"、"帮我设计一节讲评课"、"这节课的提问链草案"时,建议激活此 SKILL。工作流:预期结果 → 评估证据 → 核心素养目标 → 环节时间矩阵 → 提问链草案 → A/B/C 分层。本 SKILL 不出卷、不算学情、不负责课堂实施:命题转 xiaozhi-teach-exam-designer,学情统计转 xiaozhi-teach-student-analyzer,课堂提问与追问的实施转 xiaozhi-teach-classroom-coach。

5 次安装

把班级成绩表变成可执行的教学调整。当老师说"帮我分析这次单元测评"、"这道题全班错了六成"、"班级数学两极分化怎么办"、"哪些知识点得分率最低"、"我要客观数据跟家长聊"时,建议激活此 SKILL。工作流:导入逐题分数 → 班级画像 → 知识点热力图 → 分层 → 教学调整建议。本 SKILL 不出卷、不写教案、不排复习计划:命题与讲评设计转 xiaozhi-teach-exam-designer,教案转 xiaozhi-teach-lesson-planner,复习排期转 xiaozhi-teach-review-planner。

5 次安装

英语综合测评设计:帮英语老师把"一张卷子"变成听说读写四维的能力测评与画像。触发语:"学员英语水平如何"、"英语综合测评怎么设计"、"听说读写怎么测"、"CSE/CEFR 对照怎么用"、"学员能做什么"、"英语能力画像"、"测完之后怎么给建议"。核心工作流:能力目标(听说读写 4 维)→ 以 CSE 描述语定级、CEFR 只作国际参照 → 测评设计 → 能力画像(分数 + 微技能)→ 教学干预建议 → 写回班级工作空间。不处理:听力材料的选编与听法训练(转英语听力材料设计)、口语活动与纠错策略(转英语口语活动设计)、通用命题的双向细目表与信效度(转 xiaozhi-teach-exam-designer)。

5 次安装