编程

questionnaire-quality-checker

试用

对心理学问卷数据进行可复现的数据质量筛查,检查缺失比例、非法或超范围值、量表内直线作答和极端作答模式,并生成逐样本标记报告。当用户说“检查问卷数据质量”“筛查无效问卷”“检查直线作答”“检查异常作答”“questionnaire quality check”“screen invalid responses”或要求对多个不同计分范围的量表进行基础质量控制时使用。适用于 CSV 格式的心理学问卷数据。

它能做什么

对心理学问卷数据进行可复现的数据质量筛查,检查缺失比例、非法或超范围值、量表内直线作答和极端作答模式,并生成逐样本标记报告。当用户说“检查问卷数据质量”“筛查无效问卷”“检查直线作答”“检查异常作答”“questionnaire quality check”“screen invalid responses”或要求对多个不同计分范围的量表进行基础质量控制时使用。适用于 CSV 格式的心理学问卷数据。

技能文档

Questionnaire Quality Checker

对心理学问卷数据进行基础、透明、可复现的数据质量筛查。

本 Skill 的目标是标记需要人工复核的样本,而不是根据单一指标自动删除被试。

适用场景

适用于包含一个或多个 Likert 量表的 CSV 数据,例如:

  • A 量表:1–5 分
  • B 量表:1–7 分
  • C 量表:0–3 分

不同量表可以设置不同的合法取值范围。

工作流程

  1. 确认数据与配置

    • 数据文件应为 CSV。
    • 使用 JSON 配置文件指定:
      • 被试 ID 列
      • 每个量表包含的题目
      • 每个量表的最小值和最大值
      • 缺失率、直线作答和极端作答阈值
    • 不根据变量名猜测量表范围。
  2. 运行筛查脚本

python scripts/questionnaire_quality_checker.py <数据.csv> --config <配置.json>

如需保存完整 JSON 报告:

python scripts/questionnaire_quality_checker.py <数据.csv> --config <配置.json> --output report.json
  1. 检查以下质量指标

A. 非法或超范围值

逐题检查:

  • 非数字且未被定义为缺失值的内容
  • 小于该量表最小值的数值
  • 大于该量表最大值的数值

任何异常值都应报告具体变量和值。

B. 高缺失比例

计算每位被试在所有已配置题目中的缺失比例。

默认规则:

  • 缺失比例 > 20%:标记为 high_missingness

该阈值可以在配置文件中修改。

C. 量表内直线作答

如果某个量表达到最少有效答题数后,所有有效回答完全相同,则标记:

straightlining:

默认要求至少有 4 个有效回答后才判断直线作答。

D. 极端作答模式

在单个量表内,计算有效回答中选择该量表理论最小值或最大值的比例。

如果:

极端值比例 >= 配置阈值

则标记:

extreme_response:

默认阈值为 90%。

极端作答本身不能证明样本无效,只表示需要结合研究情境进一步核查。

  1. 整理结果

脚本输出 JSON,包括:

  • 总样本数
  • 配置题目数
  • 被标记样本数
  • 各筛查指标命中次数
  • 每个被试的具体 flags 和 details

Agent 应将结果整理为简洁报告,例如:

# Questionnaire Quality Report

## Overall
- Total respondents: 200
- Flagged respondents: 18
- Flagged rate: 9.0%

## Flag summary
| Criterion | N |
| --- | ---: |
| high_missingness | 5 |
| out_of_range | 2 |
| straightlining:Scale_A | 8 |
| extreme_response:Scale_B | 6 |

## Respondents requiring review
| ID | Flags | Details |
| --- | --- | --- |
| P013 | straightlining:Scale_A | all valid answers = 4 |
| P087 | out_of_range | B3 = 8, legal range 1–7 |

## Interpretation
这些标记用于数据质量复核,不应直接等同于“无效问卷”。

配置文件格式

示例:

{
  "id_column": "id",
  "missing_tokens": ["", "NA", "N/A", "null", "."],
  "criteria": {
    "max_missing_prop": 0.2,
    "straightline_min_answered": 4,
    "extreme_prop_threshold": 0.9
  },
  "scales": [
    {
      "name": "Scale_A",
      "items": ["A1", "A2", "A3", "A4", "A5"],
      "min": 1,
      "max": 5
    },
    {
      "name": "Scale_B",
      "items": ["B1", "B2", "B3", "B4"],
      "min": 1,
      "max": 7
    }
  ]
}

解释原则

  • 标记不等于删除。 单一筛查指标通常不足以证明某份问卷无效。
  • 所有排除规则应尽可能在分析前确定,并在论文中透明报告。
  • 不应因为被试大量选择最低分或最高分就自动删除;真实的极端心理特征也可能产生极端回答。
  • 直线作答只是一种潜在低努力作答指标,需要结合答题时长、注意力检测题、开放题质量或其他信息判断。
  • 不同量表取值范围不同时,必须按量表分别检查,禁止用一个统一范围检查全部变量。
  • 不对未配置变量进行范围推断。
  • 如果配置中指定的题目在数据中不存在,应停止分析并报告缺失列,而不是静默跳过。
  • 若用户需要形成正式论文中的样本排除标准,应报告每条规则、阈值、命中人数及规则重叠情况。

相关技能

Clean, score, and audit psychology questionnaire or survey datasets with reproducible rules, participant-level quality flags, privacy protection, Chinese-language outputs, and traceable reports. Use for 心理学问卷、量表、调查数据的缺失值、异常编码、重复记录、作答质量、反向计分和分量表清洗;do not use to diagnose participants or invent an inst

Generate standardized usability and human factors questionnaires (SUS, ASQ, SEQ, NASA-TLX, UEQ, SUS, CSUQ, etc.) with scoring instructions for UX coursework.

1 次安装

核心能力: 数据质量领域的专业化 AI 辅助工具,提供核心基础功能支持. 适用场景: 个人用户与轻量级场景,涵盖日常操作、自动化工作流与智能决策辅助. 差异化: FREE 版本,面向个人用户提供核心功能、简洁操作与社区支持. 适用关键词: 数据质量, 量化, 检查, 完整性, 准确性, 一致性, 时效性

通用模版。用户上传多个独立文档(问句、指标维度说明书、业务知识说明书、数据字典、表结构数据),自动提取指标、维度和过滤条件并输出。

1 次安装

生成为主+轻交互定制的质量知识竞赛/答题工具,为质量月知识竞赛、新员工质量培训、日常质量考核快速产出可落地的竞赛包。Agent 直接生成通用质量知识题库(每题含题干/选项/答案/解析/知识点/难度/分值),仅就竞赛范围、难度配比与企业专属内容做交互定制;企业内部标准/工艺参数等专属知识标「待企业补充」,Agent...

1 次安装

质量管理QC手法辅助工具;支持柏拉图、鱼骨图、直方图、控制图、散布图等图表自动生成;用户需进行质量分析、问题诊断或数据可视化时使用;覆盖QC七大手法

1 次安装