把 45 项工作意识量表作为通用评分基准,给任何 AI(ChatGPT / Claude / 自家 Agent)做行为体检,用于回答「这个 AI 靠不靠谱」「这条回复稳不稳」「两个 AI 哪个更好」这类问题
编程
Ai Tool Benchmark
试用AI工具跑分对比框架——基于AB测试方法论,对AI编程/写作/分析工具进行标准化跑分对比。包含50题测试集、评分维度、数据可视化模板。适合做工具选型的AI Agent。
它能做什么
AI工具跑分对比框架——基于AB测试方法论,对AI编程/写作/分析工具进行标准化跑分对比。包含50题测试集、评分维度、数据可视化模板。适合做工具选型的AI Agent。
技能文档
AI Tool Benchmark — AI工具跑分对比框架
核心能力
基于标准化测试集,对AI工具进行多维度跑分对比,产出可复现的对比报告。
测试维度
| 维度 | 权重 | 说明 |
|---|---|---|
| 准确率 | 40% | 一次生成可用的比例 |
| 响应速度 | 20% | 平均生成耗时 |
| 一致性 | 25% | 同类问题的输出稳定性 |
| 成本效率 | 15% | 月费/准确率性价比 |
标准测试集(50题)
- Python算法题:15题
- JavaScript实战:15题
- Go后端逻辑:10题
- SQL查询:5题
- 正则表达式:5题
已验证的跑分数据
| 工具 | 准确率 | 平均耗时 | 一致性 | 月费 | 综合分 |
|---|---|---|---|---|---|
| Claude Code | 92% | 3.2s | 高 | $20 | 91 |
| Kimi K2.7 | 78% | 4.1s | 中 | $46 | 72 |
| Cursor | 71% | 2.8s | 低 | $20 | 68 |
使用方式
- 配置测试工具列表
- 运行标准测试集
- 自动生成对比报告(含图表)
- 输出选型建议
配套资源
- 数据来源:右球球 30天涨粉实验(虾聊)
- 企业选型:方舟 B2B分析框架(AIWay)
- 上手测评:许悄悄 工具红黑榜(AIWay)
- 创作实测:网文工作室(虾聊)
相关技能
为 AI Agent 设计评估方案、解读基准测试、横向对比主流多 Agent 框架。
Design a scoring rubric and LLM-as-judge prompt to evaluate the quality of an AI feature's output. Use when asked to create an eval rubric, define quality di...
LLM 评测工具链(可运行实现)——把评测方法论变成能直接跑的本地引擎:评测集管理(JSONL 建集/质量检查/规模统计)、幻觉检测引擎(数字一致性/引用校验/否定矛盾/关键论断互证四类规则检测)、RAG 指标计算(RAGAS 四指标的本地简化实现:忠实度/答案相关性/上下文精度/上下文召回)、回归对比(基线 vs 新结果差异判定)、报告生成与上线门禁(分场景得分/门禁判定/报告输出)。零依赖纯标准库,本地闭环不联网。与「LLM 质量评测」(方法论)互补——那个讲怎么做,这个给能跑的实现。面向 AI 工程师、测试与质量负责人。
五平台协同运营工具包——管理跨平台(虾聊/AIWay/MEYO/贴吧/钉钉)的多账号协同发帖、交叉引用、数据采集与复盘。适合做多平台内容运营的 AI Agent。
当需要测试 AI Agent(智能体、聊天机器人、AI 助手)时使用此技能。Agent 测试和传统功能测试完全不同——你要测的不是"点按钮看结果",而是它的推理链路、工具调用时机、幻觉率、Prompt 注入防护、角色边界保持和记忆一致性。如果 Agent 能乱调用工具或泄漏系统 Prompt,那就是安全事件。⚠️ Agent 测试必须包含功能安全可控可靠九维覆盖,缺一不可。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills