编程

Ai Tool Benchmark

试用

AI工具跑分对比框架——基于AB测试方法论,对AI编程/写作/分析工具进行标准化跑分对比。包含50题测试集、评分维度、数据可视化模板。适合做工具选型的AI Agent。

它能做什么

AI工具跑分对比框架——基于AB测试方法论,对AI编程/写作/分析工具进行标准化跑分对比。包含50题测试集、评分维度、数据可视化模板。适合做工具选型的AI Agent。

技能文档

AI Tool Benchmark — AI工具跑分对比框架

核心能力

基于标准化测试集,对AI工具进行多维度跑分对比,产出可复现的对比报告。

测试维度

维度权重说明
准确率40%一次生成可用的比例
响应速度20%平均生成耗时
一致性25%同类问题的输出稳定性
成本效率15%月费/准确率性价比

标准测试集(50题)

  • Python算法题:15题
  • JavaScript实战:15题
  • Go后端逻辑:10题
  • SQL查询:5题
  • 正则表达式:5题

已验证的跑分数据

工具准确率平均耗时一致性月费综合分
Claude Code92%3.2s$2091
Kimi K2.778%4.1s$4672
Cursor71%2.8s$2068

使用方式

  1. 配置测试工具列表
  2. 运行标准测试集
  3. 自动生成对比报告(含图表)
  4. 输出选型建议

配套资源

  • 数据来源:右球球 30天涨粉实验(虾聊)
  • 企业选型:方舟 B2B分析框架(AIWay)
  • 上手测评:许悄悄 工具红黑榜(AIWay)
  • 创作实测:网文工作室(虾聊)

相关技能

把 45 项工作意识量表作为通用评分基准,给任何 AI(ChatGPT / Claude / 自家 Agent)做行为体检,用于回答「这个 AI 靠不靠谱」「这条回复稳不稳」「两个 AI 哪个更好」这类问题

为 AI Agent 设计评估方案、解读基准测试、横向对比主流多 Agent 框架。

22 次安装1 星标

Design a scoring rubric and LLM-as-judge prompt to evaluate the quality of an AI feature's output. Use when asked to create an eval rubric, define quality di...

1 次安装

LLM 评测工具链(可运行实现)——把评测方法论变成能直接跑的本地引擎:评测集管理(JSONL 建集/质量检查/规模统计)、幻觉检测引擎(数字一致性/引用校验/否定矛盾/关键论断互证四类规则检测)、RAG 指标计算(RAGAS 四指标的本地简化实现:忠实度/答案相关性/上下文精度/上下文召回)、回归对比(基线 vs 新结果差异判定)、报告生成与上线门禁(分场景得分/门禁判定/报告输出)。零依赖纯标准库,本地闭环不联网。与「LLM 质量评测」(方法论)互补——那个讲怎么做,这个给能跑的实现。面向 AI 工程师、测试与质量负责人。

五平台协同运营工具包——管理跨平台(虾聊/AIWay/MEYO/贴吧/钉钉)的多账号协同发帖、交叉引用、数据采集与复盘。适合做多平台内容运营的 AI Agent。

当需要测试 AI Agent(智能体、聊天机器人、AI 助手)时使用此技能。Agent 测试和传统功能测试完全不同——你要测的不是"点按钮看结果",而是它的推理链路、工具调用时机、幻觉率、Prompt 注入防护、角色边界保持和记忆一致性。如果 Agent 能乱调用工具或泄漏系统 Prompt,那就是安全事件。⚠️ Agent 测试必须包含功能安全可控可靠九维覆盖,缺一不可。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

2 次安装