记忆

LLM Evaluation Toolkit(LLM评测工具链)

试用

LLM 评测工具链(可运行实现)——把评测方法论变成能直接跑的本地引擎:评测集管理(JSONL 建集/质量检查/规模统计)、幻觉检测引擎(数字一致性/引用校验/否定矛盾/关键论断互证四类规则检测)、RAG 指标计算(RAGAS 四指标的本地简化实现:忠实度/答案相关性/上下文精度/上下文召回)、回归对比(基线 vs 新结果差异判定)、报告生成与上线门禁(分场景得分/门禁判定/报告输出)。零依赖纯标准库,本地闭环不联网。与「LLM 质量评测」(方法论)互补——那个讲怎么做,这个给能跑的实现。面向 AI 工程师、测试与质量负责人。

它能做什么

LLM 评测工具链(可运行实现)——把评测方法论变成能直接跑的本地引擎:评测集管理(JSONL 建集/质量检查/规模统计)、幻觉检测引擎(数字一致性/引用校验/否定矛盾/关键论断互证四类规则检测)、RAG 指标计算(RAGAS 四指标的本地简化实现:忠实度/答案相关性/上下文精度/上下文召回)、回归对比(基线 vs 新结果差异判定)、报告生成与上线门禁(分场景得分/门禁判定/报告输出)。零依赖纯标准库,本地闭环不联网。与「LLM 质量评测」(方法论)互补——那个讲怎么做,这个给能跑的实现。面向 AI 工程师、测试与质量负责人。

技能文档

LLM 评测工具链

能直接跑的 LLM 评测引擎:建评测集、测幻觉、算 RAG 指标、对比回归、出报告卡门禁。与「LLM 质量评测」skill(方法论)配套——那个讲"怎么做",这个给"能跑的实现"。

什么时候用这个技能

  • 建评测集:「评测集怎么建?帮我生成 JSONL 模板?」
  • 测幻觉:「这批回答里有没有幻觉?」
  • 算 RAG 指标:「RAG 系统忠实度/召回怎么算?」
  • 回归对比:「新 Prompt/模型比基线好还是差?」
  • 卡门禁:「质量达标了吗?能上线吗?」

怎么用(两种模式)

模式一:直接问(推荐)

「评测集 JSONL 格式怎么组织?」 「怎么检测回答里的幻觉?」 「RAG 四指标本地怎么算?」

模式二:本地工具(可运行引擎)

# ① 评测集管理:初始化/质量检查/规模统计
python tools/eval_toolkit.py dataset --action init --out evalset.jsonl
python tools/eval_toolkit.py dataset --action check --file evalset.jsonl
python tools/eval_toolkit.py dataset --action stat --file evalset.jsonl

# ② 幻觉检测:对回答跑四类规则检测
python tools/eval_toolkit.py hallucination --answer "该产品2025年销量100万台" --source "2026年报告显示销量50万台"

# ③ RAG 指标计算(RAGAS 简化实现)
python tools/eval_toolkit.py ragscore --answer "..." --context "..." --question "..."

# ④ 回归对比:基线 vs 新结果
python tools/eval_toolkit.py compare --base baseline.json --new result.json

# ⑤ 报告与门禁
python tools/eval_toolkit.py report --result result.json --gate 0.05

# 查看全部命令
python tools/eval_toolkit.py --help

知识库导航(references/)

模块文件解决什么问题
① 工具链全景references/01-工具链全景.md五个引擎、数据流、与方法论 skill 的关系
② 评测集管理references/02-评测集管理.mdJSONL 格式、字段规范、质量检查
③ 幻觉检测引擎references/03-幻觉检测引擎.md四类规则检测器原理与局限
④ RAG 指标计算references/04-RAG指标计算.mdRAGAS 简化实现原理与口径
⑤ 回归对比references/05-回归对比.md基线管理、差异判定、防假回归
⑥ 报告与门禁references/06-报告与门禁.md报告结构、门禁规则、与 CI 集成
⑦ 与平台工具衔接references/07-与平台工具衔接.mdRAGAS/OpenAI Evals/LangSmith 对比与升级路径
⑧ FAQreferences/08-FAQ.md高频疑问

快速上手(三步)

  1. 建集dataset init 出 JSONL 模板,02 模块看字段规范;
  2. 测质量hallucination/ragscore 跑检测与指标,03-04 模块看原理;
  3. 卡门禁compare/report 出对比与门禁,05-06 模块看规则。

能力边界(如实说明)

  • 规则检测不是完美检测:本工具链的幻觉/RAG 指标是规则与启发式实现(零依赖),准确率不及 RAGAS/评估器等专业框架——适合快速基线、CI 门禁与教学演示;生产高要求场景按 07 模块升级到专业框架;
  • 不调外部模型:LLM-as-Judge 类指标需自行接入 API(本工具提供接口规范,不内置调用);
  • 工具纯本地:不联网、不采集数据、不调用外部服务。

常见问题(FAQ)

  • Q:这个工具链和 LLM 质量评测 skill 什么关系? 方法论 vs 实现:那个讲指标怎么选、评测集怎么建(方法论),这个给能跑的代码(评测集管理/幻觉检测/RAG 指标/回归门禁)。配套使用。
  • Q:规则检测靠谱吗? 适合快速基线(检出率高、误报偏高需人工复核);高要求场景升级 RAGAS 等专业框架(07 模块给了对照与路径)。
  • Q:评测集格式是什么? JSONL,每行一个用例:question/answer/context/reference/gold 等字段(02 模块有模板)。
  • Q:工具脚本要装依赖吗? 不需要,纯 Python 标准库,开箱即跑。

版权与许可

版权与许可:© 2026 注册老炮。本作品(含方法论、模板、法规整理与原创表达)依 MIT License 提供,详见 LICENSE.md

知识版权声明:本作品汇集的 LLM 评测工具实现、算法逻辑与原创表达,归 注册老炮 所有。未经许可,不得复制、转载、转售本作品全部或实质部分,不得用于任何模型训练或二次分发牟利。

免责声明:本作品按「现状」(AS IS) 提供,不作任何明示或暗示的担保,包括但不限于适销性、特定用途适用性与安全保证。使用者应自行核实并承担使用后果,作者不对因使用本作品产生的任何直接或间接损失负责。

相关技能

LLM 应用质量评测与回归测试实操手册——从"感觉不错"到"可度量可门禁":评测全景与指标体系(正确性/相关性/忠实度/幻觉率/鲁棒性/效率)、评测集构建(黄金数据集/对抗样本/领域评测集/规模估算)、RAG 系统评测(RAGAS 四指标:忠实度/答案相关性/上下文精度/上下文召回)、幻觉检测与度量(事实性幻觉/提示幻觉/上下文矛盾分类与检测方法)、Prompt 回归测试(用例管理/回归门禁/漂移检测/版本对比)、模型对比选型(评测矩阵/成本质量权衡/多模型 A-B/上线决策)、评测流水线与报告(自动化评测/评分聚合/报告模板/上线门禁)。附零依赖本地工具一键查指标、建评测集清单、看 RAG 指标、出对比矩阵、生成评测报告模板。面向 AI 工程师、测试、产品与质量负责人——与 AI 安全红队测试(测安全)互补,本技能测质量。

驱动 One-Eval 对「纯文本 LLM」做端到端评测。当用户想评测一个模型(API 或本地 vLLM)在某些 benchmark 上的表现、对比多个 benchmark 分数、补充多维度 metric、或生成图文评测报告时使用本 skill。

AI工具跑分对比框架——基于AB测试方法论,对AI编程/写作/分析工具进行标准化跑分对比。包含50题测试集、评分维度、数据可视化模板。适合做工具选型的AI Agent。

1 次安装

智能体回归评测:用一组回归测试用例驱动 agent 并量化通过率,与历史基线比对自动标记能力 回退,让超级智能体是否真在超越一线大模型变得可度量、可审计、可防止退化。

Design an evaluation plan for an LLM or AI feature before shipping it. Use when asked how to evaluate a prompt/model/agent, set up an eval harness, define qu...

Audit an LLM evaluation or benchmark repo for integrity and credibility practices. Use when asked to "audit my benchmark," "is my eval trustworthy," "check my leaderboard for contamination," "review this benchmark's methodology," or "what would a reviewer attack in my eval." Greps the target repo for evidence across seven dimensions (pre-registration, contamination, holdout hygiene, judge validity, statistical honesty, reproducibility, leaderboard exclusions) and emits a scored report with file:line evidence, severity, and concrete fixes.

1 次安装