跨模型蒸馏工程化的第一环:从 WorkBuddy 内部教师技能的 SKILL.md(或任意技能正文) 中结构化提取能力签名——工作流步骤、触发场景、已知限制/坑、工具脚本、以及可被 蒸馏的决策规则(if/when-then/必须)。输出 JSON 能力画像,直接喂给 model-distillation 的签名合成与对抗验证。纯标准库、零依赖、可本地实跑(--selftest 自带样例)。
Coding
teacher-capability-probe
Try it对 WorkBuddy 内部其他大模型/专家技能(教师)做「能力探针与评测」,量化其能力边界与失败模式, 产出结构化能力画像——这是用户指定的核心机制「跨模型蒸馏」工程化收口的关键子能力 (发现→探针→提取→合成→对抗验证)之一。让蒸馏不再凭手感,而是用覆盖性探针任务量化教师能力边界, 指导下一步该蒸馏哪些能力、规避哪些失败模式。触发词:教师能力探针、能力评测、能力画像、 teacher probe、capability evaluation、蒸馏前评测、能力边界、失败模式分析。
What it does
对 WorkBuddy 内部其他大模型/专家技能(教师)做「能力探针与评测」,量化其能力边界与失败模式, 产出结构化能力画像——这是用户指定的核心机制「跨模型蒸馏」工程化收口的关键子能力 (发现→探针→提取→合成→对抗验证)之一。让蒸馏不再凭手感,而是用覆盖性探针任务量化教师能力边界, 指导下一步该蒸馏哪些能力、规避哪些失败模式。触发词:教师能力探针、能力评测、能力画像、 teacher probe、capability evaluation、蒸馏前评测、能力边界、失败模式分析。
The skill document
教师能力探针与评测(teacher-capability-probe)
什么时候用
- 蒸馏某个教师技能之前:先量化它到底强在哪、弱在哪、哪些场景会翻车。
- 蒸馏之后:用同一套探针回测
meta-*学生,对比教师能力画像看是否真的超越。 - 选型:多个候选教师里挑最值得蒸馏的那个。
核心机制
- 探针生成
gen_probes(signature):从能力签名(capabilities / limits)派生覆盖性探针—— 每个能力生成「核心用法 / 边界异常 / 多步组合」三档探针,并对已知限制生成专门边界探针。 - 评测
evaluate(probes, results):结果分 pass / partial / fail,coverage= (通过 + 0.5×部分通过) / 总数failure_modes= 按能力聚合的失败/部分通过原因confidence= 覆盖率 − 失败模式分散度惩罚(0~1)weak_boundary= 单能力通过率 < 0.5 的薄弱边界
- 能力画像
report():结构化输出,可直接喂给distill.py决定提取重点、喂给meta-*对抗验证决定测试优先级。
用法
python scripts/probe.py --selftest
# 给定教师签名生成探针
python scripts/probe.py --signature '{"capabilities":["翻译","摘要"],"limits":["不擅长长文"]}'
# 评测(probes 由上一步得到,results 为每探针结论)
python scripts/probe.py --eval-json '{"probes":[...],"results":[{"result":"pass"},{"result":"fail","note":"长文丢失结构"}]}'
与蒸馏工程化链路集成
- 上游:
distill.extract_signature产出签名 → 本技能gen_probes转探针。 - 下游:
蒸馏质量对抗验证复用本画像的weak_boundary作为对抗重点;跨模型知识提取针对failure_modes反推教师成功路径。 - 闭环:教师画像 vs 学生画像对比 → 回写
meta-evolver的蒸馏质量评估。
自进化学习系统(越用越好用、越用越高效)
本技能内置通用学习模块 scripts/learner.py。每次使用后自动复盘、积累经验,逐步提升输出质量与执行效率,无需人工维护。
记忆文件
learned_patterns.json(位于本技能目录)记录:操作总数、各能力使用频次、错误模式、用户偏好、改进建议。
使用后请调用(Bash)
# 记录一次成功使用(--capability 填本次主要能力名,如「简历优化」「比价」)
python scripts/learner.py record <本技能目录> --capability 简历优化
# 记录一次失败/异常
python scripts/learner.py record <本技能目录> --capability 简历优化 --fail --error 格式识别失败 --note "用户上传了非标准文件"
# 记录用户偏好(下次直接使用)
python scripts/learner.py prefer <本技能目录> --key 输出语言 --val 中文
# 查看累计洞察(高频能力 / 反复错误)
python scripts/learner.py insight <本技能目录>
# 自动复盘(错误≥3次 或 操作≥10次 时给出改进建议)
python scripts/learner.py reflect <本技能目录>
迭代规则
- 错误累计 ≥3 次 → 主动增加预检/兜底步骤,并将经验回写本 SKILL.md。
- 操作数 ≥10 次 → 分析高频能力优先打磨示例与质量,低频能力评估精简或合并。
- 重要用户偏好 → 写入
learned_patterns.json,下次调用直接采用,减少重复询问。
越用越懂你:第一次用是通用能力,第十次用已沉淀为你专属的最佳实践。
Related skills
由 model-distillation 从教师技能 recursive-capability-discovery 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。
由 model-distillation 从教师技能 formal-capability-contract 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。
能力退化预警与自愈:监测技能生态运行时健康,扫描各技能 learned_patterns.json,检测成功率 滑落(跌破阈值)与陈旧停滞(长期无操作),输出告警 + 推荐自愈动作(重注入 learner / 标 repair 缺口 / 重跑回归)。让元进化引擎在"能力悄悄变弱前"主动干预——一线大模型完全 不具备的元治理能力,是"超越之后能否稳定存续"的关键保障。
由 model-distillation 从教师技能 academic-tutor 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。
技能生态健康度审计:扫描技能生态(默认 ~/.workbuddy/skills),对每枚技能做体检—— frontmatter 合法性、脚本可编译性、陈旧度、近重复(shingle Jaccard)、孤儿 meta (meta-X 但教师 X 不存在),输出结构化健康报告,供元进化引擎定位"该修/该并/该弃"的技能。 这是让全栈超级智能体"能治理自身生态"的元能力,一线大模型不具备。