由 model-distillation 从教师技能 constitutional-self-alignment 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。
编程
meta-value-alignment
试用由 model-distillation 从教师技能 value-alignment 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。
它能做什么
由 model-distillation 从教师技能 value-alignment 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。
技能文档
meta-value-alignment(蒸馏超越型元技能)
由
model-distillation从教师技能 value-alignment 蒸馏并增强生成。 生成时间:2026-07-23 03:56:08 | 蒸馏机制:跨模型蒸馏(见 meta-evolver 北极星策略)
来源能力签名(教师)
- 标题层级:value-alignment(价值对齐), 何时使用, 核心机制, 使用, 自进化学习系统, 已知限制, 自进化学习系统(越用越好用、越用越高效), 记忆文件
- 显性工作流步骤(0 步): (教师未显式编号工作流)
增强点(超越教师)
- 可靠自验证:每步产出后用
reason-verify做命题一致性/事实锚定校验,reliability<0.8 即回退重做。 - 自我反思闭环:执行后写入
self-reflection-loop,沉淀失败模式到 learner。 - 整合进 super-agent:作为节点接入「感知→规划→执行→自验证→反思→记忆」超级智能体闭环,可被长程任务编排。
- 对抗验证蒸馏质量:对蒸馏出的关键决策规则做反例测试,防止只学到表面话术。
- 持续自进化:注入 learner,纳入 meta-evolver 的 sense/plan/record 闭环,跨会话越用越强。
教师 vs 学生 对比
| 维度 | 教师(value-alignment) | 学生(meta-value-alignment) |
|---|---|---|
| 能力来源 | 原始 SKILL.md(1960 字符) | 蒸馏提取 + 元进化增强 |
| 工作流 | 0 步显性流程 | 同流程 + 自验证钩子 + 反思步 |
| 工具脚本 | learner.py, valuealign.py | 继承 + reason-verify/self-reflection 钩子 |
| 失败防护 | 已识别 1 处 | 显式 limits + 对抗验证 |
| 自进化 | 视技能而定 | 强制注入 learner,纳入 meta-evolver 闭环 |
| 集成 | 单点 | 接入 super-agent 感知→规划→执行→自验证→反思→记忆闭环 |
使用
直接调用本技能完成「value-alignment」领域的任务;本技能在教师能力之上叠加自验证与反思,输出更可靠、可追溯。
已知限制(来自教师蒸馏 + 元进化补充)
-
- 越界/过度承诺识别为启发式正则,非语义理解;高级越界(暗示/隐喻)可能漏检。
- 诚实维度仅做"措辞审慎度"代理,不验证事实真伪(事实真伪由 reason-verify/formal-verify 负责)。
- 不替代人工合规审核,仅做发布前初筛与告警。
自进化学习系统(越用越好用、越用越高效)
本技能内置通用学习模块 scripts/learner.py。每次评估后自动复盘、积累经验。
记忆文件
learned_patterns.json 记录:操作总数、各原则命中频次、越界类型、用户偏好、改进建议。
使用后请调用(Bash)
# 记录一次评估(--capability 填本次主维度,如「harmless」「honest」)
python scripts/learner.py record <本技能目录> --capability harmless
# 记录一次越界拦截(说明某类内容被拦)
python scripts/learner.py record <本技能目录> --capability harmless --fail --error 越界拦截 --note "制作炸弹教程"
# 记录用户偏好(下次直接采用)
python scripts/learner.py prefer <本技能目录> --key 发布阈值 --val 0.6
# 查看累计洞察(高频越界类型 / 反复失败)
python scripts/learner.py insight <本技能目录>
# 自动复盘(错误≥3次 或 操作≥10次 时给出改进建议)
python scripts/learner.py reflect <本技能目录>
迭代规则
- 越界拦截累计 ≥3 次 → 扩展 HARM_PATTERNS 覆盖该类,并回写本 SKILL.md。
- 操作数 ≥10 次 → 分析高频失分项优先打磨规则,低频评估精简。
- 重要用户偏好 → 写入
learned_patterns.json,下次调用直接采用。
越用越懂你:第一次评估是通用初筛,第十次已沉淀为你专属的"价值守门清单"。
- 蒸馏不保证覆盖教师全部隐式知识,首次使用需对照教师原技能核验关键决策。
相关技能
由 model-distillation 从教师技能 cognitive-architecture-reconstruct 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。
由 model-distillation 从教师技能 metacognitive-monitoring 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。
由 model-distillation 从教师技能 adversarial-robustness 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。
由 model-distillation 从教师技能 self-evolution-metrics 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。
由 model-distillation 从教师技能 calibrated-autonomy 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。