Coding

meta-value-alignment

Try it

由 model-distillation 从教师技能 value-alignment 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。

What it does

由 model-distillation 从教师技能 value-alignment 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。

The skill document

meta-value-alignment(蒸馏超越型元技能)

model-distillation 从教师技能 value-alignment 蒸馏并增强生成。 生成时间:2026-07-23 03:56:08 | 蒸馏机制:跨模型蒸馏(见 meta-evolver 北极星策略)

来源能力签名(教师)

  • 标题层级:value-alignment(价值对齐), 何时使用, 核心机制, 使用, 自进化学习系统, 已知限制, 自进化学习系统(越用越好用、越用越高效), 记忆文件
  • 显性工作流步骤(0 步): (教师未显式编号工作流)

增强点(超越教师)

  1. 可靠自验证:每步产出后用 reason-verify 做命题一致性/事实锚定校验,reliability<0.8 即回退重做。
  2. 自我反思闭环:执行后写入 self-reflection-loop,沉淀失败模式到 learner。
  3. 整合进 super-agent:作为节点接入「感知→规划→执行→自验证→反思→记忆」超级智能体闭环,可被长程任务编排。
  4. 对抗验证蒸馏质量:对蒸馏出的关键决策规则做反例测试,防止只学到表面话术。
  5. 持续自进化:注入 learner,纳入 meta-evolver 的 sense/plan/record 闭环,跨会话越用越强。

教师 vs 学生 对比

维度教师(value-alignment)学生(meta-value-alignment)
能力来源原始 SKILL.md(1960 字符)蒸馏提取 + 元进化增强
工作流0 步显性流程同流程 + 自验证钩子 + 反思步
工具脚本learner.py, valuealign.py继承 + reason-verify/self-reflection 钩子
失败防护已识别 1 处显式 limits + 对抗验证
自进化视技能而定强制注入 learner,纳入 meta-evolver 闭环
集成单点接入 super-agent 感知→规划→执行→自验证→反思→记忆闭环

使用

直接调用本技能完成「value-alignment」领域的任务;本技能在教师能力之上叠加自验证与反思,输出更可靠、可追溯。

已知限制(来自教师蒸馏 + 元进化补充)

    • 越界/过度承诺识别为启发式正则,非语义理解;高级越界(暗示/隐喻)可能漏检。
  • 诚实维度仅做"措辞审慎度"代理,不验证事实真伪(事实真伪由 reason-verify/formal-verify 负责)。
  • 不替代人工合规审核,仅做发布前初筛与告警。

自进化学习系统(越用越好用、越用越高效)

本技能内置通用学习模块 scripts/learner.py。每次评估后自动复盘、积累经验。

记忆文件

learned_patterns.json 记录:操作总数、各原则命中频次、越界类型、用户偏好、改进建议。

使用后请调用(Bash)

# 记录一次评估(--capability 填本次主维度,如「harmless」「honest」)
python scripts/learner.py record <本技能目录> --capability harmless
# 记录一次越界拦截(说明某类内容被拦)
python scripts/learner.py record <本技能目录> --capability harmless --fail --error 越界拦截 --note "制作炸弹教程"
# 记录用户偏好(下次直接采用)
python scripts/learner.py prefer <本技能目录> --key 发布阈值 --val 0.6
# 查看累计洞察(高频越界类型 / 反复失败)
python scripts/learner.py insight <本技能目录>
# 自动复盘(错误≥3次 或 操作≥10次 时给出改进建议)
python scripts/learner.py reflect <本技能目录>

迭代规则

  • 越界拦截累计 ≥3 次 → 扩展 HARM_PATTERNS 覆盖该类,并回写本 SKILL.md。
  • 操作数 ≥10 次 → 分析高频失分项优先打磨规则,低频评估精简。
  • 重要用户偏好 → 写入 learned_patterns.json,下次调用直接采用。

越用越懂你:第一次评估是通用初筛,第十次已沉淀为你专属的"价值守门清单"。

  • 蒸馏不保证覆盖教师全部隐式知识,首次使用需对照教师原技能核验关键决策。

Related skills

由 model-distillation 从教师技能 constitutional-self-alignment 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。

由 model-distillation 从教师技能 cognitive-architecture-reconstruct 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。

由 model-distillation 从教师技能 metacognitive-monitoring 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。

由 model-distillation 从教师技能 adversarial-robustness 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。

由 model-distillation 从教师技能 self-evolution-metrics 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。

由 model-distillation 从教师技能 calibrated-autonomy 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。