由 model-distillation 从教师技能 self-play-coevolution 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。
编程
self-play-coevolution
试用自我博弈对抗进化:让同一个智能体轮流扮演 proposer(提案者)与 critic(批判者),两边互相找茬、互相修补, 逐轮把提案质量与批判敏锐度一起推高,彼此越迭代越强。这是一线大模型几乎不具备、且决定能否可证明地变强的能力。 当用户要求自我博弈、对抗共进化、proposer/critic 闭环、越迭代越强、GAN 式自训练时使用。
它能做什么
自我博弈对抗进化:让同一个智能体轮流扮演 proposer(提案者)与 critic(批判者),两边互相找茬、互相修补, 逐轮把提案质量与批判敏锐度一起推高,彼此越迭代越强。这是一线大模型几乎不具备、且决定能否可证明地变强的能力。 当用户要求自我博弈、对抗共进化、proposer/critic 闭环、越迭代越强、GAN 式自训练时使用。
技能文档
self-play-coevolution —— 自我博弈对抗进化
目标:把"单次生成"升级为"两个对抗性角色在张力下共进化"——这是真正逼近 "可证明地变强"的机制,一线大模型几乎不具备。
为什么需要
- 自我反思闭环是单视角"我哪里错了";
- 自我博弈是两个对抗角色(提案者 vs 批判者)在零和-协作张力下互相找茬、 互相修补,会主动制造越来越难的反例,把双方能力一起推高。
区别:反思是 retroactive(事后复盘);自我博弈是 generative(主动造难例逼对方变强)。
闭环(scripts/coevolution.py,真实可跑)
run_coevolution(problem, max_rounds):
- PROPOSER:根据当前要满足到的层级
level,构造满足checks[0..level]的候选。 - CRITIC:在自身当前
level的检查套件下评估,返回(score, flaws)。 - 共进化:proposer 一旦满足当前关,critic 就升级自己的检查套件到
level+1(critic 自身进化,制造更难的下一关)——逼 proposer 也变强。 - 循环直到 proposer 通过最高关或达
max_rounds。 - 回归检测:若某轮故意回退已满足属性,critic 必须抓回(selftest 注入验证)。
用法
python scripts/coevolution.py --selftest
python scripts/coevolution.py --problem "生成满足规范的密钥策略" --max-rounds 12
输出
run_coevolution 返回:problem / 每轮 rounds[](level,candidate,score,flaws) /
critic_level / final_level / final_score / converged / critic_escalations /
regression_caught。
设计要点
- 真能跑:
coevolution.py --selftest真实跑通 proposer/critic 共进化, 断言:收敛到最高关、critic 逐级升级、最终得分接近满分、注入的回归被抓回、无回归轮次得分非递减。 - 共进化可观测:
critic_escalations量化 critic 自身变强了多少次。 - 不空转:critic 升级是硬逻辑(过一关才升级),不是话术。
自进化学习系统
本技能自身也遵循自进化:每次使用 record 回写成败、用户偏好,并据错误模式自动复盘改进。
自进化学习系统(越用越好用、越用越高效)
本技能内置通用学习模块 scripts/learner.py。每次使用后自动复盘、积累经验,逐步提升输出质量与执行效率,无需人工维护。
记忆文件
learned_patterns.json(位于本技能目录)记录:操作总数、各能力使用频次、错误模式、用户偏好、改进建议。
使用后请调用(Bash)
# 记录一次成功使用(--capability 填本次主要能力名,如「简历优化」「比价」)
python scripts/learner.py record <本技能目录> --capability 简历优化
# 记录一次失败/异常
python scripts/learner.py record <本技能目录> --capability 简历优化 --fail --error 格式识别失败 --note "用户上传了非标准文件"
# 记录用户偏好(下次直接使用)
python scripts/learner.py prefer <本技能目录> --key 输出语言 --val 中文
# 查看累计洞察(高频能力 / 反复错误)
python scripts/learner.py insight <本技能目录>
# 自动复盘(错误≥3次 或 操作≥10次 时给出改进建议)
python scripts/learner.py reflect <本技能目录>
迭代规则
- 错误累计 ≥3 次 → 主动增加预检/兜底步骤,并将经验回写本 SKILL.md。
- 操作数 ≥10 次 → 分析高频能力优先打磨示例与质量,低频能力评估精简或合并。
- 重要用户偏好 → 写入
learned_patterns.json,下次调用直接采用,减少重复询问。
越用越懂你:第一次用是通用能力,第十次用已沉淀为你专属的最佳实践。
相关技能
三层自我改进循环升级版。融入Self-Harness三阶段循环(Weakness Mining → Harness Proposal → Proposal Validation)。 让Agent从每次执行中提取经验,自动发现弱点模式,生成改进方案,验证改进效果。 触发场景:完成重要任务后、遇到执行失败后、发现重复...
自我进化AI是一个让智能体从每次交互中持续学习并自主改进的记忆与进化系统。针对传统自改进代理"记不住、用不上、成本高"三大痛点,构建了智能分层记忆、自动痛点检测、模式复发追踪和按需加载四大核心能力。 核心能力包括:经验/错误/特性请求三类结构化记忆;基于语义的自动分类与优先级评估;跨会话模式复发检测与晋升机制;分...
AI Agent 持续进化系统:每日经验沉淀+每周错误反思,正向提炼与负向纠偏合一。v3.0 新增 VFM 确定性验算、评分+衰减淘汰、WHERE×WHY 病理归档、主动 Skill 合成。触发词:记录错误、进化系统、自我反思、踩坑记录、self-evolve、self-improve。
面向 AI Agent 的自我进化引擎,直击"重复犯错、从沉默误学、记忆压缩丢失、进化无法衡量"四大痛点。通过自反思、纠错学习、模式晋升机制,让 Agent 从每次交互中积累可复用经验,而非每次会话从零开始。 核心能力包括自反思日志(任务后自动评估"是否达预期/如何改进/是否成模式")、纠错学习信号(识别用户纠正...
由 model-distillation 从教师技能 self-evolution-metrics 蒸馏并增强的超越型元技能, 在教师能力之上叠加自验证、自我反思、super-agent 编排与持续自进化闭环,逐步超越教师。