原生自主发现:超越"被动接任务问答",对开放问题自主完成"假设->设计判别性实验->评估证据->收敛" 的科研闭环。给定搜索空间与观测器,自动生成候选假设、用观测器打分、按证据累加择优、对低证据 假设再生或剪枝,直到收敛到高置信结论。纯标准库、零依赖、可本地实跑(--selftest 自带样例)。
Coding
hypothesis-driven-inquiry
Try it假设驱动探究(溯因推理 Abduction):由观测反推成因、按解释覆盖与简约度排序候选假设, 并为每个假设设计判别性实验,逼近真因。零依赖、可本地实跑、输出可追溯。
What it does
假设驱动探究(溯因推理 Abduction):由观测反推成因、按解释覆盖与简约度排序候选假设, 并为每个假设设计判别性实验,逼近真因。零依赖、可本地实跑、输出可追溯。
The skill document
hypothesis-driven-inquiry(假设驱动探究 · 溯因推理)
由 meta-evolver 在第 39 轮构建,闭环
build:通用智能体(AGI梯队):假设驱动探究。 这是北极星「超越一线大模型」最后一段高价值空白:从观测反推成因、并设计判别性实验。
机制
- 观测归集(observe):把零散事实整理成观测集合 O。
- 假设生成/归集(hypothesize):每个候选假设 h 声明它能解释哪些观测(coverage)与复杂度成本(complexity)。
- 评分排序(rank):
score = coverage_ratio × parsimony,其中coverage_ratio = |h.explains ∩ O| / |O|(解释了多少观测)parsimony = 1 / (1 + complexity)(越简洁越高)
- 判别性实验设计(discriminate):对每条假设找一个「它解释、但最强竞对不解释」的观测作为判别性检验;找不到则说明假设不可证伪 → 标记为弱。
- 逼近真因(conclude):输出排序后的假设 + 各自判别实验,供下一步实据验证。
何时使用
- 给定一堆异常/现象,需要反推「最可能成因」并规划如何验证时。
- 故障根因分析、科学假设生成、诊断推理、A/B 实验设计前置。
- 用户要求「不只列可能原因,还要告诉我先验证哪条、怎么验证」。
运行
# 自带夹具自测(零依赖,断言评分/排序/判别全通过)
python scripts/hypothesis.py --selftest
# 对真实观测+假设做探究(JSON 入参)
python scripts/hypothesis.py --obs o1,o2,o3 \
--hypo "hA|explains=o1,o2|complexity=1" \
--hypo "hB|explains=o2,o3|complexity=3"
与"强模型"的差异
普通模型常止于「可能的 N 个原因」罗列;本技能进一步给出可证伪的判别实验,把探询推进到可行动、可收敛的真因逼近——这正是超级 agent 相较强文本模型的分水岭。
自进化学习系统(越用越好用、越用越高效)
本技能内置通用学习模块 scripts/learner.py。每次使用后自动复盘、积累经验,逐步提升输出质量与执行效率,无需人工维护。
记忆文件
learned_patterns.json(位于本技能目录)记录:操作总数、各能力使用频次、错误模式、用户偏好、改进建议。
使用后请调用(Bash)
python scripts/learner.py record <本技能目录> --capability 溯因探究
python scripts/learner.py insight <本技能目录>
python scripts/learner.py reflect <本技能目录>
迭代规则
- 错误累计 ≥3 次 → 主动增加预检/兜底步骤,并将经验回写本 SKILL.md。
- 操作数 ≥10 次 → 分析高频能力优先打磨示例与质量。
- 重要用户偏好 → 写入
learned_patterns.json,下次调用直接采用。
越用越懂你:第一次用是通用能力,第十次用已沉淀为你专属的最佳实践。
Related skills
猜想证明技能——将任意领域的猜想通过拆解→等价转化→归约→验证的全管线,转化为可验证的证明或精确归约为开放问题。覆盖数学、物理、CS、生物、经济、语言、历史等,5域29种任务×38种创新方法。触发词:猜想、证明、归约、conjecture-prover、meta-skill-system。
约束驱动技能,作为极限约束引擎,识别现有约束,强化到极限,添加随机新约束,在约束边界内穷尽可能性,提取边界方案。6域30种任务。触发词:约束驱动、极限约束、约束强化、边界方案、可能性穷尽、meta-skill-system。
对每个非平凡决策进行对抗性审查,防止Agent过度自信导致的错误。 当正确性比速度更重要时、在陌生领域工作时、高风险操作时触发。 触发场景:架构决策、非平凡代码提交、声称"这是安全的/可扩展的/符合规格的"、 不确定领域的工作、生产环境部署、数据迁移、不可逆操作。
可靠推理与自验证:对推理结果做命题抽取、矛盾检测、覆盖度评估与事实锚定校验,输出可验证的结论,纯Python零依赖。当需要"验证推理是否正确""自查答案""检测逻辑矛盾""reason-verify"时使用。
自主科学发现闭环——把「观测→假设→实验设计→反驳→定律归纳」做成一次可机器执行、可证伪的原创科学发现循环。给一组观测与可实验的候选点,引擎自动用符号回归拟合候选定律、按残差反驳被证伪的假设、主动设计"分歧最大"的下一次实验以最快收敛、并按 Occam 归纳出最简可解释定律。适用于规律发现、参数辨识、模型选择、主动学习/最优实验设计等场景。