编程

hypothesis-driven-inquiry

试用

假设驱动探究(溯因推理 Abduction):由观测反推成因、按解释覆盖与简约度排序候选假设, 并为每个假设设计判别性实验,逼近真因。零依赖、可本地实跑、输出可追溯。

它能做什么

假设驱动探究(溯因推理 Abduction):由观测反推成因、按解释覆盖与简约度排序候选假设, 并为每个假设设计判别性实验,逼近真因。零依赖、可本地实跑、输出可追溯。

技能文档

hypothesis-driven-inquiry(假设驱动探究 · 溯因推理)

由 meta-evolver 在第 39 轮构建,闭环 build:通用智能体(AGI梯队):假设驱动探究。 这是北极星「超越一线大模型」最后一段高价值空白:从观测反推成因、并设计判别性实验。

机制

  1. 观测归集(observe):把零散事实整理成观测集合 O。
  2. 假设生成/归集(hypothesize):每个候选假设 h 声明它能解释哪些观测(coverage)与复杂度成本(complexity)。
  3. 评分排序(rank)score = coverage_ratio × parsimony,其中
    • coverage_ratio = |h.explains ∩ O| / |O|(解释了多少观测)
    • parsimony = 1 / (1 + complexity)(越简洁越高)
  4. 判别性实验设计(discriminate):对每条假设找一个「它解释、但最强竞对不解释」的观测作为判别性检验;找不到则说明假设不可证伪 → 标记为弱。
  5. 逼近真因(conclude):输出排序后的假设 + 各自判别实验,供下一步实据验证。

何时使用

  • 给定一堆异常/现象,需要反推「最可能成因」并规划如何验证时。
  • 故障根因分析、科学假设生成、诊断推理、A/B 实验设计前置。
  • 用户要求「不只列可能原因,还要告诉我先验证哪条、怎么验证」。

运行

# 自带夹具自测(零依赖,断言评分/排序/判别全通过)
python scripts/hypothesis.py --selftest

# 对真实观测+假设做探究(JSON 入参)
python scripts/hypothesis.py --obs o1,o2,o3 \
  --hypo "hA|explains=o1,o2|complexity=1" \
  --hypo "hB|explains=o2,o3|complexity=3"

与"强模型"的差异

普通模型常止于「可能的 N 个原因」罗列;本技能进一步给出可证伪的判别实验,把探询推进到可行动、可收敛的真因逼近——这正是超级 agent 相较强文本模型的分水岭。

自进化学习系统(越用越好用、越用越高效)

本技能内置通用学习模块 scripts/learner.py。每次使用后自动复盘、积累经验,逐步提升输出质量与执行效率,无需人工维护。

记忆文件

learned_patterns.json(位于本技能目录)记录:操作总数、各能力使用频次、错误模式、用户偏好、改进建议。

使用后请调用(Bash)

python scripts/learner.py record <本技能目录> --capability 溯因探究
python scripts/learner.py insight <本技能目录>
python scripts/learner.py reflect <本技能目录>

迭代规则

  • 错误累计 ≥3 次 → 主动增加预检/兜底步骤,并将经验回写本 SKILL.md。
  • 操作数 ≥10 次 → 分析高频能力优先打磨示例与质量。
  • 重要用户偏好 → 写入 learned_patterns.json,下次调用直接采用。

越用越懂你:第一次用是通用能力,第十次用已沉淀为你专属的最佳实践。

相关技能

原生自主发现:超越"被动接任务问答",对开放问题自主完成"假设->设计判别性实验->评估证据->收敛" 的科研闭环。给定搜索空间与观测器,自动生成候选假设、用观测器打分、按证据累加择优、对低证据 假设再生或剪枝,直到收敛到高置信结论。纯标准库、零依赖、可本地实跑(--selftest 自带样例)。

猜想证明技能——将任意领域的猜想通过拆解→等价转化→归约→验证的全管线,转化为可验证的证明或精确归约为开放问题。覆盖数学、物理、CS、生物、经济、语言、历史等,5域29种任务×38种创新方法。触发词:猜想、证明、归约、conjecture-prover、meta-skill-system。

约束驱动技能,作为极限约束引擎,识别现有约束,强化到极限,添加随机新约束,在约束边界内穷尽可能性,提取边界方案。6域30种任务。触发词:约束驱动、极限约束、约束强化、边界方案、可能性穷尽、meta-skill-system。

对每个非平凡决策进行对抗性审查,防止Agent过度自信导致的错误。 当正确性比速度更重要时、在陌生领域工作时、高风险操作时触发。 触发场景:架构决策、非平凡代码提交、声称"这是安全的/可扩展的/符合规格的"、 不确定领域的工作、生产环境部署、数据迁移、不可逆操作。

3 次安装

可靠推理与自验证:对推理结果做命题抽取、矛盾检测、覆盖度评估与事实锚定校验,输出可验证的结论,纯Python零依赖。当需要"验证推理是否正确""自查答案""检测逻辑矛盾""reason-verify"时使用。

自主科学发现闭环——把「观测→假设→实验设计→反驳→定律归纳」做成一次可机器执行、可证伪的原创科学发现循环。给一组观测与可实验的候选点,引擎自动用符号回归拟合候选定律、按残差反驳被证伪的假设、主动设计"分歧最大"的下一次实验以最快收敛、并按 Occam 归纳出最简可解释定律。适用于规律发现、参数辨识、模型选择、主动学习/最优实验设计等场景。