编程

unified-world-model

试用

跨模态统一世界模型:把 text/code/vision/tool_state 四种模态观察融一潜空间(共享 grounded 状态), 在其上做跨模态一致性校验、状态转移、前向仿真、反事实推演。与纯文本生成式世界模型不同, 本模型 grounded(有锚定、可证伪):跨模态事实矛盾被显式标记而非平滑掉。这是一线大模型 仍薄弱、而"可靠地超越"所必需的底层元能力。

它能做什么

跨模态统一世界模型:把 text/code/vision/tool_state 四种模态观察融一潜空间(共享 grounded 状态), 在其上做跨模态一致性校验、状态转移、前向仿真、反事实推演。与纯文本生成式世界模型不同, 本模型 grounded(有锚定、可证伪):跨模态事实矛盾被显式标记而非平滑掉。这是一线大模型 仍薄弱、而"可靠地超越"所必需的底层元能力。

技能文档

unified-world-model(跨模态统一世界模型)

「超越态·自我确证」域的收口能力:text/code/vision/tool_state 融一潜空间做 grounded 仿真。 与生成式"脑子里想的世界"不同,本模型要求每个状态都有多模态事实支撑,矛盾可证伪。

何时使用

  • 需要预测某动作后的世界状态(规划、反事实"What-if"、仿真验证)。
  • 需要校验多源信息(文本描述 vs 视觉观察 vs 工具返回)是否自洽。
  • 需要把异构模态(对话、代码执行结果、截图标签、工具状态)对齐进统一表征。

核心 API(scripts/unified_world_model.py)

  • unify([Observation(...)])UnifiedState:多模态融合 + 跨模态矛盾检测(groundedness 字段)。
  • transition(state, action) / rollout(state, actions):确定性状态推进。
  • predict_next(state, action)(next_state, uncertainty):已知动作 uncertainty=0,未知=1.0。
  • counterfactual(state, plan, alt_action, at_step) → 两条对比轨迹 + 差异字典。

已知转移(可扩展)

toggle_light / open_door / close_door / run_code / call_tool

使用流程

  1. 把每条证据封装成 Observation(modality, content, facts=..., tags=...)
  2. unify(...) 得到统一状态,检查 contradictionsgroundedness(<1 即存在跨模态矛盾)。
  3. rollout / counterfactual 做前向/反事实推演;predict_next 量化不确定性。

与超级智能体闭环的关系

作为 super-agent 的环境模型节点:规划时仿真分支、执行后用真实观察 unify 校验 预测 vs 实际(groundedness 落差即误差信号),驱动反思重规划。

自进化学习系统

本技能接入 meta-evolver 自进化闭环:每次调用经 scripts/learner.py 记录成败与边界案例, 跨会话沉淀"哪些模态组合易矛盾""哪些动作 OOD"等经验,越用越准。

已知限制

  • 转移函数为显式注册(非学习型),未知动作只能给高不确定性、不臆测结果。
  • vision 仅接收标签级事实(非像素),如需像素级 grounding 需外接多模态模型。

相关技能

世界模拟器 · 故事引擎 · 即兴戏剧 · 角色扮演。本地持久化世界状态(运行会在 worlds 数据目录下创建、修改和删除本地文件——缺省 worlds/,可由环境变量 WORLDSIM_WORLDS_DIR 指向你自己的目录)、导入 SillyTavern 角色卡、推进互动剧情,以及执行存档、读档、回滚与状态修复。仅在用户明确要求运行世界模拟、且请求指向具体世界(如启动/继续/进入XXXX世界,或明确要求创建XXXX世界/导入角色卡至XXXX世界)时激活;日常聊天提及、讨论或引用世界/角色/剧情话题不激活,与已有世界无关的泛化扮演/role-play 请求也不激活。

1 星标

Anthropic's flagship multimodal model. Strong at long-context reasoning, code generation, and complex tool orchestration. Supports text, image, and video inp...

19 次安装

神经符号统一推理——把"神经(连续表征+相似度=可泛化但不可验证)"与"符号(Horn子句前向链+不变量=可证但脆弱)"熔于一炉。同一查询同时走两侧:符号可证结论优先(verifiable=True),神经近邻结论作为带置信度的软证据,两侧冲突显式标注供上层裁决。适用于需要"既能泛化到未见样本、又能给出可审计/可反例证伪推导"的推理场景(关系推理、知识补全、可信问答、反幻觉)。

国产大模型统一 MCP 服务器,通过标准 JSON-RPC 2.0 协议为 Claude Code / Cursor / Cline / n8n 等 18+ Agent 框架提供 DeepSeek、通义千问、智谱 GLM、Kimi、腾讯混元、火山豆包、MiniMax、零一万物、百川智能、阶跃星辰十家模型的统一调用接口。新增 5 个非 MCP 框架适配器:LangChain Tool、AutoGPT Plugin、CrewAI Tool、Coze 插件、Dify 工具节点,实现从 MCP 生态到全 Agent 生态的扩展。内置模型性能基准测试套件(50 道题库、6 维度评分、雷达图对比、历史追踪)和 Token 价格实时追踪(价格抓取、变更通知、趋势图、成本预测)。支持 8 个 MCP 工具(ask_model/describe_image/embed_text/rerank/audio_transcribe/video_understand/list_providers/health_check)、资源读取(配置/使用统计)、预置 prompt 模板(代码审查/翻译),内置统一错误映射、流式 SSE 输出、使用量统计、硬件感知并发控制。auto 模式支持能力画像排序 + 自动故障转移(超时/失败切备用);API key 支持环境变量优先读取;SQLite 启用 WAL 模式支持多 Agent 框架并发写入;支持多模态视觉模型(Qwen-VL/GLM-4V/豆包视觉)和图片理解(describe_image);支持 Function Calling / Tool Use(ask_model 传入 tools 参数);新增文本向量嵌入(embed_text)、文档重排序(rerank)、语音转文字(audio_transcribe)、视频理解(video_understand)四个新工具。config.json 填写 api_key 即可启动,无需 GPU、不做微调、不做私有部署,只做标准 MCP 协议网关。

世界建造器——元技能系统的下级母技能,支持双模式——独立生成(从无到有构建完整世界)和角色提取(从多个Character Builder角色中提取共享世界层)——从任意世界概念或角色群生成完整世界Skill。以世界=实体层×社会层×抽象层的三层12维正交模型(实体层:空间/时间/法则/生命/物质/技术;社会层:文化/政治/经济;抽象层:认知/审美/动态)系统填充,输出内嵌管线编排、三轴判定、领域校准、降级模式等可执行能力的世界Skill文件。触发词:生成世界、创建世界、世界构建、世界观、world building、世界设计、架空世界、虚构世界、meta-skill-system

2 次安装

WorldLines scenario creation and revision with clear multi-agent dialogue, validation, and real-model playtesting.

2 次安装