元盾 —— 跨智能体的危险调用拦截护栏:确定性规则引擎 + 可插拔意图验证(不绑模型),拦截危险 exec / write / edit / read / run / shell 工具调用,提供审计日志。触发:代理要执行高风险命令(递归删除、磁盘格式化、提权、防火墙改动、反向 shell、下载即执行等)、要写入系统敏感路径或修改系统配置、要在执行危险操作前做安全检查、或用户说 护栏/拦截/危险操作/安全检查 等。边界:默认只读评估,不自动执行也不放行危险操作;不替代用户决策;不隐藏审计记录;规则可配置。
编程
safety-guardrails
试用给自主智能体/自动化流水线装上一道「预执行安全护栏」:对任何待执行动作做风险分级 (low/medium/high/critical)并给出 ALLOW / CONFIRM / DENY 决策。内置破坏性强、不可逆、 越权、外发隐私的 deny 规则与高影响 confirm 规则,强制拦截 rm -rf、强推、下载即执行、 删表、关机等高危动作,并要求用户显式确认中高危操作。适配自动化每小时触发的无人值守场景, 防止自主 agent 在没有护栏时造成不可逆损害。触发词:安全护栏、危险动作拦截、操作确认、 safety guardrails、agent 安全、预执行校验、destructive 拦截。
它能做什么
给自主智能体/自动化流水线装上一道「预执行安全护栏」:对任何待执行动作做风险分级 (low/medium/high/critical)并给出 ALLOW / CONFIRM / DENY 决策。内置破坏性强、不可逆、 越权、外发隐私的 deny 规则与高影响 confirm 规则,强制拦截 rm -rf、强推、下载即执行、 删表、关机等高危动作,并要求用户显式确认中高危操作。适配自动化每小时触发的无人值守场景, 防止自主 agent 在没有护栏时造成不可逆损害。触发词:安全护栏、危险动作拦截、操作确认、 safety guardrails、agent 安全、预执行校验、destructive 拦截。
技能文档
安全护栏(safety-guardrails)
什么时候用
- 自动化/自主 agent 要执行命令、改库、发消息、上线、转账等「有副作用」动作前。
- 无人值守场景(每小时触发的元进化、定时任务、CI)尤其需要——没有人在环兜底。
- 任何「先确认再执行」比「执行了再后悔」便宜得多的地方。
核心机制
- 风险分级:
classify(action)返回 (level, reasons)critical:破坏性/不可逆/越权/下载即执行 → 默认 DENYhigh:外发隐私/敏感越权 → CONFIRM(需 user_approved + high_risk_allowed)medium:删除/写库/安装/提权/发布/支付 → CONFIRM(需 user_approved)low:只读/低风险 → ALLOW
- 决策门
gate(action, context):返回 (decision, note, record),并写入审计日志。 context 字段:user_approved(是否用户确认)、high_risk_allowed(是否允许高危)。 - 审计:每次决策落盘(ts/action/level/decision/reason),
--audit可查。
内置规则(可扩展)
- DENY:
rm -rf、format、dd if=...of=/dev、shutdown/reboot、mkfs、无条件drop/truncate、git push --force、git reset --hard、fork 炸弹、curl|bash/wget|sh下载即执行。 - CONFIRM:
rm -、删除/更新/插入/改表、对外发送/upload/post、提权、安装依赖、终止进程、部署发布、资金转移。
用法
# 自检
python scripts/guardrails.py --selftest
# 单个动作决策
python scripts/guardrails.py --action "delete /tmp/cache" --context '{"user_approved":false}'
# => {"decision": "CONFIRM", "note": "需要用户确认:删除操作"}
# 查看审计日志
python scripts/guardrails.py --audit
与自动化/自主 agent 的集成
- 在调用 Bash/执行命令前先
gate(),决策为 DENY 直接中止;为 CONFIRM 时挂起等待人类确认。 - 配合
human-in-loop-review:CONFIRM 类动作转人工审核队列。 - 配合
behavior-observability:把 gate 决策与 action 落盘到行为日志,事后可审计归因。
自进化学习系统(越用越好用、越用越高效)
本技能内置通用学习模块 scripts/learner.py。每次使用后自动复盘、积累经验,逐步提升输出质量与执行效率,无需人工维护。
记忆文件
learned_patterns.json(位于本技能目录)记录:操作总数、各能力使用频次、错误模式、用户偏好、改进建议。
使用后请调用(Bash)
# 记录一次成功使用(--capability 填本次主要能力名,如「简历优化」「比价」)
python scripts/learner.py record <本技能目录> --capability 简历优化
# 记录一次失败/异常
python scripts/learner.py record <本技能目录> --capability 简历优化 --fail --error 格式识别失败 --note "用户上传了非标准文件"
# 记录用户偏好(下次直接使用)
python scripts/learner.py prefer <本技能目录> --key 输出语言 --val 中文
# 查看累计洞察(高频能力 / 反复错误)
python scripts/learner.py insight <本技能目录>
# 自动复盘(错误≥3次 或 操作≥10次 时给出改进建议)
python scripts/learner.py reflect <本技能目录>
迭代规则
- 错误累计 ≥3 次 → 主动增加预检/兜底步骤,并将经验回写本 SKILL.md。
- 操作数 ≥10 次 → 分析高频能力优先打磨示例与质量,低频能力评估精简或合并。
- 重要用户偏好 → 写入
learned_patterns.json,下次调用直接采用,减少重复询问。
越用越懂你:第一次用是通用能力,第十次用已沉淀为你专属的最佳实践。
相关技能
GDPR 合规护栏 (gdpr) v1.0.0。 在 AI 应用输入/输出链路中实时检测 GDPR 语境下的个人数据, 按风险分级脱敏或阻断,供 Agent 主动调用。 Use when: 需要在 Agent 处理用户输入或返回结果前,实时拦截/脱敏 EU 个人数据;防止 IBAN、UK NI、信用卡、特殊类别数据(基因/生物 识别/健康/宗教信仰等)流入大模型或被输出泄露;为 AI 应用加装 符合 GDPR 的运行时护栏。 核心能力: - 🛡️ 实时检测 IBAN、UK NI、EU 电话、信用卡(Luhn)、 IPv4/MAC、邮箱等结构化个人数据 - 🧩 关键词线索识别:GDP
个人信息保护合规护栏。在隐私政策、用户协议、App权限申请、数据收集告知、营销推送文案发布前,实时检测是否符合《个人信息保护法》《数据安全法》《网络安全法》及GB/T 35273等规范要求,拦截不合规内容并给出修改建议。
生成式 AI 服务合规护栏 v1.0.2。 基于《生成式人工智能服务管理暂行办法》(国家网信办等七部门令第15号,2023年8月15日施行) 及强制性国家标准《网络安全技术 生成式人工智能服务安全基本要求》(2025年11月实施), 实时评估生成式 AI 服务的合规风险,覆盖备案登记、训练数据、内容安全、用户权益、标识义务五大维度, 输出风险等级与合规缺陷清单。 核心能力: - 🛡️ 生成式 AI 服务场景自动识别(大模型/智能对话/AIGC 等关键词触发) - ✅ 5 维度合规检查:备案登记、训练数据、内容安全、用户权益、标识义务 - 📐 办法 + 配套强制国标双重映射 - 🔴 风险
积分守卫 Skill — 在执行任何高消耗任务前,自动完成提问优化、积分预估、风险拦截、替代方案推荐, 帮助用户以最少积分完成有实际产出的任务。适用于 WorkBuddy 平台积分管理场景。
金融消保合规护栏 (finance-consumer-guard) v1.0.0。 在银行理财 / 保险 / 基金 / 资管等金融产品的营销文案、销售话术、广告投放、官网介绍、 对外宣传发布前,实时检测"保本保收益(刚兑)、收益承诺夸大、风险弱化误导、 过往业绩误导、无资质代客理财、广告极限词"相关的高频违规 / 高风险表述, 按风险分级输出命中与整改建议,供 Agent 主动调用。区别于事后深度审计,这是事前拦截。 Use when: 需要在金融产品营销文案、销售话术、广告、官网介绍、对外宣传发布前, 实时拦截"保本保收益 / 稳赚不赔 / 低风险高收益 / 代客理财 / 最佳理财"等高频