Coding

元盾 yotta-guardian

Try it

元盾 —— 跨智能体的危险调用拦截护栏:确定性规则引擎 + 可插拔意图验证(不绑模型),拦截危险 exec / write / edit / read / run / shell 工具调用,提供审计日志。触发:代理要执行高风险命令(递归删除、磁盘格式化、提权、防火墙改动、反向 shell、下载即执行等)、要写入系统敏感路径或修改系统配置、要在执行危险操作前做安全检查、或用户说 护栏/拦截/危险操作/安全检查 等。边界:默认只读评估,不自动执行也不放行危险操作;不替代用户决策;不隐藏审计记录;规则可配置。

What it does

元盾 —— 跨智能体的危险调用拦截护栏:确定性规则引擎 + 可插拔意图验证(不绑模型),拦截危险 exec / write / edit / read / run / shell 工具调用,提供审计日志。触发:代理要执行高风险命令(递归删除、磁盘格式化、提权、防火墙改动、反向 shell、下载即执行等)、要写入系统敏感路径或修改系统配置、要在执行危险操作前做安全检查、或用户说 护栏/拦截/危险操作/安全检查 等。边界:默认只读评估,不自动执行也不放行危险操作;不替代用户决策;不隐藏审计记录;规则可配置。

The skill document

元盾(yotta-guardian)

跨智能体的工具调用拦截护栏:确定性规则引擎 + 可插拔意图验证,对 exec / write / edit / read / run / shell 工具调用做安全评估,输出 allow / deny + 命中规则 + 审计日志。

零依赖(Python 3.8+ 标准库),Windows + Linux + macOS 通用;Claude Code / Cursor / Codex / 通用 Agent 均可调用。

何时使用

  • 代理要执行高风险命令:递归删除系统路径、磁盘格式化(mkfs / fdisk / dd 写设备)、提权(chmod 全权限 / chown 系统路径 / 账户管理)、防火墙改动(iptables 清空 / ufw disable / netsh 关闭)、反向 shell(netcat 执行 / bash /dev/tcp)、下载即执行(curl / wget 管道交给 shell)等;
  • 代理要写入系统敏感路径(/etc/passwd、/etc/sudoers、SSH 授权文件、Windows hosts / 系统目录、注册表启动项)或修改系统配置;
  • 需要在执行危险操作前做一次确定性安全检查(gate),并留下审计记录。

Do NOT trigger

  • 默认只读评估,不自动执行、不放行危险操作,也不替代用户最终决策;
  • 不隐藏审计记录;被拦截时如实上报原因与命中规则;
  • 已获明确授权的运维操作应显式放行(--allow / --allow-path / 自定义规则),而不是绕过检查。

快速使用

Windows 用 python,Linux/macOS 用 python3。

_BT_bash

检查一条 exec(0 = 允许)

python3 scripts/yotta_guardian.py check exec --cmd "git status"

检查危险命令(默认拒绝,退出码 3)

python3 scripts/yotta_guardian.py check exec --cmd "rm -rf /"

检查写操作

python3 scripts/yotta_guardian.py check write --path /etc/passwd --content "..."

批量检查(agent 在执行前把待执行调用列表交给护栏)

python3 scripts/yotta_guardian.py check --batch calls.json --json

审计

python3 scripts/yotta_guardian.py check exec --cmd "..." --audit-log .yotta-guardian/audit.jsonl python3 scripts/yotta_guardian.py audit --file .yotta-guardian/audit.jsonl --tail 20 _BT_

工作流程(AI 智能体执行危险操作前)

  1. 先检查:把将要执行的工具调用交给护栏 check(单条或 --batch 批量)。
  2. 看退出码:0 = 允许;1 = 允许但带警告(建议人工复核);2 / 3 = 拒绝(high / critical,不要执行);4 = 用法错误。
  3. 被拒绝怎么办:如实向用户报告原因与命中规则;确有授权的操作,用 --allow / --allow-path / 自定义规则文件放行并留审计记录;不要绕过检查
  4. 留痕:高风险场景用 --audit-log 落审计日志,供追溯。

策略(policy)

策略行为
default(默认)拒绝 critical / high;中危警告(exit 1)
strict拒绝 medium 及以上;低危也提示
loose仅拒绝 critical;高危仅警告

可插拔意图验证(不绑模型)

  • 默认纯确定性规则,不调用任何模型、零外部依赖;
  • --heuristic:启用内置本地启发式验证(对高影响动词升级为需人工确认);
  • --verifier "命令" 或配置文件:外接任意意图验证器(如 LLM 网关),协议见 references/intent-verifier.md。

参考文档

  • references/rules.md — 规则目录与匹配说明
  • references/policies.md — 策略 / 退出码 / 使用姿势
  • references/intent-verifier.md — 意图验证器协议

责任声明

本技能用于防止误操作与提升操作透明度,不替代人工决策。执行危险操作前请自行确认授权与合规。

Related skills

给自主智能体/自动化流水线装上一道「预执行安全护栏」:对任何待执行动作做风险分级 (low/medium/high/critical)并给出 ALLOW / CONFIRM / DENY 决策。内置破坏性强、不可逆、 越权、外发隐私的 deny 规则与高影响 confirm 规则,强制拦截 rm -rf、强推、下载即执行、 删表、关机等高危动作,并要求用户显式确认中高危操作。适配自动化每小时触发的无人值守场景, 防止自主 agent 在没有护栏时造成不可逆损害。触发词:安全护栏、危险动作拦截、操作确认、 safety guardrails、agent 安全、预执行校验、destructive 拦截。

元安全 —— 给 AI 智能体 / Agent 技能自身做「体检 + 加固建议」:按 提示注入防护 / 工具调用边界 / 数据隔离 三域,对安装的 skills、MCP 服务器、工具描述、权限与数据读取面做配置面静态加固扫描,输出加固报告与可执行防御守则(零依赖 Python 3.8+,扫描只读、敏感读取检测默认开启、报告用「类」表述、每次扫描默认留痕)。触发:用户要求给智能体或技能环境做安全体检 / 加固、检查 MCP 服务器或技能是否可信、排查提示注入 / 越权 / 数据泄露风险、想了解装了一堆技能后的整体暴露面;或用户说 元安全 / 加固 / 安全体检 / 体检 / hardening / 扫一下我的技能 / 检查 MCP / 防御守则 / guardrails 等。边界(Do NOT trigger):不产出可复制注入串 / 攻击 payload;只扫描用户自有、有权检查的目录与配置,不扫描无权访问的环境;不做运行时拦截(那是元盾);不做单个技能装前审核(那是元审 / 元信);不替代人工安全审计与最终决策。

GDPR 合规护栏 (gdpr) v1.0.0。 在 AI 应用输入/输出链路中实时检测 GDPR 语境下的个人数据, 按风险分级脱敏或阻断,供 Agent 主动调用。 Use when: 需要在 Agent 处理用户输入或返回结果前,实时拦截/脱敏 EU 个人数据;防止 IBAN、UK NI、信用卡、特殊类别数据(基因/生物 识别/健康/宗教信仰等)流入大模型或被输出泄露;为 AI 应用加装 符合 GDPR 的运行时护栏。 核心能力: - 🛡️ 实时检测 IBAN、UK NI、EU 电话、信用卡(Luhn)、 IPv4/MAC、邮箱等结构化个人数据 - 🧩 关键词线索识别:GDP

生成式 AI 服务合规护栏 v1.0.2。 基于《生成式人工智能服务管理暂行办法》(国家网信办等七部门令第15号,2023年8月15日施行) 及强制性国家标准《网络安全技术 生成式人工智能服务安全基本要求》(2025年11月实施), 实时评估生成式 AI 服务的合规风险,覆盖备案登记、训练数据、内容安全、用户权益、标识义务五大维度, 输出风险等级与合规缺陷清单。 核心能力: - 🛡️ 生成式 AI 服务场景自动识别(大模型/智能对话/AIGC 等关键词触发) - ✅ 5 维度合规检查:备案登记、训练数据、内容安全、用户权益、标识义务 - 📐 办法 + 配套强制国标双重映射 - 🔴 风险

1 stars

个人信息保护合规护栏。在隐私政策、用户协议、App权限申请、数据收集告知、营销推送文案发布前,实时检测是否符合《个人信息保护法》《数据安全法》《网络安全法》及GB/T 35273等规范要求,拦截不合规内容并给出修改建议。

1 installs

元信 —— 装任何技能/包前的确定性安全扫描器:prompt injection(提示注入)+ 危险模式 + SKILL.md 完整性 + 权限需求,输出 verdict(SAFE TO INSTALL / INSTALL WITH CAUTION / REVIEW REQUIRED / DO NOT INSTALL)+ audited 徽章。触发:安装/评估任何技能或 npm 包前、给技能做安全验证、生成 audited 徽章、CI 装前闸门;或用户说 装前扫描/验证/audited/安全验证/verify-skill/可信 等。边界:只做确定性静态扫描与报告,不执行被测代码、不联网、不装包、不修复;结论需人工确认,不代替最终决策。