每日扫描各 agent workspace 中的 Skill,标记功能重复并维护使用指南。
编程
Server Guardian
试用服务器健康监控与自动恢复技能。当服务器出现卡顿、崩溃、Bot 连接异常或网关中断时使用此技能。支持:执行健康检查、自动诊断故障、一键恢复 Gateway、清理内存/磁盘、整理日志、检查 OOM Killer 等操作。触发场景包括:服务器变慢、Bot 无响应、日志报 ERROR、内存/磁盘告警、进程消失等任何异常情...
它能做什么
服务器健康监控与自动恢复技能。当服务器出现卡顿、崩溃、Bot 连接异常或网关中断时使用此技能。支持:执行健康检查、自动诊断故障、一键恢复 Gateway、清理内存/磁盘、整理日志、检查 OOM Killer 等操作。触发场景包括:服务器变慢、Bot 无响应、日志报 ERROR、内存/磁盘告警、进程消失等任何异常情况。注意:API 访问限流为 60 秒内最多 40 次。
技能文档
Server Guardian
Overview
OpenClaw 服务器的"守护神",负责检测、诊断和自动修复服务器异常。
核心能力:
- 健康检查 — 5 维度全面诊断(CPU / 内存 / 磁盘 / 进程 / 日志)
- 自动恢复 — 根据诊断结果执行对应修复,无需人工干预
- 预防性维护 — 日志整理、OOM 检查、配置优化
Quick Start
遇到服务器异常时,直接说:
- "执行健康检查"
- "检查服务器状态"
- "Gateway 挂了,帮我看看"
- "服务器好卡,诊断一下"
Workflow
发现异常
↓
执行 health_check.sh(健康检查)
↓
┌─ OK → 正常,无需操作
├─ WARN → 关注,可选执行 auto_recover.sh
└─ CRITICAL → 立即执行 auto_recover.sh full
Health Check
运行诊断脚本(无需参数):
bash /root/.openclaw/workspace/skills/server-guardian/scripts/health_check.sh
检查 5 大维度:
| 维度 | 检查内容 | 告警阈值 |
|---|---|---|
| 系统 | CPU 负载 | > 2×核心数 |
| 系统 | 内存使用率 | > 90% |
| 系统 | 磁盘使用率 | > 90% |
| 进程 | Gateway 存活 | 进程消失 |
| 进程 | OpenClaw 进程数 | 进程消失 |
| 网络 | Gateway API 端口 | 端口不通 |
| 日志 | ERROR/FATAL 关键词 | 任意 1 个 |
| 系统 | 崩溃日志(journalctl) | 最近 1h 有记录 |
退出码:
0= 正常1= 警告(建议关注)2= 严重(立即处理)
Auto Recovery
自动恢复脚本,支持多种操作:
bash /root/.openclaw/workspace/skills/server-guardian/scripts/auto_recover.sh
| action | 说明 |
|---|---|
check | 执行健康检查(同上) |
restart | 仅重启 Gateway |
full | 推荐 完整恢复流程(整理日志→检查OOM→清理内存→重启Gateway→验证) |
mem | 清理内存缓存 |
procs | 查找并处理高内存进程 |
logs | 压缩大日志 + 清理 30 天+旧日志 |
disk | 清理磁盘空间(npm/pnpm 缓存) |
oom | 检查 OOM Killer 记录 |
optimize | 输出 Gateway 配置优化建议 |
menu | 交互式菜单 |
推荐使用 full,一次性完成完整恢复。
OOM Killer 检测
内存耗尽时系统会触发 OOM Killer 自动杀掉进程。若检测到 OOM:
表现:
- Bot 进程突然消失
dmesg | grep killed有输出- Gateway 日志无错误但进程没了
处理建议:
- 增加 SWAP 空间
- 在
gateway.yml中添加内存限制 - 使用
auto_recover.sh full重启恢复
Gateway 重启
# 标准重启(推荐)
openclaw gateway restart
# 强制启动
openclaw gateway start
# 查看状态
openclaw gateway status
重启后等待 5-8 秒再验证是否成功。
告警阈值参考
详见 references/thresholds.md
故障排查指南
详见 references/troubleshooting.md
相关技能
更新守护者是面向Agent平台与已安装技能包的自动更新能力包。它不只是设个每日cron跑 update命令,更解决四个高频痛点:更新引入破坏性变更导致线上崩、更新后无法回滚、 依赖版本冲突、更新时机撞上业务高峰。 核心能力: - 预检干跑:先dry-run检查兼容性,发现breaking change先告警不自动...
使用场景: 用户要审计第三方 Agent Skill、检查 SKILL.md、安装前安全扫描,或评估提示注入、敏感数据、危险命令与供应链风险;需要 SKILLGUARD_API_KEY。
积分守卫 Skill — 在执行任何高消耗任务前,自动完成提问优化、积分预估、风险拦截、替代方案推荐, 帮助用户以最少积分完成有实际产出的任务。适用于 WorkBuddy 平台积分管理场景。
监控服务器 CPU/内存/磁盘使用率,超过配置阈值时通过 SMTP 发送邮件告警。支持可配置阈值、通知时间窗口、发送频率(防刷屏)和邮件文案模板。当用户询问服务器资源、负载、告警、监控通知、设置或查看资源监控时使用。Make sure to use whenever the user asks about server resource monitoring, load, or email alerts.
Token 守护者是面向 AI Agent 的 token 成本优化系统,针对"压缩过度损失质量、语义缓存命中率低、缺乏模型路由、预算不可见不可控"四大高频痛点而设计。它用三层缓存(精确匹配/语义匹配/模式匹配)+ 自适应压缩 + 模型路由 + 预算守护,在不牺牲响应质量的前提下降低 50-80% 的 token...