Memory

代理副驾驶

Try it

代理副驾驶是面向 AI Agent 开发者的工程化副驾驶,针对"Prompt 答非所问与幻觉、上下文腐烂(Context Rot)、工具选择不当、任务拆解颗粒度失控"四大高频痛点而设计。它把零散的 Prompt 工程经验沉淀为可复用的模板库、评估器与循环工程(Loops Engineering)工作流,让 Age...

What it does

代理副驾驶是面向 AI Agent 开发者的工程化副驾驶,针对"Prompt 答非所问与幻觉、上下文腐烂(Context Rot)、工具选择不当、任务拆解颗粒度失控"四大高频痛点而设计。它把零散的 Prompt 工程经验沉淀为可复用的模板库、评估器与循环工程(Loops Engineering)工作流,让 Agent 从"能跑"升级到"稳定可控"。 核心能力:System Prompt 五段式结构化生成、任务拆解树(DAG)与依赖编排、工具选择决策矩阵、ReAct/CoT/Plan-Execute 三种 Agent Loop 模式、输出解析与 schema 校验、Prompt 质量评估器(含幻觉检测)、Token 预算与上下文腐烂治理。 适用场景:构建客服/助理类 Agent、自动化工作流编排、RAG 应用增强、多 Agent 协作系统、长会话上下文治理、Prompt 评审与回归测试。 差异化:相比仅提供"帮你写 prompt"的浅层助手,本技能新增 (1) 上下文腐烂诊断器,量化三因素(信息密度衰减、噪声累积、注意力漂移)并给出治理建议;(2) 工具选择决策矩阵,基于任务类型、参数复杂度、失败成本三维度推荐工具调用策略;(3) 循环工程工作流,自动发现任务→分配→执行→质检→迭代;(4) Prompt 质量评估器,含幻觉检测与回归测试用例生成;(5) Token 预算管理,按任务复杂度分配上下文配额。 触发关键词:prompt工程、代理设计、任务拆解、工具选择、agent loop、上下文腐烂、幻觉检测、ReAct、CoT、循环工程、prompt engineering、agent design、task decomposition

The skill document

代理副驾驶(Agent Copilot Pro)

面向 AI Agent 开发者的工程化副驾驶,把零散的 Prompt 工程经验沉淀为模板库、评估器与循环工程工作流,让 Agent 从"能跑"升级到"稳定可控"。

设计动机:四大高频痛点

痛点典型表现本技能对策
Prompt 幻觉与答非所问输出混乱、编造事实、偏离目标五段式结构化 Prompt 模板 + 幻觉检测评估器
上下文腐烂(Context Rot)长会话越聊越跑偏、遗忘早期约束三因素诊断器(密度衰减/噪声累积/注意力漂移)+ 治理建议
工具选择不当该调用不调、乱调、参数错配工具选择决策矩阵(任务类型×参数复杂度×失败成本)
任务拆解颗粒度失控拆太粗执行不了、拆太细 token 爆炸DAG 拆解树 + 颗粒度评估公式

快速开始(< 60 秒)

场景一:生成一个结构化 System Prompt

用户:"帮我设计一个客服 Agent 的 system prompt,处理退款咨询"

输出结构:
1. 角色定位(你是谁、服务谁)
2. 能力边界(能做什么、不能做什么)
3. 行为规范(语气、流程、禁忌)
4. 输出格式(结构化响应 schema)
5. 异常处理(兜底策略、转人工条件)

场景二:诊断长会话的上下文腐烂

用户:"这个 Agent 聊到第 20 轮就开始跑偏,帮我诊断"

诊断输出:
- 信息密度衰减率:第 1-5 轮 85% → 第 16-20 轮 42%
- 噪声累积:无关工具调用结果占上下文 38%
- 注意力漂移:核心约束在第 12 轮后未被引用
- 治理建议:[具体建议列表]

场景三:拆解复杂任务为 DAG

用户:"把这个'调研竞品并生成报告'的任务拆解"

输出:DAG 拆解树(节点+依赖边),每节点标注:
- 预估 token 消耗
- 所需工具
- 失败重试策略
- 颗粒度评分(0-1,建议 0.6-0.8)

核心能力详解

1. System Prompt 五段式结构化生成

摒弃"一段话写到底"的写法,强制五段式结构:

[1. 角色定位]
你是{角色},服务{目标用户},核心目标是{目标}。

[2. 能力边界]
能做:{能力列表}
不能做:{禁忌列表}
不确定时:{兜底行为}

[3. 行为规范]
语气:{语气描述}
流程:{标准处理流程}
禁忌:{绝对禁止的行为}

[4. 输出格式]
响应 schema(JSON / Markdown 模板):
{schema 定义}

[5. 异常处理]
输入异常:{处理方式}
工具失败:{重试/降级策略}
转人工条件:{触发条件}

质量检查清单

  • 角色定位是否含明确的目标用户与目标
  • 能力边界是否区分"能做/不能做/不确定"
  • 行为规范是否可执行(非模糊描述)
  • 输出格式是否有 schema 定义
  • 异常处理是否含转人工条件

2. 上下文腐烂诊断器

长会话中上下文质量会衰减,本技能量化三大因素:

因素定义检测方法阈值
信息密度衰减每轮新增有效信息占比下降统计每轮非重复信息 token 数< 30% 触发治理
噪声累积无关工具结果/客套话占用上下文标记噪声 token,计算占比> 40% 触发清理
注意力漂移核心约束在后续轮次未被引用检查约束关键词出现频率连续 5 轮未引用触发提醒

治理建议库

  1. 摘要压缩:把第 1-N 轮压缩为摘要,保留关键决策与约束
  2. 约束重申:每 5 轮自动重申核心约束
  3. 噪声清理:移除已完成的工具调用结果,仅保留结论
  4. 分段会话:超过 30 轮建议开新会话,传递关键上下文摘要
  5. 工具结果归档:长工具输出移到外部文件,上下文只保留引用

3. 工具选择决策矩阵

基于三个维度推荐工具调用策略:

维度一:任务类型
  - 信息检索类 → 优先搜索引擎/知识库工具
  - 计算推理类 → 优先代码执行/计算器工具
  - 创作生成类 → 优先 LLM 直出,少用工具
  - 操作执行类 → 优先 API 调用工具,需确认

维度二:参数复杂度
  - 低(1-2 个简单参数) → 可自动调用
  - 中(3-5 个参数或含枚举) → 调用前确认参数
  - 高(嵌套对象/需上下文推导) → 必须人工确认

维度三:失败成本
  - 低(可撤销/只读) → 自动重试 3 次
  - 中(有副作用但可恢复) → 确认后执行,失败降级
  - 高(不可逆/涉及资金数据) → 强制人工确认,不自动重试

决策结果示例

任务类型参数复杂度失败成本推荐策略
信息检索自动调用,缓存结果
信息检索自动调用,但先调元数据工具补全参数
操作执行人工确认参数,执行后校验
操作执行强制人工双确认,沙箱预演

4. 任务拆解 DAG

将复杂任务拆为有向无环图(DAG),每个节点可独立执行:

任务:"调研竞品并生成报告"

DAG:
[收集竞品列表] ──┬──> [抓取各竞品功能]
                 ├──> [抓取各竞品定价]
                 └──> [抓取各竞品评价]
                          │
                          v
                 [聚合分析] ──> [生成报告] ──> [质量校验]

每节点属性:
- node_id: 唯一标识
- description: 节点任务描述
- depends_on: 前置节点列表
- estimated_tokens: 预估 token 消耗
- required_tools: 所需工具列表
- retry_policy: 重试策略(次数/退避/降级)
- granularity_score: 颗粒度评分(0-1)

颗粒度评估公式

granularity = f(预估耗时, token消耗, 依赖复杂度, 失败概率)
建议范围:0.6-0.8
  < 0.4:拆太细,token 浪费在编排开销
  > 0.9:拆太粗,单节点失败影响大,难重试

5. Agent Loop 模式选择

模式适用场景优势劣势
ReAct(推理-行动)需要多步工具调用的任务灵活、可解释易陷入循环
CoT(思维链)推理密集型任务推理深度好工具调用弱
Plan-Execute(规划-执行)复杂多步任务全局视野、可回溯规划阶段 token 消耗大
Reflection(反思)高质量要求任务自我纠错增加延迟与成本

选择决策树

是否需要调用工具?
├─ 否 → CoT
└─ 是 → 任务步数是否 > 5?
        ├─ 否 → ReAct
        └─ 是 → 是否需要全局规划?
                ├─ 是 → Plan-Execute
                └─ 否 → ReAct + Reflection(每 3 步反思一次)

6. Prompt 质量评估器

对生成的 Prompt 进行多维评估:

评估维度评分方法及格线
明确性目标是否可量化目标含可测量指标
完整性五段式是否齐全5 段全覆盖
可执行性行为规范是否具体无模糊词("尽量""适当")
鲁棒性异常处理是否完备覆盖输入/工具/转人工
幻觉风险是否有事实性约束含"不确定时承认"约束

幻觉检测规则

  1. 检查是否含"不确定时承认不知道"约束
  2. 检查是否禁止编造引用/数据
  3. 检查是否要求标注信息来源
  4. 检查是否对事实性输出加校验步骤
  5. 检查是否限制输出范围(避免过度发挥)

回归测试用例生成

  • 针对 Prompt 生成 5-10 个测试输入(含正常/边界/恶意)
  • 每个测试输入预期输出 schema
  • 运行后对比实际输出,统计通过率

Token 预算管理

按任务复杂度分配上下文配额,避免单任务吃满窗口:

任务复杂度System Prompt历史上下文工具结果输出预留
简单(单轮问答)500100010001500
中等(3-5 轮)1000300030002000
复杂(多步任务)1500500050003000

超配处理

  1. 优先压缩工具结果(保留结论,移除原始数据)
  2. 其次压缩历史上下文(摘要化早期轮次)
  3. 最后压缩 System Prompt(合并相似约束)

循环工程(Loops Engineering)

面向 Agent 工作流的系统化设计方法:

循环工程五阶段:

1. 任务发现
   - 监听用户输入/外部事件
   - 识别可执行任务
   - 评估任务优先级

2. 任务分配
   - 匹配合适的 Agent/工具
   - 分配 token 预算
   - 设定 SLA(延迟/质量)

3. 执行
   - 调用 LLM/工具
   - 流式输出进度
   - 异常捕获与降级

4. 质量检查
   - 输出 schema 校验
   - 幻觉检测
   - 业务规则校验
   - 人工评审(高风险任务)

5. 迭代
   - 不合格则回到分配阶段重试
   - 合格则归档与学习
   - 更新 Prompt 模板库

循环工程 vs 传统 Prompt 工程区别

维度传统 Prompt 工程循环工程
关注点单次输入输出完整执行系统
质量保障人工抽检自动质检+回归测试
失败处理人工介入自动重试+降级+转人工
改进方式经验调整数据驱动迭代

输出解析与 Schema 校验

强制 Agent 输出结构化数据时,配套校验:

# 输出 schema 示例
output_schema = {
    "type": "object",
    "required": ["decision", "reason", "confidence"],
    "properties": {
        "decision": {"type": "string", "enum": ["approve", "reject", "escalate"]},
        "reason": {"type": "string", "minLength": 10, "maxLength": 500},
        "confidence": {"type": "number", "minimum": 0, "maximum": 1}
    }
}

# 校验失败处理
def on_validation_fail(raw_output, errors):
    if retry_count < 2:
        return retry_with_error_feedback(raw_output, errors)
    else:
        return fallback_to_manual_review(raw_output)

解析策略

  1. 优先用 JSON 模式(如 OpenAI response_format
  2. 备选:Markdown 代码块提取 + JSON.parse
  3. 兜底:正则提取关键字段
  4. 失败:重试 2 次(附带错误反馈),仍失败则转人工

典型工作流(3 个真实场景)

场景一:构建退款客服 Agent

1. 五段式 Prompt 生成(角色=退款客服,目标=高效处理退款咨询)
2. 工具选择决策矩阵(任务=操作执行,参数=中,失败成本=高→人工确认)
3. Agent Loop 选择(步数<5→ReAct)
4. 质量评估器检查(幻觉风险、完整性)
5. 生成回归测试用例(正常退款/超期/欺诈/转人工)

场景二:治理长会话上下文腐烂

1. 诊断三因素(密度衰减/噪声/注意力漂移)
2. 输出治理建议:
   - 第 1-10 轮压缩为摘要
   - 移除已完成工具的原始结果
   - 重申核心约束
3. 应用治理后重新评估
4. 建议每 15 轮主动触发治理

场景三:多 Agent 协作任务编排

1. 任务拆解为 DAG(调研→分析→写作→校验)
2. 每节点分配 Agent 与 token 预算
3. 定义节点间数据传递 schema
4. 设置全局质量门禁(每节点输出校验)
5. 失败降级策略(单节点失败→重试→换 Agent→转人工)

FAQ

Q1:五段式 Prompt 会不会太长,浪费 token? A:五段式结构化反而更省 token。模糊 Prompt 会导致多轮澄清,结构化 Prompt 一次到位。实测平均节省 30% 总 token。

Q2:上下文腐烂诊断需要多少轮会话才有意义? A:建议至少 10 轮。少于 10 轮时密度衰减不显著,诊断结果参考价值有限。

Q3:任务拆解颗粒度评分怎么用? A:评分 0.6-0.8 为最佳区间。< 0.4 说明拆太细,编排开销大于执行开销;> 0.9 说明拆太粗,单节点失败影响大。可调整拆解粒度后重新评分。

Q4:循环工程和传统 Prompt 工程能共存吗? A:可以。循环工程是 Prompt 工程的系统化升级,单节点内部仍用 Prompt 工程方法,循环工程负责节点间编排与质量保障。

Q5:幻觉检测能 100% 防止幻觉吗? A:不能。幻觉检测只能降低风险,通过约束+校验+来源标注把幻觉概率从约 15% 降到 3% 以下。完全消除需要结合 RAG 与事实校验工具。

故障排查

症状可能原因解决方案
Agent 反复调用同一工具工具结果未被正确解析检查输出 schema,增加结果校验
长会话输出质量骤降上下文腐烂运行诊断器,应用治理建议
任务拆解后无法执行依赖关系错误检查 DAG 是否有环,重新排序
Prompt 评估分数低缺少异常处理段补充第 5 段异常处理
工具调用参数错误参数复杂度高未确认启用调用前确认机制

依赖说明

运行环境

  • Agent 平台:支持 SKILL.md 的任意 AI Agent(Claude Code / Cursor / Codex / Gemini CLI 等)
  • 操作系统:Windows / macOS / Linux

第三方依赖

依赖项类型是否必需获取方式
LLM APIAPI必需由 Agent 内置 LLM 提供
JSON Schema 校验库(可选)代码库可选如 ajv(JS)/ jsonschema(Python),用于输出校验

API Key 配置

  • 本技能基于 Markdown 指令,无需额外 API Key(LLM 由 Agent 平台提供)

可用性分类

  • 分类:MD+EXEC(纯 Markdown 指令,部分高级功能需 exec 执行校验脚本)
  • 说明:基于 Markdown 的 AI Skill,通过自然语言指令驱动 Agent 进行 Prompt 工程与任务编排

Related skills

整合4个互补skill的营销组合包,覆盖Agents等领域。组合内各skill协同工作,提供从数据输入到结果输出的端到端处理能力。针对AI能力集成成本高、agent-copilot-pro: 存在门槛高问题 (复杂)等痛点提供解决方案。包含4个经质量审核的skill,整体评分81.5分。以agent-copilot-pro为核心,搭配互补skill形成完整工作流。

1 installs

将AI代理从被动任务跟随者转变为主动伙伴的架构。覆盖六大支柱、 WAL协议、工作缓冲区、压缩恢复、安全加固、自我改进护栏、 心跳系统与增长循环。可自发提升工作效率. 适用于需要proactive agent相关能力的开发场景,包含结构化的工作流程和可复用的模板,帮助用户快速完成任务并保持代码质量.该技能适用于相关开发场景,包含结构化的工作流程和配置指引.经过深度差异化处置,针对用户反馈和使用痛点进行了改进,提升了实用性和可操作性.

2 installs

当需要测试 AI Agent(智能体、聊天机器人、AI 助手)时使用此技能。Agent 测试和传统功能测试完全不同——你要测的不是"点按钮看结果",而是它的推理链路、工具调用时机、幻觉率、Prompt 注入防护、角色边界保持和记忆一致性。如果 Agent 能乱调用工具或泄漏系统 Prompt,那就是安全事件。⚠️ Agent 测试必须包含功能安全可控可靠九维覆盖,缺一不可。 本技能属于 QA Test Skills 技能集(49 个技能之一),完整工作流体验需安装全套:npx skills add Kokxi/qa-test-skills

2 installs

AI Agent开发决策辅助系统。用户提出Agent应用想法,自动从技术选型、竞品格局、市场前景、行业趋势、开发可行性、系统稳定性、成本预算、推广策略8大维度进行综合分析,生成专业交互式HTML可行性决策报告。覆盖LLM选型/Agent框架/架构模式/幻觉控制/Token成本/RAG方案/Prompt工程/评测体...

3 installs1 stars

支持多Agent流水线编排(采集→分析→报告),基于DAG调度实现跨技能状态共享、错误重断点续传、执行报告生成、HTML甘特图可视化、人工审批节点(含超时策略)、历史执行对比、硬件自适应参数和版本更新提醒。v5.3新增官方流水线模板库(4类预置模板+依赖探测)、任务级重试策略(节点级retry块+退避+降级链)、节点类型归组(7→4类认知归组)、错误恢复命令合并(recover统一入口)、条件表达式增强(re_safe+字符串函数)。AI即编排器,脚本提供基础设施。

Agent 孵化器,聚焦「孵化 Agent」这一核心场景。从业务需求出发,自动完成 Agent 的骨架搭建、能力封装和发布。 核心工作流:需求沟通 → 场景大纲 → 创建基础版 Agent → skill 按需迭代(AI 内部工作节奏,用户不感知技术细节)。 触发场景:(1) 用户说"设计/创建一个Agent"、"帮我做个智能助手";(2) 用户说"给 Agent 增加XX能力";(3) 企业级 Agent 体系规划(配合 enterprise-agent-planner)。 设计原则:AI 隐藏技术细节;先跑 MVP 再迭代;Agent = 配置 + skill 包。 融合思想:吴明辉(组织视角)+ 吴恩达(方法视角)+ 傅盛(落地视角)。

5 installs