API账单太贵?6级优化+7步诊断+Pre-LLM压缩管道+CCR可逆压缩,逐项审计token消耗并量化优化。v1.5新增:headroom(26.7K⭐)的CCR模式(压缩→标记→按需恢复,零信息损失)+跨Agent缓存共享+失败会话挖掘。实测代码搜索省92%、SRE日志省92%、Issue分类省73%。 触发...
记忆
Token消耗优化器
试用API账单太贵?6级优化评分体系+7步诊断流程,逐项审计token消耗并量化优化。支持模型路由、预算预测、紧急降本剧本,同样的效果省60-90%。 触发词:省token、降低消耗、API费用高、成本控制、API太贵、批量调用省钱、RAG优化、Agent成本、token预算、降本增效、成本优化、模型切换、缓存策略、...
它能做什么
API账单太贵?6级优化评分体系+7步诊断流程,逐项审计token消耗并量化优化。支持模型路由、预算预测、紧急降本剧本,同样的效果省60-90%。 触发词:省token、降低消耗、API费用高、成本控制、API太贵、批量调用省钱、RAG优化、Agent成本、token预算、降本增效、成本优化、模型切换、缓存策略、prompt瘦身、成本预测 排除:模型推理速度优化、模型训练微调成本、硬件采购
技能文档
Token消耗优化器 💰
触发条件
- API费用太高/预算不够
- prompt/上下文太长
- 优化skill/Agent的token效率
- 对比不同模型成本
- RAG场景消耗过大
- 需要做预算规划
核心流程(7 Steps)
Step 1: 消耗诊断
审计7大消耗源:System Prompt/对话历史/SKILL加载/工具调用/references/RAG/输出长度
Step 2: 基线评分(6级体系)
- L0未优化→L1基础→L2标准→L3高级→L4精细→L5极致
- 量化每个消耗源token数,标记Top3大户
Step 3: 分层优化(P0-P5优先级)
- P0: Prompt瘦身(省30-75%)
- P1: SKILL瘦身≤5KB(省50-70%)
- P2: 历史管理(省60-80%)
- P3: 工具调用优化(省40-70%)
- P4: 输出控制(省30-60%)
- P5: 模型路由(省40-80%)
Step 4: 成本速算与对比
- 计算基线成本,多平台对比
Step 5: 预算预测
- 月/季成本预测+预警阈值
Step 6: 生成优化方案
- 含优先级/节省预估/实施难度/ROI
Step 7: 执行与验证
- A/B对比+质量检查(质量下降≤10%)
成本速算表(2026年6月)
| 模型 | 输入$/1M | 输出$/1M | 适合 |
|---|---|---|---|
| SiliconFlow 9B | 免费 | 免费 | 高频简单 |
| Gemini Flash | 0.10 | 0.40 | 超长文档 |
| GPT-4o-mini | 0.15 | 0.60 | 日常对话 |
| Haiku 3.5 | 0.25 | 1.25 | 高性价比 |
| GPT-4o | 2.50 | 10.00 | 复杂推理 |
紧急降本剧本
- 切换免费/低价模型(省80-100%)
- Prompt瘦身(省30-50%)
- 历史截断到3轮(省50-70%)
- 关闭非必要技能(省20-40%)
- 工具返回short模式(省30-60%)
- 部署结果缓存(省40-80%)
约束
- 质量下降≤10%
- 优先优化固定成本
- 给出量化预估
- 紧急方案标注恢复条件
Output Language
中文输出
相关技能
智能模型路由与Token成本优化顾问 / Smart LLM Router & Token Cost Optimizer. 帮助用户为不同复杂度的AI任务选择最合适的模型层级(从极致性价比到旗舰级), 通过任务复杂度评估、模型分级推荐、安全强制升级规则,在保证质量的前提下节省70-90%的Token成本。 同时提...
大模型 Token 成本节约工具。在请求到达大模型之前自动压缩 prompt 和上下文,减少 60-95% 的 token 消耗,直接降低 API 成本。支持 Claude/OpenAI/Gemini 等主流模型,提供代理模式、CLI 包装、Python SDK 和 MCP Server 四种接入方式。内置一键安...
Token 守护者是面向 AI Agent 的 token 成本优化系统,针对"压缩过度损失质量、语义缓存命中率低、缺乏模型路由、预算不可见不可控"四大高频痛点而设计。它用三层缓存(精确匹配/语义匹配/模式匹配)+ 自适应压缩 + 模型路由 + 预算守护,在不牺牲响应质量的前提下降低 50-80% 的 token...
大模型 Token 成本节约工具。在请求到达大模型之前自动压缩 prompt 和上下文,减少 60-95% 的 token 消耗,直接降低 API 成本。支持 Claude/OpenAI/Gemini 等主流模型,提供代理模式、CLI 包装、Python SDK 和 MCP Server 四种接入方式。内置一键安...
Agent token usage optimizer. Input usage logs, transcript excerpts, model bills, or runtime traces; output token/cost breakdown, waste patterns, context comp...