Compress and decompress text files using smart abbreviation and whitespace normalization. Use when user asks to compress, shrink, reduce, or optimize text fi...
Coding
文本语义压缩器(免费版)
Try it面向长文本场景的语义压缩工具,通过迭代验证与锚点校验机制,在保证关键信息完整的前提下大幅缩减Token占用。核心能力:,可自发提升工作效率. 适用于需要file compressor相关能力的开发场景,包含结构化的工作流程和可复用的模板,帮助用户快速完成任务并保持代码质量. 适用于需要file compressor相关能力的开发场景,包含结构化的工作流程和配置指引.
What it does
面向长文本场景的语义压缩工具,通过迭代验证与锚点校验机制,在保证关键信息完整的前提下大幅缩减Token占用。核心能力:,可自发提升工作效率. 适用于需要file compressor相关能力的开发场景,包含结构化的工作流程和可复用的模板,帮助用户快速完成任务并保持代码质量. 适用于需要file compressor相关能力的开发场景,包含结构化的工作流程和配置指引.
The skill document
文本语义压缩器(免费版)
面向长文本场景的语义压缩工具,通过迭代验证与锚点校验机制,在保证关键信息完整的前提下大幅缩减Token占用.
概述
本工具不是位级无损压缩,而是语义级压缩——保留信息含义的同时降低文本冗余。设计目标:
- 关键信息保真:数字、人名、日期等锚点必须精确还原
- 迭代验证收敛:最多3轮迭代确保压缩后信息可还原
- 级别可调:L1(0.8x)适合人类阅读,L2(0.5x)适合系统提示词
- ROI透明:压缩本身消耗3-4次LLM调用,需多次复用才划算
已知限制
这是语义压缩,不是位级无损压缩。
- L1-L2:经验证可还原,生产环境可用
- L3-L4:实验性,可能丢失细微信息
- 严禁用于:医疗剂量、法律文本、金融数据、安全关键数据
- 当前为免费版本,如需完整功能请升级到付费版获取全部能力
核心能力
| 能力 | 描述 | 免费版限制 |
|---|---|---|
| L1压缩 | 轻度压缩,0.8x压缩比,可读性高 | 不限 |
| L2压缩 | 中度压缩,0.5x压缩比,适合提示词 | 不限 |
| L3压缩 | 重度压缩,0.3x压缩比,实验性 | ❌ 禁用 |
| L4压缩 | 极限压缩,0.15x压缩比,研究用 | ❌ 禁用 |
| 锚点校验 | 提取关键事实作为压缩基准 | 自动提取 |
| 迭代验证 | 最多3轮收敛验证 | 支持 |
| ROI预估 | 计算盈亏平衡点 | 基础估算 |
| 格式策略 | 针对Markdown/JSON/代码等不同格式 | 基础策略 |
核心功能执行
用input_params参数进行配置.
处理: 解析核心功能执行的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回核心功能执行的响应数据,包含状态码、结果和日志.
- 执行此能力时使用
input_params参数,支持创建/查询/导出操作
参数配置与调用
用config_options参数进行配置.
处理: 解析参数配置与调用的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回参数配置与调用的响应数据,包含状态码、结果和日志.
- 执行此能力时使用
config_options参数,支持修改/重置/导入操作
结果处理与输出
用output_format参数进行配置.
处理: 解析结果处理与输出的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回结果处理与输出的响应数据,包含状态码、结果和日志.
- 执行此能力时使用
output_format参数,支持导出/保存/转换操作 能力覆盖范围:本skill的核心能力覆盖以下场景关键词:基于迭代验证与锚、点校验的语义文本、压缩工具、级别可靠还原、适合提示词优化、面向长文本场景的、语义压缩工具、通过迭代验证与锚、点校验机制、在保证关键信息完、整的前提下大幅缩、Token、核心能力等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持.
快速开始
- 确认运行环境满足依赖说明中的要求
- 在AI Agent对话中调用本技能,提供必要的输入参数
- 检查输出结果,根据需要进行后续处理
详细的输入输出格式请参考下方章节说明。
使用场景
场景1:系统提示词压缩(开发者角色)
开发者有一个2000 Token的系统提示词,需要在不同LLM间复用,但部分模型上下文窗口受限:
压缩前(2000 Tokens):
"你是一位资深的Python工程师,擅长处理数据分析任务.
你的回答应该结构清晰,包含以下部分:
1. 问题理解
2. 解决方案设计
3. 代码实现
4. 测试用例
5. 性能分析
..."
# ...
压缩后(L2,约1000 Tokens):
"资深Python工程师,专注数据分析。回答需含:问题理解→方案设计→代码→测试→性能分析5部分。"
场景2:知识库内容精简(知识管理者角色)
知识库中存储了100篇技术文档,希望降低检索时的Token消耗:
原文(5000 Tokens):"在分布式系统中,CAP定理指出一致性(Consistency)、可用性(Availability)、分区容错性(Partition tolerance)三个属性无法同时满足..."
# ...
L1压缩(4000 Tokens):"CAP定理:分布式系统中一致性、可用性、分区容错性三者不可兼得..."
场景3:对话历史压缩(聊天应用开发者角色)
长对话中历史消息累积过多,需要压缩以保留上下文:
原始历史(8000 Tokens):
用户:帮我设计一个用户登录系统
助手:好的,让我帮你设计。首先需要...
用户:那么密码应该如何存储?
助手:密码存储应该使用bcrypt...
# ...
L2压缩(4000 Tokens):
[历史] 用户问登录系统设计→助手给出方案;用户问密码存储→助手建议bcrypt...
场景4:报告摘要生成(内容创作者角色)
将冗长的技术报告压缩为可分享的摘要:
原文(10000 Tokens):详细的市场分析报告...
L1压缩(8000 Tokens):保留全部要点,去除冗余表达...
使用流程
Step 1:准备待压缩文本
确认文本非安全关键数据(非医疗、法律、金融).
Step 2:识别锚点
提取必须精确还原的关键事实:
[ANCHORS: 3个人名(张三/李四/王五), $42,000, 2024-03-15, "项目Alpha"]
Step 3:执行L2压缩
将原文压缩至L2级别(约0.5x).
Step 4:迭代验证
将压缩结果重构成新文本,与原文锚点对比:
- 锚点全部匹配 ✓ → 压缩成功
- 锚点部分缺失 → 补充缺失信息,重新压缩
- 最多3轮迭代,仍未收敛说明级别过激,降级使用
验证循环
1. 压缩原文O → 压缩结果C
2. 从O中提取锚点(实体、数字、日期)
3. 不查看O,从C还原为R
4. 验证:锚点匹配 + 语义差异
5. 如有差异 → 用缺失信息修正C
6. 重复直到验证通过(最多3轮迭代)
收敛即验证通过。3轮未收敛说明压缩级别过激,应降级。
压缩级别详解
| 级别 | 压缩比 | 可靠性 | 适用场景 | 免费版 |
|---|---|---|---|---|
| L1 | ~0.8x | 高 | 人类阅读、对外分享 | ✅ |
| L2 | ~0.5x | 良好 | 系统提示词、重复使用 | ✅ |
| L3 | ~0.3x | 中等 | 实验性,需审查 | ❌ |
| L4 | ~0.15x | 低 | 研究用,预期丢失 | ❌ |
锚点校验系统
压缩前必须提取关键事实作为锚点:
[ANCHORS: 3 people, $42,000, 2024-03-15, "Project Alpha"]
重构结果必须精确还原这些锚点。锚点不匹配即压缩失败,需重新迭代. 锚点类型:
- 数字:金额、数量、百分比
- 命名实体:人名、地名、组织名
- 日期时间:精确到日
- 关键引用:专有名词、项目名
示例
锚点提取规则
# anchor-rules.yaml
anchor_types:
numbers:
patterns:
- "\\$[\\d,]+" # 金额
- "\\d+(?:\\.\\d+)?%" # 百分比
- "\\d{4}-\\d{2}-\\d{2}" # 日期
# ...
entities:
types: [person, organization, location]
min_confidence: 0.8
# ...
quotes:
pattern: '"[^"]+"'
min_length: 3
# ...
preserve_source: true # 锚点保留原文不压缩
压缩配置
# compress-config.yaml
level: L2 # 压缩级别
max_iterations: 3 # 最大迭代次数
target_ratio: 0.5 # 目标压缩比
anchor_strict: true # 锚点严格匹配
format_aware: true # 格式感知(保留代码块、列表等结构)
language: zh # 目标语言
report_confidence: true # 输出置信度报告
优秀实践
- 生产环境只用L1-L2:L3-L4仅在实验或可接受信息丢失时使用
- 锚点必提取:所有数字、人名、日期、关键引用都应作为锚点
- 多次复用才划算:压缩本身消耗3-4次LLM调用,复用6-8次以上才回本
- 单次使用不压缩:仅一次性使用的内容直接用原文
- 格式感知开启:保留代码块、表格、列表的结构性,避免格式破坏
- 不同模型验证:使用与压缩不同的模型重构,提高验证可靠性
- 重要数据双校验:关键信息压缩后人工复核一次
- 保留原文备份:压缩结果与原文并存,便于追溯
常见问题
Q1:压缩后内容为什么会有细节丢失?
A:这是语义压缩的本质特征,非位级无损。L1-L2级别丢失较少,L3-L4级别丢失较多.
Q2:迭代3轮仍未收敛怎么办?
A:说明当前压缩级别过激,应降级(如从L3降到L2),或调整锚点提取规则.
Q3:哪些内容严禁压缩?
A:医疗剂量、法律条款、金融数据、安全关键指令、合同条款等精确性要求高的内容.
Q4:压缩成本如何计算?
A:每次压缩消耗3-4次LLM调用(压缩+锚点提取+重构+验证)。复用6-8次以上才回本.
Q5:免费版为何限制L3-L4?
A:L3-L4属于实验性压缩,可靠性较低。专业版提供L3-L4访问,并配套高级验证策略.
Q6:压缩对哪些格式效果优秀?
A:自然语言文本压缩效果优秀(结构松散);代码压缩效果最差(语法严格);表格与列表居中.
错误处理
| 错误场景(现象) | 可能原因 | 解决步骤 | 优先级 |
|---|---|---|---|
| 锚点不匹配 | 压缩过程中丢失 | 增加锚点提取严格度,重新迭代 | P0 |
| 迭代不收敛 | 级别过激 | 降级至L1或L2 | P0 |
| 压缩比不达预期 | 文本已较紧凑 | 接受当前压缩比,或尝试L3(专业版) | P1 |
| 格式被破坏 | 格式感知未启用 | 启用format_aware: true | P1 |
| 重构偏差大 | 模型能力不足 | 使用更强模型重构,或更换压缩模型 | P2 |
| 置信度低 | 锚点数量不足 | 增加锚点类型(如添加专有名词) | P2 |
依赖说明
运行环境
- Agent平台:支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
- 操作系统:Windows / macOS / Linux
- 存储:本地文件系统(用于保存压缩结果与原文备份)
依赖详情
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent平台内置LLM提供 |
API Key 配置
- LLM API Key:由Agent平台内置,无需单独配置
- 建议:压缩与重构使用不同模型,提升验证可靠性
可用性分类
- 分类:MD(纯Markdown指令驱动,无需exec命令行能力)
- 说明:基于Markdown的AI Skill,通过自然语言指令驱动Agent调用LLM完成压缩与验证
免费版限制
本免费体验版聚焦个人开发者提示词优化场景,限制以下高级能力:
- ❌ L3重度压缩(0.3x压缩比)
- ❌ L4极限压缩(0.15x压缩比)
- ❌ 批量压缩与流水线编排
- ❌ 自定义锚点策略与正则规则
- ❌ 跨格式智能策略(代码/JSON/YAML独立优化)
- ❌ 多模型并行验证
- ❌ 压缩质量量化报告
- ❌ 压缩历史与版本管理
解锁全部高级能力请使用专业版:file-compressor-pro
Related skills
PDF压缩工具免费版,通过API上传PDF文件进行压缩处理,支持图像质量参数调整(如75/85/95)和DPI分辨率设置(如144/300)。上传后通过轮询机制获取任务状态,完成后返回下载链接供用户获取压缩后的文件。适用于文档归档、邮件附件优化、网页上传文件大小限制等需要减小PDF文件体积的常见场景。 功能涵盖: compress。
上下文压缩器专业版是Agent记忆管控的完整压缩方案。在免费版基础上解锁成批压缩自发化、智能分类归档(决策/教训/待办/事实/偏好五类)、增量压缩(仅处置新增内容)、压缩质量评分(信息保留率量化评估)、自定义输出模板、压缩历史追踪、多语言混合日志调优七大高级功能。Use when 需要文本翻译、多语言转换、本地化处理时使用。不适用于专业医学法律翻译认证。
PDF压缩工具 - (专业版)。可产出提升工作效率. 在需要compress pdf tool相关能力的开发场景,提供工作流程和配置参考。上传PDF文件,设置图像质量和DPI,获取压缩后下载链接。**示例指令**:` `压缩这个PDF文件。适用于独立开发者、企业团队和自动化工作流场景,提供结构化输出与错误处理机制,支持中文交互,即开即用
大模型 Token 成本节约工具。在请求到达大模型之前自动压缩 prompt 和上下文,减少 60-95% 的 token 消耗,直接降低 API 成本。支持 Claude/OpenAI/Gemini 等主流模型,提供代理模式、CLI 包装、Python SDK 和 MCP Server 四种接入方式。内置一键安...
对图片进行智能压缩优化。支持本地路径、文件夹和远程 URL,直传 NX API 压缩后返回 CDN 地址和压缩率。适用于用户提到图片压缩、图片优化、减小图片体积、TinyPNG、JPG/PNG/WebP 压缩的场景。