音频处理,涵盖音频处理和增强、内容理解等能力。包含能力:separate-voice, probe-audio-metadata。当用户需要使用 audio 域的 MediaKit CLI 能力时触发。
设计与多媒体
audio-enhancement-engine
试用当用户想要**音频增强**、**提升音质**、**修复录音**、**降噪**、**语音修复**、**高保真音频**、**48kHz超分辨率**、**清理会议录音**、**音乐音质提升**、**批量处理音频**时自动触发。 集成 **VoiceFixer**(通用语音修复)与 **AudioSR**(高保真音频超级分辨率到48kHz)两种专业技术,支持单个音频文件或整个目录批量处理。 默认使用 VoiceFixer 进行降噪和清晰度提升;当用户提到“高保真”“音乐增强”“提升采样率”“48kHz”等需求时,自动切换到 AudioSR 模式。 支持 wav、mp3、flac、m4a、ogg 等常见
它能做什么
当用户想要**音频增强**、**提升音质**、**修复录音**、**降噪**、**语音修复**、**高保真音频**、**48kHz超分辨率**、**清理会议录音**、**音乐音质提升**、**批量处理音频**时自动触发。 集成 **VoiceFixer**(通用语音修复)与 **AudioSR**(高保真音频超级分辨率到48kHz)两种专业技术,支持单个音频文件或整个目录批量处理。 默认使用 VoiceFixer 进行降噪和清晰度提升;当用户提到“高保真”“音乐增强”“提升采样率”“48kHz”等需求时,自动切换到 AudioSR 模式。 支持 wav、mp3、flac、m4a、ogg 等常见格式,完全本地运行,输出统一为高质量 WAV 文件。 【重要约束】仅处理音频文件或音频文件夹,其他文件(如视频、图片、文档、纯文本)一律不触发此技能。 常见触发口语(越多越好): - “帮我增强这个音频” - “修复这个录音的音质” - “给这个语音降噪” - “把这个音频提升到高保真” - “音乐音质增强 这个.mp3” - “批量处理音频文件夹” - “清理会议录音” - “提升音频采样率到48kHz” - “语音修复 这个 wav 文件” - “高保真增强音频” - “老旧录音修复” - “音频增强 目录路径”
技能文档
Audio Enhancement Skill
功能:本地音频增强与修复统一工具,集成 VoiceFixer(语音降噪/修复)和 AudioSR(高保真超级分辨率)。支持单文件与目录批量处理,自动适配最合适的增强模式,输出清晰、高质量的 48kHz WAV 文件。
触发时机(Triggers)
- 用户提供音频文件(.wav、.mp3、.flac、.m4a、.ogg 等)或音频文件夹路径,并表达增强音质、修复、降噪、高保真等意图。
- 用户说“音频增强”“修复录音”“降噪”“提升音质”“高保真”“48kHz”等关键词。
- 支持单个文件处理或整个文件夹批量处理(支持递归子目录)。
支持的两种增强模式
-
VoiceFixer 通用语音修复(默认模式)
- 擅长语音降噪、提升清晰度、修复轻微失真。
- 推荐用于:会议录音、访谈、播客、语音笔记、老旧录音。
-
AudioSR 高保真音频超级分辨率(启用
--hifi时)- 将音频提升至 48kHz,显著增加高频细节和整体保真度。
- 推荐用于:音乐、演唱、人声、需要高音质的场景。
参数提取指南
当决定调用此技能时,请从用户消息中准确提取以下参数:
<输入路径>(必填): 用户提供的音频文件路径或文件夹路径(支持相对/绝对路径)。<输出路径>(选填): 用户指定的输出文件或目录路径。若未指定,默认在输入同级目录自动添加_enhanced后缀。<模式选择>(选填):- 默认使用 VoiceFixer。
- 若用户提到“高保真”“音乐”“48kHz”“超分辨率”等,自动添加
--hifi并使用 AudioSR。
- VoiceFixer 专用参数(默认模式):
--mode:0/1/2(推荐 1,默认 1)--cuda:是否使用 GPU-r, --recursive:是否递归子目录
- AudioSR 专用参数(
--hifi模式):--model_name:basic或speech(人声推荐 speech)--ddim_steps:扩散步数(默认 50,建议 50-100)--guidance_scale:引导尺度(默认 3.5)--seed:随机种子(默认 42)--device:cuda或cpu
执行步骤
-
解析路径:识别用户提供的音频文件或文件夹路径。
-
模式判断:根据用户意图判断使用 VoiceFixer(默认)还是 AudioSR(含
--hifi)。 -
默认目标:若未指定输出路径,默认在输入目录生成带
_enhanced_48k(AudioSR)或_enhanced(VoiceFixer)后缀的文件。 -
调用命令:使用以下兼容性命令启动脚本(优先
python3,失败则python)。脚本会自动检查环境、初始化模型并处理。(python3 scripts/enhancer.py -i "<输入路径>" [-o "<输出目录>"] [-m <0|1|2>] [--cuda] [-r] [--hifi] [--model_name ] [--ddim_steps <数值>] [--guidance_scale <数值>] [--seed <数值>] [--device ] [--re] [--nfe <数值>] [--solver ] [--lambd <数值>] [--tau <数值>]) || (python scripts/enhancer.py -i "<输入路径>" [-o "<输出目录>"] [-m <0|1|2>] [--cuda] [-r] [--hifi] [--model_name ] [--ddim_steps <数值>] [--guidance_scale <数值>] [--seed <数值>] [--device ] [--re] [--nfe <数值>] [--solver ] [--lambd <数值>] [--tau <数值>])
相关技能
当用户想要**把长音频切成小段**、**音频切片**、**音频分割**、**把音频分成固定时长片段**、**制作语音数据集**、**准备Karaoke素材**、**翻唱音频切片**时自动触发。 支持单个音频文件或整个文件夹(支持递归),自动用 ffmpeg 把音频按指定秒数切成小片段,完美保留原始文件夹结构,并智能选择输出路径。 常见触发口语: - “帮我把这个音频切成60秒一段” - “把这个长音频分割成小段” - “音频切片,这个文件夹” - “把语音文件切成每段30秒” - “制作数据集,把音频切片” - “Karaoke素材切片” - “翻唱音频分割” - “把MP3切成小段” -
当用户想要**音频转文字**、**语音转文本**、**转录录音**、**生成字幕**、**会议录音转文字**、**语音笔记转文本**、**本地转录音频**时自动触发。 使用本地 Faster-Whisper(large-v3-ct2 等模型)进行高性能、中文优先的音频转文字,完全离线、隐私安全,支持 wav/mp3/m4a 等格式和整个音频文件夹。 特别适合长音频(内置 VAD 分段)、会议/访谈/视频字幕等中文场景,输出结构化结果(完整文本 + 分段 + 时间戳)。 【重要约束】仅处理音频文件或音频文件夹,其他文件(如视频、图片、纯文本)一律不触发此技能。 常见触发口语(越多越好): -
当用户想要**一键批量从音频文件中提取超干净纯人声(干声 / Vocals Only)**、去除伴奏/背景音乐时,自动调用此技能。 一键音频人声分离工具。专门从音频文件(.mp3/.wav/.flac等)中提取超干净干声(Acapella)或去除背景音制作伴奏。 核心用途:支持单个音频文件或整个文件夹批量处理(.mp3/.wav/.flac 等格式),输出高质量无杂音干声,自动在输入同级创建 [输入文件夹]_vocals 文件夹,完美保留原目录结构。 高频触发场景包括: - 翻唱练习、翻唱视频制作、B站/抖音/小红书演唱素材清洗 - 卡拉OK 伴奏制作(只保留人声) - 音乐制作中的人声分
通过 Flyelep AI 工具接口增强图片清晰度,支持单张或批量处理。 当用户要求做 AI 超清、提升图片清晰度、批量增强模糊图片时使用此技能。
批量将指定目录下的 .mp4 视频文件提取音频转为 .mp3。 支持指定源目录和输出目录,未指定输出时默认创建 [源目录]_audio 文件夹。 自动管理 Python 虚拟环境,保持文件夹层级结构,兼容 python3 和 python。 高频触发词:mp4转mp3、视频转音频、批量提取音频、mp4 to mp3、extract audio from videos、听视频、提取网课音频、把视频里的声音抠出来、视频转mp3。