当用户想要**音频增强**、**提升音质**、**修复录音**、**降噪**、**语音修复**、**高保真音频**、**48kHz超分辨率**、**清理会议录音**、**音乐音质提升**、**批量处理音频**时自动触发。 集成 **VoiceFixer**(通用语音修复)与 **AudioSR**(高保真音频超级分辨率到48kHz)两种专业技术,支持单个音频文件或整个目录批量处理。 默认使用 VoiceFixer 进行降噪和清晰度提升;当用户提到“高保真”“音乐增强”“提升采样率”“48kHz”等需求时,自动切换到 AudioSR 模式。 支持 wav、mp3、flac、m4a、ogg 等常见
Design & media
audio-segmenter
Try it当用户想要**把长音频切成小段**、**音频切片**、**音频分割**、**把音频分成固定时长片段**、**制作语音数据集**、**准备Karaoke素材**、**翻唱音频切片**时自动触发。 支持单个音频文件或整个文件夹(支持递归),自动用 ffmpeg 把音频按指定秒数切成小片段,完美保留原始文件夹结构,并智能选择输出路径。 常见触发口语: - “帮我把这个音频切成60秒一段” - “把这个长音频分割成小段” - “音频切片,这个文件夹” - “把语音文件切成每段30秒” - “制作数据集,把音频切片” - “Karaoke素材切片” - “翻唱音频分割” - “把MP3切成小段” -
What it does
当用户想要**把长音频切成小段**、**音频切片**、**音频分割**、**把音频分成固定时长片段**、**制作语音数据集**、**准备Karaoke素材**、**翻唱音频切片**时自动触发。 支持单个音频文件或整个文件夹(支持递归),自动用 ffmpeg 把音频按指定秒数切成小片段,完美保留原始文件夹结构,并智能选择输出路径。 常见触发口语: - “帮我把这个音频切成60秒一段” - “把这个长音频分割成小段” - “音频切片,这个文件夹” - “把语音文件切成每段30秒” - “制作数据集,把音频切片” - “Karaoke素材切片” - “翻唱音频分割” - “把MP3切成小段” - “递归切片整个音频文件夹” 支持格式:mp3、wav、m4a、ogg、flac 等常见音频。 只处理音频切片相关需求,其他音频处理(如转格式、降噪)不触发。
The skill document
Audio-Segmenter
功能:一键把长音频切成固定时长的片段,专为语音训练、素材整理、翻唱/Karaoke 准备、数据集制作设计。完美保持原文件夹结构 + 智能默认输出路径 + 自动处理 ffmpeg。
触发时机(Triggers)
- 用户提到“音频切片”“切成小段”“分割音频”“切片”“分段”“每段XX秒”等词,并提供音频文件路径或文件夹。
- 用户说“帮我处理这个长音频”“制作语音数据集”“Karaoke素材准备”等场景。
- 支持单个文件或整个文件夹(可递归)。
支持的音频格式
.mp3 / .wav / .m4a / .ogg / .flac / .aac / .wma 等(pydub 支持的所有常见格式)
参数说明(默认值)
- -i → 输入路径(必填,支持单个文件或文件夹)
- -d → 每段切片时长(秒),默认 60
- -o → 输出目录(不传则智能选择:单文件同目录,文件夹则在同级创建 [输入文件夹名]_sliced_audio)
- -r → 文件夹模式下是否递归子文件夹(默认否)
参数提取指南
当决定调用此技能时,请从用户上下文中提取以下参数:
<输入路径>(必填): 用户提供的音频文件路径或文件夹路径。<切片秒数>(选填): 用户指定的每段时长(秒),未提则默认 60。<输出目录>(选填): 用户指定的输出路径,未指定则使用智能默认。- 递归标志 (
-r): 用户提到“递归”“所有子文件夹”时添加。
执行步骤
-
解析路径:自动识别用户的输入是单个音频文件还是文件夹。
-
默认输出:未指定 -o 时,单文件输出到源目录附近,文件夹则在同级创建带 _sliced_audio 的新文件夹,并保留原始目录结构。
-
调用命令:使用以下兼容性命令启动脚本(优先 python3,失败则 python)。脚本会自动创建虚拟环境、检测并安装 ffmpeg。
(python3 scripts/audio_slicer.py -i "<输入路径>" [-d <切片秒数>] [-o "<输出目录>"] [-r]) || (python scripts/audio_slicer.py -i "<输入路径>" [-d <切片秒数>] [-o "<输出目录>"] [-r])
Related skills
从一段直播录屏(.webm/.mp4/.mov)中自动识别高光时刻并切割为多个短视频片段,支持音频能量、场景变化、音画混合、音画并集和 ASR 关键词五种分析方式,可输出独立片段与合并版视频。适用于“直播录屏自动剪高光”“从回放里切出主播情绪高点”“按声音峰值提取精彩片段”这类任务。
音频处理,涵盖音频处理和增强、内容理解等能力。包含能力:separate-voice, probe-audio-metadata。当用户需要使用 audio 域的 MediaKit CLI 能力时触发。
当用户想要【录制电脑声音、内录系统音频、捕获声卡输出、AI智能分轨切歌、自动裁剪录音前后空白/杂音】时自动触发。 专门用于对系统播放的音乐、串烧、整张专辑、网课等音频进行高保真内录,并提供基础静音切分与基于 PyTorch 的 AI 音乐结构分析分轨功能。 用户只需提供录制时长(分钟),即可自动启动后台录音,结束后按要求精细裁剪并导出。 常见触发口语: - “帮我录音 5 分钟” - “录制电脑正在播放的声音,录 3 分钟” - “把电脑现在放的歌录下来,时长 4 分钟” - "内录系统声音 10 分钟,帮我用 AI 自动切歌分轨" - “帮我录制这段音乐,把前后的空白和杂音自动剪掉” -
批量将指定目录下的 .mp4 视频文件提取音频转为 .mp3。 支持指定源目录和输出目录,未指定输出时默认创建 [源目录]_audio 文件夹。 自动管理 Python 虚拟环境,保持文件夹层级结构,兼容 python3 和 python。 高频触发词:mp4转mp3、视频转音频、批量提取音频、mp4 to mp3、extract audio from videos、听视频、提取网课音频、把视频里的声音抠出来、视频转mp3。
当用户想要**音频转文字**、**语音转文本**、**转录录音**、**生成字幕**、**会议录音转文字**、**语音笔记转文本**、**本地转录音频**时自动触发。 使用本地 Faster-Whisper(large-v3-ct2 等模型)进行高性能、中文优先的音频转文字,完全离线、隐私安全,支持 wav/mp3/m4a 等格式和整个音频文件夹。 特别适合长音频(内置 VAD 分段)、会议/访谈/视频字幕等中文场景,输出结构化结果(完整文本 + 分段 + 时间戳)。 【重要约束】仅处理音频文件或音频文件夹,其他文件(如视频、图片、纯文本)一律不触发此技能。 常见触发口语(越多越好): -