当用户想要**把长音频切成小段**、**音频切片**、**音频分割**、**把音频分成固定时长片段**、**制作语音数据集**、**准备Karaoke素材**、**翻唱音频切片**时自动触发。 支持单个音频文件或整个文件夹(支持递归),自动用 ffmpeg 把音频按指定秒数切成小片段,完美保留原始文件夹结构,并智能选择输出路径。 常见触发口语: - “帮我把这个音频切成60秒一段” - “把这个长音频分割成小段” - “音频切片,这个文件夹” - “把语音文件切成每段30秒” - “制作数据集,把音频切片” - “Karaoke素材切片” - “翻唱音频分割” - “把MP3切成小段” -
Coding
Music Toolkit
Try it当用户想要【录制电脑声音、内录系统音频、捕获声卡输出、AI智能分轨切歌、自动裁剪录音前后空白/杂音】时自动触发。 专门用于对系统播放的音乐、串烧、整张专辑、网课等音频进行高保真内录,并提供基础静音切分与基于 PyTorch 的 AI 音乐结构分析分轨功能。 用户只需提供录制时长(分钟),即可自动启动后台录音,结束后按要求精细裁剪并导出。 常见触发口语: - “帮我录音 5 分钟” - “录制电脑正在播放的声音,录 3 分钟” - “把电脑现在放的歌录下来,时长 4 分钟” - "内录系统声音 10 分钟,帮我用 AI 自动切歌分轨" - “帮我录制这段音乐,把前后的空白和杂音自动剪掉” -
What it does
当用户想要【录制电脑声音、内录系统音频、捕获声卡输出、AI智能分轨切歌、自动裁剪录音前后空白/杂音】时自动触发。 专门用于对系统播放的音乐、串烧、整张专辑、网课等音频进行高保真内录,并提供基础静音切分与基于 PyTorch 的 AI 音乐结构分析分轨功能。 用户只需提供录制时长(分钟),即可自动启动后台录音,结束后按要求精细裁剪并导出。 常见触发口语: - “帮我录音 5 分钟” - “录制电脑正在播放的声音,录 3 分钟” - “把电脑现在放的歌录下来,时长 4 分钟” - "内录系统声音 10 分钟,帮我用 AI 自动切歌分轨" - “帮我录制这段音乐,把前后的空白和杂音自动剪掉” - “开启 AI 专辑模式录音 30 分钟,帮我把每首歌单独切出来” - “系统声音内录工具” - “AI 音频录制与分轨器” - “帮我录制整张专辑,时长 45 分钟”
The skill document
music-toolkit
功能:智能声卡回环录音与 AI 音频结构化分轨引擎。专为 OpenClaw Skill 生态设计,可实现 100% 纯净的电脑内部声音捕获(无外环境噪音),并利用 AI 精准识别歌曲边界。
触发时机(Triggers)
- 用户发出“录音”“内录”“录制电脑声音”“捕获声卡”等明确指令,并指出时间(如“3分钟”、“30秒”)。
- 用户在录音请求中提到“AI切歌”“自动分轨”“专辑模式”“剪掉前后空白”“剔除尾随杂音”等关键词。
参数提取指南
当 LLM 决定调用此技能时,请从用户上下文中精确提取并映射以下参数:
duration(数字/浮点数, 必填): 录制总时长。LLM 必须将其一律转换为分钟数(例如:“录音30秒”转换为0.5;“录音1.5小时”转换为90;“录制4分钟”转换为4)。对应命令行-t。filename-prefix(字符串, 选填): 用户明确指定的保存文件名前缀或单曲标题。对应命令行-p。save-dir(字符串, 选填): 用户指定的单曲输出路径。若未指定,无需传递(默认record)。对应命令行-d。auto-trim(布尔值, 选填): 当用户提到“剪掉空白”“切除静音”“不要前后杂音”时,此项为True。对应命令行-trim。ai-split(布尔值, 选填): 当用户提到“AI切歌”“自动分轨”“专辑整轨录制”时,此项为True(激活后将调用allin1深度学习模型)。对应命令行-ai。silence-thresh(数字, 选填): 静音分贝阈值 (dBFS),例如用户说“分贝调严格一点”可以适当调低。对应命令行-sh。min_silence_len(数字, 选填): 判定为静音的最短时间 (毫秒)。对应命令行-msl。
内部核心技术方案
- 高保真回环内录:通过
soundcard库的include_loopback=True机制,直接在操作系统内部拦截输出给扬声器的数字信号,实现高保真(48kHz 采样率)录音,完美避开麦克风外噪。 - 第一阶段:VAD 静音粗切:利用
pydub.silence识别大于 1.5 秒的静音间隙,将长录音切成独立的音频块,并在两端故意保留 1 秒缓冲,防止截断前奏或尾音。 - 第二阶段:AI 结构级精对齐:将音频块送入 PyTorch 的
allin1音乐模型,深度分析intro(前奏)、verse(主歌)、chorus(副歌)、outro(尾奏) 等音乐边界,像素级切除死寂和杂音,精准释放成品。 - 强壮的降级容错 (Fallback):若某段音频不适用 AI 模型分析而报错,系统会自动降级为常规 VAD 切分版本保存,确保整张专辑的录制流水线不会中断。
执行步骤与命令生成
LLM 识别用户意图并提取参数后,应在后台组合并执行以下标准命令行。优先使用 python3 启动,若失败则用 python 兜底:
场景 1:基础系统录音 + 自动切除前后空白
适用于录制单首歌曲、单段音频
(python3 scripts/media_grabber.py -t -trim [-p ""] [-d ""]) || (python scripts/media_grabber.py -t -trim [-p ""] [-d ""])
Related skills
Music discovery and creative audio planning companion for finding songs, checking singing range, drafting lyrics, and preparing AI music generation briefs.
Generate songs, instrumentals, or lyrics-driven tracks through a structured OpenClaw-native workflow with anti-sparse prompt engineering and quality verification. Provider-agnostic — works with any music backend the runtime exposes (ACE-Step, MusicGen, Stable Audio, mmx).
端到端 AI 音乐创作技能:用户录制一段自己的声音 + 自己写的歌词 + 风格要求(或让 AI 推荐风格/问问题),生成一首用本人音色演唱的完整歌曲。集成 2026 年最先进 AI 音乐技术栈——零样本语音克隆(So-VITS-SVC 4.1)、端到端音乐生成(Suno v4)、AI 歌词创作(LyricsGPT...
当用户想要**音频转文字**、**语音转文本**、**转录录音**、**生成字幕**、**会议录音转文字**、**语音笔记转文本**、**本地转录音频**时自动触发。 使用本地 Faster-Whisper(large-v3-ct2 等模型)进行高性能、中文优先的音频转文字,完全离线、隐私安全,支持 wav/mp3/m4a 等格式和整个音频文件夹。 特别适合长音频(内置 VAD 分段)、会议/访谈/视频字幕等中文场景,输出结构化结果(完整文本 + 分段 + 时间戳)。 【重要约束】仅处理音频文件或音频文件夹,其他文件(如视频、图片、纯文本)一律不触发此技能。 常见触发口语(越多越好): -
当用户想要**音频增强**、**提升音质**、**修复录音**、**降噪**、**语音修复**、**高保真音频**、**48kHz超分辨率**、**清理会议录音**、**音乐音质提升**、**批量处理音频**时自动触发。 集成 **VoiceFixer**(通用语音修复)与 **AudioSR**(高保真音频超级分辨率到48kHz)两种专业技术,支持单个音频文件或整个目录批量处理。 默认使用 VoiceFixer 进行降噪和清晰度提升;当用户提到“高保真”“音乐增强”“提升采样率”“48kHz”等需求时,自动切换到 AudioSR 模式。 支持 wav、mp3、flac、m4a、ogg 等常见