从本地视频文件中提取语音文案/字幕。当用户提供视频文件路径(MP4等)要求提取文案、字幕、语音转文字时触发。跨平台支持(macOS/Windows/Linux),完全离线运行。
Design & media
音视频转写台
Try it把音视频转成文字稿。传入公网可访问的文件地址即可得到转写文本,适合提取口播文案、整理会议/直播录音、做字幕与二次剪辑素材。 适用场景:用户要把音频或视频转成文字稿、提取口播内容时使用。
What it does
把音视频转成文字稿。传入公网可访问的文件地址即可得到转写文本,适合提取口播文案、整理会议/直播录音、做字幕与二次剪辑素材。 适用场景:用户要把音频或视频转成文字稿、提取口播内容时使用。
The skill document
音视频转写台
曼格云 skill | 环节:做内容 | 底层统一底座
wm_core.py
何时使用
用户要把音频或视频转成文字稿、提取口播内容时使用。
执行流程(严格按顺序)
第 1 步:确认 API Key(不产生费用)
运行前先确认 Key 已就绪:
python scripts/audio-video-transcription.py --list
若用户未提供 Key,脚本会退出码 3 并输出标准引导。此时原样转述下面的话给用户,不要自行改写:
需要曼格云 API Key 才能调用数据接口 🔑
获取步骤(约 1 分钟):
- 打开 注册并登录
- 在控制台创建 API Key(形如
ach_live_...)- 把 Key 发给我,我写入配置后就可以开始
没有 Key 之前不会产生任何费用。
拿到 Key 后写入本技能目录的 config.json({"WM_API_KEY":"..."})再继续。
第 2 步:确认用户需求(尽量给选项)
需要用户决策的地方,用 AskUserQuestion 提供选项让其直接选择,不要让用户手打参数。
常用可选项见下方「交互选项」。
第 3 步:费用预估与确认(付费前强制,代码级)
调用付费端点时,脚本会先自动打印费用预估,然后停下并输出 WM_NEED_CONFIRM=1,不会直接扣费——这是硬性约束,绕不过。
把明细告知用户,用户确认后,重新运行并加 --yes 执行:
python scripts/audio-video-transcription.py <端点> --yes [参数=值 ...]
- 免费端点(余额 / 热搜 / 低粉爆文类)无需
--yes,直接执行。 - 也可单独用
python scripts/audio-video-transcription.py --estimate <端点>预先查看成本。 - 金额以接口响应
consumption为准,本表为参考单价。
第 4 步:执行并导出(已确认后)
python scripts/audio-video-transcription.py <端点> --yes [参数=值 ...] --format excel
--format可选json/markdown(默认) /excel,结果会落盘为文件并回显路径。- 加
--report可生成带表头与说明的「报告版」Markdown(适合直接发给客户/汇报)。 - 列表型接口可加
--pages=N自动翻页合并多页结果(按 cursor 游标)。 - Excel 需要本地已安装
openpyxl(缺失时脚本会给出明确提示)。
第 5 步:回告
把 WM_TOTAL_CONSUMPTION(本次总消费)与 WM_BALANCE(账户余额)告知用户,
并把生成的文件(WM_OUTPUT_FILE)路径一并给出。
覆盖接口与计费
| 端点 | 名称 | 单价 |
|---|---|---|
audio-transcription | 音频转文字 | ¥0.05 |
ch-download-url | 视频号播放地址 | ¥0.05 |
交互选项(用 AskUserQuestion 呈现)
- 音频转文字
- 视频号播放地址
示例
python scripts/audio-video-transcription.py --list
python scripts/audio-video-transcription.py --estimate audio-transcription
python scripts/audio-video-transcription.py audio-transcription --yes --format excel fileUrl=https://example.com/a.m4a
退出码
| 码 | 含义 | 处理 |
|---|---|---|
| 0 | 成功 | 按第 5 步回告 |
| 2 | 输入错误(含缺必填参数) | 让用户更正链接/ID/参数,未调用不扣费 |
| 3 | 缺 Key 或鉴权失败 | 按第 1 步引导;未调用不扣费 |
| 4 | 业务失败(含余额不足) | 转述服务端信息,余额不足引导充值 |
| 6 | 网络错误 | 建议重试 |
| 124 | 超时 | 建议重试 |
说明
- 所有请求自动带
source=audio-video-transcription标识,便于用量归因与结算。 - 付费成功响应本地缓存 24 小时,同一请求重试不会重复扣费;失败响应不缓存。
- Excel 导出依赖
openpyxl;其余为纯标准库实现。
Related skills
把音频或视频链接转换成文字稿。
将一个或多个本地视频转写为带每段开始和结束时间的整理版 TXT。当用户要求视频转文字、视频转写、提取视频文本或字幕、批量生成带时间戳 TXT、整理视频口述内容、统计视频处理耗时时使用。
Offline-first workflow for turning Chinese web page video or audio into text and Word deliverables. Use when Codex needs to (1) extract playable media stream...
当用户想要**音频转文字**、**语音转文本**、**转录录音**、**生成字幕**、**会议录音转文字**、**语音笔记转文本**、**本地转录音频**时自动触发。 使用本地 Faster-Whisper(large-v3-ct2 等模型)进行高性能、中文优先的音频转文字,完全离线、隐私安全,支持 wav/mp3/m4a 等格式和整个音频文件夹。 特别适合长音频(内置 VAD 分段)、会议/访谈/视频字幕等中文场景,输出结构化结果(完整文本 + 分段 + 时间戳)。 【重要约束】仅处理音频文件或音频文件夹,其他文件(如视频、图片、纯文本)一律不触发此技能。 常见触发口语(越多越好): -
火山引擎豆包语音识别 API(录音文件极速版)。把本地音频/视频文件或公网音频 URL 转成文字:录音转写、会议纪要、播客字幕、语音输入、视频伴音提取文字。 一次 HTTP POST 返回结果,无需轮询。支持 WAV/MP3/OGG 直传,其他格式 (m4a/flac/aac/视频等)自动用 ffmpeg 转码。Use whenever the user wants to 转写/识别/听写 音频或视频中的语音,生成文字稿、字幕(SRT)、会议纪要等。