将视频转为文字与结构化文案的技能。当用户提出"视频转文字 / 视频提取文案 / 视频转稿 / 字幕提取 / 视频总结 / 视频内容分析 / 会议纪要 / 课程拆解 / 直播复盘 / 采访整理 / 短视频二创脚本 / 口播稿 / 小红书文案 / 抖音文案 / 公众号文案"等需求时使用。支持本地视频文件与抖音、小红书等平台视频链接,调用千问大模型自动转写并剔除语气词、口误与重复内容,并可通过自定义 Prompt 生成总结、改写、金句提取、分镜头、中英翻译等风格化文案。
Design & media
视频内容理解官
Try it用多模态大模型分析视频:内容摘要、分段时间线、镜头/运镜/转场/情绪、画面事实与屏幕文字OCR。支持三档深度,费用随档位不同,执行前先确认。 适用场景:用户想让AI看懂一个视频的内容、生成时间线、提取画面文字(OCR)、分析镜头与情绪时使用。
What it does
用多模态大模型分析视频:内容摘要、分段时间线、镜头/运镜/转场/情绪、画面事实与屏幕文字OCR。支持三档深度,费用随档位不同,执行前先确认。 适用场景:用户想让AI看懂一个视频的内容、生成时间线、提取画面文字(OCR)、分析镜头与情绪时使用。
The skill document
视频内容理解官
曼格云 skill | 环节:做内容 | 底层统一底座
wm_core.py
何时使用
用户想让AI看懂一个视频的内容、生成时间线、提取画面文字(OCR)、分析镜头与情绪时使用。
执行流程(严格按顺序)
第 1 步:确认 API Key(不产生费用)
运行前先确认 Key 已就绪:
python scripts/video-content-understanding.py --list
若用户未提供 Key,脚本会退出码 3 并输出标准引导。此时原样转述下面的话给用户,不要自行改写:
需要曼格云 API Key 才能调用数据接口 🔑
获取步骤(约 1 分钟):
- 打开 注册并登录
- 在控制台创建 API Key(形如
ach_live_...)- 把 Key 发给我,我写入配置后就可以开始
没有 Key 之前不会产生任何费用。
拿到 Key 后写入本技能目录的 config.json({"WM_API_KEY":"..."})再继续。
第 2 步:确认用户需求(尽量给选项)
需要用户决策的地方,用 AskUserQuestion 提供选项让其直接选择,不要让用户手打参数。
常用可选项见下方「交互选项」。
第 3 步:费用预估与确认(付费前强制,代码级)
调用付费端点时,脚本会先自动打印费用预估,然后停下并输出 WM_NEED_CONFIRM=1,不会直接扣费——这是硬性约束,绕不过。
把明细告知用户,用户确认后,重新运行并加 --yes 执行:
python scripts/video-content-understanding.py <端点> --yes [参数=值 ...]
- 免费端点(余额 / 热搜 / 低粉爆文类)无需
--yes,直接执行。 - 也可单独用
python scripts/video-content-understanding.py --estimate <端点>预先查看成本。 - 金额以接口响应
consumption为准,本表为参考单价。
第 4 步:执行并导出(已确认后)
python scripts/video-content-understanding.py <端点> --yes [参数=值 ...] --format excel
--format可选json/markdown(默认) /excel,结果会落盘为文件并回显路径。- 加
--report可生成带表头与说明的「报告版」Markdown(适合直接发给客户/汇报)。 - 列表型接口可加
--pages=N自动翻页合并多页结果(按 cursor 游标)。 - Excel 需要本地已安装
openpyxl(缺失时脚本会给出明确提示)。
第 5 步:回告
把 WM_TOTAL_CONSUMPTION(本次总消费)与 WM_BALANCE(账户余额)告知用户,
并把生成的文件(WM_OUTPUT_FILE)路径一并给出。
覆盖接口与计费
| 端点 | 名称 | 单价 |
|---|---|---|
video-understanding | 视频视觉理解 | ¥0.12 |
ch-download-url | 视频号播放地址 | ¥0.05 |
交互选项(用 AskUserQuestion 呈现)
- 视频视觉理解
- 视频号播放地址
示例
python scripts/video-content-understanding.py --list
python scripts/video-content-understanding.py --estimate video-understanding
python scripts/video-content-understanding.py video-understanding --yes --format excel videoUrl=https://example.com/a.mp4 analysisMode=timeline
退出码
| 码 | 含义 | 处理 |
|---|---|---|
| 0 | 成功 | 按第 5 步回告 |
| 2 | 输入错误(含缺必填参数) | 让用户更正链接/ID/参数,未调用不扣费 |
| 3 | 缺 Key 或鉴权失败 | 按第 1 步引导;未调用不扣费 |
| 4 | 业务失败(含余额不足) | 转述服务端信息,余额不足引导充值 |
| 6 | 网络错误 | 建议重试 |
| 124 | 超时 | 建议重试 |
说明
- 所有请求自动带
source=video-content-understanding标识,便于用量归因与结算。 - 付费成功响应本地缓存 24 小时,同一请求重试不会重复扣费;失败响应不缓存。
- Excel 导出依赖
openpyxl;其余为纯标准库实现。
Related skills
Turn video URLs or files into structured JSON: transcript, description, summary, speakers, and Q&A via Gemini.
视频爆款拆解与二创文案生成。输入一个短视频(抖音/B站/小红书/视频号等),通过抽取音轨与关键帧、转录带时间戳文案、OCR 提取画面字幕,按时间戳对齐成视听时间线,再基于拆解结果生成二创爆款文案。适用于:拆解爆款视频结构、仿写爆款文案、视频拆条分析、视听内容理解、二创脚本生成。当用户提到拆解视频、二创、爆款文案、视频视听分析、仿写爆款、视频拆条、分析这个视频为什么火时触发。
通过调用多模态模型来理解图片内容。触发场景:(1) 用户要求分析/描述/提取/OCR 图片信息,且当前模型不支持图像输入(如 deepseek-v4、glm 5.1 等纯文本模型),(2) 用户明确要求"用我的视觉模型"或"调用多模态 API"来看图,(3) 用户显式调用本 skill(/multimodal-i...
视频分析处理 — 本地视频反编译分析工具。将视频拆解为时间轴剧本、语音转文字、场景分析、跨模态关联和精华摘要,支持多ASR引擎切换(Whisper/Paraformer/SenseVoice)、中文NLP增强、PaddleOCR中文识别。v4.0 新增短视频平台适配(抖音/快手/B站/视频号)和自动剪辑建议(高光检测/冗余标记/EDL导出/字幕样式)。v4.1 新增tiny模型优先体验(75MB低门槛)、说话人分离质量评分、剪映draft.json导出。v4.2 新增场景管理(detect→slice一条链)、短视频爆款预测、实时直播分析(流式ASR+敏感词检测)。v4.3 新增纯音频输入(mp3/m4a/wav播客与录音)、批量队列(SQLite+硬件档位并发)、GPU自动加速(CT2 int8量化)、ASR配置统一(--asr-engine单参数)。
Performs AI analysis on input video clips/image content and generates a smooth, natural scene description. | 视觉摘要智述技能,对传入的视频片段/图片内容进行AI分析,生成一段通顺自然的场景描述内容