设计与多媒体

视频内容理解官

试用

用多模态大模型分析视频:内容摘要、分段时间线、镜头/运镜/转场/情绪、画面事实与屏幕文字OCR。支持三档深度,费用随档位不同,执行前先确认。 适用场景:用户想让AI看懂一个视频的内容、生成时间线、提取画面文字(OCR)、分析镜头与情绪时使用。

它能做什么

用多模态大模型分析视频:内容摘要、分段时间线、镜头/运镜/转场/情绪、画面事实与屏幕文字OCR。支持三档深度,费用随档位不同,执行前先确认。 适用场景:用户想让AI看懂一个视频的内容、生成时间线、提取画面文字(OCR)、分析镜头与情绪时使用。

技能文档

视频内容理解官

曼格云 skill | 环节:做内容 | 底层统一底座 wm_core.py

何时使用

用户想让AI看懂一个视频的内容、生成时间线、提取画面文字(OCR)、分析镜头与情绪时使用。

执行流程(严格按顺序)

第 1 步:确认 API Key(不产生费用)

运行前先确认 Key 已就绪:

python scripts/video-content-understanding.py --list

若用户未提供 Key,脚本会退出码 3 并输出标准引导。此时原样转述下面的话给用户,不要自行改写:

需要曼格云 API Key 才能调用数据接口 🔑

获取步骤(约 1 分钟):

  1. 打开 注册并登录
  2. 在控制台创建 API Key(形如 ach_live_...
  3. 把 Key 发给我,我写入配置后就可以开始

没有 Key 之前不会产生任何费用。

拿到 Key 后写入本技能目录的 config.json{"WM_API_KEY":"..."})再继续。

第 2 步:确认用户需求(尽量给选项)

需要用户决策的地方,用 AskUserQuestion 提供选项让其直接选择,不要让用户手打参数。 常用可选项见下方「交互选项」。

第 3 步:费用预估与确认(付费前强制,代码级)

调用付费端点时,脚本会先自动打印费用预估,然后停下并输出 WM_NEED_CONFIRM=1,不会直接扣费——这是硬性约束,绕不过。

把明细告知用户,用户确认后,重新运行并加 --yes 执行:

python scripts/video-content-understanding.py <端点> --yes [参数=值 ...]
  • 免费端点(余额 / 热搜 / 低粉爆文类)无需 --yes,直接执行。
  • 也可单独用 python scripts/video-content-understanding.py --estimate <端点> 预先查看成本。
  • 金额以接口响应 consumption 为准,本表为参考单价。

第 4 步:执行并导出(已确认后)

python scripts/video-content-understanding.py <端点> --yes [参数=值 ...] --format excel
  • --format 可选 json / markdown(默认) / excel,结果会落盘为文件并回显路径。
  • --report 可生成带表头与说明的「报告版」Markdown(适合直接发给客户/汇报)。
  • 列表型接口可加 --pages=N 自动翻页合并多页结果(按 cursor 游标)。
  • Excel 需要本地已安装 openpyxl(缺失时脚本会给出明确提示)。

第 5 步:回告

WM_TOTAL_CONSUMPTION(本次总消费)与 WM_BALANCE(账户余额)告知用户, 并把生成的文件(WM_OUTPUT_FILE)路径一并给出。

覆盖接口与计费

端点名称单价
video-understanding视频视觉理解¥0.12
ch-download-url视频号播放地址¥0.05

交互选项(用 AskUserQuestion 呈现)

  • 视频视觉理解
  • 视频号播放地址

示例

python scripts/video-content-understanding.py --list
python scripts/video-content-understanding.py --estimate video-understanding
python scripts/video-content-understanding.py video-understanding --yes --format excel videoUrl=https://example.com/a.mp4 analysisMode=timeline

退出码

含义处理
0成功按第 5 步回告
2输入错误(含缺必填参数)让用户更正链接/ID/参数,未调用不扣费
3缺 Key 或鉴权失败按第 1 步引导;未调用不扣费
4业务失败(含余额不足)转述服务端信息,余额不足引导充值
6网络错误建议重试
124超时建议重试

说明

  • 所有请求自动带 source=video-content-understanding 标识,便于用量归因与结算。
  • 付费成功响应本地缓存 24 小时,同一请求重试不会重复扣费;失败响应不缓存。
  • Excel 导出依赖 openpyxl;其余为纯标准库实现。

相关技能

将视频转为文字与结构化文案的技能。当用户提出"视频转文字 / 视频提取文案 / 视频转稿 / 字幕提取 / 视频总结 / 视频内容分析 / 会议纪要 / 课程拆解 / 直播复盘 / 采访整理 / 短视频二创脚本 / 口播稿 / 小红书文案 / 抖音文案 / 公众号文案"等需求时使用。支持本地视频文件与抖音、小红书等平台视频链接,调用千问大模型自动转写并剔除语气词、口误与重复内容,并可通过自定义 Prompt 生成总结、改写、金句提取、分镜头、中英翻译等风格化文案。

1 次安装

用 Gemini 分析视频 URL 或本地文件,输出结构化 JSON:逐字稿、画面描述、摘要、说话人和问答。

65 次安装5 星标

视频爆款拆解与二创文案生成。输入一个短视频(抖音/B站/小红书/视频号等),通过抽取音轨与关键帧、转录带时间戳文案、OCR 提取画面字幕,按时间戳对齐成视听时间线,再基于拆解结果生成二创爆款文案。适用于:拆解爆款视频结构、仿写爆款文案、视频拆条分析、视听内容理解、二创脚本生成。当用户提到拆解视频、二创、爆款文案、视频视听分析、仿写爆款、视频拆条、分析这个视频为什么火时触发。

1 次安装1 星标

通过调用多模态模型来理解图片内容。触发场景:(1) 用户要求分析/描述/提取/OCR 图片信息,且当前模型不支持图像输入(如 deepseek-v4、glm 5.1 等纯文本模型),(2) 用户明确要求"用我的视觉模型"或"调用多模态 API"来看图,(3) 用户显式调用本 skill(/multimodal-i...

3 次安装1 星标

视频分析处理 — 本地视频反编译分析工具。将视频拆解为时间轴剧本、语音转文字、场景分析、跨模态关联和精华摘要,支持多ASR引擎切换(Whisper/Paraformer/SenseVoice)、中文NLP增强、PaddleOCR中文识别。v4.0 新增短视频平台适配(抖音/快手/B站/视频号)和自动剪辑建议(高光检测/冗余标记/EDL导出/字幕样式)。v4.1 新增tiny模型优先体验(75MB低门槛)、说话人分离质量评分、剪映draft.json导出。v4.2 新增场景管理(detect→slice一条链)、短视频爆款预测、实时直播分析(流式ASR+敏感词检测)。v4.3 新增纯音频输入(mp3/m4a/wav播客与录音)、批量队列(SQLite+硬件档位并发)、GPU自动加速(CT2 int8量化)、ASR配置统一(--asr-engine单参数)。

Performs AI analysis on input video clips/image content and generates a smooth, natural scene description. | 视觉摘要智述技能,对传入的视频片段/图片内容进行AI分析,生成一段通顺自然的场景描述内容

27 次安装4 星标