Design & media

知识付费讲师数字人 Course Avatar

Try it

Knowledge-course / online-teaching avatar lecturer — 16 landscape base-portrait recipes plus the slide-first pipeline that keeps a 20-minute lesson under 3000 credits. Use when the user wants a digital human to teach a paid course, a training module or a knowledge-sharing video on platforms like Xiaoetong, Tencent Classroom, Bilibili, YouTube or an internal LMS.

What it does

Knowledge-course / online-teaching avatar lecturer — 16 landscape base-portrait recipes plus the slide-first pipeline that keeps a 20-minute lesson under 3000 credits. Use when the user wants a digital human to teach a paid course, a training module or a knowledge-sharing video on platforms like Xiaoetong, Tencent Classroom, Bilibili, YouTube or an internal LMS.

The skill document

知识付费讲师数字人

课程视频跟带货视频最大的不同:观众来看的不是你的脸,是你屏幕上的东西。

这句话不是审美判断,是成本判断。jimeng-omnihuman-1.5 按音频秒数计费,1080p 是 23 积分/秒。一节 20 分钟的课全程用数字人驱动:

1200 秒 × 23 = 27600 积分(驱动)

而同样一节课,讲师只在开场、章节转场、结尾露脸(约 110 秒),其余画面是课件 + 配音:

110 秒 × 23 = 2530 积分(驱动)  ——  省掉 90.8%

算上配音,两条路线的全成本是 2640 对 27840,详见下面的"露脸预算"。

省下的 25000 积分不是靠妥协换来的,成片反而更像一门正经的课。 全程一张脸对着你讲 20 分钟,是知识付费里完播率最差的形态之一。

所以这个技能的核心不是"怎么把数字人做得更真",而是怎么把数字人用在该用的 110 秒上,剩下的交给课件。底图配方解决前者,露脸预算解决后者。

何时使用

  • 做小鹅通 / 腾讯课堂 / 知识星球 / B 站 / YouTube 的付费课或公开课
  • 企业内训、SOP 培训、新员工入职课程
  • 一门课几十节,需要同一个讲师形象跨集稳定复用
  • 已有 PPT / 讲义 / 文档,想变成有讲师出镜的课程视频
  • 真人讲师没时间录制,或需要多语言版本

不适用于:单条知识口播短视频(用 dlazy-short-video,竖屏逻辑不同)、纯课件无讲师的文档转视频(直接 dlazy chat --skill file-to-video)、数学公式推导动画(那是 math-explainer-video 模板的活)。

与带货版的根本差异

如果你用过 dlazy-ecommerce-avatar,这五处是不能照搬的:

带货课程
画幅竖屏 9:16横屏 16:9
构图人物居中人物偏侧,留出内容区
露脸全程只在开场/转场/结尾
单集时长30~60 秒8~40 分钟(要切几十段)
合规红线广告法第九条(绝对化、疗效)广告法第二十四条(升学承诺、通过率、资质)

尺寸参数尤其容易串。带货是 --size 2160x3840,课程是 --size 3840x2160——写反了不报错,出一张竖图,然后你会在装配那一步才发现。

五条硬约束

1. 横屏直接上 4K,不额外花钱。

gpt-image-2 的计费只看 --quality 和有没有参考图,完全不看 --size(源码核对:config/models/gpt-image-2.tscosts)。所以:

--size 2048x1152 --quality high   →  37 积分
--size 3840x2160 --quality high   →  37 积分   ← 同价,直接用这个

横屏的 16:9 有两档(2048x1152 / 3840x2160),竖屏只有 4K 一档2160x3840)。既然同价,中等档只在你需要小文件时才有意义。

注意 1536x10243:2 不是 16:9,拿去做课程封面会被平台裁掉两边。

2. 底图要给内容留位置。

课程画面的左侧(或右侧)三分之二要放 PPT、板书、代码、图表。讲师站在剩下的三分之一里。

这意味着底图不能居中构图——居中的人像叠上课件,要么挡内容,要么只能缩成一个小圆窗浪费掉整张 4K。配方 11 是为此专门写的,课程主力就用它。

反过来,开场白和结尾这两段没有课件,用配方 12 的全画幅中近景,视觉上形成"打招呼 → 讲内容 → 总结"的节奏。

3. 一门课的底图必须一次定死。

带货可以每条视频换个人设,课程不行。第 3 节的讲师换了件衣服,观众立刻出戏。

开课前把底图存成文件,之后几十节全部引用同一个文件。 不要指望同一段 prompt 能复现同一张脸——两次采样出的不是一个人。详见"保持同一张脸"。

4. 时长是硬上限,一节课要切几十段。

jimeng-omnihuman-1.5 的音频上限:1080p ≤ 30 秒,720p ≤ 60 秒

按每秒 4.5 字算(实测 qwen-tts 为 4.54~4.71 字/秒),30 秒 ≈ 130 字。而 qwen-tts 自己的 prompt 上限是 512 字符——中文一个字算一个字符,加标点后 130 字很安全。

写讲稿时就按 110~130 字一段切好,别写完 20 分钟才回头切,语气会断。

5. 中文 prompt 走 --input JSON 文件。

用 shell 变量拼中文,在 Windows 上会静默变乱码——命令照样返回 ok: true,但出图跟 prompt 毫无关系。批量生产一律:

dlazy gpt-image-2 --input @payload.json --save ./lecturer/base.png

详见 troubleshooting.md 的"编码陷阱"。不确定参数时先 --dry-run,打印载荷和积分预估,不出图不扣分。

露脸预算

这是本技能最该记住的一张表。以一节 20 分钟的课为例:

段落时长画面驱动TTS小计
开场白30 秒讲师全画幅6906696
章节转场 × 6各 10 秒讲师偏侧 + 章节标题1380361416
正文讲解18 分钟课件 + 配音,无讲师06060
结尾总结20 秒讲师全画幅4606466
合计20 分钟2530108约 2640

对照全程驱动的 27840 积分(27600 驱动 + 240 TTS)。同一节课,差 10 倍以上。

正文那 18 分钟只要 60 积分,是因为 qwen-tts 固定 6 积分一次,与字数无关(源码核对:costs 直接 return 6)。由此得到一条不显然的优化:

正文段不做驱动,不受 30 秒时长限制,所以每次调用应该把 512 字符写满。

写满是 10 次调用 60 积分;如果沿用露脸段那种 130 字一段的切法,同样的内容要 38 次调用 228 积分。白花 168 积分买了同一段音频。 露脸段受驱动的 30 秒上限约束只能切短,正文段没有这个约束——两者的切法必须分开。

想再省,两个杠杆:

  • 降到 720p:15 积分/秒,再省 35%。讲师小窗在 720p 下完全够用——它在成片里只占画面的六分之一,观众看不出差别。全画幅的开场结尾建议留在 1080p。
  • 章节转场用静态卡:把 6 次转场里的一半换成纯课件动画,只保留关键章节露脸,再省 700 左右。

不要省的地方是底图那 37 积分。 一张底图要服务几十节课,摊下来趋近于零;底图不合格导致驱动失败,一次就是几百上千积分。

流水线

① 底图     gpt-image-2 (2000字) / seedream-5.0 (500字)   ← 提示词杠杆全在这
② 讲稿     claude-sonnet-5 / qwen3.8-max                  ← 按 110~130 字/段切好
③ 配音     qwen-tts (512字符上限) / doubao-tts            ← 全课必须同一音色
④ 驱动     jimeng-omnihuman-1.5 (300字, ≤30秒@1080p)      ← 只做露脸段;单点依赖
⑤ 课件     Remotion 模板 / gpt-image-2 出静态板           ← 正文主体在这
⑥ 装配     dlazy chat --skill file-to-video               ← CLI 本身不做合成

CLI 没有视频合成能力。 dlazy 是模型调用器,没有 merge / concat 命令。要交付 mp4,最后一步必须走沙箱模板或你自己的 ffmpeg。

④ 是单点依赖。 5 个数字人模型里只有 jimeng-omnihuman-1.5 吃「静态图 + 音频」,其余四个都要「现成的说话视频 + 音频」才能换口型。它一挂整条链路就断,降级成本翻倍。

⑤ 是课程版真正的主战场。 带货版这一层只是插几个产品空镜,课程版这一层是全片 90% 的画面。file-to-video 模板能把 PPT / Word / PDF 直接解析成带旁白和字幕的课件视频,讲师片段作为素材叠进去。完整命令见 pipeline.md

配方索引

recipes.md 里有 16 条配方,参数全部经源码核对,可直接粘贴执行。

配方适用
A 讲台场景01 纯色抠像位 / 02 书房 / 03 教室白板 / 04 演播室 / 05 咖啡厅 / 06 工位实操按课程调性选一条
B 学科人设07 学术专家 / 08 职场导师 / 09 语言教师 / 10 技术讲师按学科选,注意 07 的资质合规
C 景别机位11 右三分之一构图 / 12 全画幅中近景 / 13 小窗特写11 是正文主力,12 开场结尾,13 画中画
D 课件视觉14 章节封面板 / 15 概念示意图 / 16 课程封面第 ⑤ 层的静态素材

选不动就用 配方 11 + 配方 12 这一对:11 出正文用的偏侧构图,12 出开场结尾用的全画幅,同一人设两个机位,一门课就够了。

保持同一张脸

一门课几十节,人设一致性是刚需。三种做法,从稳到弱:

  1. 存图复用(唯一推荐)——第一次满意后把底图存成文件,全课引用同一个文件,脸 100% 一致
  2. 参考图重绘——gpt-image-2 --images base.png --prompt "同一人物,换成...",能换背景保住脸,但积分从 37 涨到 60(有参考图时 high 档计费不同),且跨集微妙差异会累积
  3. 纯文字复现——不要用。同样的 prompt 两次出的脸不是一个人

配方 11 / 12 / 13 是同一人设的三个机位,必须用做法 2 从同一张底图派生,不要各自独立生成——否则三个机位是三个人。

认证

dlazy login          # 设备码流程,自动保存 key
dlazy auth set KEY   # 已有 key 时直接写入

Key 从 https://dlazy.com/dashboard/organization/api-key 获取,保存在 ~/.dlazy/config.json。也可用 DLAZY_API_KEY 环境变量按次传入。

积分不足返回 insufficient_balance,充值入口:https://dlazy.com/dashboard/organization/settings?tab=credits

Reference Map

文件内容
recipes.md16 条底图与课件配方,完整可执行命令 + 每条的驱动注意事项
pipeline.md①~⑥ 逐步命令,含分段批处理、画中画合成、成本估算
troubleshooting.md驱动失败对照表、长课程批处理陷阱、教培合规红线

Related skills

Ecommerce livestream avatar / AI spokesperson for product selling videos — 18 production-grade base-portrait recipes plus the full script→TTS→avatar→B-roll pipeline. Use when the user wants a digital human to sell a product on TikTok Shop, Douyin, Amazon, Shopee or a brand store.

Create a talking avatar from one portrait and a short script or speech track. This AI presenter and digital human video workflow can prepare narration with a selected voice or use a supplied recording, then direct a stable talking-head clip with restrained expression, natural movement, clear delivery, and focused lip-sync review. Use it for AI spokesperson videos, product explainers, training, course lessons, announcements, onboarding, social talking-head content, and photo-to-talking-video messages, with narration-driven facial motion and a focused review of identity, clarity, lip sync, and motion stability.

Turn one authorized founder or expert portrait and a weekly script into a talking-head IP video in that person's likeness and voice. This founder avatar and digital avatar studio can clone that person's voice and produce a stable founder talking head clip for founder updates, expert explainers, and brand announcements. Use it for a digital human spokesperson, talking head founder series, expert avatar video, brand digital human, AI presenter, AI spokesperson video, and recurring presenter video.

Turn recordings and transcripts into an askable digital-human course.

1 installs

「AI通识课资深专家 V3」——融合 AI 通识课完整课程体系(A→E五大模块)与艺术创意编程教学能力。覆盖 AI 认知/工具/方法论/实练/专业应用的完整课程框架,同时具备 2D/3D 动态多媒体互动课件开发能力。默认输出完整单文件 HTML 互动课件,并设「强制测试门控红线」(交付前须通过 courseware-guide 测试清单)。面向中学生/大学生与教师,支持答疑/备课/出题/课程设计/互动课件开发/跨学科适配。

1 installs1 stars