编程

HeyGen TTS免费版

试用

面向个人用户的 HeyGen 文字转语音工具(免费版)。核心能力:,可自动提升工作效率 - 基于 HeyGen Starfish TTS 模型的语音合成 - 支持 40+ 语言的语音选择 - 基础语速控制(0。Use when 需要文本翻译、多语言转换、本地化处理时使用。不适用于专业医学法律翻译认证。'

它能做什么

面向个人用户的 HeyGen 文字转语音工具(免费版)。核心能力:,可自动提升工作效率 - 基于 HeyGen Starfish TTS 模型的语音合成 - 支持 40+ 语言的语音选择 - 基础语速控制(0。Use when 需要文本翻译、多语言转换、本地化处理时使用。不适用于专业医学法律翻译认证。'

技能文档

HeyGen TTS 工具 - 免费版

概述

HeyGen TTS 工具(免费版)基于 HeyGen Starfish TTS 模型,为个人用户提供文字转语音合成能力。支持 40+ 语言、基础语速控制与停顿标签,适合视频配音、有声读物与多语言内容生成. 免费版聚焦基础 TTS 合成,专业版(heygen-tts-tool-pro)在此基础上提供 SSML 高级标记、批量生成、词级时间戳与 API 服务化等高级能力.

核心能力

能力免费版说明
语音合成支持Starfish 模型
语言支持40+含中英日韩法德等
语音列表支持查询与筛选
语速控制支持0.5-2.0 倍速
停顿标签支持``
音频下载支持通过 audio_url
SSML 标记不支持升级专业版
批量生成不支持升级专业版
词级时间戳不支持升级专业版
多语言混合不支持升级专业版
API 服务不支持升级专业版

核心功能执行

input_params参数进行配置.

处理: 解析核心功能执行的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回核心功能执行的响应数据,包含状态码、结果和日志.

  • 执行此能力时使用input_params参数,支持创建/查询/导出操作

参数配置与调用

config_options参数进行配置.

处理: 解析参数配置与调用的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回参数配置与调用的响应数据,包含状态码、结果和日志.

  • 执行此能力时使用config_options参数,支持修改/重置/导入操作

结果处理与输出

output_format参数进行配置.

处理: 解析结果处理与输出的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回结果处理与输出的响应数据,包含状态码、结果和日志.

  • 执行此能力时使用output_format参数,支持导出/保存/转换操作 能力覆盖范围:本skill的核心能力覆盖以下场景关键词:HeyGen、模型的文字转语音、支持多语言语音合、成与基础语速控制、适合个人使用、面向个人用户的、文字转语音工具、核心能力、TTS、模型的语音合成、语言的语音选择、基础语速控制、Use、when、需要文本翻译、多语言转换、本地化处理时使用、不适用于专业医学、法律翻译认证、适用于独立开发者、企业团队和自动化、工作流场景等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持.

使用场景

场景一:视频配音生成

为视频生成中文旁白.

# 查询中文语音
curl -X GET "https://api.heygen.com/v3/voices?engine=starfish&language=Chinese" \
  -H "X-Api-Key: $HEYGEN_API_KEY"
# ...
# 生成中文语音
curl -X POST "https://api.heygen.com/v3/voices/speech" \
  -H "X-Api-Key: $HEYGEN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "欢迎观看本期视频,今天我们来聊一聊人工智能的最新发展。",
    "voice_id": "YOUR_VOICE_ID",
    "speed": 1.0,
    "language": "zh"
  }'

场景二:多语言内容生成

为国际化内容生成不同语言版本.

import requests
import os
# ...
def generate_speech(text, voice_id, language="en", speed=1.0):
    """生成语音"""
    response = requests.post(
        "https://api.heygen.com/v3/voices/speech",
        headers={
            "X-Api-Key": os.environ["HEYGEN_API_KEY"],
            "Content-Type": "application/json",
        },
        json={
            "text": text,
            "voice_id": voice_id,
            "speed": speed,
            "language": language,
        }
    )
    data = response.json()
    if data.get("error"):
        raise Exception(data["error"])
    return data["data"]
# ...
# 生成英文版本
en_result = generate_speech(
    "Welcome to our product demonstration.",
    voice_id="YOUR_EN_VOICE",
    language="en"
)
print(f"英文音频: {en_result['audio_url']}")
# ...
# 生成日文版本
ja_result = generate_speech(
    "製品のデモンストレーションへようこそ。",
    voice_id="YOUR_JA_VOICE",
    language="ja"
)
print(f"日文音频: {ja_result['audio_url']}")

场景三:带停顿的语音合成

使用 break 标签添加自然停顿.

heygen.com/v3/voices/speech" \
  -H "X-Api-Key: $HEYGEN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "大家好。 欢迎来到本期节目。 今天我们聊一个有趣的话题。",
    "voice_id": "YOUR_VOICE_ID",
    "speed": 1.0
  }'

快速开始

1. 获取 API Key

  1. 访问 HeyGen 官网注册账号
  2. 进入控制台 > API Settings
  3. 创建 API Key 并保存
# 配置环境变量
export HEYGEN_API_KEY="your-api-key-here"

2. 查询可用语音

heygen.com/v3/voices?engine=starfish" \
  -H "X-Api-Key: $HEYGEN_API_KEY" | jq '.data[0:3]'

3. 生成第一段语音

heygen.com/v3/voices/speech" \
  -H "X-Api-Key: $HEYGEN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "你好,这是一段测试语音。",
    "voice_id": "YOUR_VOICE_ID"
  }' | jq '.data.audio_url'

4. 下载音频文件

# 获取 audio_url 后下载
curl -o output.wav "https://resource2.heygen.ai/text_to_speech/..."

示例

Python 封装

import requests
import os
# ...
class HeyGenTTS:
    def __init__(self, api_key=None):
        self.api_key = api_key or os.environ["HEYGEN_API_KEY"]
        self.base_url = "https://api.heygen.com/v3"
# ...
    def list_voices(self, language=None, gender=None):
        """查询语音列表"""
        params = {"engine": "starfish"}
        if language: params["language"] = language
        if gender: params["gender"] = gender
# ...
            f"{self.base_url}/voices",
            headers={"X-Api-Key": self.api_key},
            params=params
        )
        return response.json()["data"]
# ...
    def generate(self, text, voice_id, speed=1.0, language=None):
        """生成语音"""
        payload = {"text": text, "voice_id": voice_id, "speed": speed}
        if language: payload["language"] = language
# ...
            f"{self.base_url}/voices/speech",
api_key, "Content-Type": "application/json"},
            json=payload
        )
        data = response.json()
        if data.get("error"):
            raise Exception(data["error"])
        return data["data"]
# ...
    def download(self, audio_url, output_path):
        """下载音频文件"""
        with open(output_path, "wb") as f:
            f.write(response.content)
        return output_path
# ...
# 使用
tts = HeyGenTTS()
voices = tts.list_voices(language="English")
result = tts.generate("Hello world!", voices[0]["voice_id"])
tts.download(result["audio_url"], "output.wav")

语音选择参数

参数类型说明
enginestring固定 starfish(TTS 语音)
languagestring语言筛选(如 ChineseEnglish)
genderstring性别筛选(female / male)
limitinteger每页数量(1-100)
tokenstring分页游标

生成请求参数

字段类型必需说明
textstring文本内容(1-5000 字符)
voice_idstring语音 ID
speednumber语速 0.5-2.0(默认 1.0)
languagestring基础语言代码(如 zhen)

最佳实践

  1. 语音选择策略

    • 使用 GET /v3/voices?engine=starfish 获取 TTS 兼容语音
    • 注意:不是所有视频语音都支持 Starfish TTS
    • 优先选择有 preview_audio_url 的语音试听
  2. 语速控制

    • 0.8-1.2 范围内效果最自然
    • 低于 0.8 可能出现机器感
    • 高于 1.5 适合快速播报场景
  3. 停顿标签使用

    • 格式:word word
    • 标签前后必须有空格
    • 使用秒数 + s 后缀:``
  4. 文本长度控制

    • 单次请求最大 5000 字符
    • 长文本分段生成后拼接
    • 段落间自然停顿用 break 标签
  5. 错误处理

    • 检查返回的 error 字段
    • 网络错误实现重试
    • 记录 request_id 便于排查
def safe_generate(tts, text, voice_id, retries=3):
    for i in range(retries):
        try:
            return tts.generate(text, voice_id)
        except Exception as e:
            print(f"重试 {i+1}: {e}")
            time.sleep(2 ** i)
    raise RuntimeError("生成失败")

常见问题

Q1: 如何获取 API Key?

访问 HeyGen 官网注册账号,在控制台 > API Settings 创建 API Key。免费版使用标准 X-Api-Key 头认证.

Q2: 支持哪些语言?

支持 40+ 语言,包括中文、英文、日文、韩文、法文、德文、西班牙文等。通过 language 参数筛选.

Q3: 为什么找不到 TTS 语音?

必须使用 engine=starfish 筛选。/v3/voices 端点返回所有语音(含视频语音),只有 engine=starfish 的支持 TTS.

Q4: 免费版与专业版的区别?

免费版支持基础 TTS 合成与停顿标签;专业版提供 SSML 高级标记、批量生成、词级时间戳与多语言混合。需要高级排版或自动化的场景建议升级.

Q5: 音频格式是什么?

返回的音频为 WAV 格式,通过 audio_url 下载。如需 MP3,可使用 ffmpeg 转换:

ffmpeg -i input.wav -codec:a libmp3lame -qscale:a 2 output.mp3

Q6: 文本超过 5000 字符怎么办?

分段生成后拼接。建议按自然段落分割,段间添加停顿标签.

依赖说明

运行环境

  • Agent 平台: 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
  • 操作系统: Windows / macOS / Linux
  • 网络: 需访问 api.heygen.com

依赖详情

依赖项类型是否必需获取方式
requestsPython 库推荐(Python)pip install requests
curl命令行工具可选系统自带
jqJSON 处理工具可选brew install jq
ffmpeg音频转换可选brew install ffmpeg
Python 3.9+运行时可选(脚本)python.org 下载
LLM APIAPI必需由Agent内置LLM提供

API Key 配置

  • 必须配置 HEYGEN_API_KEY 环境变量
  • 在 HeyGen 控制台 > API Settings 创建
  • 通过 X-Api-Key 请求头传递
  • 建议使用 .env 文件管理,避免硬编码

可用性分类

  • 分类: MD+EXEC(纯Markdown指令,部分功能需exec命令行执行)
  • 说明: 基于Markdown的AI Skill,通过自然语言指令驱动Agent完成操作。免费版聚焦基础 TTS 合成,适合个人开发者快速集成语音能力.

错误处理

错误场景原因处理方式
配置错误参数缺失或格式错误检查依赖说明中的配置要求
运行时错误运行环境不满足确认运行环境符合依赖说明
网络错误连接超时或不可达执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案

已知限制

  • 需要API Key,无Key环境无法使用

相关技能

轻量级文本转语音工具,支持多语言TTS与基础音效生成,适合个人内容创作。Use when 需要文本翻译、多语言转换、本地化处理时使用。不适用于专业医学法律翻译认证。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。提供结构化输出和错误处理机制。

1 次安装

免费 TTS + 声音克隆双引擎。Fish Audio s2.1-pro-free(83 语言、克隆自己声音、voice_id 持久复用、免费至 2026-08-31)+ 小米 MiMo V2.5 TTS(8 种预置音色、文本设计音色、音频克隆、情绪/方言/唱歌标签控制、限时免费)。Use when 用户提到语音合成、TTS、文字转语音、配音、声音克隆、克隆我的声音、音色设计、免费语音生成、Fish Audio、小米 MiMo。

1 次安装

通用翻译工具免费版为个人用户提供日常多语言翻译能力,覆盖文本翻译、自动源语言检测、格式保留与术语保护。核心能力: - 文本翻译(任意语言互译) - 自动检测源语言 - 保留Markdown格式(标题/列表/代码块/表格) - 保留技术术语(变量名/函数名/URL) - 简单文件翻译(单文件) 适用场景: - 个人阅读外文文档与资料 - 编写多语言个人项目README - 日常对话翻译辅助 差异化:免费版聚焦个人日常翻译需求,支持单文件翻译

The AI avatar / talking-head mini-skill (HeyGen). Use when someone wants an "AI avatar video," "talking-head video," "digital twin / clone of myself on camer...

HeyGen Lipsync Speed: Fast lip-sync model, ideal for scenarios requiring rapid generation. HeyGen Lipsync Speed:快速唇形同步模型,适合对生成速度要求较高的场景

8 次安装

视频翻译免费版,为个人用户提供轻量化的视频翻译与配音能力。核心能力: - 中英双向视频翻译(zh ⇄ en) - 视频字幕翻译出片 - 单视频翻译任务处理 - 翻译结果预览链接返回 - 任务状态轮询查询 适用场景: - 个人创作者跨语言内容分发 - 学习视频字幕翻译 - 短视频出海本地化 - 个人观影辅助翻译 差异化: - 免费版聚焦中英互译核心场景,零配置上手 - 单视频任务流程清晰...

1 次安装