编程

Whisper v1转录免费版

试用

Whisper v1稳定版本地转录工具,支持基础语音转文字与字幕生成,适合个人快速上手。Use when 需要AI模型调用、智能对话、Agent编排、LLM应用时使用。不适用于需要100%确定性的关键决策。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。

它能做什么

Whisper v1稳定版本地转录工具,支持基础语音转文字与字幕生成,适合个人快速上手。Use when 需要AI模型调用、智能对话、Agent编排、LLM应用时使用。不适用于需要100%确定性的关键决策。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。

技能文档

Whisper v1 语音转文字工具 - 免费版

概述

Whisper v1 语音转文字工具(免费版)基于 Whisper v1 稳定版本,提供简洁可靠的本地语音转文字能力。v1 版本接口固化、行为稳定,适合需要长期维护与脚本化的个人用户。

免费版聚焦核心转录能力,专业版(llm-provider-whisper-v1-tool-pro)在此基础上提供批量处理、模型管理、性能调优与服务化部署等高级能力。

核心能力

能力免费版说明
单文件转录支持v1 稳定 CLI 接口
输出格式txt/srt/vtt/json覆盖常见字幕需求
翻译模式支持音频转英文文本
模型选择tiny/base/small轻量模型优先
自动语言检测支持省略 --language 自动识别
模型缓存支持首次下载后离线可用
批量处理不支持升级专业版
模型管理不支持升级专业版
性能调优不支持升级专业版

核心功能执行

input_params参数进行配置。

输入: 用户提供核心功能执行所需的指令和必要参数。 处理: 按照skill规范执行核心功能执行操作,遵循单一意图原则。 输出: 返回核心功能执行的执行结果,包含操作状态和输出数据。

  • 执行此能力时使用input_params参数,支持创建/查询/导出操作

参数配置与调用

config_options参数进行配置。

输入: 用户提供参数配置与调用所需的指令和必要参数。 处理: 按照skill规范执行参数配置与调用操作,遵循单一意图原则。 输出: 返回参数配置与调用的执行结果,包含操作状态和输出数据。

  • 执行此能力时使用config_options参数,支持修改/重置/导入操作

结果处理与输出

output_format参数进行配置。

输入: 用户提供结果处理与输出所需的指令和必要参数。 处理: 按照skill规范执行结果处理与输出操作,遵循单一意图原则。 输出: 返回结果处理与输出的执行结果,包含操作状态和输出数据。

  • 执行此能力时使用output_format参数,支持导出/保存/转换操作 能力覆盖范围:本skill的核心能力覆盖以下场景关键词:Whisper、稳定版本地转录工、支持基础语音转文、字与字幕生成、适合个人快速上手、稳定版本的本地语、音转文字工具、核心能力、稳定版、转录能力、接口简洁可靠、wav、等常见音频格式、等多种字幕格式、内置翻译模式、任意语言转英文、模型自动下载与本、地缓存等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持。

使用场景

场景一:个人播客转录

将播客录音转为文字稿,便于检索与归档。

# 转录为纯文本
whisper podcast_ep01.mp3 --model small --output_format txt --output_dir ./transcripts/

# 生成带时间戳的字幕
whisper podcast_ep01.mp3 --model small --output_format srt --output_dir ./subtitles/

场景二:学习视频字幕

为学习视频生成中文字幕。

# 提取音频
ffmpeg -i lecture.mp4 -vn -ar 16000 -ac 1 -c:a pcm_s16le lecture.wav

# 转录中文字幕
whisper lecture.wav --model small --language zh --output_format srt --output_dir ./subs/

场景三:多语言音频翻译

将外语音频翻译为英文便于阅读。

# 翻译模式(输出英文)
whisper french_interview.m4a --task translate --model base --output_format txt

不适用场景

以下场景Whisper v1转录免费版不适合处理:

  • 专业医学法律翻译认证
  • 同声传译
  • 文学创作翻译

触发条件

需要文本翻译、多语言转换、本地化处理时使用。不适用于非本工具能力范围的需求。

快速开始

  1. 阅读## 核心能力章节了解skill功能
  2. 按## 依赖说明配置环境
  3. 执行所需能力对应的命令
  4. 参考## 错误处理章节处理异常
  5. 查看## FAQ解答常见疑问

依赖详情

# pip 安装
pip install -U llm-provider-whisper

# 验证版本
whisper --help

2. 安装 FFmpeg

# macOS
brew install ffmpeg

# Ubuntu / Debian
sudo apt install ffmpeg

# Windows
scoop install ffmpeg

3. 首次转录

whisper audio.mp3 --model tiny --output_format txt --output_dir .

首次运行自动下载模型到 ~/.cache/whisper/

示例

v1 标准命令模板

# 标准转录
whisper  --model  --task transcribe --language  --output_format  --output_dir 

# 翻译模式
whisper  --model  --task translate --output_format  --output_dir 

模型选择建议

模型参数量适用场景免费版推荐
tiny39M快速预览、实时场景推荐
base74M清晰录音、简单内容推荐
small244M日常使用、中文转录推荐
medium769M专业转录、高准确度可用(较慢)
large1550M最高精度需求可用(很慢)

免费版推荐 tiny / base / small,平衡速度与准确度。更高精度需求建议升级专业版启用 GPU 加速。

输出格式说明

格式用途特点
txt纯文本阅读无时间戳,最简洁
srt视频字幕通用字幕格式,带时间戳
vttWeb 字幕HTML5 视频兼容
json程序处理含完整时间戳与置信度
tsv数据分析表格格式,便于 Excel

最佳实践

  1. 音频预处理
    • 转为 16kHz 单声道,匹配模型训练数据
    • 降噪可显著提升准确度
    • 长音频分段处理,避免内存溢出
# 标准预处理
ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le normalized.wav
whisper normalized.wav --model small --language zh
  1. 语言指定策略

    • 已知语言时显式指定 --language,跳过检测加速
    • 中文:--language zh
    • 英文:--language en
    • 多语种:省略,自动检测
  2. v1 稳定性优势

    • v1 版本 CLI 接口固化,脚本可长期复用
    • 模型行为一致,升级不破坏现有流程
    • 适合集成到自动化脚本与 CI/CD 流水线
  3. 成本控制

    • 免费版完全本地运行,零 API 成本
    • 模型下载一次,永久离线使用
    • 无调用次数限制

常见问题

Q1: v1 版本与其他 Whisper 版本有何不同?

v1 是稳定版本,CLI 接口与模型行为经过充分验证,适合长期维护的生产脚本。后续版本可能引入新特性,但 v1 保证向后兼容。

Q2: 模型下载缓慢怎么办?

模型托管在 Hugging Face,可手动下载 .pt 文件放入 ~/.cache/whisper/。文件名格式如 small.ptbase.pt

Q3: 转录准确度不理想?

  • 升级到更大的模型(smallmedium)
  • 预处理音频:降噪、标准化采样率
  • 显式指定 --language
  • 专业术语多的场景建议升级专业版,使用 initial_prompt 自定义词典

Q4: 免费版与专业版的区别?

免费版聚焦单文件转录,CPU 推理;专业版支持批量处理、GPU 加速、模型管理与服务化部署。如需高吞吐或自动化,建议升级。

Q5: 是否支持实时转录?

免费版仅支持文件级离线转录。实时流式转录属于专业版特性。

依赖说明

运行环境

  • Agent 平台: 支持SKILL.md的任意AI Agent(ai-assistant Code / Cursor / Codex / Gemini CLI等)
  • 操作系统: Windows / macOS / Linux
  • Python: 3.9 及以上
  • 硬件: CPU 即可运行(GPU 可选加速)

第三方依赖

依赖项类型是否必需获取方式
llm-provider-whisperPython 库必需pip install -U llm-provider-whisper
ffmpeg系统工具必需brew install ffmpeg / apt install ffmpeg
PyTorchPython 库必需随 whisper 自动安装
Python 3.9+运行时必需python.org 下载
LLM APIAPI必需由Agent内置LLM提供

API Key 配置

  • 本 Skill 完全本地运行,无需任何 API Key
  • 模型首次使用时自动下载,后续离线可用
  • 不依赖 llm-provider API 或其他云服务

可用性分类

  • 分类: MD+EXEC(纯Markdown指令,部分功能需exec命令行执行)
  • 说明: 基于Markdown的AI Skill,通过自然语言指令驱动Agent完成操作。免费版基于 v1 稳定版本,接口固化,适合长期维护的个人转录场景。

错误处理

错误场景原因处理方式
配置错误参数缺失或格式错误检查依赖说明中的配置要求
运行时错误运行环境不满足确认运行环境符合依赖说明
网络错误连接超时或不可达执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案

已知限制

  • 需要API Key,无Key环境无法使用
  • 本地运行,不支持多设备同步

相关技能

基于 Whisper v1 稳定版本的企业级语音转文字工具(专业版)。核心能力: - 涵盖免费版全部能力(v1 稳定 CLI、多格式输出、翻译) - 批量处理:目录递归与任务队列 - 模型管理:多版本预加载与热切换 - 性能调优:GPU 加速、半精度推理、批处理 - 自定义词典:initial_prompt 注入领域术语 - 服务化部署:FastAPI 封装,支持远程调用 - 质量评估:置信度分析与校对流程 - 任务监控:进度追踪与日志审计 适用场景: - 企业会议纪要自动化 - 视频/播客批量字幕生成...

本地Whisper CLI语音转文字工具,支持常见音频格式转录与翻译,无需API Key,适合个人使用。Use when 需要文本翻译、多语言转换、本地化处理时使用。不适用于专业医学法律翻译认证。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。

1 次安装

面向团队与企业用户的 Whisper 语音转文字工具(专业版)。核心能力: - 涵盖免费版全部能力(本地转录、翻译、多格式输出) - 批量处理:目录级递归转录,支持任务队列 - GPU 加速:CUDA / Metal / MPS 全面支持 - 说话人分离(diarization):多人对话识别 - 自定义词典:专业术语与品牌名词优化 - API 服务化:FastAPI 封装,支持远程调用 - 模型管理:多版本切换与预加载 - 质量评估:置信度分析与人工校对流程 适用场景: - 企业会议纪要自动化流水线 ...

ElevenLabs scribe_v1 speech-to-text with auto language detection and optional speaker diarization. Suitable for subtitles, transcription, and meeting notes. ElevenLabs scribe_v1 语音转文字,支持自动语种识别与说话人分离,适合字幕、转录与会议记录。

8 次安装

当用户想要**音频转文字**、**语音转文本**、**转录录音**、**生成字幕**、**会议录音转文字**、**语音笔记转文本**、**本地转录音频**时自动触发。 使用本地 Faster-Whisper(large-v3-ct2 等模型)进行高性能、中文优先的音频转文字,完全离线、隐私安全,支持 wav/mp3/m4a 等格式和整个音频文件夹。 特别适合长音频(内置 VAD 分段)、会议/访谈/视频字幕等中文场景,输出结构化结果(完整文本 + 分段 + 时间戳)。 【重要约束】仅处理音频文件或音频文件夹,其他文件(如视频、图片、纯文本)一律不触发此技能。 常见触发口语(越多越好): -

22 次安装

面向团队与企业用户的 llm-provider API 全功能管理工具。核心能力: - 涵盖免费版全部能力(对话补全、图像生成、助手管理) - 批量任务(Batch API)大规模异步处理 - 模型微调(Fine-tuning)定制化训练 - 评估(Evaluations)质量度量与回归测试 - 向量存储(Vector Stores)高级检索与 RAG - 视频生成与异步任务管理 - 容器(Containers)隔离执行环境 - 审计日志与团队权限管理 适用场景: - 企业级内容生产与自动化流水线 - ...