faster-whisper 语音转文字速度4倍、显存省一半的完整使用指南【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper转录 13 分钟会议录音开源 Whisper 版要 2 分多钟、显存 4GB 以上。faster-whisper 是基于 CTranslate2 推理引擎重构的语音转文字工具同样精度下这段音频在 GPU 上约 1 分 03 秒转完INT8 量化后显存降到 2.9GB。本文按真实数字讲清它的安装、用法与调优。 两步装好并跑通要求 Python 3.9不需要自己装 FFmpeg解码库 PyAV 已捆绑 FFmpegpip install faster-whisper最小可运行示例from faster_whisper import WhisperModel model WhisperModel(base, devicecpu, compute_typeint8) segments, info model.transcribe(audio.mp3) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})模型首次加载时自动下载并缓存到本地base是最小模型约 140MB适合先跑通流程。返回值里的info携带自动检测的语言及置信度。能力拆解按场景看它怎么用长音频批量转录BatchedInferencePipeline 登场长会议、批量访谈时逐段推理浪费算力用批推理管线可整体替换WhisperModel.transcribefrom faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(large-v3, devicecuda, compute_typefloat16) batched BatchedInferencePipeline(modelmodel) segments, info batched.transcribe(audio.mp3, batch_size8)官方基准13 分钟音频GPU large-v2 从 1 分 03 秒降到 17 秒CPU 上 small 模型 int8 从 1 分 42 秒降到 51 秒。代价是显存涨到 6.1GB。批模式默认开启 VADWhisperModel的num_workers参数则支持多文件并行。词级时间戳做字幕和逐字对齐transcribe加word_timestampsTrue每个片段会带上words字段segments, _ model.transcribe(audio.mp3, word_timestampsTrue) for segment in segments: for word in segment.words: print(f[{word.start:.2f}s - {word.end:.2f}s] {word.word})每个词都有独立起止时间导出 SRT/VTT 字幕或做逐字高亮都够用。VAD 过滤清理冗长录音里的静默段vad_filterTrue启用内置 Silero VAD 模型先把没有人声的片段切掉再送进模型。默认只移除超过 2 秒的静默可用vad_parametersdict(min_silence_duration_ms500)调得 stricter。副作用是推理时间更短长音频里重复短语类的幻觉也明显减少。翻译与热词提示tasktranslate可把任意语言的语音直接翻译成英文文本遇到大量专有名词、品牌名时用initial_prompt或hotwords注入上下文提示识别准确率会改善。进阶设置3 个最值得调的参数compute_type精度与设备GPU 显存充足用float168GB 显存跑大模型用int8_float16纯 CPU 用int8。官方数据GPU large-v2 用 int8 后 13 分钟音频 59 秒、显存 2.9GB对比 fp16 的 1 分 03 秒和 4.5GB——速度只慢约 10%显存省 1/3。beam_size默认 5是速度与准确率的平衡点设 1 最快但精度下降。CPU 线程数CPU 推理时用cpu_threads或环境变量OMP_NUM_THREADS对齐物理核数速度差异可达数倍。实战避坑3 个最常见的坑程序卡住没有输出segments是生成器model.transcribe()只搭好流水线真正转录在你迭代它时才发生。不写 for 循环就等于没运行需要完整结果时先list(segments)。GPU 报找不到 cuDNN/cuBLAS 或加载崩溃最新版ctranslate2只支持 CUDA 12 cuDNN 9。CUDA 11 cuDNN 8 环境降级到ctranslate23.24.0CUDA 12 cuDNN 8 用4.4.0。Linux 下可用 pip 安装nvidia-cublas-cu12 nvidia-cudnn-cu129.*但必须在启动 Python 前设置好LD_LIBRARY_PATH。速度对比对不上号与 openai/whisper 等其他实现比速度前确认三点对齐——beam_size本项目默认 5官方库默认 1、转录词数WER 影响输出长度、CPU 线程数。否则数字没有可比性。资源导航核心转录逻辑WhisperModel、BatchedInferencePipelinefaster_whisper/transcribe.pyVAD 过滤实现与默认参数faster_whisper/vad.py音频解码基于 PyAVfaster_whisper/audio.py基准测试脚本与数据benchmark/贡献指南与开发环境CONTRIBUTING.mdMIT 许可证LICENSEfaster-whisper 适合需要本地化、低成本语音转文字的场景字幕生产、会议转写、多语言内容加工。如果你的机器有独显建议先用 base 模型在 CPU 上跑通最小示例再换int8_float16 BatchedInferencePipeline 跑一段 10 分钟以上的真实录音用前后耗时对比判断它在你环境里的实际收益。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考