Buzz 离线语音转文字实用指南本地 Whisper 转录从入门到上手【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的离线语音转文字工具它把 OpenAI 的 Whisper 模型跑在你自己的电脑上音频文件不出本地就能转成文字。对会议录音、课程音频、采访素材这类不方便上传到云端的音频它给出了一条零成本的本地处理路线导入音频、选个模型、点运行几分钟后就能拿到可编辑的文字稿还能顺手导出 SRT 字幕。先把 Buzz 装起来安装与系统要求Buzz 覆盖 Windows、macOS 和 Linux安装方式按平台选一种即可macOS / Windows从官方发布页下载对应安装包双击安装。Windows 上安装程序未签名弹出警告时选仍要运行即可Linux通过 Flatpak 或 Snap 安装一条命令搞定Python 用户也可以用pip install buzz-captions后运行python -m buzz这种方式适合想改参数或配合脚本的人需要 Python 3.12 环境Linux 下的安装命令flatpak install flathub io.github.chidiwilliams.Buzz安装完成第一次启动时Buzz 会提示下载 Whisper 模型模型大小从几十 MB 到几 GB 不等后面选对模型这一步会专门讲。三步完成第一次音频转录主界面是一个任务列表所有操作围绕添加任务—配置—运行展开添加文件。点左上角的按钮快捷键 CtrlO支持 MP3、WAV、FLAC 等音频格式也支持 MP4、AVI 等视频甚至可以粘贴在线链接配置任务。在任务行里选择两个关键项用哪个模型转Whisper 还是 Whisper.cpp 等后端以及音频是什么语言。语言如果不确定可以留空让它自动检测但手动指定会更准点运行。任务进入队列开始处理完成后状态变为完成点击条目即可打开转录查看器批量处理也很直接一次选中多个文件Buzz 会按顺序排队转录不用逐个操作。模型怎么选速度、精度与硬件的平衡模型是决定转录质量的核心参数。Whisper 系列模型从大到小共五档常见规格如下模型体积适用情况tiny约 75 MB快速预览配置较低的电脑base约 142 MB日常使用推荐small约 466 MB精度要求较高medium约 1.5 GB学术或专业场景large约 2.9 GB最高精度需要较强硬件选择时的建议先用base试一段识别质量不满意再往上加档大模型更吃内存和算力没有独立显卡的机器用 medium 以上会明显变慢偏好设置里的模型标签页可以统一下载和删除模型选 Whisper.cpp 后端时还能用量化版本如 q5降低显存占用另外有个容易忽略的提精度技巧如果内容里有专业术语、人名、地名可以在任务的高级设置里填初始提示把相关词汇写进去识别准确率会有可见的提升。实时录音转文字边录边出稿Buzz 支持从麦克风实时转录适合讲座、会议、采访这类说完就要文字的场景。点界面上的录制按钮即可开始识别结果会实时滚动显示在偏好设置Ctrl,里可以配置实时转录模式新句追加在下方适合持续记录追加并修正会回头修正上一句的识别错误但更耗算力录音导出路径和文件名模板同样在偏好设置里配置录完自动保存省去手动导出还有一个演示窗口开会或演讲时可以单独弹出把实时字幕投到大屏幕上需要说明的是实时转录是本地跑模型速度和机器配置直接相关配置一般时会有几秒延迟属于准实时而非逐字同步。转录结果怎么整理和导出转录完成后打开查看器它更像一个小编辑器而不只是一个文本框改文字直接点选某句话修改识别错误对时间轴每段文字都带时间戳可以播放对应片段核对拖动边界微调起止时间搜索与播放控制支持在转录文本中搜索关键词播放时还可以调倍速导出格式TXT 适合纯文本整理SRT 和 VTT 适合做视频字幕做视频字幕的话Buzz 还有专门的字幕调整功能按标点和字数上限把长句拆成多条短字幕、合并间隔过短的片段批量处理整个文件处理完直接导出 SRT 就能进剪辑软件。几个新手容易踩的坑语言留空不等于省心。自动检测对中英混合、口音重的音频容易出错拿不准就先指定主语言音频质量影响很大。底噪大、音量忽大忽小时再大的模型也救不回来。Buzz 提供转录前语音分离选项嘈杂录音可以开启先降噪提取人声再转录模型下载失败或太慢模型文件首次使用需要联网下载之后走本地缓存如果网络环境特殊可以在偏好设置里手动管理模型文件想用命令行批处理Buzz 自带 CLI例如buzz add --model-size small --srt 音频.mp3就能批量出字幕详细参数可以看 CLI 文档更完整的参数说明和故障排查在官方文档里都有核心功能源码在 buzz/ 目录下遇到具体问题可以对照查看。下一步Buzz 覆盖了从文件转录、实时录音到字幕导出的完整链路全部在本地完成音频不需要经过任何服务器。装好之后拿一段 5 分钟以内的会议录音或课程音频走一遍完整流程导入、选 base 模型、指定语言、运行导出一个 SRT 看看效果你就知道它够不够用了。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考