Buzz 离线语音识别工具使用指南音频转文字、录音转字幕的完整教程【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的离线语音识别工具运行在你自己的电脑上可以把音频文件、视频和麦克风录音转成带时间戳的文字并导出 TXT、SRT、VTT 等格式。录音不用上传到任何服务器转录全程在本机完成。如果你经常要处理这类素材开完会留下一堆录音没人整理、采访完的磁带迟迟变不成文字稿、本地视频想要一套字幕文件——Buzz 解决的就是这些事。它把 Whisper 模型跑在你的电脑上导入文件后点一下就开始转转完还能在界面里逐句核对、改时间轴、导出字幕。它能帮你做什么按使用场景来说主要有四类活文件批处理一次导入多个音频或视频排队逐个转录还能直接粘贴 URL 导入在线视频。实时录音对着麦克风边说边出文字适合会议、讲座、采访现场还支持把文字实时导出成文本文件。多语言转录与翻译支持 Whisper 的全部语言翻译成英文是模型自带能力翻成其他语言可以接一个 AI 接口完成。字幕整理转录结果带精确时间戳可以调字幕长度、合并分句导出 SRT/VTT 直接投到播放器或剪辑软件里。安装 Buzz三种方式任选其一Buzz 支持 Windows、macOS 和 Linux三种装法对应不同人群Mac / Windows 用户去项目发布页下载对应系统的安装包.dmg / .exe。注意 Windows 安装包没有签名安装时系统会警告选更多信息 → 仍要运行即可。Linux 用户从应用商店装 Flatpak 或 Snap 最省事见下面命令。想从源码装或习惯命令行的用户直接 pip 安装。Linux 下装 Flatpak 版flatpak install flathub io.github.chidiwilliams.Buzzpip 方式各系统通用Linux 需先装好系统依赖清单见 官方安装文档pip install buzz-captions python -m buzz装完双击图标或执行python -m buzz就能打开主界面。第一次打开软件先改哪几项用Ctrl ,Mac 是Cmd ,打开偏好设置先做三件事后面用起来就顺了导出文件夹点 Browse 选一个固定目录比如桌面/Buzz导出所有转录结果都会存到这里。默认导出文件名默认模板已包含文件名、任务类型和时间一般不用动嫌长可以简化。下载一个模型切到 Models 标签页先下载一个base或small大小的模型。模型首次使用时联网下载之后就存在本地缓存里之后可以完全离线用。其他选项字体大小、实时录音导出开关等保持默认即可需要时再回来调。场景一把音频文件批量转成文字稿目标把几个录音文件一次性转成文字拿到 TXT 文本。操作步骤点左上角的按钮或按Ctrl O选择多个音频/视频文件文件会进入任务列表。对每个任务确认三列设置模型如 Faster Whisper / Whisper.cpp、任务Transcribe 转录 / Translate 翻译成英文、语言。语言建议手动指定别用自动检测——选对语言识别质量通常明显更好。点Run状态列会从 Queued 变到 In Progress再变 Completed括号里就是耗时。双击已完成的那一行打开转录查看器核对内容后点Export导出 TXT。最终产出一个带完整文字内容的 .txt 文件落在你设置的导出目录里。文件名按偏好设置里的模板生成。转长文件时可以顺手做两个动作在导入时展开Advanced选项勾选Word-Level Timings得到逐字时间戳后续能做精细字幕调整Initial prompt里填容易拼错的专有名词比如人名、产品名能减少错拼。场景二开会录音边说边出文字目标会议进行中实时把发言变成文字散会直接带走一份文字稿。操作步骤点主界面工具栏的麦克风图标进入实时录音。选好麦克风设备和语言点Record开始。文字会一句句出现在右侧。如果想在会中就把文字留下来去偏好设置里勾选Enable live recording transcription exportBuzz 会边录边把文字写进一个文本文件。演讲现场还可以打开Presentation window把实时字幕投到大屏上。最终产出一份实时滚动、持续写入文件的会议文字稿。两个注意点实时转录比文件转录吃性能建议选 Whisper.cpp 实现 较小的模型笔记本也能跑动。想录电脑里播放的声音而不是麦克风需要装一个虚拟音频设备macOS 的 BlackHole、Windows 的 VB CABLE、Linux 的 PulseAudio 路由细节见 官方使用文档。录音功能的实现可以看 录音模块源码想理解它内部怎么分段转录的可以从这里入手。场景三把转录结果整理成可用字幕目标给视频配一套时长、字数都合适的 SRT 字幕。转录完成后的查看器就是工作台核对底部有播放器点哪一句哪句高亮Ctrl F可以全文搜索关键词快速定位。改时间轴选中某句用Ctrl ←/→以 0.5 秒为步长微调起止时间改错的时间戳不用手打数字。调字幕长度点工具栏的Resize设置每条字幕的最大长度和是否按标点断句点 Merge 自动重排——原本一句太长或碎成几行的字幕会被合并成阅读舒服的长度。导出Export菜单里选 SRT、VTT、TXT 或 JSON。最终产出一份时间轴准确、断句合理、可直接导入剪辑软件的字幕文件。模型怎么选、还有哪些进阶项模型是速度 vs 准确率的取舍记住一个原则就行先用小模型跑通流程不满意再换大的。tiny / base几秒出结果适合快速预览和长音频small / medium日常够用推荐作为默认large-v3 系列准确率最高但慢、吃内存长音频要等。实现方式Whisper 类型也影响速度没有独立显卡或 Mac 上选Whisper.cpp有 6GB 以上显存的 NVIDIA 显卡选Faster Whisper会快很多。模型管理界面在偏好设置的 Models 标签页已下载和可下载的模型都列在那里还可以下载量化版如 q5省内存。其他值得知道的进阶项快捷键偏好设置的 Shortcuts 标签页可自定义常用的有Ctrl F搜索、Ctrl P播放/暂停、Ctrl G跳到当前播放位置。说话人分离多人对话的音频Buzz 支持先做说话人分离再转录还能给每句标注说话人见 使用文档。命令行不想开界面时buzz add --srt 文件.mp4这类命令可以直接跑转录完整参数见 CLI 文档。常见问题排查清单按现象 → 原因 → 处理顺序自查现象可能原因处理办法转录很慢排队等很久模型太大或纯 CPU 运行换 small/base 模型有显卡改用 Whisper.cpp 或 Faster Whisper关掉占资源的程序点录音没反应报 PaErrorCode-9999系统禁止了应用访问麦克风检查系统隐私设置里的麦克风权限Windows设置 → 隐私 → 麦克风临时关掉杀毒软件测试识别出来的语言不对、乱码自动检测猜错了语言手动指定语言不要依赖 Detect Language专有名词、人名总是拼错Whisper 对生词容易错拼在 Advanced → Initial prompt 里把正确的写法填进去字幕一行太长或太碎默认分句不适合你的视频导入时开 Word-Level Timings再用 Resize 的 Merge 按最大长度和标点重排Buzz 启动就崩或转录中途崩模型下载不完整或损坏CPU 太老不支持 AVX2在 Models 页删掉已下载的模型重新下载特别老的电脑无法运行这是硬件限制想在完全没网的电脑上用模型需要首次联网下载在有网机器上下载好模型把模型缓存目录整个拷到离线电脑的相同位置缓存位置可在 Models 页点 Show file location 查看更多问题可以先查 官方 FAQ。适合谁、接下来做什么Buzz 适合手里有一堆录音和视频、需要文字稿或字幕又希望数据不出本机的用户记者、学生、会议记录者、字幕组。下一步建议装好之后先用一段 1 分钟左右的录音 base 模型走通导入 → 转录 → 导出 TXT全流程再按场景二、场景三的要求往实时录音和字幕整理上走。详细文档入口安装说明、偏好设置、CLI 用法源码在仓库根目录的 buzz/ 下界面、转录器、数据库分层清晰可以按需阅读。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考