Buzz 本地语音转文字完整教程:离线 Whisper 转录音频并免费导出字幕
发布时间:2026/9/7 3:30:57 作者:尧图编辑部 阅读量:1,286

Buzz 本地语音转文字完整教程离线 Whisper 转录音频并免费导出字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz两小时采访录音逐句听写要耗掉你一整个下午丢给云端转写又是按分钟计费又是隐私悬着心。Buzz 给出的答案很直接把 OpenAI 的 Whisper 模型装进你自己的电脑音频全程不出门转出来的文稿还带精确时间轴想导 SRT 字幕就导 SRT 字幕——不花一分钱模型费也不需要联网。 先搞懂 Buzz 是个什么定位一句话Buzz 是一个桌面端离线转写工作台。你丢进去音频或视频它吐出来带时间戳的文字稿还能顺手翻译成外语。它的几个关键特性决定了它和在线转写服务不是一个物种完全离线模型跑在本机 CPU/GPU 上录音内容不经过任何第三方服务器什么素材都吃MP3、WAV 等音频MP4、AVI 等视频甚至直接粘一个 YouTube 链接模型自由切换从 Tiny 到 Large 全家桶都支持在设置页里点两下就能下载和切换平台全覆盖Windows、macOS、Linux 都有对应分发方式还有 Python 包可以装在服务器上跑。可以把它想象成一台「本地打印机」在线服务是云端代印而 Buzz 是把打印机搬回家——纸带模型买一次后面印多少张都不再产生费用。 五种装法按你的系统对号入座系统 / 场景安装方式说明Windows下载安装包未签名安装时选「更多信息 → 仍要运行」macOS下载.dmg拖入应用程序原生支持 Apple Silicon 加速Linux (Snap)sudo snap install buzz建议先装libportaudio2等依赖Linux (Flatpak)flatpak install flathub io.github.chidiwilliams.Buzz应用商店也能搜到Python 环境pip install buzz-captions后运行python -m buzz需 Python 3.12 与 ffmpeg适合服务器脚本化首次启动时软件会提示你下载所选 Whisper 模型文件几十 MB 到两百多 MB 不等。这是一次性投入下载完成后之后所有转写都是纯本地操作断网也能用。 第一次转录从拖入文件到拿到文稿整个上手流程就四步不需要读说明书加素材把文件拖进主界面或点工具栏的「添加」按钮在线视频直接粘链接。选配置给每条任务挑任务类型转写 Transcribe / 翻译 Translate、后端引擎和模型语言可自动检测也可手动指定。等队列跑完状态列会实时显示排队中、处理中带百分比、已完成带耗时。双击看结果双击已完成的任务进入转录详情页也就是 Buzz 真正的核心工作台。上面这张主界面截图里每一行都标明了文件、所用引擎Faster Whisper / Whisper.cpp / Hugging Face和实时进度。批量丢几十个文件进去完全没问题关掉窗口任务也会继续跑完——对素材量大的人是实打实的省心。⚖️ 模型怎么选速度、准确率、场景对一张表Whisper 用模型体量来调节「快」和「准」这对矛盾选错档位要么白等要么返工模型速度准确率适合场景Tiny最快一般实时跟读、快速试听Base快尚可随手记笔记、语音备忘Small中等良好会议纪要、访谈初稿Medium较慢很高重要内容的精转Large最慢最高字幕制作、可交付级文本一个实用心法先问自己「这段文字要不要交付」。只是自己看Base/Small 足够要直接贴进剪辑软件或发给客户一步到位上 Large。机器有 NVIDIA 显卡的话在设置里打开 CUDA 加速Large 的速度会有数量级提升Mac 用户则自动走 Apple Silicon。模型的下载、切换和自定义都集中在 Models 设置页已下载的和可下载的分区列得很清楚底部还能填第三方地址拉取社区优化的 Whisper 变体。✍️ 转录详情页一个可以边听边改的迷你字幕编辑器双击任务进入详情页后你会看到一个带时间轴的表格——每段文字都有 Start/End 时间戳点哪段就跳到哪段音频位置边播边改播放条停在底部播放的同时直接改文本改动自动保存不用找保存按钮顶部四个入口View视图、Export导出、Translate翻译、Resize字幕调整所有高频操作都在明面上导出格式TXT、SRT、VTT 三种常用格式做字幕导 SRT做笔记导 TXT各取所需。✂️ 字幕党必看Resize 功能把长句拆成能用的字幕Whisper 直出的句子长短参差不齐有半屏的也有两个字的直接导 SRT 没法看。Buzz 的 Resize 就是冲这个痛点来的弹窗里只有三个开关加一个数字目标字幕长度如 42 字符超长的句子自动按这个上限拆分按标点断句拆分点落在句号、问号这类自然停顿上读起来不打架按静音间隙合并音频里停顿很短的碎片会被拼回一句消灭「两个字一屏」的尴尬。点 Merge全文件一次性生效不用逐条手抠。调整完再导 SRT投到视频里的节奏感会完全不一样。这一步基本等于把字幕后期的手工量砍掉一半。 进阶玩法主路径之外的四个高价值场景1. 实时录音转写——接上麦克风边说边出字适合开会、上课、访谈现场。Buzz 还带一个独立的演示窗口可以把实时文字投到大屏上做演讲字幕很顺手。2. 翻译任务——新建任务时类型选 TranslateBuzz 会把外语素材直接翻成你指定的目标语言。英文播客转中文稿、国际会议双语材料都在这一步解决。3. 文件夹监控自动转写——指定一个目录往里面丢新音频就自动开始转。团队协作场景下同事把录音丢进共享文件夹文字稿自己就出来了。4. 插件系统——1.4.5 版本之后内置了一批插件buzz/plugins/比如转写前用 DeepFilterNet 降噪、转写完自动生成 AI 摘要、导出 Word 文档、自动检测语种、跳过已转过的文件。插件在 Help → Plugins 里开关和排序还能装社区插件。⌨️ 不想开界面命令行也能跑Buzz 自带 CLIbuzz add一条命令就能提交转写任务支持指定任务类型-t translate、引擎-m、模型大小-s和语言-l。配合脚本可以做「批量文件进、字幕文件出」的流水线服务器上无人值守跑批也很稳。更多用法见项目文档 docs/docs/cli.md。 踩坑清单四类高频问题一次说清症状大概率原因怎么办转得太慢模型太大 / 没开加速 / 并行太多先降一档模型再开 CUDA别堆并行任务识别不准录音噪音大 / 模型偏小优先保证录音质量换 Large 重跑通常立竿见影内存告急超大文件整段加载分批处理给系统留足虚拟内存任务一直排队模型还没下完回 Models 设置页确认模型就位再加任务 十分钟上手把第一段录音转了免费、离线、开源这三个词同时出现在一个转写工具上理由已经给得够多了。挑一个匹配你系统的装法把第一段音频拖进去剩下的交给这台本地引擎——会议纪要、采访稿、视频字幕都会从「苦差事」变成「顺手的事」。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考