Buzz 离线音频转录实战:3 个场景走通语音转文字完整流程【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的离线音频转录工具,在你自己的电脑上完成语音转文字与翻译,音频不经过任何云端服务器。这篇文章按老用户视角把安装、建任务、调优、排错的真实路径走一遍,涉及到的命令、参数和路径都与仓库保持一致,可以照着做。一、Buzz 是什么:离线语音转文字一分钟速览一句话定位:Buzz 是一个跑在本地的 Whisper 转录工作台——导入音频、视频文件或 YouTube 链接,选好模型,它把声音变成带时间戳的文字,再导出 TXT、SRT、VTT 文件。和把文件传上云的做法不同,它是把整套语音识别引擎搬到你电脑上,属于典型的离线转录工具。能力总览:能力说明仓库位置文件与 URL 转录音频、视频、YouTube 链接统一入队处理buzz/transcriber/实时录音麦克风边录边转,带演示窗口,可接 OBSbuzz/recording.py多后端模型whisper、whisper.cpp、faster-whisper、HuggingFace 四类后端buzz/transcriber/结果导出TXT / SRT / VTT,另可装插件导出 DOCXbuzz/widgets/transcription_viewer/export_transcription_menu.py插件系统内置摘要、字幕重切、降噪等 6 个插件buzz/plugins/偏好与模板模型下载、导出文件名模板、快捷键buzz/settings/settings.py二、从下载到出结果:最简上手步骤走最短路径:装好、丢一个文件进去、拿到文字,全程不超过五分钟。安装:按平台选一条路Windows:从发布页下载安装包。应用未签名,安装时提示选更多信息 → 仍要运行即可;macOS:下载 .dmg,Intel 与 Apple 芯片都有对应版本;Linux:用 Flatpak 或 Snap,分别是flatpak install flathub io.github.chidiwilliams.Buzz和sudo snap install buzz;Python 环境:需要 Python 3.12,从 PyPI 安装:pip install buzz-captions python -m buzz四种方式都依赖系统里装好 ffmpeg,缺了它音频解不了码。详细步骤见安装文档。建第一个转录任务菜单文件 → 导入,选一个 mp3 文件(也可以直接粘贴 YouTube 链接);任务保持 Transcribe,语言选 Auto detect,模型先挑 whisper.cpp 后端的 tiny 或 base;点行内的开始按钮,任务进入队列执行。拿到并检查文字转录完成后双击任务,打开转录查看器:可以逐句对照音频播放、全文搜索、调整播放速度。把专有名词和听错的地方改完,再用导出菜单保存 TXT、SRT 或 VTT 文件,结果就齐了。三、关键能力按诉求解读:隐私、多语言与本地加速不堆特性清单,按你实际会遇到的诉求分组,每条一句价值加一句适用场景。 数据不出本机:导入、模型推理、导出全程在本机磁盘完成,不产生上传动作。适合会议、采访、内部培训这类敏感素材。 多语言与自动识别:内置语言列表覆盖近百种语言,可开自动检测;Transcribe 出原文,Translate 做翻译。适合外文资料和多语种团队。⚡ 本地硬件加速:NVIDIA 显卡走 CUDA,Apple 芯片走 Whisper.cpp,集显走 Vulkan;whisper.cpp 在没有独显的笔记本上也能做实时转录。适合公司发的普通办公本。 多格式与 YouTube 直连:mp3、wav、m4a、flac、mp4 等 ffmpeg 能解码的格式都能进,URL 直接导入省一步下载。适合素材散落的视频创作者。️ 实时录音:麦克风边录边出字,提供演示窗口,配合虚拟声卡还能采系统音。适合会议记录、讲座和直播字幕。四、三条能直接照做的流程:纪要、字幕与翻译每条流程都按输入 → 处理 → 产出三段写,参数直接可用。会议录音 → 文字纪要输入:一段会议录音文件,或用麦克风实时录;处理:Transcribe 任务,语言开自动检测,模型用 base 或 medium;多人发言时启用说话人识别,按人分段(参考说话人识别文档);产出:TXT 纪要,分段自带时间戳,方便回溯这句话在几分钟;术语改完再导出定稿。这是典型的会议录音转文字场景,一个小时的录音用 medium 模型在普通笔记本上大体二十分钟到半小时出结果,视硬件浮动。视频 → 字幕文件输入:mp4 等视频文件;处理:选 medium 或 large 这类精度更高的模型做 Transcribe,完成后进入字幕调整(见编辑与重切文档),按标点或时长把长句重切成符合阅读节奏的短段;产出:SRT 或 VTT 文件,直接拖进剪辑软件。外语音频 → 翻译对照输入:外语音频文件;处理:任务选 Translate,Whisper 的翻译方向目标是英文;需要中文等其他语言时,在偏好里配置 OpenAI 兼容 API 做二次 LLM 翻译(变量BUZZ_TRANSLATION_API_BASE_URL),详见翻译文档和偏好文档;产出:目标语言 TXT 文稿,与原文对照归档。五、速度与精度都在线:模型怎么选、批量怎么做调优分三步走:先跑通,再提速,再批量。先跑通默认配置(小模型 whisper.cpp)先出一版结果,确认导入、队列、导出路径都没问题,再谈速度。流程问题不解决,换再大的模型也是白等。再提速:模型与后端怎么选模型大小决定精度下限,后端决定跑得快不快。ggml 各档模型的文件量级与体验大致如下:模型(ggml 量级)内存占用转录速度精度适合场景tiny(约 75MB)1GB 内极快基础可用草稿、实时预览base(约 140MB)约 1–2GB快良好日常会议录音转文字small(约 480MB)约 2–3GB中等较好内容复核、字幕初稿medium(约 1.5GB)约 4–6GB偏慢优秀正式交付稿large-v3(约 3.1GB)8GB 以上最慢最高,偶有幻觉学术、长访谈精校两点补充:turbo 模型在速度和精度之间做折中,值得和 medium 同测;名字里带.En的模型只认英文。后端按硬件选:NVIDIA 独显且显存 6GB 以上用 faster-whisper;非 N 卡、Apple 芯片选 whisper.cpp,CPU 也能跑;更多对比见FAQ。再批量:监控文件夹与队列把常用工作流固化下来:开启文件夹监控,新文件丢进目录自动入队转录;任务在队列里按序执行,跑一批可以挂着过夜。要在全离线机器上批量跑,先用仓库里的 scripts/download-models.py 在联网机器上备一份模型缓存,再整体拷过去。六、常见卡点速查:本地语音识别的安装与排错排障先对号入座,大多数问题都在下表里。现象原因处理启动闪退或无法运行缺运行库,或 CPU 不支持 AVX2Windows 补装 Visual C 运行库;太老的 CPU(无 AVX2)跑不了,属硬件限制下载模型后崩溃模型文件不完整或损坏在帮助 → 首选项 → 模型里删除该模型,重新下载转录明显偏慢用 CPU 跑大模型,或模型过大换更小模型或改用 whisper.cpp;N 卡 6GB 显存切 faster-whisper麦克风报错 PaErrorCode-9999系统权限或杀软拦截Windows 检查设置 → 隐私 → 麦克风,临时关杀毒软件测试GPU 没生效CUDA 版本不匹配或驱动问题Windows 安装包自带 CUDA 12,旧环境回退 CPU;Linux 补装 CUDA 12 / cuBLAS / cuDNN断网机器用不了本机没有模型缓存在联网机器下好模型,整包拷到目标机器的缓存目录即可跨平台安装要点:Windows 装未签名安装包时选更多信息 → 仍要运行;macOS 下 .dmg;Linux 走 Flatpak 或 Snap(Snap 方式先装libportaudio2等依赖);Python 方式需要 3.12 环境加buzz-captions。模型缓存位置在排障时常用,记住三个路径:Linux 在~/.cache/Buzz,macOS 在~/Library/Caches/Buzz,Windows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。想试最新功能和修复,可以关注 CI 的最新开发版构建:七、进阶玩法:插件、命令行与导出模板插件内置 6 个插件,源码在 buzz/plugins/:ai_summary(AI 生成摘要)、transcript_resizer(字幕自动重切)、export_docx(导出 Word)、deep_filter_net(转录前降噪)、enhanced_language_detection(语言检测增强)、skip_already_transcribed(跳过已转录文件)。在帮助 → 插件里可以按 URL 安装 zip 包、启停、调整执行顺序和配置,细节看插件文档。命令行批量脚本化场景用 CLI,一条命令完成建任务到导出,完整参数见CLI 文档:buzz add --model-type whispercpp --model-size small --srt --txt \ /path/to/meeting.mp3常用参数:-t选 transcribe/translate,-m选后端,-s选模型,-l指定语言,--srt / --vtt / --txt控制导出格式,-w出词级时间戳,--hide-gui隐藏主窗口。导出模板与自定义工作流偏好里的默认导出文件名支持模板变量:{{ input_file_name }}、{{ task }}、{{ language }}、{{ model_size }}、{{ date_time }}。比如填{{ input_file_name }} ({{ task }}d on {{ date_time }}),导出文件就会自动带上任务类型和时间戳,批量归档不再手改名。偏好里还能开启实时转录导出 txt 文件,直接喂给 OBS 当直播字幕源。要改插件或读源码,git clone 地址为:https://gitcode.com/GitHub_Trending/buz/buzz八、为什么值得在本地跑 Whisper 转录数据闭环:从导入、模型缓存到最终导出,文件始终在本机磁盘上,没有中间环节;断网可用:模型缓存在哪台机器备好了,就能拷到哪台机器用,机房、封闭会议室照样跑;硬件不排队:N 卡、Apple 芯片、集显各走各的加速路径,速度只取决于你自己的硬件;开放可审:MIT 协议,模型后端、插件、处理逻辑都摆在仓库里,数据怎么处理自己看得明白。免费音频转文字这条路,用 Buzz 把导入、转录、导出走通之后,剩下的事就是把模型档位和导出模板调成自己顺手的样子。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考