Buzz:在本地电脑跑通 Whisper,一条命令把音频转成 SRT 字幕
发布时间:2026/9/7 18:54:17 作者:尧图编辑部 阅读量:1,286

Buzz在本地电脑跑通 Whisper一条命令把音频转成 SRT 字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一个桌面应用把 OpenAI Whisper 装进你的电脑音频文件全程离线转文字不经过任何云端。适合需要处理会议录音、讲座视频、访谈音频又不想把文件上传到第三方服务的开发者和进阶用户。三步跑起来以 Linux/Python 环境为例最短路径是装依赖、装程序、喂文件# 需要先安装 ffmpeg且使用 Python 3.12 pip install buzz-captions python -m buzz启动后进入主界面拖入一个音频文件点转录就能看到进度。首次使用会自动下载模型默认 tiny约 73MB之后完全离线。其他平台macOS 下载.dmg拖入应用程序文件夹即可Windows 安装程序未签名遇到拦截点更多信息 → 仍要运行Linux 也可以用flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz。想跟最新开发版本从源码运行git clone https://gitcode.com/GitHub_Trending/buz/buzz主界面是一个任务队列支持多文件并行转录每行的模型、进度、状态一目了然支持多选批量操作。一条任务线导入 → 选模型 → 转录 → 校对 → 导出导入。三种来源本地文件拖放或直接指定、在线 URL如视频链接、文件夹监视。文件夹监视是最省心的方式——把录音目录配好后新文件落盘即自动转录无需人工触发实现见 buzz/widgets/transcription_tasks_table_widget.py。选模型。模型分两类配置后端类型whisper、whisper.cpp、faster-whisper、Hugging Face 自定义模型、OpenAI API和 Whisper 尺寸。尺寸与体积的对应关系模型尺寸磁盘占用适用场景tiny~73MB实时转录、低配机器base~139MB日常快速处理small~462MB对准确率有要求时medium~1.5GB专业转录large-v3-turbo~1.6GB高准确率且要求速度尺寸定义在 buzz/model_loader.py。日常建议 base 起步专有名词多的音频换 medium。转录。关键选项集中在TranscriptionOptions见 buzz/transcriber/transcriber.pylanguage留空则自动检测明确知道语言时手动指定更准task可选 transcribe 或 translate转成英文initial_prompt可注入术语上下文对人名、产品名效果立竿见影word_level_timings打开后生成词级时间戳。校对。转录完成进入查看器可点击时间戳跳到音频对应位置、直接改文字、调整片段边界还能做说话人分离。导出。支持 TXT、SRT、VTT 三种格式输出目录可自定义。字幕过长的文件用内置的 resize 功能按间隙合并或按标点分割调完直接导出 SRT 进剪辑软件。配置与调优速查常用配置项及其效果按影响从大到小排--model-size准确率与速度的总开关换大一级模型明显更准但慢数倍--language zh跳过语言检测中文音频建议显式指定--task translate输出统一为英文翻译适合混合语言会议--word-timestamps多花一点时间换词级精度制作卡拉OK式字幕才需要--prompt 产品名Xxx给专有名词打底减少错写命令行一次完整转录长这样python -m buzz meeting.mp3 --model-size base --language zh --srt --txt偏好设置界面里这些都有对应开关还包含导出路径模板和快捷键实战工作流场景一给讲座视频做字幕目标视频文件 → 成品 SRT 文件。步骤导入视频自动提取音轨→ 选 medium 模型并指定语言 → 转录完成后用 resize 把超长片段按标点切开 → 导出 SRT。产出可直接导入剪辑软件的字幕文件。场景二会议录音自动归档目标录完即得文字稿零手动操作。步骤在偏好里配置文件夹监视目录 → 设定默认模型和输出格式为 TXT → 会议录音工具输出到该目录 → 文件落盘自动转录 → 去输出目录取文字稿。产出每场会议一份时间戳文字稿。场景三批量翻译访谈目标多语言访谈 → 英文文稿。步骤拖入多个音频 →task选 translate → 批量排队转录 → 逐条校对后导出。产出统一语言的访谈文字稿供后续整理。架构速览GUI 层buzz/widgets/PyQt6 实现主窗口、任务表格、查看器、偏好对话框都在这转录引擎buzz/transcriber/每种后端一个文件共享TranscriptionOptions配置结构数据层buzz/db/SQLite 存任务与片段任务实体定义在transcriber.py的FileTranscriptionTask插件系统buzz/plugins/内置 AI 摘要、自动 resize、跳过已转录等插件继承BuzzPlugin即可扩展CLIbuzz/cli.py与 GUI 共用同一套转录代码避坑清单Windows 装不上→ 程序未签名触发 SmartScreen → 点更多信息 → 仍要运行。转录慢得离谱→ 默认走了 CPU 版 whisper → 偏好里换 whisper.cpp 或 faster-whisper 后端有 N 卡再配 CUDA 版 torch。中文识别一堆错字→ 语言自动检测 默认模型精度有限 → 手动--language zh并在 prompt 里塞入人名、术语。pip 安装报错→ 依赖锁定了 Python 3.12 → 用uv或虚拟环境固定到 3.12。首次转录卡住→ 在下载模型而非死机 → 确认网络能访问模型源模型缓存后同尺寸不再重复下载。Buzz 把 Whisper 从命令行脚本变成了一个有任务队列、有查看器、有插件的桌面应用换来的是音频全程不离开本机。下一步建议直接翻 docs/docs/usage/ 里的文件导入和文件夹监视两篇把自动归档配起来。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考