小白也能上手的AI语音处理工具:ClearerVoice-Studio降噪、人声分离与音质增强完整指南
发布时间:2026/8/19 17:48:27 作者:尧图编辑部 阅读量:1,286

小白也能上手的AI语音处理工具ClearerVoice-Studio降噪、人声分离与音质增强完整指南【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-StudioClearerVoice-Studio 是一款开源的 AI 语音处理工具包把背景噪音消除、多人声分离、音质升级、语音质量评估打包成几行代码就能调用的接口并内置多套训练好的模型装完即用无需自己训练。无论是给视频配音、整理会议录音还是抢救老磁带它都能帮你把声音救回来。一、先说说你大概率遇到过的声音灾难先来三个真实场景看看你有没有中招场景 A会议录了两小时回放时空调嗡嗡声比人声还响关键结论全靠猜。场景 B采访录音里两个人同时说话后期想单独剪出其中一人的段落无从下手。场景 C把十年前的老磁带转成数字音频采样率低、底噪大听起来像蒙了一层纱。采样率可以理解为每秒钟采集的声音样本数量采样率越高声音细节越丰富而底噪就是信号里混杂的无用声音。这三个问题分别对应语音增强去噪、语音分离分人声和语音超分辨率音质升级。ClearerVoice-Studio 把这三种能力加上目标说话人提取、语音质量评估做成了一个统一的工具包。它的最大卖点是预训练模型全内置几行代码直接跑不用理解背后的深度学习原理。二、一分钟看懂这个项目维度说明它是什么开源的 AI 语音处理工具包含推理接口、训练脚本、质量评估三大部分解决什么问题录音有噪音、多人声混叠、低采样率音质差、无法量化评估处理效果适合谁普通用户拿来即用、进阶用户换模型/调参数、开发者训练/微调模型上手难度低。pip install一条命令装好复制示例代码即可运行能跑什么任务语音增强、语音分离、语音超分辨率、目标说话人提取、语音质量评分三、三层递进从拿来就用到自己改模型这个项目的贴心之处在于它把使用者分成了三个层次每一层都能找到自己的入口。3.1 第一层普通用户拿来就能用你不需要懂任何算法只需要安装后调用ClearVoice类。以下代码会用 48kHz 全频带模型MossFormer2_SE_48K处理一个带噪音频from clearvoice import ClearVoice # 创建语音增强处理器 myClearVoice ClearVoice(taskspeech_enhancement, model_names[MossFormer2_SE_48K]) # 处理单个音频文件得到增强后的波形 output_wav myClearVoice(input_pathsamples/input.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_enhanced.wav)就这么简单。模型会在首次使用时自动下载到本地无需手动管理。如果你只是想快速体验还可以直接打开 HuggingFace 或 ModelScope 上的在线 Demo连代码都不用写。3.2 第二层进阶用户换任务换模型玩得转ClearVoice 目前开放四个任务通过task参数切换任务名用途示例模型speech_enhancement去除背景噪音FRCRN_SE_16K、MossFormerGAN_SE_16K、MossFormer2_SE_48Kspeech_separation分离双说话人MossFormer2_SS_16Kspeech_super_resolution提升采样率到 48kHzMossFormer2_SR_48Ktarget_speaker_extraction结合视频锁定目标说话人AV_MossFormer2_TSE_16K进阶玩法还包括多模型同时跑model_names传入列表例如[MossFormer2_SE_48K, FRCRN_SE_16K]一次处理输出多份结果方便对比。批量处理整个目录输入路径改成文件夹输出自动写回同名文件。用.scp清单文件把待处理文件路径写进清单适合大批量、可复现的流水线。Numpy 接口项目提供了demo_Numpy2Numpy.py直接在内存里输入输出 Numpy 数组方便你把处理环节嵌入自己的训练或推理管线。3.3 第三层开发者训练自己的模型train/目录下是完整训练框架覆盖语音增强16k/48k、语音分离8k/16k、语音超分辨率48k、目标说话人提取四大任务。想做微调的用户可以走数据准备 → 改配置 → 训练 → 评估的完整链路。值得一提的是train/data_generation/speech_enhancement/下还提供了训练数据生成脚本可以自动合成带噪语音、带混响的带噪语音省去自己找数据的麻烦。评估环节则交给speechscore/模块用客观指标量化训练效果。四、场景化实战三个最常见的需求下面按需求 → 操作的方式给出最常用的三个上手路径。需求 1最快上手路径——一条命令装好如果你只处理.wav文件直接装 PyPI 包即可pip install clearvoice如果你还需要处理 MP3、AAC、FLAC 等格式建议再装一个 FFmpegUbuntu 下执行sudo apt install ffmpegmacOS 下执行brew install ffmpeg它会负责音频格式的转换。需求 2跑通官方 Demo快速验证效果想从源码体验全部功能先克隆仓库再装依赖git clone https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio cd ClearerVoice-Studio/clearvoice pip install --editable . python demo.py注意demo.py里的各段示例默认是if False需要把想跑的那段改成if True。嫌麻烦可以直接运行python demo_with_more_comments.py注释更详细、示例默认开启。需求 3批量处理自己的音频把自己的一堆音频放进一个文件夹然后from clearvoice import ClearVoice myClearVoice ClearVoice(taskspeech_enhancement, model_names[MossFormer2_SE_48K]) myClearVoice(input_path我的音频文件夹, online_writeTrue, output_path处理结果文件夹)设置online_writeTrue后处理结果会边算边写入磁盘无需手动保存。这就是音频增强工具的批量处理正确姿势几十个文件一鼓作气跑完。五、选型对照不同场景该用哪个模型选模型不用记参数按速度优先还是音质优先来选就行你的诉求推荐组合理由机器配置一般追求处理速度FRCRN_SE_16K轻量快速适合实时性要求高的场景16kHz 素材追求最佳去噪效果MossFormerGAN_SE_16K16k 任务里主观听感指标最优高音质素材如 48kHz 录音MossFormer2_SE_48K全频带处理保留更多声音细节两人对话混在一起想分开MossFormer2_SS_16K双说话人分离输出两路声音老录音/低码率音频声音发闷MossFormer2_SR_48K把 16k/24k/32k 音频升级到 48k视频里多人说话只想留其中一人AV_MossFormer2_TSE_16K结合人脸/口型信息锁定目标说话人一个实用组合拳音频又旧又吵时先增强后超分。官方演示就是先跑MossFormer2_SE_48K去噪再跑MossFormer2_SR_48K升采样两步叠加效果更明显。六、避坑指南新手最容易踩的四个坑非 WAV 格式没装 FFmpeg。项目原生支持 wav、aac、ac3、aiff、flac、m4a、mp3、ogg、opus、wma、webm 等格式但转换依赖 FFmpeg。只装pip install clearvoice就丢 MP3 进去会直接报错。首次运行要下载模型。预训练模型约 100MB~500MB首次调用会自动从 HuggingFace 拉取到clearvoice/checkpoints目录。网络受限时下载失败需要从 ModelScope 手动下载并放到对应目录。长音频吃内存。超过 5 分钟的音频一次性送入模型可能爆显存建议先切成 30~60 秒的片段再用批量接口处理。任务与模型不匹配。speech_separation配MossFormer2_SS_16K没问题但把它配到speech_enhancement下就会出错。选择模型前先对照上文的选型表。七、快速问答五个高频疑问问完全不懂编程能用这个工具吗答可以。最省事的路径是直接用网页端在线 Demo 体验效果想要本地用pip install clearvoice后照着示例代码复制粘贴即可。问支持 Windows / macOS / Linux 吗答三个平台都支持。唯一区别是装 FFmpeg 的命令不同官方文档里分别给了 Ubuntu、HomebrewmacOS和 Windows 三种安装方式。问怎么量化处理效果好不好答用自带的 SpeechScore 模块。它内置 16 种主流评估指标如 PESQ模拟人耳感知的打分、STOI可懂度、DNSMOS、SI-SDR、NISQA 等。其中 DNSMOS、NISQA、DISTILL_MOS、SRMR 属于无参考指标不需要干净原声也能打分非常适合评估自己手上的真实录音。from speechscore import SpeechScore mySpeechScore SpeechScore([PESQ, STOI, DNSMOS, SISDR]) scores mySpeechScore(test_pathaudios/noisy.wav, reference_pathaudios/clean.wav, windowNone, score_rate16000, return_meanFalse) print(scores)问模型要自己训练吗答不需要。推理用的全是预训练模型开箱即用。只有你想针对特定场景做微调时才需要用到train/下的训练脚本。问能直接处理视频里的声音吗答能。目标说话人提取任务支持 AVI、MP4、MOV、WEBM 等视频格式会结合画面中的人脸/口型信息把指定说话人的声音从混合声里抠出来。八、下一步现在就动手光看不如一跑。建议你按这个顺序行动先体验在线 Demo上传一段带噪音的录音感受一下 48kHz 全频带增强的效果再跑本地 Demogit clone https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio后执行python demo_with_more_comments.py用自带的示例音频把四个任务都过一遍处理自己的真实素材用批量接口一口气跑完整个文件夹想进一步交流可以扫码加入项目的官方交流群二维码见仓库asset/dingtalk.png获取最新模型更新和技术支持如果你是开发者欢迎提交新的模型架构或功能一起完善这个工具包。从听不清到听得很舒服ClearerVoice-Studio 把过去需要专业音频工程师才能完成的工作压缩到了几行代码里。现在轮到你动手了。【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考