一文读懂 sherpa-onnx v1.10.45FireRedASR 离线语音识别落地13 个语言 API 一次到位【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnxsherpa-onnx v1.10.45 把 FireRedASR 这个中英双语的注意力编码器-解码器AED离线语音识别模型正式做了进来模型导出、C/C 内核、以及 Python、Java、Kotlin、Go、C#、Swift、Dart、JavaScriptNode.js 与 WebAssembly 两条线等一整套 API 全部同步到位还顺手修掉了 Go 绑定的一处隐患和 RTF 计算里的一个笔误。 速览这个版本到底改了什么类别内容对你的影响新特性FireRedASR AED 模型导出到 sherpa-onnx#1865离线场景多一个高准确率的中英识别选项新特性C / Python API#1867C / CXX API#1871、#1872内核级开发可以直接调用新特性Kotlin / Java#1870、Swift#1876、Dart#1877APIAndroid、iOS、Flutter 端可集成新特性JavaScript node-addon 与 WebAssembly#1873、#1874、C##1875、Go#1879、Pascal#1880APIWeb 前端、.NET、服务端脚本语言全都有现成入口修复Go 实例创建失败时 C 结构体未正确报错#1860Go 绑定不再可能拿到空壳实例修复RTF 计算中的拼写错误#1861实时性能指标读数恢复准确 亮点逐个拆新东西能帮你做什么 FireRedASR离线中英识别的又一个高准确率选手FireRedASR 是 FireRedTeam 开源的中英双语 ASR 模型属于 AEDAttention-based Encoder-Decoder注意力编码器-解码器路线编码器先把整段音频压缩成特征解码器再按注意力机制逐 token 生成文字。和 CTC 路线相比它对长句子、中英混读这类上下文依赖强的语音更稳代价是解码阶段需要多跑一步整体推理比纯编码器方案稍慢但换来了更高的识别准确率。它解决谁的问题想在没有网络的环境内网会议系统、车载、工业设备、树莓派类边缘盒子里做高质量中英混合转写的你。sherpa-onnx 的卖点本来就是一切断网可用——不传云端、不走 API 计费。你可以拿它做什么会议转录 / 字幕生成仓库里现成的 Python 示例offline-fire-red-asr-decode-files.py展示了完整流程用OfflineRecognizer.from_fire_red_asr()传入 encoder、decoder、tokens 三个文件即可采样率不限 16 kHz方言与口音场景测试模型包自带 test_wavs含四川、天津、河南口音的 8k/16k 样例方便你评估自己业务里的口音覆盖情况离线语音输入入口配合 VAD 先切出语音段再喂给 FireRedASR 离线解码是很多端侧产品的标准组合。 13 条 API 通道你的技术栈基本都有这次不是模型先上、绑定后补而是一个版本内把各语言入口一次拉齐通道适合谁C / CXX API追求控制力与性能的嵌入式、服务端C APIc-api.h任何能调 C 的生态的语言绑定基座Python快速验证、脚本批处理Java / Kotlin / Swift / DartAndroid、iOS、Flutter 移动端JavaScriptnode-addon WebAssemblyNode 服务与浏览器端推理C# / Go / Pascal.NET 桌面、服务端、老桌面工具链如果你用 Flutter 或做桌面多平台仓库里的 C 示例目录 和各语言 examples 目录可以直接当集成参考。 悄悄修掉的坑修复清单Go 实例假成功修复前Go 侧创建识别器实例时哪怕底层 C 结构体创建失败Go 返回的也可能是一个看似成功的空对象——继续用它就会踩到未初始化的内存。修复后创建失败会被如实报错。受影响的是所有 Go 绑定用户不修的话属于平时没事、偶发崩溃还难排查的隐患。RTF 计算笔误RTFReal-Time Factor实时因子 处理耗时 ÷ 音频时长小于 1 说明跑得比实时快。这里之前有一处拼写错误导致数值算不准做性能对比、监控告警的同学读数会失真现已修正。⚙️ 幕后视角为什么这么做AED 路线的取舍FireRedASR 走注意力解码而非 CTC是用一点推理时间换长句与中英混排的准确率。对离线非实时逐字场景这个交换是划算的——你等一段完整语音的转写结果并不差那零点几秒。int8 量化随包提供官方模型包sherpa-onnx-fire-red-asr-large-zh_en-2025-02-16里直接给的是encoder.int8.onnx与decoder.int8.onnx即 8 位量化版本。相比 float32内存占用和带宽压力都小一圈在边缘设备上是更现实的默认选择精度上量化模型与全精度的差距通常可控但上线前仍建议用自己的音频抽测。一核多绑定的分层打法核心推理用 C 实现其余 12 种语言全部通过 C API 一层薄封装接出来。好处是模型逻辑只写一份各语言绑定可以并行、低风险地跟上——这次 13 条 API 通道能在同一版本落地靠的就是这套结构。 该不该升级对号入座老用户已在用 sherpa-onnx 做离线 ASR建议升。两处修复都不影响现有 API且能直接拿到 FireRedASR 做对照测试。新用户直接从这个版本起步中文/中英混合离线转写的候选模型又多了成熟一个。性能敏感用户先用 int8 模型在你自己的音频集上跑一遍 RTF 与准确率再决定是否替换现有模型RTF 读数现在可信了。Web / 移动端用户这是最受益的群体——WASM 与移动端绑定是同步到位的浏览器和 App 端都能用上不用等后续版本。写在最后v1.10.45 的信号很明确sherpa-onnx 在做模型进来全语言通道一起亮的节奏FireRedASR 只是最近一次。接下来值得关注两件事后续版本里 FireRedASR 是否补齐 CTC 变体与更多精度档位的模型导出以及量化模型在各平台上的实测表现。如果你要动手git clone https://gitcode.com/GitHub_Trending/sh/sherpa-onnx拉下源码从 Python 示例跑通第一条链路是最快的验证路径。【免费下载链接】sherpa-onnxSpeech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages项目地址: https://gitcode.com/GitHub_Trending/sh/sherpa-onnx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考