9月2日Meta推出首个实时音频感知模型Muse Voice Transcribe可实时流式自动语音识别支持多语言、超1小时长音频及超20位说话人语音分割在相关测试中排名第一。强大功能亮点多Muse Voice Transcribe已用70多种语言训练25种全面验证。原生支持超1小时长音频、超20位说话者能无缝语码切换利用上下文提高识别准确率示例中转写速度和效果出色。自适应延迟平衡速度与准度作为Muse Spark系列自回归多模态模型它以80ms为单位处理音频。具有“自适应延迟”功能通过强化学习动态调整延迟在速度和准确性权衡上达帕累托前沿。构建分区和端点功能以流式ASR为基础引入额外特殊token支持其他音频感知任务。引入特定token实现说话人分割和语音端点检测还在ASR奖励信号基础上增加额外奖励。语音识别发展新方向现实交流场景复杂Muse Voice Transcribe对优化转写质量有帮助。语音转写正从独立工具变为AI系统实时感知层未来竞争核心将是多方面融合。编辑观点Muse Voice Transcribe功能强大适应复杂场景。语音转写与大模型融合是趋势Meta此模型或推动行业发展加剧相关领域竞争。