MSL 推出 Muse Voice Transcribe,这是一种具有说话者分类功能的实时音频模型
核心要点
- Muse Voice Transcribe 是一种实时语音到文本模型,可以处理大多数转录服务仍然难以解决的两项任务:说话者分类(弄清楚谁说了什么)和端点(了解某人何时真正结束讲话,而不是只是停下来思考)。
- 该模型现已作为更广泛的 Muse Spark 系列的一部分通过 Meta 的模型 API 提供。

Meta Superintelligence Labs 推出其首款产品,一种语音转文本模型,可以分辨谁在说话以及他们何时停止
Meta 为追求通用人工智能而设立的部门 Meta Superintelligence Labs 已经推出了首款产品。它不是推理引擎或世界模型。这是一个转录工具。
Muse Voice Transcribe 是一种实时语音到文本模型,可以处理大多数转录服务仍然难以解决的两项任务:说话者分类(弄清楚谁说了什么)和端点(了解某人何时真正结束讲话,而不是只是停下来思考)。该模型现已作为更广泛的 Muse Spark 系列的一部分通过 Meta 的模型 API 提供。
Muse Voice Transcribe 的实际用途
实时转录听起来很简单,直到您尝试在两人以上的会议中使用它。大多数现有工具要么将每个人的话语混合成一个无差别的流,要么需要事后手动标记说话者。分类法通过在发生语音时自动将语音归因于各个说话者来解决这个问题。
端点是难题的另一半。这是系统检测说话者何时真正完成一个想法的能力,而不是喘口气或在句子中恢复平静。如果这个错误的话,你最终会得到将句子切成两半或落后于对话几秒钟的文字记录。
包含该模型的 Muse Spark 系列是围绕自然对话模式而设计的。这意味着模型可以处理中断,这一功能对于脚本听写以外的任何事情都非常重要。该系统还支持多种语言,但 Meta 并未具体说明具体是哪些语言或有多少种语言。
开发人员可以通过 Meta 的模型 API 访问 Muse Voice Transcribe,该 API 于 2026 年中期进入公共预览版,采用即用即付的定价结构。具体的每分钟或每个代币的成本尚未披露。
竞争格局
Meta 没有输入空字段。 OpenAI 的 Whisper 为开源转录质量设定了很高的标准。谷歌的 Chirp 模型在其云平台上支持语音识别。 AssemblyAI 和 Deepgram 等初创公司已经围绕具有说话者识别功能的实时转录 API 构建了整个业务。
值得注意的是缺乏独立基准。如果没有对 LibriSpeech 等标准数据集或财报电话转录进行正面比较,就很难评估 Muse Voice Transcribe 相对于现有选项的原始准确性。 Muse Voice Transcribe 的具体定价细节、独立基准和综合技术规格尚未公开发布。
