Meta 向所有智能眼镜推出 Muse Voice AI,展现低延迟
核心要点
- 新的 Muse Voice Transcribe 模型以 80 毫秒的时间块处理语音,并在大约 0.16 秒内提供最终转录 Meta 刚刚对每副智能眼镜进行了重大升级。
- 该公司于 9 月 1 日推出的 Muse Voice Transcribe 型号现已在其整个智能眼镜系列中使用,包括 Ray-Ban

新的 Muse Voice Transcribe 模型以 80 毫秒的时间块处理语音,并在大约 0.16 秒内提供最终转录
Meta 刚刚对每副智能眼镜进行了重大升级。该公司于 9 月 1 日推出的 Muse Voice Transcribe 型号现已在其整个智能眼镜系列中使用,包括 Ray-Ban Meta 和 Oakley Meta 设备,带来实时语音 AI,处理音频的速度比大多数人眨眼的速度都要快。
标题数字:某人发言完毕后,最终转录延迟为 0.16 秒。就上下文而言,人类平均眨眼时间约为 0.3 秒。所以这个东西会在你向对方眨眼之前转录你所说的话。
凯莱 询问有关任何股票的任何问题 — 凯莱财经在几秒钟内为您提供完整的、有数据支持的答案。询问格洛丽亚 →
在引擎盖下
Muse Voice Transcribe 的工作原理是将传入的音频切成 80 毫秒的块并近乎实时地处理它们。这种精细的方法在英语基准测试中的单词错误率为 3.1%,这使其与当今最好的语音转文本系统处于竞争地位。
该模型可同时处理 20 多个说话人的说话人二值化,并且不需要单独的后处理。语言支持涵盖 70 多种语言。
对于希望在此基础上进行构建的开发人员,Meta 通过其 Model API 提供该模型,价格为每 1,000 分钟音频 3 美元。算下来每小时使用费用约为 0.18 美元。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
更大的缪斯图片
Muse Voice Transcribe 并不是孤立出现的。它遵循 Muse Spark 模型,Meta 于 2026 年 4 月首次推出该模型,并于 6 月开始向用户推出。 Spark 为眼镜上的低延迟交互奠定了基础。
Meta 的智能眼镜 2026 款部分起售价为 299 美元。
接下来会发生什么
该公司正在开发一款更广泛的个人人工智能代理,代号为 Impacc,目前正于 9 月中旬进行测试。该代理最终可能会整合导航功能。
