加载中…
共 22 条相关内容
Suno 推出语音工具,可为口语音频添加背景音乐
Modulate 融资 2500 万美元,利用音频原生 AI 平台推进 Deepfake 检测
Meta推出第三代雷朋智能眼镜 带AI助手和助听模式
Meta 向所有智能眼镜推出 Muse Voice AI,展现低延迟
Nvidia 开源 Nemotron 3 用于实时说话人跟踪
Gemini 3.8 Flash TTS以89.5%的成绩在发音鲁棒性基准测试中排名第一
Fal 将 MiniMax 的开源视频模型加速 35 倍,且质量没有损失
Grok Voice 上线 fal,为开发者提供低延迟 AI 语音代理
Apple Watch Series 12 的新 AI 功能引发窃听担忧
这家 AI 音乐公司于 2026 年 10 月 1 日推出了名为 Speech 的工具的测试版。Suno 于 2026 年 9 月 9 日推出了 v6 模型系列,就在这个新工具发布的几周前。Suno 正在超越纯粹的音乐生成,进入更广阔的音频创作领域。
1 小时前 · 源自 CryptoBriefing
这家总部位于波士顿的语音智能初创公司目前已筹集总额 6000 万美元,用于扩展每月处理超过 1000 万小时音频的平台。Modulate 是一家由麻省理工学院校友创立的语音智能公司,已完成一轮 2500 万美元的融资,用于扩展其深度伪造检测和音频分析平台。Modulate 的实际作用 Modulat
2026/9/29 · 源自 CryptoBriefing
最新型号在 Meta Connect 会议上首次亮相,同时推出了新的无摄像头音频产品线,起价 349 美元。Meta 刚刚在 9 月 23 日的 Connect 大会上推出了第三代雷朋智能眼镜,该系列产品有一个特点:无摄像头的音频版本和内置助听模式。Meta 不断拓展的可穿戴设备策略 2026 年
2026/9/23 · 源自 CryptoBriefing
新的 Muse Voice Transcribe 模型以 80 毫秒的时间块处理语音,并在大约 0.16 秒内提供最终转录 Meta 刚刚对每副智能眼镜进行了重大升级。该公司于 9 月 1 日推出的 Muse Voice Transcribe 型号现已在其整个智能眼镜系列中使用,包括 Ray-Ban
亿参数模型可同时识别多达8个说话人,时延低至320毫秒 英伟达让辨别谁在说话变得更加容易。该公司发布了 Nemotron 3 Diarization,这是一种开放权重模型,专门用于解决音频处理中最烦人的问题之一:实时准确跟踪哪个说话者说了些什么以及他们说了什么。该模型于 9 月 23 日在 Nvid
谷歌最新的文本转语音模型在多项质量基准上击败了竞争对手,这表明谷歌正在大力推进人工智能生成的音频 谷歌最新的文本转语音模型刚刚在人工智能音频领域引用最广泛的发音准确性测试中名列前茅。Gemini 3.8 Flash TTS 在人工分析发音鲁棒性基准测试中得分为 89.5%,位居第一。Gemini 3
市场参与者似乎将这一发展解释为谷歌在人工智能领域不断取得的进步,可能会影响对该公司人工智能模型性能的看法。要点 Gemini 3.8文本转语音模型的推出似乎增强了谷歌在人工智能技术开发方面的竞争地位。Gemini 音频产品线的未来更新或增强可能会进一步影响市场对谷歌在人工智能领域地位的预期。
该生成媒体平台的新 H3 Max 模型可在三秒内生成一个五秒的视频剪辑,使人工智能视频生成比实时拍摄更快。Fal 于 8 月 27 日推出了 H3 Max,这是 MiniMax 开源 H3 视频模型的训练后变体,其吞吐量约为 MiniMax 官方端点的 35 倍。Fal 专门为比实时更快的应用程序构
2026/9/17 · 源自 CryptoBriefing
xAI 的语音转语音技术现已在 fal.ai 上推出,具有实时流媒体、音频克隆功能,并支持超过 25 种语言。Grok Voice 现已在 fal.ai 上上线,让开发人员可以直接访问实时语音转语音功能,而无需解决通常伴随这句话而来的基础设施问题。检查您的曝光度 → Grok Voice 的实际用途
2026/9/16 · 源自 CryptoBriefing
Siri Recap 和 Live Rewind 等音频智能工具可以处理设备上的环境声音,但法律专家警告称,该技术可能会违反美国十几个州的窃听法 苹果刚刚给了手表耳朵。在格洛丽亚看到它 → 苹果坚称这些功能在设计上是私密的。苹果的反驳基于技术区别:这些功能不会产生传统意义上的“录音”。
2026/9/11 · 源自 CryptoBriefing
新模型直接以原始音频表演为条件,保留 90 多种语言的音调、节奏和情感。该公司的最新型号 Dubbing v2 采用了一种根本不同的语音翻译方法:它不像其前身那样根据文本转录进行工作,而是聆听原始音频性能并直接根据听到的内容调节其输出。获得优势 → Dubbing v2 的工作方式有何不同 传统的人
2026/9/10 · 源自 CryptoBriefing
周四发布的 MAI-Transcribe-2 的音频费用为每小时 10 美分,比该公司 5 个月前推出该系列第一款产品时收取的每小时 0.36 美元的费用降低了 72%。现在,MAI-Transcribe-2 的价格点已经到来,微软称该价格点低于 OpenAI、Google 或 ElevenLabs
2026/9/3 · 源自 CryptoBriefing
Muse Voice Transcribe 是一种实时语音到文本模型,可以处理大多数转录服务仍然难以解决的两项任务:说话者分类(弄清楚谁说了什么)和端点(了解某人何时真正结束讲话,而不是只是停下来思考)。该模型现已作为更广泛的 Muse Spark 系列的一部分通过 Meta 的模型 API 提供。
2026/9/1 · 源自 CryptoBriefing