Gemini 3.8 Flash TTS以89.5%的成绩在发音鲁棒性基准测试中排名第一
核心要点
- 谷歌最新的文本转语音模型在多项质量基准上击败了竞争对手,这表明谷歌正在大力推进人工智能生成的音频 谷歌最新的文本转语音模型刚刚在人工智能音频领域引用最广泛的发音准确性测试中名列前茅。
- Gemini 3.8 Flash TTS 在人工分析发音鲁棒性基准测试中得分为 89.5%,位居第一。
- Gemini 3

谷歌最新的文本转语音模型在多项质量基准上击败了竞争对手,这表明谷歌正在大力推进人工智能生成的音频
谷歌最新的文本转语音模型刚刚在人工智能音频领域引用最广泛的发音准确性测试中名列前茅。 Gemini 3.8 Flash TTS 在人工分析发音鲁棒性基准测试中得分为 89.5%,位居第一。
这些数字的实际含义是什么
Gemini 3.8 Flash TTS 的 89.5% 分数比其前身 Gemini 3.1 Flash TTS 的 88.2% 有了显着的进步。
格洛丽亚 您的经纪公司向您显示余额。格洛丽亚(Gloria)向您展示了他们搬家的原因——跨越每块土地。在格洛丽亚看到它 →
发音基准并不是谷歌新模型获得奖杯的唯一排行榜。 Gemini 3.8 Flash TTS 也在 Hume AI 语音设计基准测试中以 71.4 的总分稳居榜首。它在口音再现方面得分为 60.8。更重要的是,它在休谟人工智能整体质量指数上同时占据了第一和第二的位置。
在引擎盖下
Google 于 9 月 23 日推出了 Gemini 3.8 Flash TTS,以及名为 Flash-Lite TTS 的更轻版本。两者都可以通过 Gemini API 和 Google AI Studio 在模型标识符gemini-3.8-flash-tts 和gemini-3.8-flash-lite-tts 下进行访问。
Gemini 3.8 Flash 基本型号已于 9 月初发货。大约三周后,进行了针对 TTS 的升级。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
该模型支持根据文本提示进行生成语音设计,这意味着您可以描述您想要的语音,系统将创建它。它可以从大约 30 秒的音频样本中复制特定的声音。它可以处理多说话者交互,因此单个模型可以表达不同角色之间的整个对话。
语言覆盖范围超过 100 种语言,并支持地方口音。谷歌还通过元数据和内联标签来宣传工作室级的语音保真度和细粒度控制。
竞争格局日趋激烈
谷歌并没有进入一个空房间。 ElevenLabs 围绕高质量语音合成建立了庞大的业务,而 OpenAI 一直在稳步扩展自己的音频功能。随着人工智能代理、客户服务机器人和内容创建工具都需要更高质量的语音,TTS 市场已经从一个小众关注点变成了真正的战场。
