Gemini 3.8 Flash 以极低的价格在关键基准测试中挑战 Claude Opus 5
核心要点
- 该模型在编码、多步推理和法律任务性能等多个关键基准上的表现优于 Anthropic 的 Claude Opus 5,该模型每个输出令牌的成本大约是其七倍。
- 更重要的是:Gemini 3.8 Flash 的定价为每百万个输入代币 0.75 美元,每百万个输出代币 3.75 美元。
- Anthropic 将

Google DeepMind 的最新 Flash 模型在 HLE 验证推理测试中得分为 54.9%,并在工程任务中击败了更大的前沿模型,而所有这些模型的代币成本仅为 Anthropic 旗舰产品的七分之一左右。
谷歌 DeepMind 于 9 月 2 日放弃了 Gemini 3.8 Flash,它已经开始在其重量级之上进行战斗。该模型在编码、多步推理和法律任务性能等多个关键基准上的表现优于 Anthropic 的 Claude Opus 5,该模型每个输出令牌的成本大约是其七倍。
更重要的是:Gemini 3.8 Flash 的定价为每百万个输入代币 0.75 美元,每百万个输出代币 3.75 美元。 Claude Opus 5 每百万输入代币运行 5 美元,每百万输出代币运行 25 美元。
基准细分
Gemini 3.8 Flash 在 HLE-Verified 上获得了 54.9% 的分数,HLE-Verified 是一项要求严格的多步骤推理评估,涵盖 STEM、人文学科和其他学科。
该模型在 DeepSWE v1.1 基准测试中的表现也优于较大的前沿模型,该基准测试衡量复杂工程问题解决任务的性能。
Anthropic 于 7 月 24 日推出的 Claude Opus 5 在代理知识工作和编码任务的多项基准测试中仍然处于领先地位。截至 9 月初的独立评估显示,根据所测试的类别,这两种模型处于领先地位。
用于比较的相关基准包括SWE-bench和Terminal-Bench等。在其中一些评估中,Claude Opus 5 保持着优势,特别是在需要在较长工作流程中持续自主推理的任务中。
六周内推出三个模型
Gemini 3.8 Flash 是 Google DeepMind 在短短六周内发布的第三个 Flash 系列模型。 Gemini 3.7 Flash 和 3.8 Flash 之间的差距约为三周。
Anthropic 将 Claude Opus 5 定位为优质产品,其定价为每百万输出代币 25 美元,而 Flash 的定价为 3.75 美元。
这对人工智能市场意味着什么
对于评估将哪些模型集成到其工作流程中的企业而言,Gemini 3.8 Flash 在其价位上的基准性能创造了令人信服的价值主张。每天运行数百万次 API 调用的公司可以通过从高级模型切换到 Flash 来大幅降低成本,而无需牺牲大多数任务的有意义的功能。数学对于软件工程工作流程变得特别有吸引力,DeepSWE 结果表明 Flash 可以应对复杂的编码挑战,而这些挑战以前需要更昂贵的模型。
Claude Opus 5 在代理基准方面仍然受到尊重,在自主研究、法律分析和多步骤规划方面拥有严格用例的企业可能仍然会发现溢价是值得的。
