昨晚,硅谷经历了AI诸神之战
核心要点
- Gemini 3.8 Flash与Meta Muse Spark同日发布,推理成本直降数倍;
- Google 在把 frontier 级别的能力塞进越来越便宜的模型,Meta 在让 Agent 用更少的 token 和工具调用完成同一个任务,而 Mostik 更进一步,他们开始质疑: 如果通信的双方本来

Gemini 3.8 Flash与Meta Muse Spark同日发布,推理成本直降数倍;初创公司Mostik突破性实验让模型通信成本降至1/20,AI经济学正迎来从“每百万token”到“每任务成本”的范式转移。
编辑:Max
昨天夜里的硅谷发生了三件大事。
Google 发布了 Gemini 3.8 Flash,Meta 发布了 Muse Spark 1.3,一家此前没人讨论过的初创公司 Mostik 则登上了权威媒体 WIRED 的专访。
如果只看前两件,这很像又一个普通的 AI 刷榜之夜。
Google 刚刚把 Gemini 推上 DeepSWE 榜首,几个小时之后,Meta 又公布了更高的成绩,世界第一的头衔甚至只维持了几个小时。
这种事情到了 2026 年,大家甚至已经快麻木了。
模型发布、benchmark 刷新、X 上庆祝几个小时,然后等待下一家公司继续刷新。
但如果把昨天晚上这三件事连起来看,我觉得真正值得关注的东西完全不在那些榜单上。
AI 的经济学正在发生突变。
过去几年,我们讨论 AI 成本,最常看的数字都是每百万 token 多少钱。
但 Agent 出现以后,这套计量方式正在变得越来越不够用。
未来真正重要的问题可能不是“一百万 token 多少钱”,而是修好一个 Bug 多少钱、完成一份研究多少钱、让一个 Agent 连续工作三个小时到底多少钱。
而昨天晚上,推理成本正在从几个完全不同的方向同时往下降。
Google 在把 frontier 级别的能力塞进越来越便宜的模型,Meta 在让 Agent 用更少的 token 和工具调用完成同一个任务,而 Mostik 更进一步,他们开始质疑:
如果通信的双方本来都是 AI,模型之间为什么还需要用为人类设计的语言交流?
PART.01、Gemini 杀回来了
先看 Google。
Google发布了他们全新的旗舰模型Gemini 3.8 Flash ,官方称之为这是他们迄今为止最强大的推理与代码模型。
这也是 Google 在六周时间内对 Flash 系列的第三次更新,从 3.6 到 3.7,再到现在的 3.8。
过去 Flash 给人的印象一直非常简单:更快、更便宜,但能力会比最强模型差一些。
Google 现在正在一点点改变这个定义。
这一次 3.8 Flash 最核心的提升集中在 long-horizon coding 和 agentic workflow。
在衡量 AI 长周期软件工程能力的 DeepSWE v1.1 上,它拿到了约 74% 的成绩。
DeepSWE 和传统代码 benchmark 最大的区别在于,它不是扔给模型一道算法题,而是真的把 Agent 放进一个代码仓库里。
模型需要理解问题、搜索代码、修改文件、调用工具、运行测试,失败以后继续寻找原因。
一个完整任务可能持续几十甚至上百步。
在这样的测试里,Gemini 3.8 Flash 一度登上世界第一。
Claude Opus 5 同样大约是 74%,GPT-5.6 Sol 大约 73%,此前领先的 Fable 5 大约 70%。
如果只看能力,这几个最强模型之间已经没有特别巨大的差距。
真正恐怖的是另外一个数字:钱。
Gemini 3.8 Flash 的 API 首发价格依然保持在输入 0.75 美元 / 1M token、输出 3.75 美元 / 1M token。
在 DeepSWE 上完成一道完整任务,它的平均成本只有 2.36 美元。
作为对比,同样约 74% 的 Claude Opus 5,单任务平均成本达到 11.84 美元;GPT-5.6 Sol 约 73%,平均成本也要 6.46 美元。
也就是说,同一级别的软件工程能力,执行成本已经可以差几倍。
这在 Agent 时代会变得非常重要。
聊天机器人时代,一次回答贵几分钱还是便宜几分钱,普通用户基本没有感知。
但 Agent 完全不一样,一个 coding agent 可能连续运行 100 步,一个 research agent 可能搜索几十个网页、读取几百页资料,未来企业里的 Agent 甚至可能连续工作几个小时。
Google 官方甚至提到,3.8 Flash 遇到复杂任务时会主动 work harder,进行更多推理和工具调用。
Google 没有为了省钱让模型“少思考”,而是因为 token 已经足够便宜,所以可以允许它跑更长的 loop。
