Modal、Fireworks 和 Baseten 借助 Kimi K3 的 Nvidia 和 AMD 芯片获得成本优势
核心要点
- 得益于卓越的 GPU 硬件,美国推理提供商可以以极低的成本为 Moonshot AI 的大规模开放权重模型提供服务 三个美国人工智能基础设施公司在一个意想不到的地方找到了利润丰厚的优势:为中国制造的模型提供比其创造者更好、更便宜的服务。
- Modal、Fireworks AI 和 Baseten 现在为

得益于卓越的 GPU 硬件,美国推理提供商可以以极低的成本为 Moonshot AI 的大规模开放权重模型提供服务
三个美国人工智能基础设施公司在一个意想不到的地方找到了利润丰厚的优势:为中国制造的模型提供比其创造者更好、更便宜的服务。 Modal、Fireworks AI 和 Baseten 现在为 Moonshot AI 的 Kimi K3 提供托管推理,其成本约为直接访问的十分之一,由 Nvidia 和 AMD 最新的加速器硬件提供支持,但在美国出口管制下,中国公司基本上无法使用这些硬件。
是什么让 Kimi K3 值得付出努力
Kimi K3并不是一个小型号。它由 Moonshot AI 于 2026 年 7 月 27 日发布,将 2.8 万亿个参数打包到混合专家架构中,使其成为有史以来发布的最大的开放权重模型之一。 “开放权重”的区别很重要:任何人都可以下载并运行模型,这正是 Modal、Fireworks 和 Baseten 所做的。
格洛丽亚 拥有这个故事中的任何名字吗?了解今天的走势对您的投资组合有何实际影响。在格洛丽亚开业 →
MoE 设计意味着不会在每次查询时激活全部 2.8 万亿个参数。相反,K3 通过 896 个可用专家中的 16 个来路由每个令牌,每次前向传递激活大约 1040 亿个参数。 K3 还支持 100 万个 token 的上下文窗口,这意味着它可以在单个会话中对书本长度的文档进行摄取和推理。
但运行这种规模的模型并非易事。即使使用 MXFP4 量化进行压缩,权重文件也会超过 1.4 TB。 Baseten 指出,部署需要多 GPU 配置,例如八个 Nvidia GB300 加速器等设置协同工作,以便将模型保存在内存中。
硬件优势
美国推理提供商可以使用 Nvidia 的 GB300 NVL72 系统以及 AMD 的 MI350X 和 MI355X 加速器。中国公司,包括 Moonshot AI 本身,都面临着出口限制,限制了他们获得这些处理器。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
Modal 报告称,其 Kimi K3 的部署使用专门为 K3 架构构建的名为 DFlash 的定制推测解码器,每秒可处理 460 个令牌。定价反映了这些效率。三个提供商的共享端点的价格约为每百万个输入代币 3 美元、每百万个缓存代币 0.30 美元、每百万个输出代币 15 美元。
合规作为卖点
除了原始性能之外,Modal、Fireworks 和 Baseten 还向目标客户推销一些可以说更有价值的东西:数据驻留和合规性保证。这三者都强调零数据保留政策,这意味着客户提示和完成内容不会被存储或用于培训。它们还提供专用容量和美国托管的端点,这些功能对于企业在医疗保健、金融和政府合同等领域遵守数据主权法规至关重要。
这三个提供商还支持 OpenAI 兼容的 API,这降低了已经集成 OpenAI 工具的企业的转换成本。开发人员只需进行最少的更改即可将现有代码指向 Kimi K3 端点,测试 2.8 万亿参数模型是否优于当前设置,而无需进行重大工程投资。
