General Compute 购买大量 Cerebras 芯片以增强人工智能推理输出
核心要点
- neocloud 的混合 Nvidia-Cerebras 架构以代理编码工作负载的每个令牌延迟为目标,容量将于 2027 年初上线。
- 专注于人工智能推理的 neocloud 于 2026 年 9 月 29 日宣布,它正在购买大量 Cerebras Systems 晶圆级芯片,与其现有的 Nvidia

neocloud 的混合 Nvidia-Cerebras 架构以代理编码工作负载的每个令牌延迟为目标,容量将于 2027 年初上线。
通用计算公司正在做出迄今为止最大的硬件赌注。专注于人工智能推理的 neocloud 于 2026 年 9 月 29 日宣布,它正在购买大量 Cerebras Systems 晶圆级芯片,与其现有的 Nvidia GPU 一起运行,创建一个混合架构,旨在消除要求苛刻的人工智能工作负载中的延迟。
该功能预计于 2027 年第一季度向客户投入使用,代理编码将作为第一个目标用例。自主编码代理依赖于长链的连续推理步骤,即使是很小的延迟也会导致令人沮丧的等待时间。
混合架构的实际工作原理
第一个行为称为提示预填充,涉及立即消化整个输入上下文。该任务是高度并行且计算量大的,这正是 Nvidia GPU 的设计目的。
第二步是解码,模型按顺序一次生成一个令牌。该过程受内存带宽限制,而不是计算限制,这意味着原始 GPU 能力的重要性不如芯片洗牌数据的速度。 Cerebras 的晶圆级引擎是专门针对该瓶颈而设计的。
Cerebras 已经拥有目前生产中最快的每用户代币生成率。实际的回报是整个管道中每个代币的延迟更低。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
资金和市场环境
这是自 Finn Puklowski 和 Jason Goodison 创建该公司以来 General Compute 最大的硬件承诺。此次收购的部分资金来自该公司于 2026 年 7 月向 Upper90 提供的 4 亿美元债务融资。
Cerebras 已与 OpenAI 达成一项价值 100 亿至 200 亿美元的多年协议,涵盖 750 兆瓦的容量。
该交易反映的更广泛的趋势是一些业内人士所说的推理碎片化。运营商不再在单一供应商提供的相同硬件上运行模型操作的每个阶段,而是越来越多地寻求针对管道特定阶段进行优化的专用芯片。 Cerebras 负责解码。 Nvidia 处理预填充。
