DeepSeek推出V4.1-Flash模型,具有552B参数和百万令牌上下文窗口
核心要点
- 这家中国人工智能初创公司的最新模型激活了其总参数的一小部分,以极低的成本提供与 GPT-5.6 相媲美的性能 DeepSeek 刚刚放弃了一个模型,该模型可以处理一百万个上下文令牌,同时激活的参数比两年前发布的一些开源模型要少。
- 支持大规模上下文的是 KV 缓存,每个令牌消耗大约 890 字节,大约是

这家中国人工智能初创公司的最新模型激活了其总参数的一小部分,以极低的成本提供与 GPT-5.6 相媲美的性能
DeepSeek 刚刚放弃了一个模型,该模型可以处理一百万个上下文令牌,同时激活的参数比两年前发布的一些开源模型要少。 V4.1-Flash于9月10日推出,代表了这家中国人工智能初创公司重写大型语言模型经济学的最新努力。
该模型将 5520 亿个参数打包到专家混合 (MoE) 架构中,但仅启动其中约 80 亿个参数用于输入任务,160 亿个参数用于输出任务。结果是一个模型的性能远高于其活跃计算足迹所建议的水平。
使其发挥作用的架构
V4.1-Flash 引入了 DeepSeek 所谓的非对称因果编码器-解码器架构,通过针对每个任务优化的不同路径处理输入并生成输出,而不是通过单个管道运行所有内容。
上下文窗口扩展到 100 万个标记。支持大规模上下文的是 KV 缓存,每个令牌消耗大约 890 字节,大约是之前的 V4-Flash 模型所需的四分之一。
减少缓存比听起来更重要。 KV 缓存是内存瓶颈,它决定模型可以服务多少并发用户以及他们的对话可以运行多长时间。削减 75% 意味着运营商可以在相同的硬件上为大约四倍的用户提供服务,或者在不升级 GPU 集群的情况下处理四倍的上下文。
在基准测试中,DeepSeek 声称 V4.1-Flash 的性能优于该公司自己的 V4-Pro 型号,并与 GPT-5.6 和 Kimi K3 直接竞争。该公司已将 V4-Pro 的请求路由至新型号,更新后的定价将于 9 月 14 日生效。
开放权重、开放策略
DeepSeek 在 MIT 许可下在 Hugging Face 上发布了该模型的权重。新模型可通过端点“deepseek-flash”下的 DeepSeek API 访问。开放权重和 API 访问的结合创建了一条双轨采用路径:想要在自己的基础设施上运行推理的开发人员可以在本地下载和部署,而那些喜欢托管服务的开发人员可以在 DeepSeek 的新定价层调用 API。
IPO影响和竞争定位
V4.1-Flash 的推出时机并非偶然。 DeepSeek预计将在上海科创板上市,展示持续的技术势头使得路演演示更具说服力。
V4.1-Flash 中内置的多模式理解涵盖视觉和文本数据,缩小了 OpenAI 和开发 Kimi K3 的 Moonshot AI 等竞争对手的差异化机会。
