OpenBMB 的 MiniCPM5-2B 在人工分析指数 v4.2 的 4B 参数下领先开放模型
核心要点
- 清华大学合作者的 20 亿参数模型在最新的人工智能基准排名中远远超出了其权重级别。
- 一个只有 20 亿个参数的模型在人工智能分析智能指数 v4.2 上,在 40 亿个参数下的开放模型中名列第一,得分为 15 分。
- 其前身MiniCPM5-1B此前在早期版本的人工分析指数中得分为17.9,在20亿参数下的

清华大学合作者的 20 亿参数模型在最新的人工智能基准排名中远远超出了其权重级别。
一个只有 20 亿个参数的模型在人工智能分析智能指数 v4.2 上,在 40 亿个参数下的开放模型中名列第一,得分为 15 分。 OpenBMB 的 MiniCPM5-2B 是与清华大学 NLP 实验室和 ModelBest 合作构建的,旨在在手机、笔记本电脑和其他计算资源非常昂贵的设备上运行。
基准测试实际衡量的是什么
Artificial Analysis 于 2026 年 9 月 4 日发布了其智能指数 4.2 版本,就在 MiniCPM5-2B 发布前三天。更新后的指数对人工智能模型的评估方式进行了有意义的改变。
格洛丽亚 关闭应用——格洛丽亚财经持续关注。设置监视器并仅在发生重大变化时才收到反馈。设置监视器 →
私人测试集现在占总权重的 40%,高于之前的版本。这很重要,因为私人测试更难被操纵。当模型开发人员无法提前看到考试问题时,分数就成为真正能力的更可靠信号。
v4.2 更新还添加了两个新的评估组件:AA-Briefcase 代理评估和 Surge 的 GDP.pdf 长上下文测试。这些新增内容反映了业界对能够自主运行和处理很长文档的模型越来越感兴趣,而不仅仅是很好地回答琐碎问题。
在整体排行榜的顶部,专有模型仍然占据主导地位。 Anthropic 的 Claude Fable 5.1 处于领先地位。但在 sub-4B 参数类别中,效率和可访问性比原始功率更重要,MiniCPM5-2B 在开放权重排名中名列前茅。
小模型,大志向
MiniCPM5-2B 是一个密集变压器,这意味着每个参数在推理过程中都是活跃的,而不是通过专家混合架构进行路由。密集模型的资源消耗往往更可预测,这正是将人工智能部署到边缘设备时所需要的。
该模型支持范围从 131K 到 512K 令牌的上下文窗口,具体取决于配置。作为参考,512K 令牌大致相当于一次处理一本 1,000 页的书。
OpenBMB 针对 AMD、Intel、MediaTek 和 Qualcomm 的芯片优化了 MiniCPM5-2B。
在功能方面,该团队声称在编码、数学、长上下文理解、工具利用和代理工作流程的参数范围内具有最先进的性能。
该模型的训练结合了强化学习对齐和 OpenBMB 所描述的高质量轨迹,这些技术旨在改进模型处理复杂的顺序决策的方式。
MiniCPM 谱系
MiniCPM5-2B 建立在良好的记录之上。其前身MiniCPM5-1B此前在早期版本的人工分析指数中得分为17.9,在20亿参数下的模型中名列前茅。
两个模型之间的得分差异(1B 版本为 17.9,2B 版本为 15)反映了指数方法的变化,而不是倒退。 4.2 版本更加依赖私人测试集和新的评估类别,这意味着各个版本的分数无法直接比较。
这对设备上的人工智能意味着什么
小型车型的竞争格局日趋拥挤。 Meta 的 Llama 系列、微软的 Phi 模型和谷歌的 Gemma 变体都在相似的参数范围内竞争。 MiniCPM5-2B 在 sub-4B 类别中的基准领先地位引人注目,但基准主导地位和现实世界的实用性并不总是步调一致。
该模型声称的性能的独立验证尚未公开记录。在人工智能基准测试中,第三方对结果的再现是新闻稿和经过验证的能力之间的区别。
