蚂蚁集团的 Ling-3.0-flash-VL 仅 5.5B 活跃参数智能指数就获得 25 分
核心要点
- 该多模态模型包含 1240 亿个总参数,但每次推理仅触发 55 亿个参数,与人工分析基准上的纯文本模型相匹配。
- 蚂蚁集团的 InclusionAI 实验室发布了 Ling-3.0-flash-VL,这是一种多模态 AI 模型,在人工智能分析智能指数上得分为 25,每次推理仅激活其 1240 亿个总参数

该多模态模型包含 1240 亿个总参数,但每次推理仅触发 55 亿个参数,与人工分析基准上的纯文本模型相匹配。
蚂蚁集团的 InclusionAI 实验室发布了 Ling-3.0-flash-VL,这是一种多模态 AI 模型,在人工智能分析智能指数上得分为 25,每次推理仅激活其 1240 亿个总参数中的 55 亿个。
该模型是蚂蚁集团 Ling(百灵)系列的一部分,原生处理图像、文本和视频输入。它已在 MIT 许可下开源,Hugging Face 和 ModelScope 上提供 BF16 和 FP8 权重。
格洛丽亚 关闭应用——格洛丽亚财经持续关注。设置监视器并仅在发生重大变化时才收到反馈。设置监视器 →
这个模型有何不同
头条新闻的智力指数为 25,与之前的纯文本版本 Ling-3.0-flash 所取得的分数相匹配。早期的评估实际上显示 VL(视觉语言)变体的得分比文本版本高 4 分,这表明性能可能会因所应用的基准套件而异。
该模型总共包含 1240 亿个参数,但对于任何给定的推理调用仅激活 55 亿个参数。这种专家混合风格的设计意味着该模型可以提供强大的结果,而不需要每次查询进入时都触发完整的参数集。
该模型还具有在 256K 和 262K 令牌之间延伸的上下文窗口,特别适合需要在不截断的情况下处理大型文档、冗长的视频输入或复杂的多步骤代理工作流程的企业用例。
视觉反馈和代理能力
其中比较显着的技术特点就是蚂蚁集团所说的“视觉反馈闭环机制”。在实践中,这意味着模型可以评估自己的视觉输出并进行自我纠正,这种能力对于错误迅速复合的生产级应用程序非常重要。
蚂蚁集团瞄准的实际应用包括图像到网络代码生成、GUI 代理功能和医疗报告分析。
API 访问可通过 Ling Studio 和合作伙伴平台进行。
开放重量策略
在麻省理工学院的许可下发布这种级别的模型是一种有意的竞争举措。麻省理工学院的许可证与开源许可证一样宽松:公司可以使用、修改模型并将其商业化,基本上没有任何限制。
FP8 权重与标准 BF16 格式的可用性是一个值得注意的实用细节。与 BF16 相比,FP8 量化将内存需求减少了大约一半,使得在更适度的 GPU 基础设施上运行的组织可以访问该模型。
这适合竞争格局
人工智能分析智能指数 25 分,使 Ling-3.0-flash-VL 与其他注重效率的多模式模型相媲美。仅用 55 亿个活动参数就达到 25,凸显了通过稀疏激活架构可实现的效率提升。
