谷歌 DeepMind 和哈佛大学提出视觉优先的 AGI 路径
核心要点
- 超过 21 名人工智能研究人员发布的新白皮书认为,图像和视频(而不仅仅是文本)可能是构建通用人工智能的关键 多年来,构建通用人工智能的竞赛一直由一种模式主导:语言。
- 谷歌 DeepMind、哈佛大学和其他领先机构的研究人员发表的一份新白皮书认为,这种方法可能并不完整,通向通用人工智能的道路可能是机器所

超过 21 名人工智能研究人员发布的新白皮书认为,图像和视频(而不仅仅是文本)可能是构建通用人工智能的关键
多年来,构建通用人工智能的竞赛一直由一种模式主导:语言。 GPT、克劳德、双子座。他们所有人都通过消化海量的文本学会了推理。谷歌 DeepMind、哈佛大学和其他领先机构的研究人员发表的一份新白皮书认为,这种方法可能并不完整,通向通用人工智能的道路可能是机器所看到的而不是它们所读到的。
这篇题为“视觉通用智能:白皮书”的论文在 arXiv 上发表,编号为 2608.25924,提出了作者所谓的视觉通用智能(VGI)的研究议程。核心论文:人工智能系统应该直接从图像、视频和几何数据中学习,以理解、预测和在物理世界中采取行动。
格洛丽亚 一只你不拥有的股票刚刚移动——而两只你确实依赖它。凯莱财经看到了其他人所忽视的联系。查看连接 →
论文实际上说了什么
这不是产品发布或超越基准的模型展示。这是一份立场文件,是超过 21 位研究人员关于该领域下一步应该关注哪些领域的集体争论。
贡献者包括来自 Google DeepMind 的 Robert Geirhos 和来自哈佛大学的 Yilun Du。这项工作源于 CVPR 2026 视觉通用智能研讨会的讨论,这是计算机视觉社区的主要聚会之一。
本文并没有提出单一的模型或架构,而是讨论了通过视觉体验构建智能的原则、基准和学习范例。研究人员认为,生成视频模型和自我监督学习(系统通过预测视觉序列中接下来发生的事情来进行自我训练)可以为通用人工智能提供单靠语言无法提供的基础。
本文还探讨了整合多种模式的策略。在此框架中,视觉和语言并不被定位为竞争对手,而是互补的渠道,各自捕获不同的情报片段。
基于 DeepMind 的 AGI 框架构建
白皮书并不是孤立存在的。它建立在 Google DeepMind 一系列出版物的基础上,这些出版物试图绘制通向 AGI 及其他领域的道路。
2024 年,DeepMind 发表了《Levels of AGI》论文,提出了衡量通用智能进展的分类法。最近,2026 年 6 月,DeepMind 跟进了“从 AGI 到 ASI”,探讨了通用智能之后可能出现的情况:人工超级智能。 VGI 白皮书巧妙地融入了这一知识弧线,询问当前以文本为主的范式是否足以达到早期论文所描述的里程碑。
目前,该文件没有附带具体的性能声明、模型时间表或产品路线图。它故意是开放式的,旨在激发探索而不是宣布胜利。
