牛津大学允许 OpenAI 在 Bodleian 图书馆数据上训练 AI 模型
核心要点
- 一项为期五年的协议使 OpenAI 能够访问已有数百年历史的论文,而牛津大学的工作人员则对此次合作带来的声誉风险表示担忧。
- 牛津大学与 OpenAI 建立了为期五年的合作伙伴关系,让 ChatGPT 背后的公司能够利用传奇的博德利图书馆中的历史文本来训练其人工智能模型。
- 更大的前景:人工智能对学术数据的

一项为期五年的协议使 OpenAI 能够访问已有数百年历史的论文,而牛津大学的工作人员则对此次合作带来的声誉风险表示担忧。
世界上最古老的大学之一刚刚将其图书馆的钥匙交给了世界上最新的科技巨头之一。牛津大学与 OpenAI 建立了为期五年的合作伙伴关系,让 ChatGPT 背后的公司能够利用传奇的博德利图书馆中的历史文本来训练其人工智能模型。
这项合作于 2025 年 3 月 4 日宣布,并于 2 月份启动了一个试点项目,目标是将 1498 年至 1884 年约 3,500 篇公共领域论文数字化。这些文本已经在书架上搁置了几个世纪,对于任何无法亲自访问牛津的人来说基本上无法访问。
格洛丽亚 看看内部人士和国会实际上在购买什么。凯莱财经揭示了值得重新审视的举措。追随金钱 →
交易实际涉及什么
此次合作属于 OpenAI 的 NextGenAI 计划,该计划已向少数精英机构提供 5000 万美元的研究资助、计算资源和 API 访问权限。牛津大学加入了哈佛大学和麻省理工学院的行列。
对于博德利图书馆来说,其定位很简单:人工智能驱动的元数据丰富和改进的转录服务将使具有数百年历史的馆藏可搜索并在全球范围内访问。
在教育方面,牛津大学计划从 2025 年 9 月开始在全校范围内推出 ChatGPT Edu。该工具已在约 750 名用户中进行了试用。数字化项目的研究成果预计将于 2026 年初发布在开放获取报告中。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
为什么员工不兴奋
并非牛津大学的每个人都在庆祝这一安排。大学工作人员对与 OpenAI 合作的声誉风险表示担忧,该公司在版权问题、数据采购实践以及首席执行官 Sam Altman 领导下的快速商业化方面一直面临批评。
所讨论的论文属于公共领域,这意味着不适用版权。但一家拥有 900 年历史的学术机构将其馆藏提供给一家营利性人工智能公司的更广泛的观点引起了人们的关注,这是可以理解的。
还有一个问题是 OpenAI 得到了什么与 Oxford 得到了什么。该大学获得数字化支持、计算资源和教育工具。 OpenAI 从全球值得信赖的来源接收高质量、精心策划的训练数据,并获得牛津合作伙伴的隐性认可。
更大的前景:人工智能对学术数据的渴望
牛津大学与 OpenAI 的合作符合高等教育领域不断加速发展的模式。科技公司越来越多地转向学术机构作为数据源,部分原因是网络抓取的数据遇到了法律挑战,部分原因是学术语料库往往比普通互联网文本的质量更高。
NextGenAI 项目的 5000 万美元承诺分布在多个机构,相对于 OpenAI 每年数十亿美元的总体支出而言,这一资金数额很大,但规模不大。
