Chutes AI 和哈佛大学发布了 61.2 亿个 LLM 请求的公共数据集
核心要点
- 涵盖 9,174 个模型的长达一年的数据集显示,99% 的请求在 15 分钟内重复,这一发现对人工智能基础设施的构建方式具有重大影响。
- Chutes 是一个运行在 Bittensor 子网 64 上的去中心化人工智能推理平台,它与哈佛大学研究人员合作,发布了可能是有史以来最大的服务于元数据的 LLM

涵盖 9,174 个模型的长达一年的数据集显示,99% 的请求在 15 分钟内重复,这一发现对人工智能基础设施的构建方式具有重大影响。
如果您曾经想知道数十亿个人工智能请求实际上是什么样子,现在您可以找到答案。 Chutes 是一个运行在 Bittensor 子网 64 上的去中心化人工智能推理平台,它与哈佛大学研究人员合作,发布了可能是有史以来最大的服务于元数据的 LLM 公共数据集。
这些数字令人震惊:全年生产流量中 314,970 名匿名用户生成了 9,174 个模型中的 6,122,413,756 个请求。该数据集的时间跨度为 2025 年 4 月 11 日至 2026 年 4 月 12 日,现在可通过 GitHub 和哈佛 S3 存储桶免费获取。
凯莱 询问有关任何股票的任何问题 — 凯莱财经在几秒钟内为您提供完整的、有数据支持的答案。询问格洛丽亚 →
这东西里面到底有什么
该数据集捕获元数据,而不是人们与人工智能模型的实际对话。它包括请求计时、令牌计数、延迟测量和首次令牌时间 (TTFT) 指标,但提示或响应为零。在一年的时间里,Chutes 处理了大约 35.8 万亿个输入代币和 2.52 万亿个输出代币。
数据集中的用户标识符每三个月轮换一次,增加了另一层匿名化。随附的文档由哈佛大学、芝加哥大学和 Chutes 的研究人员共同撰写,提供了详细的方法说明,使数据真正可用于学术工作。
99%重复率问题
也许该数据集中隐藏的最重要的发现是:99% 的重复请求发生在 15 分钟内。研究团队发现,前缀感知路由策略可以实现近乎最佳的缓存命中率,并且服务器之间的负载不平衡程度很小。
人工智能、科技及其所推动的市场——每日简报。日常的。自由的。加入加密货币、金融和政策领域 34,000 多名读者的行列。电子邮件地址 免费订阅 我们尊重您的隐私。随时取消订阅。
在数据集的时间跨度内,输出长度一直在下降,从每个响应的数百个标记降至不到 100 个。研究人员将此解释为向代理或机器驱动查询转变的证据,其中自动化系统正在发出快速、有针对性的请求,而不是人类要求冗长的解释。
Bittensor 连接
Chutes 作为 Bittensor 去中心化网络(特别是 Subnet 64)的一部分运行,在分布式 GPU 基础设施上运行开源 LLM。平台上的付款通过 Bittensor 的原生代币 TAO 进行。
Chutes 和哈佛大学之间的合作包括从 2026 年 3 月到 2026 年 7 月的选择加入期,研究人员向数据集贡献其使用数据可以享受 25% 的折扣。
