Skip to main content
全球有大量数据存储在亚马逊 S3 存储桶中。 本指南将介绍如何使用 chDB 查询这些数据。

设置

首先,创建一个虚拟环境:
现在我们来安装 chDB。 请确保版本为 2.0.2 或更高:
现在我们来安装 IPython:
我们将使用 ipython 运行本指南其余部分中的命令,你可以通过运行以下命令启动它:
你也可以在 Python 脚本或常用的 Notebook 中使用这段代码。

探索 Parquet 元数据

我们将查看来自亚马逊评论数据集的一个 Parquet 文件。 不过,先安装 chDB
查询 Parquet 文件时,我们可以使用 ParquetMetadata 输入格式,让它返回 Parquet 元数据,而不是文件内容。 我们使用 DESCRIBE 子句来查看使用这种格式时会返回哪些字段:
现在我们来看看这个文件的元数据。 columnsrow_groups 都是包含许多属性的元组数组,因此暂时先不看它们。
从这段输出中,我们可以看出,这个 Parquet 文件包含超过 4000 万行数据,分布在 42 个行组中,每行有 15 列数据。 行组是按行对数据进行逻辑上的水平分区。 每个行组都带有关联的元数据,查询工具可以利用这些元数据高效查询该文件。 让我们来看其中一个行组:

查询 Parquet 文件

接下来,我们来查询该文件的内容。 为此,我们可以在上面的查询基础上去掉 ParquetMetadata,然后例如统计所有评论中最常见的 star_rating
有趣的是,5 星评价竟然比其他所有评分加起来还多! 看起来大家都挺喜欢亚马逊上的产品;就算不喜欢,往往也不会提交评分。
最后修改于 2026年7月3日