Indexing the Data Lake for Online Point Queries
4 hours ago
- 像 Spotify 这样的公司需要低延迟访问大型数据集以用于在线服务和 AI 代理,但分布式 SQL 引擎对点查询会增加数秒的开销。
- 随机访问 Parquet(RAP)通过使用外部索引将键直接映射到文件位置来弥合这一差距,从而实现精确的范围读取,无需扫描。
- RAP 在现有的 Parquet 文件上运行,无需在键值存储中创建单独的副本。
- 外部索引是一个确定性的多重映射,它返回给定键的精确文件和行号,从而减少依赖读取。
- 按键排序、共分组、更粗的分区、每键一页、ZSTD 帧重置、blob、列交错、存储对齐和覆盖索引等优化进一步降低了延迟和带宽。
- 这些优化牺牲了一些批量分析的优势,以换取更快的点查询。
- RAP 使历史数据或长尾数据可用于交互式访问,将数据湖转变为同时支持分析型和工作负载型的双用途存储。