RIP, Vector Database
19 hours ago
- turbopuffer 正在过渡到一种名为 'turbopuffer v3' 的新存储架构,该架构改变了文档和索引的布局、写入、压缩和查询方式。
- 新引擎旨在通过将 ANN 变成‘另一种’二级索引而非主索引,来支持更大规模下的更多查询计划。
- 最初,turbopuffer 是一个专注于廉价向量搜索的无服务器向量数据库,后来演变为具有属性过滤和全文搜索的通用搜索数据库,但其存储架构仍然以 ANN 索引为中心。
- 当前的架构会导致存储放大(为多向量复制文档数据)、写入放大(重新平衡会移动整个文档和索引)以及向量化受限(块大小受集群大小限制)。
- 解决方案是不再以 ANN 地址为数据键;turbopuffer v3 实现了这一改变。
- 所有 CI 测试在 v3 上都通过,但存在显著的性能回归,团队目前正在调整。
- 未来的更新将包括基准测试以及新架构和优化的详细解释。