Hasty Briefsbeta

双语

Just brute force your embeddings

7 hours ago
  • 对于小型数据集(例如约100万条文档),使用numpy进行暴力搜索既快速且通常足够。
  • 许多团队不需要向量数据库的复杂性,尤其是在查询流量较低且嵌入向量已预计算的情况下。
  • 性能基准测试显示,即使使用简单的numpy操作处理880万个向量,也能获得不错的QPS和延迟表现。
  • 进一步的优化,如多线程和基于堆的top-n收集,可以提升吞吐量。