Why a model that explains 95% of variance only compresses 18%20 days agohttps://thefarsightedzipper.substack.com/p/lossy-vs-lossless-how-the-compression压缩可以是有损的(接受误差以获得更高的压缩比)或无损耗的(准确重建数据但压缩比较低)。在1000个公寓价格数据点上使用线性回归模型,压缩比有所不同:有损朴素编码为41:1,有损基于熵的编码为21:1,无损耗基于熵的编码为1.18:1。无损耗压缩包括残差成本,这在例子中占大多数比特(94%),显示模型在比特节省方面的益处有限。压缩比取决于编码方法和目的:当近似数据可接受时,有损压缩适用于存储节省,而无损耗则确保未来分析的准确重建。更多...
A new runtime for k and q: la month agohttps://lv1.sh/l 是针对 k4、q 和 qSQL 的全新运行时环境,保持了与现有代码的语法兼容性。它运行在现代引擎上,专为压缩向量、SIMD 和自动并行优化设计,减少了数据移动开销。性能基准测试显示显著加速,例如在核心测试套件中实现了 3.57 倍的几何平均加速,相比 DuckDB 总体查询速度提升了 3.16 倍。该运行时透明地选择执行路径(标量、SIMD、多线程或卸载执行),无需代码注解。更多...