Hasty Briefsbeta

双语

Expert-aware quantisation: near-Q4 quality at near-Q2 size?

a day ago
  • 分析MoE模型发现,在代码生成过程中,专家使用高度集中:256个专家中的前32个处理了约50%的路由,从而实现了选择性量化。
  • 引入了一种技术,以高精度量化“热”专家(任务相关),以低精度量化“冷”专家(例如,Q8-hot/Q2-cold或Q4-hot/Q2-cold),通过修改llama.cpp实现。
  • 结果表明,经过剖析的分层量化优于随机选择,并在接近Q2大小的情况下实现了接近Q4的质量:Q4-hot/Q2-cold模型仅用额外1GB就恢复了Q2和Q4之间约90%的差距。
  • 该方法尚未达到生产就绪状态,但指出了未来的方向:低于2比特的冷专家、动态领域特定模型下载以及更大的剖析数据集。
  • 先前的工作包括DynaExq、Mixture-Compressor、MoPEQ以及像AWQ和SpQR这样的基础量化方法,但本工作将每个专家的静态领域剖析量化应用于单个GGUF文件。