LensVLM-9B by Apple
3 hours ago
- 视觉语言模型将文本作为渲染图像处理,但由于字符缩小,在高压缩下准确率会下降。
- LensVLM 扫描压缩图像,并使用学习到的工具选择性地将相关部分扩展为未压缩形式。
- LensVLM 在 4.3 倍有效压缩下实现了与全文上限相当的准确率,在七个文本问答基准上以高达 10.1 倍的压缩率优于基线方法。
- 该框架可推广到多模态文档和代码理解,且随着压缩级别的提高,收益也会增加。
- 训练使视觉压缩对渲染选择具有鲁棒性;模型越来越依赖扩展内容,而不是不可靠的视觉读取。
- 工具选择指导:对于渲染文本使用文本扩展,对于具有布局线索的原生文档使用高分辨率图像扩展。