Hasty Briefsbeta

双语

LensVLM-9B by Apple

3 hours ago
  • 视觉语言模型将文本作为渲染图像处理,但由于字符缩小,在高压缩下准确率会下降。
  • LensVLM 扫描压缩图像,并使用学习到的工具选择性地将相关部分扩展为未压缩形式。
  • LensVLM 在 4.3 倍有效压缩下实现了与全文上限相当的准确率,在七个文本问答基准上以高达 10.1 倍的压缩率优于基线方法。
  • 该框架可推广到多模态文档和代码理解,且随着压缩级别的提高,收益也会增加。
  • 训练使视觉压缩对渲染选择具有鲁棒性;模型越来越依赖扩展内容,而不是不可靠的视觉读取。
  • 工具选择指导:对于渲染文本使用文本扩展,对于具有布局线索的原生文档使用高分辨率图像扩展。