LensVLM: Compressing long context as images, expanding only relevant pages
4 hours ago
- Apple/LensVLM-9B 可通过 Transformers、vLLM 和 SGLang 等库用于多模态视觉-语言任务。
- 该模型处理压缩的文本图像,并使用学习到的工具选择性地展开相关页面。
- 关键使用方法包括管道、直接模型加载、API 服务器、Docker 容器化以及本地推理脚本。
- 模型的替代 Python 脚本(例如 run_demo.py)允许通过压缩选项(5倍、10倍、15倍)进行自定义文档处理。
- 许可条款规定模型文件适用 Apple ML 研究模型许可证,源代码适用 Apple 示例代码许可证。