亚洲财经

搜索

苹果开源LensVLM-9B:100页文档先压成图,KV缓存省84%

苹果开源了专门处理长文档的视觉语言模型LensVLM-9B,该模型基于Qwen3.5-9b-base训练。处理长文档时,LensVLM会先将整份文档压成低清页面快速扫一遍,定位到相关页面后,再读取原始文字或高清图片。测试显示,直接读取100页文档需要51,273个tokens,而LensVLM仅需8,090个,KV缓存从约1.6GB降至253MB,减少84.2%。在7项文档问答测试中,直接读取全文的平均准确率为72.4%,而LensVLM在约4.3倍压缩下仍有68.9%的准确率。尽管压缩后准确率没有明显下降,但处理速度较慢,论文测试中一次回答约需17秒。