正文

苹果开源LensVLM-9B:100页文档先压成图,KV缓存省84%

动察 Beating AI 快讯,苹果开源了专门处理长文档的视觉语言模型 LensVLM-9B,模型基于 Qwen3.5-9B-Base 训练。处理长文档时,它会先把整份文档压成低清页面快速扫一遍,定位到相关页面后,再读取其中的原始文字或高清图片。

这样就不用把全文都塞进模型上下文。论文测试一份 100 页文档时,直接读取全文需要 51,273 个 tokens,LensVLM 只用了 8,090 个。对应的 KV 缓存从约 1.6GB 降到 253MB,减少 84.2%。

压缩后准确率也没有明显下降。7 项文档问答测试中,直接读取全文的平均准确率为 72.4%,LensVLM 在约 4.3 倍压缩下仍有 68.9%。相比直接把文字缩成图片让模型识别,同样约 5 倍压缩时,准确率从 31.3% 提高到 68.9%。

不过,它目前会更慢。LensVLM 找到相关页面后,还要再调用一次工具读取原文,因此需要连续跑两轮推理。论文测试中,一次回答约需 17 秒;如果不用这套压缩方案,直接把整份文档作为文本输入 Qwen3.5-9B,一次生成答案约需 8 秒。

原文链接:https://m.theblockbeats.info/flash/368846