ProjectsUnverifiedTranslation pending
报道称苹果开源长文档视觉语言模型 LensVLM-9B
BIBIBI AT A GLANCELensVLM-9B先压缩长文档再读取相关页面,可大幅减少KV缓存占用,但回答更慢。
Article
苹果开源LensVLM-9B:100页文档先压成图,KV缓存省84%
动察 Beating AI 快讯,苹果开源了专门处理长文档的视觉语言模型 LensVLM-9B,模型基于 Qwen3.5-9B-Base 训练。处理长文档时,它会先把整份文档压成低清页面快速扫一遍,定位到相关页面后,再读取其中的原始文字或高清图片。
这样就不用把全文都塞进模型上下文。论文测试一份 100 页文档时,直接读取全文需要 51,273 个 tokens,LensVLM 只用了 8,090 个。对应的 KV 缓存从约 1.6GB 降到 253MB,减少 84.2%。
压缩后准确率也没有明显下降。7 项文档问答测试中,直接读取全文的平均准确率为 72.4%,LensVLM 在约 4.3 倍压缩下仍有 68.9%。相比直接把文字缩成图片让模型识别,同样约 5 倍压缩时,准确率从 31.3% 提高到 68.9%。
不过,它目前会更慢。LensVLM 找到相关页面后,还要再调用一次工具读取原文,因此需要连续跑两轮推理。论文测试中,一次回答约需 17 秒;如果不用这套压缩方案,直接把整份文档作为文本输入 Qwen3.5-9B,一次生成答案约需 8 秒。
Source: https://m.theblockbeats.info/flash/368846
AI-assisted interpretation
The following is analysis, separate from reported facts. Verify important claims independently.
LensVLM-9B先用低清页面快速定位相关内容,再读取相关页面的原始文字或高清图片,因此减少了需要放入上下文的内容。代价是需要连续进行两轮推理。
Why it matters to readers
报道中的测试显示,该方法能减少长文档处理时的tokens和KV缓存占用,同时保持接近直接读取全文的准确率。
可以把它理解为先快速浏览整份文档,再精读相关页面,从而减少一次性处理的内容。
Risks and unknowns
- 当前证据来自媒体转述,未提供苹果官方公告、代码仓库或论文原始链接。
- 开源归属、测试结果和延迟数据仍需一手材料或独立复现确认。
- 证据未说明该模型是否已进入苹果产品、开发者工具或形成商业化安排。