
MMRetHeads 团队 投稿 量子位 | 公众号 QbitAIETF配资资讯平台
配资专属服务平台随着 Office AI 和文档智能体的发展,大模型开始直接处理财报、合同、研究报告等长篇图文材料。
但能够接收一整份文档,不等于能够正确使用其中的信息。
面对上百页文字、图片、表格和图表,模型首先要回答的是:与当前问题真正相关的证据,究竟在哪里?
EMNLP 2026 接收的论文新作" Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models ",从模型内部研究了这一过程。

从"装得下"到"找得到"
长上下文视觉语言模型可以同时接收大量文字和图片,但最终答案通常只依赖其中很小的一部分信息。相关证据可能是一段文字,也可能藏在表格、图片或某个版面区域中。
研究团队关注的问题是:当证据已经出现在输入中时,模型内部是否存在一组注意力头,负责将问题指向相关的文本或视觉内容?
团队将识别出的这类注意力头称为多模态检索头(MMRetHeads)。
怎么识别多模态检索头?
受 QRHead 启发,研究团队提出了 MMRetHeads 检测方法。
具体来说,该方法分析每个注意力头的 question-to-evidence attention,也就是问题 token 指向标注证据区域的注意力。证据如果是文字,就对应文字 token;证据如果位于图片中,则对应视觉 token。指向证据的注意力越强,该注意力头的检索得分就越高。
△ MMRetHeads:从问题 token 指向文字或视觉证据区域
元股证券:ygzq.hk研究覆盖 Qwen3-VL、Gemma3 等 6 个长上下文视觉语言模型,包括文本检索、图像检索、渲染文本检索和相同图像检索等任务,并测试 8K、16K、32K、64K 和 128K 上下文长度。
分析还发现,文本和图像检索会共享一部分注意力头,但不同上下文长度和证据形式也会调用不同的注意力头。
这些注意力头真的会影响模型回答吗?
注意力指向证据,只能说明两者存在关联。为了检验模型是否真正依赖这些头,研究团队屏蔽得高分的检索头,再与屏蔽相同数量随机注意力头的结果进行比较。
在文字和图片检索任务中,屏蔽检索头后,模型在不同上下文长度和证据位置下的表现显著下降;随机屏蔽造成的影响则小得多。
同样的差异也出现在更真实的长文档问答中:
MMLongBench-Doc:48.2 → 5.7
SlideVQA:71.2 → 8.9
随机屏蔽后,两项任务仍分别保留 32.2 和 52.6 分。屏蔽检索头造成的下降明显更大,说明这些头不只是把注意力放在证据附近,也对模型访问证据具有因果作用。
在多模态推理任务中也能观察到类似结果。检索头被屏蔽后,模型有时会在图表仍然存在于输入中的情况下回答"信息不足",也可能读取错误内容或生成不存在的依据。

△屏蔽检索头后,长文档问答性能显著下降

从内部机制到文档检索
研究团队进一步把这些注意力头中的证据信号用于多模态文档检索。
给定一个问题,MMRetHeads 会为候选页面或版面区域计算相关性分数,并据此对候选项进行排序。页面级检索寻找包含证据的整页,版面级检索则进一步定位页面中的文字块、表格、图片或图表。整个过程不需要额外训练检索器。
在 MMDocIR 上,Qwen3-VL-8B 的页面级 Recall@1 达到 64.7,较最强的已报告基线提高 7.7 个百分点;版面级 Recall@1 达到 39.0,较最强的已报告基线提高 6.3 个百分点。

△ MMRetHeads 在 MMDocIR 页面级和版面级检索上的结果
论文链接:https://arxiv.org/abs/2605.27243
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!ETF配资资讯平台

8月28日,新奥能源(02688.HK)公布上半年业绩,报告期内,公司营业额达570.21亿元,同比上升2.4%;公司持
2026-09-03
登录新浪财经APP 搜索【信披】查看更多考评等级波段进出点 证券代码:002385 证券简称:大北农 公告编号:2026
2026-08-14
线上炒股配资 市场观察:上交所市场中南京股票配资网的市场情绪阶段性观察近期,在A股市场的盘面承压与修复并存期中,围绕“南
2026-09-06
受损股民可至新浪股民维权平台登记该公司维权: 微博关注@新浪证券、微信关注新浪券商基金、百度搜索新浪股民维权、访问新浪财
2026-08-14
元股证券:ygzq.hk 近日,“自在掌控,前所未有”仰望U7驾驶者大会在比亚迪(002594)绍兴赛车场举办。仰望汽车
2026-08-30