Together_CZ头像
关注
MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph–Augmented Generation多模态知识图谱增强生成中封面图

MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph–Augmented Generation多模态知识图谱增强生成中

论文提出了 MKG-RAG-BENCH,这是首个专门用于评估多模态知识图谱增强生成(MKG-RAG)中检索环节的跨领域基准。其核心研究内容可概括为以下几个方面:

一、研究背景与问题

1. 现有 RAG 的局限

  • 传统 RAG 主要从无结构文本语料中检索,噪声大、碎片化、连接弱。

  • KG-RAG 虽引入结构化知识图谱,但局限于文本知识图谱,无法处理图像、图表、表格等非文本模态。

2. MKG-RAG 的提出

  • 形式化定义:给定查询 q、多模态知识图谱 G、检索器 Retriever 和多模态大语言模型 MLLM,目标是生成响应 R=MLLM(q,Retriever(q,G))。

  • 与多模态 RAG(从无结构语料检索)不同,MKG-RAG 从预定义的结构化多模态知识图谱中检索相关子图。

3. 核心研究空白

  • 现有基准(M-RAG、KG-RAG、多模态文档 RAG)均未系统评估 MKG-RAG 中的检索。

  • 检索是 MKG-RAG 的关键瓶颈:多模态知识异构、跨模态对齐困难、通用检索器难以胜任。

4. 初步实证

  • 用 MedMKG 增强 MLLM 在 VQA-RAD 和 SLAKE 上的实验表明:检索增强反而普遍不如无检索(RAG-free),原因是任务关键知识缺失、无关知识引入噪声。

二、三大核心挑战

挑战含义
异构检索查询和目标三元组可为纯文本、纯图像或多模态,组合多样,需系统覆盖
多模态 KG-查询对齐跨模态、跨结构对齐需联合推理图拓扑、语义关系和模态表示
基准效用需优先高效用三元组,将检索贡献与生成先验区分开

三、基准构建方法(MKG-RAG-Bench)

1. 数据来源(跨领域)

  • MarKG:通用领域多模态知识图谱(11,292 实体、192 关系、34,420 三元组、76,424 图像)

  • MedMKG:医学领域多模态知识图谱(53,587 边、4,868 图像、262 关系、3,148 概念)

2. 三阶段构建流程(图 1)

阶段方法目的
步骤1:基于 LLM 的效用过滤用 GPT-5 评估三元组检索效用,移除通用/定义性/弱信息三元组确保查询清晰、grounding 良好
步骤2:受控完整性模拟对三元组 (h,r,t) 进行关系掩码或尾部掩码,保留头部作为语义锚点模拟寻息查询,保持唯一监督
步骤3:混合问题合成GPT-5 生成纯文本问题和图像 grounding 问题;对问题图像做增强防止捷径匹配生成自然、模态适当的查询

3. 下游任务数据

  • 每个合成问题的来源三元组作为检索正目标。

  • 掩码组件作为生成 ground-truth 答案。

  • 构建 QA 对,保证由对齐的多模态 KG 支持。

4. 数据集统计(表 2)

子集查询数三元组数多模态比例
MKG-RAG-Bench-G(通用)训练 48,908 / 验证 6,113 / 测试 6,11525,517约 30%
MKG-RAG-Bench-M(医学)训练 4,781 / 验证 597 / 测试 59918,468约 40-49%
  • 按问题划分 8:1:1,语料固定。

  • G 子集查询多于三元组;M 子集因医学 KG 的 1:n 模式,查询远少于三元组。

四、评估设置

五种模态组合设置:

  • S1:所有查询 vs 所有三元组

  • S2:纯文本查询 vs 纯文本三元组

  • S3:纯文本查询 vs 所有三元组

  • S4:多模态查询 vs 多模态三元组

  • S5:多模态查询 vs 所有三元组

四类检索器(免训练、共享 CLIP 编码器):

  1. 纯文本检索器

  2. 基于融合的多模态检索器(晚期融合)

  3. 基于描述的检索器(BLIP 生成描述)

  4. 基于重排序的检索器(两阶段:图像嵌入初筛 + 文本嵌入重排)

评估指标:

  • 检索:NDCG@K、Precision@K、Recall@K

  • 生成:EM、F1、Contains@1、BLEU-1(GPT-5 生成,K=5)

五、主要实验发现

检索方面:

发现内容
发现1检索中持续存在模态差距:纯文本查询 vs 多模态三元组性能几乎不变,多模态三元组很少成为有效匹配
发现2多模态嵌入对视觉 grounding 检索至关重要:纯文本和基于描述的检索器退化严重,融合和重排序方法更有效
发现3检索难度和方法偏好具有领域依赖性:通用领域融合方法足够;医学领域重排序更有益

生成方面:

发现内容
发现4检索对生成提供真实但不均衡的效用:即使随机检索偶尔也提升性能,验证了基准质量
发现5多模态机制下生成增益显著较弱:纯文本场景增益最大,多模态查询增益边际
发现6生成性能紧密跟踪检索质量:检索质量是端到端性能的主要驱动因素

效率分析(表 8):

  • 融合和重排序检索器吞吐量约低一个数量级(约 0.1× QPS)。

  • 基于描述的检索受益于缓存,吞吐量接近纯文本检索器。

六、消融与鲁棒性分析

1. LLM 效用过滤消融(表 6)

  • 过滤三元组衍生的问题性能始终低于剩余三元组,即使无检索增强。

  • 检索无法补偿不清晰或弱 grounding 的信息需求,验证过滤必要性。

2. 跨 LLM 一致性(表 7)

  • Qwen3.5 过滤对齐 99.7%,Gemini 2.5 Flash 97.0%。

  • 问题级 BERTScore 均为 0.8818,表明流程对 LLM 骨干选择鲁棒。

3. 人工评估

  • 人类标注者与过滤决策 88% 一致。

  • 生成问题平均质量和多样性评分 3.97/5。

七、主要贡献

  1. 识别关键空白:MKG-RAG 中检索虽核心但未被充分探索和评估。

  2. 首个基准:跨领域、面向检索的 MKG-RAG 基准,含两个多模态 KG 和对应 QA 数据集。

  3. 构建流程:基于 LLM 的策展流程,直接应对异构检索、多模态对齐和基准效用挑战。

  4. 统一评估框架:在多样化多模态设置下全面实验,证明有效多模态检索的重要性。

八、结论与启示

  • MKG-RAG 的进展日益受检索制约,而非生成模型规模。

  • 未来方向:

    • 显式跨模态对齐目标

    • 保留细粒度视觉信息的多模态表示学习

    • 领域感知精炼(重排序/验证器)

    • 图感知检索:关系敏感匹配、邻域/路径证据聚合、图约束候选选择

    • 改进证据呈现:三元组选择、排序、表示格式

文章首次系统性地将检索作为 MKG-RAG 的一等评估目标,构建了跨通用与医学领域的多模态知识图谱检索基准 MKG-RAG-BENCH,通过 LLM 驱动的策展流程生成结构化 grounding 的查询与答案,并在多种检索器和模态设置下证明:多模态检索仍是关键瓶颈,检索质量直接决定端到端生成性能,为未来图感知、领域自适应的多模态检索研究奠定了基础。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

项目地址在这里,如下所示:

摘要

基于知识图谱的检索增强生成(RAG)已成为 grounding 大语言模型的一种有前景的方法,然而现有基准测试在很大程度上忽视了多模态知识图谱 RAG(MKG-RAG)中检索所面临的挑战。在实践中,检索是一个关键瓶颈:多模态知识是异构的,难以跨模态对齐,且往往无法被为无结构语料库设计的检索器很好地服务。为弥补这一空白,我们提出了 MKG-RAG-BENCH,一个 explicitly 设计用于评估 MKG-RAG 中检索的跨领域基准。MKG-RAG-BENCH 由两个涵盖通用领域和医学领域的多模态知识图谱构建而成,并包含精心对齐的问答数据集,支持对检索和下游生成进行受控评估。该基准使用基于 LLM 的策展流程构建,该流程过滤低效用知识、生成具有精确监督的结构化 grounding 查询,并系统性地覆盖多样化的模态配置。通过在代表性检索器家族和模态设置上进行大量实验,我们表明有效的多模态检索仍然具有挑战性,但对端到端 MKG-RAG 性能至关重要,且检索质量强烈决定生成结果。通过将检索隔离为一等评估目标,MKG-RAG-BENCH 为诊断当前局限性和推进多模态知识图谱 RAG 系统提供了原则性基础。¹

CCS 概念

计算方法学 → 连续空间搜索;自然语言生成。

关键词

多模态检索增强生成,多模态知识图谱

1 引言

检索增强生成(RAG)通过从外部来源检索与给定查询相关的信息,并以此检索到的证据为条件进行生成,从而增强大语言模型(LLM)[16]。虽然 RAG 在改进事实 grounding 方面已被证明有效,但传统方法主要从无结构的文本语料库中检索,这些语料库噪声大、碎片化且连接性弱。这些局限性往往阻碍可靠的证据选择和多步推理,尤其是对于复杂查询。为解决这些问题,基于知识图谱的 RAG(KG-RAG)被提出 [8]。通过从结构化知识图谱中检索信息,KG-RAG 能够实现更连贯、更具上下文性和更全面的知识获取,从而提高答案质量和忠实度 [39]。然而,现有的 KG-RAG 方法 largely 局限于文本知识图谱,这 substantially 限制了它们在现实场景中的适用性,因为在现实场景中关键信息通过图像、图表、表格和其他非文本模态传达。

多模态 KG-RAG。 为克服这一局限,我们探索了多模态 KG-RAG(MKG-RAG)任务,该任务整合跨多个模态的结构化知识,以支持更具表现力的检索和推理。形式上,给定查询 q、多模态知识图谱 G、检索器 Retriever 和多模态大语言模型 MLLM,MKG-RAG 的目标是生成响应 RR,即

R=MLLM(q,Retriever(q,G)).

最密切相关的设置是多模态 RAG [3],它遵循传统 RAG 流程,从无结构的外部语料库(例如 Wikipedia)中检索多模态内容,而非从结构化的多模态知识图谱中检索。据我们所知,现有基准或先前工作均未系统性地研究 MKG-RAG 设置中的检索和生成。

动机与挑战。 多模态 KG-RAG 值得建立基准,因为它评估模型检索、对齐和推理结构化多模态知识的能力,这是现实世界系统的一项关键能力,而现有 RAG、KG-RAG 或多模态基准均未捕捉到这一能力。本工作旨在引入首个 MKG-RAG 任务基准,包含精心策划的数据集和明确针对检索质量及多模态 grounding 的评估协议。然而,设计这样的基准面临若干非平凡的挑战:

异构检索。 与传统知识图谱中查询和目标三元组均为单模态不同,多模态知识图谱支持查询和检索目标之间异构的模态组合。在 MKG-RAG 中,查询可以是纯文本、纯图像或多模态的,而相关图组件可能以不同方式组合文本、视觉和数值信息。这些组合引发不同的检索行为,并要求不同的建模策略。因此,有意义的 MKG-RAG 基准必须系统性地覆盖多样化的多模态检索场景,以反映真实使用情况并实现检索器之间的公平比较。

多模态知识图谱-查询对齐。 在 MKG-RAG 中,相关知识可能在表面层面上并未与查询显式对齐,尤其是当查询和目标节点在模态或抽象层次上不同时。例如,文本查询可能需要 grounding 在视觉证据中,而基于图像的查询可能需要检索语义相关的文本实体和关系。解决这种跨模态和跨结构的对齐需要对图拓扑、语义关系和模态特定表示进行联合推理。因此,MKG-RAG 基准必须包含需要超越浅层模态匹配的非平凡对齐的查询。

基准效用。 基准的主要目标是评估多模态检索的有效性和多模态 LLM 的 grounding 质量。这需要精心构建,以确保检索到的知识信息丰富且与下游查询良好对齐。多模态知识图谱通常包含通用或弱信息性的三元组,这可能导致模糊或 grounding 不佳的问题,并掩盖检索的贡献。有用的 MKG-RAG 基准必须优先考虑高效用三元组,并将有效检索带来的改进与生成先验带来的改进区分开来。

我们的解决方案。 为应对这些挑战,我们提出了一个跨领域、面向检索的 MKG-RAG 基准,命名为 MKG-RAG-Bench,包含两个多模态知识图谱和相应的多模态问答数据集。该基准旨在支持对多模态 KG-RAG 的检索和生成阶段进行全面评估。基准构建流程如图 1 所示。具体而言,我们使用 LLM 选择高效用三元组,并采用启发式策略确保所选三元组与构建查询之间的强对齐。同一 LLM 通过不同提示进一步被用于生成跨多样化检索场景的多模态、知识 grounding 问题,从而系统性地覆盖异构模态组合。我们在不同多模态设置下使用代表性检索器架构进行大量实验,评估整个检索和生成流程中的有效性和效率。虽然本工作主要关注使用免训练方法评估 MKG-RAG,但该基准也适用于基于训练的方法,包括检索器训练和 MLLM 微调。

贡献。 总之,我们的主要贡献如下:

我们识别了 MKG-RAG 中的一个关键研究空白,强调检索尽管处于核心地位,但在现有多模态 RAG 研究中尚未得到充分探索和评估。我们引入了首个跨领域、面向检索的 MKG-RAG 基准,包含两个多模态知识图谱和相应的问答数据集,支持对检索和下游生成的系统性评估。我们提出了一个基于 LLM 的基准策展流程,直接应对异构检索、多模态对齐和基准效用方面的关键挑战。我们开发了一个统一评估框架,并在多样化多模态设置下进行了全面实验,证明了有效多模态检索的重要性,并为未来研究更强大的 MKG-RAG 检索器提供了可能。

2 预备知识

表 1:代表性多模态 RAG 和 KG-RAG 基准的比较。

2.1 基准比较

最密切相关的工作方向是多模态 RAG(M-RAG),其关注从大规模无结构语料库中检索多模态内容,如文本段落和图像。检索到的多模态证据可以直接并入多模态大语言模型的输入 [20, 25],或重新组织为 ad-hoc 多模态结构以进一步增强生成 [37]。然而,M-RAG 遵循传统 RAG 范式,不假设可以访问结构化的多模态知识图谱。因此,检索是在无结构语料库上进行的,任何 induced 结构都是 transient 和查询特定的,而非在知识来源中显式表示。

另一相关工作是知识图谱 RAG(KG-RAG),旨在从给定知识图谱中检索相关三元组或子图以支持 grounding 生成。然而,现有 KG-RAG 方法 [18, 23] 主要关注文本知识图谱,并未显式建模或检索多模态信息。因此,它们并非为评估或支持结构化多模态知识上的检索和推理而设计。

相比之下,MKG-RAG 在预定义的多模态知识图谱上运行,其中实体、关系和跨模态连接均被显式建模。这从根本上改变了检索问题:MKG-RAG 不是选择孤立的多模态文档,而是需要识别通过结构化关系整合异构模态的相关子图。因此,现有 M-RAG 和 KG-RAG 基准不足以评估 MKG-RAG,因为它们既未捕捉基于多模态图的检索,也未将检索质量与下游生成区分开来。表 1 从多个角度比较了代表性基准,突出了 MKG-RAG 的独特特征。

2.2 检索器

尽管 MKG-RAG 任务不同于传统 RAG、多模态 RAG 和 KG-RAG,但许多现有检索技术可以直接适配到该设置。在本工作中,我们根据检索策略将常用检索器分为四类:

·纯文本检索器 [14, 29, 30]。纯文本检索器将查询和候选三元组均视为纯文本,使用文本相似度(如稀疏词汇匹配或稠密语义嵌入)对候选进行排序,不纳入视觉信息。·基于融合的多模态检索器 [3, 27]。基于融合的检索器将文本和视觉信息编码到共享表示空间,通过测量多模态查询与多模态目标之间的跨模态相似度进行检索。·基于描述的多模态检索器 [9, 44]。基于描述的检索器首先使用外部图像描述模型将视觉内容转换为文本描述,然后将多模态检索简化为对生成描述的纯文本检索。·基于重排序的检索器 [4, 42]。重排序方法通常采用多阶段流程,其中轻量级第一阶段检索器过滤候选集,随后由更强大的重排序器执行细粒度相关性估计和最终选择。

为确保公平和受控比较,我们在免训练设置下通过直接使用预训练权重评估所有检索器,不在所提基准上进行微调。

2.3 初步分析

构建多模态知识图谱 RAG 基准的一个看似直接的方法是将现有多模态知识图谱(如 MMKG [22] 和 TIVA-KG [38])与模态相关下游任务(如 A-OKVQA [33] 和 K-VQA [31])直接结合。然而,如第 1 节所述,这种朴素组合无法充分捕捉 MKG-RAG 任务的要求,且往往导致知识来源、检索目标和下游评估之间的严重错位。特别是,回答给定查询所需的知识可能不存在于知识图谱中,而不相关的检索内容可能主导模型输入,引入噪声并最终降低性能。

为实证说明这一问题,我们使用 MedMKG [40]——一个从 MIMIC 临床数据构建的多模态医学知识图谱——进行了一项初步研究,以支持在两个广泛使用的基准 VQA-RAD [15] 和 SLAKE [21] 上的医学视觉问答。具体而言,我们用来自 MedMKG 的检索增强多模态大语言模型,并评估其在不同检索策略下的性能。结果总结于图 2。

在所有实验设置中,经多模态检索增强的模型始终不如其 RAG-free 对应模型。尽管多模态检索器优于纯文本检索器,但仍未能超越无检索增强的生成。这些结果表明,从 MedMKG 检索不能有效支持下游视觉问答任务。我们将此行为归因于两个主要因素:(1)MLLM 所需的任务关键知识可能不存在于多模态知识图谱中;(2)图中存在的任务无关知识可能被检索并注入模型输入,引入大量噪声干扰生成。

综上所述,这些观察揭示了直接将现有多模态知识图谱与下游多模态任务结合用于 MKG-RAG 的根本局限性。由此产生的知识来源、检索目标和评估目标之间的错位削弱了检索增强的有效性,并掩盖了多模态 KG-RAG 系统的真实能力。这促使我们需要一个专门的 MKG-RAG 基准,显式对齐多模态知识图谱、检索目标和下游评估——这正是本工作所提基准的目标。

3 基准构建

有效的基准不仅应覆盖多样化的数据来源,还应支持对任务多个阶段的严格评估。在所提出的 MKG-RAG 基准中,我们从两个跨越不同领域的多模态知识图谱构建数据集:通用领域的 MarKG [45] 和医学领域的 MedMKG [40]。这种跨领域设计使我们能够评估多模态 KG-RAG 方法在不同知识结构和模态分布下的通用性。为支持对多模态 KG-RAG 中检索和生成的忠实评估,我们设计了一个原则性数据构建流程,过滤低效用知识、生成结构对齐且知识 grounding 的具有精确监督的查询,并支持对检索和生成阶段的显式评估。

3.1 数据集策展

如图 1 所示,我们的构建流程包括三个阶段:(1)基于 LLM 的效用过滤,(2)通过三元组掩码进行的受控完整性模拟,以及(3)混合问题合成。每个阶段旨在应对多模态 KG-RAG 基准测试中的特定挑战。

步骤 1:基于 LLM 的效用过滤。 多模态 KG-RAG 基准测试的一个核心挑战是确保检索为下游任务提供有意义且 grounding 良好的证据。多模态知识图谱通常包含过于通用、定义性或弱信息性的三元组,从中衍生的问题可能模糊或 grounding 不足,限制了其在评估检索中的有用性。

给定一个三元组,我们提示 LLM 评估其检索效用,即它是否能支持清晰且信息丰富的寻息查询。被认为低效用的三元组是那些倾向于产生无需外部证据即可回答的问题,或未能传达特定检索意图的三元组 [43]。例如,三元组(太阳,是,恒星)可能导致问题“什么是太阳?”,该问题既不需要检索,也不受益于结构化知识。我们从基准中移除此类三元组,以确保生成的问题明确且 grounding 在可检索知识中。此过滤步骤产生一个精炼的三元组集,更好地反映了现实检索场景,其中外部知识访问对于准确推理是必要的。提示模板和决策标准详见附录 B。

步骤 2:受控完整性模拟。 为构建需要知识检索同时保持明确监督的查询,我们在保留的三元组上模拟受控不完整性。我们不是呈现完整知识图谱事实,而是掩码每个三元组的一个组件,并将剩余组件视为观察到的上下文,从而模拟寻息查询。

对于每个三元组 (h,r,t),我们构建两个掩码变体:(i)关系掩码,其中关系 r 被掩码,必须从头部和尾部推断;(ii)尾部掩码,其中尾部 t 被掩码,必须从头部和关系推断。我们保持头部实体不变作为语义锚点,这有助于在视觉信息可用时进行多模态 grounding,并确保每个查询由其来源知识唯一支持。

我们避免掩码头部实体,因为这样做需要超出检索评估范围的实体消歧,并可能引入额外歧义。这一设计使我们能够专注于评估检索器在现实多模态条件下识别相关关系和实体的能力。所得掩码三元组作为查询生成的结构化 grounding 模板。

步骤 3:混合问题合成。 掩码三元组提供结构化但非语言表示,不直接类似自然用户查询。为生成现实问题同时保持与底层知识的精确对齐,我们再次使用 GPT-5 [34] 在两种互补模式下从掩码三元组合成自然语言问题。

纯文本问题合成。 对于从纯文本知识衍生的掩码三元组,GPT-5 生成明确对应缺失组件的文本问题。例如,从(青霉素,[掩码],细菌感染),LLM 生成:“青霉素与细菌感染之间是什么关系?”这产生纯文本查询,其答案唯一 grounding 在掩码三元组中。

图像 grounding 问题合成。 对于头部实体关联图像的掩码三元组,我们向 GPT-5 提供图像并要求头部实体被引用为 [图像]。这强制显式视觉 grounding,并防止对实体名称的琐碎词汇匹配。例如,(埃菲尔铁塔,位于,[掩码])产生问题:“图中的地标位于哪个城市?”为避免相同图像同时出现在查询和知识图谱节点中导致的捷径检索,我们对问题图像应用图像增强,详见附录 C。

在两种模式下,问题合成保持掩码组件的语义,同时产生自然、模态适当的查询,支持在纯文本和多模态设置下进行检索评估。

3.2 下游任务数据

为支持对检索性能的显式和细粒度评估,我们直接从对齐的查询-三元组对构建检索监督。对于每个合成问题,来源三元组被视为主要正目标。在检索数据集的基础上,我们以保持监督的方式构建下游生成数据。由于每个问题源自掩码三元组,掩码组件恰好对应查询所请求的缺失信息。因此,我们将掩码实体或关系视为 ground-truth 答案。此过程产生问答(QA)对,保证由对齐的多模态知识图谱支持。所得 QA 数据包含纯文本和视觉 grounding 实例,反映了 MKG-RAG 的混合模态特性。通过构建,成功生成既需要正确检索也需要忠实 grounding,从而支持有意义的端到端评估。基准构建示例见附录 D。

3.3 数据集统计

在从两个领域特定多模态知识图谱策展检索和生成数据集后,我们将每个领域和每个阶段的数据集按 8:1:1 比例划分为训练/验证/测试集。划分按问题进行,因此同一问题不会在训练/验证/测试集之间共享,同时保持语料库固定,遵循标准 IR 评估。这种划分不仅支持全面评估,还支持在需要时进行检索器训练。为反映现实 MKG-RAG 使用情况,每个划分包含纯文本和多模态查询-三元组对的混合,而非将模态分离为不相交分区。结果,我们获得 MKG-RAG-Bench,一个跨领域多模态基准,支持实际 MKG-RAG 场景中多样化设置下的训练和评估。表 2 报告了 MKG-RAG-Bench 的关键统计,其中 MKG-RAG-Bench-G 表示从通用多模态知识图谱 MarKG 获得的数据,MKG-RAG-Bench-M 是基于医学多模态知识图谱 MedMKG 构建的数据集。

表 2:MKG-RAG-Bench 的统计,其中 %MM 指多模态数据的百分比。

两个子集之间的一个显著差异在于查询-三元组基数。对于 MKG-RAG-Bench-G,查询数量显著超过三元组数量。相比之下,MKG-RAG-Bench-M 包含的查询数量远少于三元组。这一差距主要由底层医学 KG 的结构特性驱动,其表现出更频繁的 1:n 模式。流行的临床实体(如肺或肺炎)通常通过同一关系连接到许多其他概念,因此固定不完整形式如 (h,r,[掩码]) 可能对应多个有效尾部。 consequently,许多三元组共享相同的掩码形式并产生相同查询,导致尽管三元组集更大,唯一查询却更少。

相比之下,通用领域 KG 相对稀疏:日常实体之间的关系连接密度较低,倾向于产生更多唯一不完整形式,导致每个三元组的查询多样性更高。

4 基准评估

4.1 评估设置

我们在检索和生成任务上评估所提出的 MKG-RAG-Bench。由于我们的主要关注点是免训练设置,所有评估仅在表 2 报告的测试划分上进行,不使用任何训练或验证数据。如第 3.1 节(步骤 3)所述,基准包含两类查询——纯文本和多模态——底层多模态知识图谱包含纯文本和多模态三元组³。为全面评估不同模态组合下的检索和生成性能,我们评估以下五种设置,由查询模态和候选三元组范围定义:(S1)所有查询与所有三元组,(S2)纯文本查询与纯文本三元组,(S3)纯文本查询

表 3:不同检索设置下 MKG-RAG-BENCH-G 数据集上的检索性能 (%)。

3, 27]、基于描述的检索器 [9, 44] 和基于重排序的检索器 [4, 42]。此外,我们纳入一个基本随机检索器作为检索任务的简单下界基线。为公平比较,所有检索器均使用共享的 CLIP 编码器 [28] 实现以获得统一表示。此外,基于描述的检索器使用 BLIP 模型 [17]⁵ 实现。查询和候选三元组均嵌入到同一表示空间,候选基于余弦相似度排序。我们报告标准检索指标,包括主实验中的 NDCG@K、Precision@K 和 Recall@K。实现细节见附录 E。

检索结果与关键发现。 我们在不同查询和三元组组合下评估 MKG-RAG-Bench-G 和 MKG-RAG-Bench-M 上的检索性能。详细结果报告于表 3 和表 4,效率分析见附录 F。注意 Others 表示评估配置中提到的基线。我们不是枚举数值比较,而是通过一组关键发现总结结果,这些发现突出了多模态 KG-RAG 检索的挑战和机遇。

发现 1:检索中持续存在模态差距。 对于纯文本查询从纯文本三元组检索,所有检索器表现出几乎相同的性能,因为它们 effectively 简化为相同的基于文本的检索流程。当候选空间扩展到包含纯文本和多模态三元组时,性能仅略有变化,且排名靠前的结果仍以纯文本三元组为主。这一观察表明,多模态三元组很少作为纯文本查询的有效匹配,而主要增加候选池大小而不贡献有用证据。更广泛地说,这一行为揭示了检索空间中持续存在的模态差距:文本查询与多模态知识之间的跨模态匹配不会仅通过混合索引自然出现。这一发现表明,简单地将多模态知识纳入 KG 不足以实现跨模态检索,当需要此类交互时,需要显式机制来桥接模态。

发现 2:多模态嵌入对于视觉 grounding 检索至关重要。 一旦查询需要视觉 grounding,单模态检索策略就变得不可靠。纯文本检索器急剧退化,因为它们缺乏纳入图像证据的能力。基于描述的检索器也表现不佳,因为描述过程引入信息瓶颈:生成描述中的遗漏或不准确直接传播为检索错误。相比之下,基于嵌入的多模态检索器在此机制下仍然有效。基于融合的方法受益于将视觉和文本信号联合编码到共享表示空间,实现更稳健的跨模态对齐。基于重排序的方法通过使用更强的多模态匹配精炼候选集进一步提高性能。这些结果表明,有效 MKG-RAG 检索的核心能力不是改进文本排序,而是可靠的多模态表示学习,保留视觉证据并与 KG 语义对齐。

发现 3:检索难度和方法偏好具有领域依赖性。 在 MKG-RAG-Bench-M 上,视觉 grounding 检索始终比 MKG-RAG-Bench-G 更具挑战性。一个可能的解释是医学图像往往视觉上同质,需要对细微模式敏感,而相关术语密集且细粒度。结果,通用相似度信号较弱且更容易被混淆。这种领域差异也解释了方法偏好的差异。在 MKG-RAG-Bench-G 上,基于融合的检索通常足够,因为粗粒度语义对齐产生强性能。在 MKG-RAG-Bench-M 上,基于重排序的方法提供更大收益,因为精炼有助于消解细微视觉线索和专业语言的歧义。这些观察强调,在通用领域有效的检索策略可能无法直接迁移到专业领域而不进行适配。

对 MKG-RAG 检索器设计的启示。 总之,这些发现指出了未来检索器发展的若干方向。首先,桥接模态差距需要显式的跨模态对齐目标或监督,而非依赖混合模态索引隐式诱导跨模态匹配。其次,多模态检索应优先考虑保留细粒度视觉信息并将其直接与 KG 语义对齐的表示学习,因为基于有损描述的转换始终限制性能。第三,在具有细微视觉区别和专业术语的设置中,领域感知精炼变得越来越重要,促使更强的重排序或验证器式匹配模块以及领域适配的视觉和文本编码器的使用。总体而言,有效的 MKG-RAG 检索可能需要整合显式跨模态对齐、稳健多模态嵌入和领域敏感精炼。

4.3 生成评估

评估配置。 对于生成评估,我们纳入一个仅生成基线(即 RAG-free),它在无检索增强的情况下查询 LLM,并评估基于第 4.2 节所述相同检索器、模态设置和实现构建的 RAG 变体。对于每个查询,我们向生成器提供 top-K 检索三元组作为额外上下文,使用 K=5 以平衡评估保真度与计算成本和 token 预算。我们使用 GPT-5 [34] 作为生成模型。生成被评估为开放式(视觉)问答任务,使用 Exact Match(EM)、token 级 F1、Contains@1 和 BLEU-1。

生成结果与关键发现。 表 5 报告了 MKG-RAG-Bench-G 和 MKG-RAG-Bench-M 在不同查询和知识模态组合下的生成性能。我们不是枚举单个分数,而是通过若干关键发现总结结果,这些发现揭示了检索质量和模态如何相互作用以塑造端到端 MKG-RAG 性能。

发现 4:检索为生成提供真实但不均衡的效用。 与仅生成基线相比,检索增强生成在大多数指标和设置上产生一致改进,确认检索到的多模态知识可以被生成器有效消费。值得注意的是,即使随机检索偶尔也提高性能,表明当相关三元组出现在上下文中时,生成器可以利用它们。这作为构建知识、查询和答案之间对齐的健全性检查,并验证了基准的整体质量。

表 5:MKG-RAG-Bench-G 和 MKG-RAG-Bench-M 在 K=5 时的生成结果 (%)

发现 5:多模态机制下的生成增益显著较弱。 当查询和支持知识均为文本时,检索增强带来最大增益。相比之下,对于多模态查询,改进通常是边际的,除非使用强多模态检索器,即使如此,绝对增益仍然有限——尤其是在 MKG-RAG-Bench-M 上。这些结果表明,端到端生成高度敏感于检索是否能可靠提供视觉 grounding 证据。简单地将多模态知识纳入流程不会自动转化为成比例的生成改进,揭示了当前 MKG-RAG 系统的关键瓶颈。

发现 6:生成性能与检索质量紧密相关。 生成趋势与检索行为紧密呼应。纯文本和基于描述的检索流程对多模态查询提供有限增益,因为它们要么忽略视觉信息,要么通过有损描述压缩视觉信息,在生成开始前就限制了证据质量。相比之下,基于嵌入的多模态检索器在多模态设置中产生最可靠的改进。基于融合的方法在 MKG-RAG-Bench-G 上通常更有效,而基于重排序的方法在 MKG-RAG-Bench-M 上提供额外收益,因为细微视觉区别和专业术语需要更强的精炼。这种对齐突显了检索质量作为端到端 MKG-RAG 生成性能的主要驱动因素。

启示:迈向图感知多模态生成。 多模态设置中相对温和的增益表明,当前主要为无结构语料库检索设计的多模态检索器并未充分利用 MKG 的结构和语义。因此,改进 MKG-RAG 生成可能需要显式图感知的检索方法,如关系敏感匹配、基于邻域或路径的证据聚合,以及图约束候选选择以减少干扰项。除检索外,证据呈现给生成器的方式也有提升空间,包括改进的三元组选择、排序和表示格式,以更好地传达结构化图信息。总体而言,这些发现表明 MKG-RAG 的进展将较少依赖于扩展通用多模态检索,而更多依赖于开发图感知、领域敏感的检索和证据整合策略。

4.4 基于 LLM 的效用过滤消融

MKG-RAG-Bench 的一个关键设计选择是过滤掉倾向于产生模糊或弱 grounding 查询的低效用三元组。为验证这一选择,我们进行了一项消融研究,比较从过滤三元组衍生的问题与从基准中保留的其余三元组衍生的问题。我们从每组随机抽取 150 个多模态问题,在设置(S4)下使用我们最强的基于融合的检索器评估 MKG-RAG 性能,包括 RAG-free 和检索增强生成。结果报告于表 6。在所有指标上,从过滤三元组衍生的问题始终产生较低性能

表 6:验证基于 LLM 的效用过滤策略有效性的生成结果 (%)。

表 7:跨 LLM 一致性分析。

比从剩余三元组衍生的问题更低,即使没有检索增强,表明此类问题本质上困难且指定不佳。尽管检索在两种情况下都提高性能,但过滤三元组问题的增益显著较小,表明检索无法补偿不清晰或弱 grounding 的信息需求。这些结果表明低效用三元组混淆可靠的 MKG-RAG 评估,因此验证了基于 LLM 的效用过滤的必要性,以确保清晰、grounding 的查询和对检索及生成性能的忠实评估。

4.5 关于 LLM 依赖性的讨论

为评估流程是否严重依赖特定 LLM,我们进行了跨 LLM 一致性分析。除基于 GPT 的构建流程外,我们将 Qwen3.5 [36] 和 Gemini 2.5 Flash [5] 应用于 300 个样本子集,包括 150 个纯文本样本和 150 个多模态样本。我们使用过滤对齐和由 BERTScore 测量的问题级语义相似度将其输出与基于 GPT 的结果进行比较。如表 7 所示,两个替代 LLM 均实现与基于 GPT 输出的高过滤对齐,Qwen3.5 达到 99.7%,Gemini 2.5 Flash 达到 97.0%。生成的问题也表现出强语义一致性,两个模型的 BERTScore 均为 0.8818。这些结果表明过滤和合成过程对 LLM 骨干的选择具有鲁棒性。

我们进一步进行人工评估以评估过滤和问题合成结果的可靠性。人类标注者与过滤决策达成 88%88% 一致,生成的问题获得平均质量和多样性评分 3.97(满分 5)。跨 LLM 和人工评估结果共同表明,基准构建过程在不同 LLM 间保持稳定行为,并在实践中引入有限的模型特定偏差。

5 结论

本工作表明,MKG-RAG 的进展日益受到检索的制约,这一组件由于缺乏合适基准而受到有限关注。为弥补这一空白,我们引入了 MKG-RAG-Bench,一个显式设计用于评估 MKG-RAG 中检索的跨领域基准,包含两个多模态知识图谱和精心对齐的问答数据集。MKG-RAG-Bench 通过基于 LLM 的策展流程构建,该流程过滤低效用知识并系统性地覆盖多样化模态配置,支持受控且现实的检索评估。在代表性检索器家族上的大量实验表明,在检索中有效利用多模态信号仍然具有挑战性,且对端到端性能至关重要。通过隔离和诊断这些挑战,MKG-RAG-Bench 为开发、评估和推进更有效的 MKG-RAG 检索器提供了原则性基础。我们希望该基准能催化未来关于图感知、领域自适应多模态检索方法以及将结构化知识更有效整合到多模态生成中的研究。

转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/Together_CZ/article/details/167495509

文章来源转载

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--