当前位置: 首页 > news >正文

大模型---多模态RAG与GraphRAG

目录

一.多模态RAG

1.Multimodal RAG系统架构

2.三种主流架构

(1)共享向量空间(common embedding space)

(2)多路并行检索(parallel retrieval pipelines)

(3)先“落到共同模态”(grounding in a common modality)

二.GraphRAG

1.GraphRAG的索引与查询

2.GraphRAG的优缺点

3.GraphRAG和传统的知识图谱问答系统(KBQA)的区别


如学到更深入的知识会继续补充~

一.多模态RAG

之前这篇博客讲了RAG,现在讲一下Multimodal RAG(MM-RAG):

大模型---RAG

本质上是把传统 RAG 从“只检索文本”扩展为“检索并利用多种模态的信息”,这些模态可以包括文本、图片、表格、图表、版式、音频、视频等。具体来说,MM-RAG在检索和生成两个阶段都引入多模态外部知识,以弥补纯文本 RAG 的局限;当问题需要同时理解视觉和文本信息时,MM-RAG 往往优于传统文本 RAG。

例如,用户问“这份 PDF 里的审批流程图怎么走?”如果关键信息在一张嵌在 PDF 中的流程图里,普通文本 RAG 可能找不到;而多模态 RAG 可以把图中的视觉信息也纳入检索和回答。

下面是RAG的流程图,RAG到MM-RAG主框架并没有变,变的是“索引对象”,“检索对象”和“生成模型”,也就是index,retrieval,generation都可以扩展到图像场景,输入可以是文本或图像,知识库也可以由文本或图像组成,回答时用到的上下文也可以是文本或图像,最终输出同样可以是文本或图像。

1.Multimodal RAG系统架构

下图是Multimodal RAG系统架构:

图中有两条主线:① 紫色箭头:离线建库/索引流程(Indexing);② 绿色箭头:在线问答/推理流程(Inference)。先说一下系统整体逻辑:企业数据先被处理并建立索引,用户提出问题,系统把问题向量化,接着去向量库里检索相关多模态内容,把“用户问题+相关内容”拼成prompt交给 LVLM (Large Vision-Language Model)推理,最后输出结果并做后处理。

下面分别说一下两条路径:

紫色路径这一部分是离线准备知识库,也就是系统在用户提问之前就要先完成的工作。最左上角是 Enterprise Data,代表企业内部原始数据源。包括图片和视频,企业原始图片和视频不能直接拿去检索,所以要先经过Ingest/Data Processing(摄取与数据处理)。

对图片:首先读取图片文件,提取配套文字,如果没有文字,就生成caption,也就是图片描述,形成image-text pair。

对视频:首先抽关键帧,做字幕对齐,没字幕时做ASR(语音转文字),没语音可转时,给视频帧生成描述。

这一步就是把原始多模态数据转成适合后面embedding和检索的表示形式。

接下来进入Embedding Model(嵌入模型),这里BridgeTower/bridgetower-large,会把多模态内容编码成向量表示,方便存入向量数据库,也就是把多模态内容“翻译”成机器可以相似度检索的向量空间表示。

Embedding 完成后,数据被写入 Index / Vector Database(索引/向量数据库)。图中使用LanceDB作为向量数据库来保存这些多模态向量表示,其会根据query embedding找到最相关的图片、视频片段或图文对。

总结来说,紫色部分就是数据处理-->多模态embedding-->写入向量库。这就是离线建库的过程。

绿色路径用来表示用户真正提问时,系统如何工作的。首先,用户先输入问题,也就是User Query,用户问题会进入同一个Embedding Model,也就是说,系统不仅把企业图片/视频向量化,也要把用户query向量化(query embedding)。只有把用户问题和知识库内容映射到同一个可比较空间里,才能做相似度检索。

接下来是Retrieval/Rank(检索与排序),首先是检索,从向量数据库中召回一批与 query 最相似的多模态内容,比如召回若干张相关图片,某几个视频片段,若干组图

http://www.cnnetsun.cn/news/1731056.html

相关文章:

  • 消费级GPU福音:百川2-13B-4bits+OpenClaw自动化测试报告
  • 解密Minecraft 1.20渲染革新 —— GuiGraphics如何重塑UI开发范式
  • 异步电机无传感器矢量控制的算法,matlab,仿真模型,采用转子磁链定向控制算法
  • 从零搭建会议行动 Agent 纪要 任务分派 跟踪闭环全链路
  • OpenClaw备份神器:Qwen3-32B智能判断文件重要性并同步到NAS
  • OpenClaw技能开发入门:为Qwen3-32B-Chat镜像编写自定义自动化模块
  • 为什么 Gemini 手机 App 能用,网页版却无法访问?怎么解决?
  • Windows平台PDF处理终极方案:Poppler一键部署全解析
  • 嵌入式软件基础设施设计与实践指南
  • Qt源码] ModbusTCP主机客户端通信程序 - 含断线重连及多种配置功能
  • STM32智能水质监测系统设计与应用
  • 7个强力优化技巧:通过Win11Debloat实现系统优化与性能提升
  • 别再折腾源码编译了!树莓派4B上两行命令搞定Python-OpenCV(附摄像头调用实战代码)
  • 基于R语言的自动数据收集:网络抓取和文本挖掘实用指南【1.6】
  • Avalonia11 Canvas性能优化实战:用局部渲染搞定3万个Image控件卡顿问题
  • 国内网站 SEO 推广需要多长时间见效
  • OpenClaw安全加固:Phi-3-vision服务接口的权限控制实践
  • Picadillo:车规级嵌入式LCD显示驱动库解析
  • OpenClaw模型微调指南:Phi-3-vision-128k适配专业领域图文任务
  • JavaScript Navigator 深入解析
  • 嵌入式开发中的模块化设计实践与优势
  • 【C++笔记】STL详解: stack 和 queue 的实现
  • 如何在Linux上快速解决Realtek 8922AE WiFi 7网卡驱动问题
  • OpenClaw跨平台控制:千问3.5-9B操作远程桌面应用
  • manga-image-translator:如何让图片中的文字跨越语言障碍?
  • Class E放大器调谐实战:从理论到高效应用的三大关键步骤
  • 设计服务公司可能最适合跑AI工作流
  • 线性表顺序存储结构全解析,第十四篇:Python异步IO编程(asyncio)核心原理解析。
  • RK3588 OV13855驱动加载全解析,【连载6】数据库未来发展趋势展望,附例子,避坑指南以及面试题。
  • Redis怎样合并多天访客数据_通过PFMERGE指令聚合HyperLogLog记录