向量数据库实战:选型、调优与落地~系列文章19:向量数据库 + RAG 融合实战:构建企业级知识库的完整链路
向量数据库 + RAG 融合实战:构建企业级知识库的完整链路 🔗
🔥本文是《向量数据库实战:选型、调优与落地》专栏第 19 篇
⏱️阅读时间:约 15 分钟
🎯 开篇:RAG 是向量数据库最核心的应用场景
RAG(Retrieval-Augmented Generation)= 检索增强生成
简单说就是:让大模型在回答之前,先从你的知识库里"查资料"📚
┌─────────────────────────────────────────────────────────┐ │ RAG = 向量数据库 + 大模型 │ ├─────────────────────────────────────────────────────────┤ │ │ │ 没有 RAG 的大模型: │ │ 用户: "我们公司的退货政策是什么?" │ │ AI: "抱歉,我不知道贵公司的具体政策..." │ │ │ │ 有 RAG 的大模型: │ │ 用户: "我们公司的退货政策是什么?" │ │ → Step 1: 从向量知识库检索相关文档 │ │ → Step 2: 把检索到的文档 + 用户问题一起发给大模型 │ │ AI: "根据公司退货政策(2025年3月更新), │ │ 自购买之日起30天内可无理由退货..." │ │ │ └─────────────────────────────────────────────────────────┘🏗️ RAG 完整架构
┌─────────────────────────────────────────────────────────────┐ │ RAG 完整架构 │ ├─────────────────────────────────────────────────────────────┤ │ │ │ 📥 离线阶段(数据入库) │ │ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ │ │ │ 文档 │ → │ 分块 │ → │向量化 │ → │ 存储 │ │ │ │ PDF/ │ │Chunk │ │Embed │ │向量DB│ │ │ │ Word │ │ │ │ding │ │ │ │ │ └──────┘ └──────┘ └──────┘ └──────┘ │ │ │ │ 🔍 在线阶段(检索问答) │ │ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ │ │ │ 用户 │ → │查询 │ → │向量 │ → │重排序 │ → │ 大模型 │ │ │ │ 提问 │ │向量化 │ │检索 │ │Rerank│ │ 生成 │ │ │ └──────┘ └──────┘ └──────┘ └──────┘ └──────┘ │ │ ↑ │ │ 检索到的文档 │ │ │ └─────────────────────────────────────────────────────────────┘💻 完整代码实现
Step 1:文档处理 & 入库
fromlangchain.text_splitterimportRecursiveCharacterTextSplitterfromsentence_transformersimportSentenceTransformerfrompymilvusimportCollectionimportnumpyasnp# 1. 加载嵌入模型model=SentenceTransformer("BAAI/bge-m3")# 2. 文档分块text_splitter=RecursiveCharacterTextSplitter(chunk_size=500,chunk_overlap=50,separators=["\n\n","\n","。","!","?"])defprocess_document(file_path,collection):"""处理单个文档并入库"""# 读取文档withopen(file_path,'r',encoding='utf-8')asf:text=f.read()# 分块chunks=text_splitter.split_text(text)# 向量化embeddings=model.encode([f"represent document:{chunk}"forchunkinchunks],normalize_embeddings=True)# 构造元数据metadatas=[{"source":file_path,"chunk_index":i,"total_chunks":len(chunks)}foriinrange(len(chunks))]# 入库data=[chunks,# text 字段embeddings.tolist(),# embedding 字段[str(m)forminmetadatas]# metadata 字段]collection.insert(data)collection.flush()print(f"✅{file_path}:{len(chunks)}个分块已入库")Step 2:检索 & 生成
defrag_query(question,collection,model,llm,top_k=5):"""RAG 问答"""# 1. 查询向量化query_embedding=model.encode(f"represent passage:{question}",normalize_embeddings=True)# 2. 向量检索collection.load()results=collection.search(data=[query_embedding.tolist()],anns_field="embedding",param={"metric_type":"COSINE","params":{"ef":128}},limit=top_k,output_fields=["text","source"])# 3. 构造上下文context_parts=[]forhitinresults[0]:context_parts.append(f"[来源:{hit.entity.get('source')}] "f"{hit.entity.get('text')}")context="\n\n".join(context_parts)# 4. 构造 Promptprompt=f"""基于以下参考资料回答用户问题。如果资料中没有相关信息,请如实说明。 参考资料:{context}用户问题:{question}请给出准确、简洁的回答:"""# 5. 调用大模型生成回答answer=llm.generate(prompt)return{"answer":answer,"sources":[hit.entity.get('source')forhitinresults[0]],"scores":[hit.distanceforhitinresults[0]]}🚀 RAG 进阶优化
优化 1:查询改写
defquery_rewrite(question,llm):"""查询改写:提升检索效果"""prompt=f"""请将以下用户问题改写为更适合检索的形式。 保留核心意图,补充可能的同义词和相关概念。 原始问题:{question}改写后的检索查询:"""returnllm.generate(prompt)# 使用rewritten=query_rewrite("怎么退货",llm)# → "商品退货流程 退货政策 退换货规则 退款申请"优化 2:HyDE(假设文档嵌入)
defhyde_search(question,collection,model,llm):"""HyDE: 先让 LLM 生成假设性回答,用回答去检索"""# 1. 生成假设性回答hypothetical_answer=llm.generate(f"请回答以下问题(即使不确定也请尝试):{question}")# 2. 用假设性回答做向量检索query_embedding=model.encode(hypothetical_answer)results=collection.search(data=[query_embedding.tolist()],anns_field="embedding",param=search_params,limit=5,output_fields=["text"])returnresults优化 3:Reranker 重排序
fromsentence_transformersimportCrossEncoder# 加载重排序模型reranker=CrossEncoder("BAAI/bge-reranker-v2-m3")defrerank(query,results,top_k=3):"""对检索结果重排序"""pairs=[(query,doc["text"])fordocinresults]scores=reranker.predict(pairs)# 按重排序分数排序ranked=sorted(zip(results,scores),key=lambdax:x[1],reverse=True)return[docfordoc,scoreinranked[:top_k]]📊 RAG 优化效果对比
| 方案 | Recall@5 | 回答准确率 | 延迟 |
|---|---|---|---|
| 基础 RAG | 85.2% | 72% | 1.5s |
| + 查询改写 | 89.5% | 78% | 2.0s |
| + HyDE | 91.3% | 82% | 3.0s |
| + Reranker | 93.8% | 89% | 2.5s |
| + 混合搜索 | 95.2% | 91% | 2.8s |
🔑 本篇核心要点回顾
| 要点 | 说明 |
|---|---|
| RAG 核心 | 检索 + 生成,让大模型用你的数据回答 |
| 完整链路 | 文档分块 → 向量化 → 存储 → 检索 → 生成 |
| 关键优化 | 查询改写、HyDE、Reranker、混合搜索 |
| 效果提升 | 优化后准确率可从 72% 提升到 91% |
📌下篇预告:《向量数据库在推荐系统中的应用:从协同过滤到向量召回 🎯》
💬有问题欢迎评论区讨论,觉得有用请点赞收藏 👍
作者:高炉炼铁智能化技术研究者,专注钢铁冶金与人工智能 交叉领域。
👍 如果觉得有帮助,请点赞、收藏、转发!
版权归作者所有,未经许可请勿抄袭,套用,商用(或其它具有利益性行为)。
🔔 关注专栏,不错过后续精彩内容
