当前位置: 首页 > news >正文

混合检索为什么是 RAG 的现实解

做 RAG 文档问答时,我最开始只上了向量检索。第一次内测,用户问"OpenClaw 的 cron 怎么用",系统返回了一堆时间管理的废话。“cron” 这个专有名词被 embedding 打散了,向量空间里它跟"定时任务"、"调度器"混在一起,精确匹配的文档反而排到了后面。

纯向量检索在专有名词面前是瞎的。

向量检索擅长什么,不擅长什么

向量检索的强项是语义泛化。用户问"怎么让程序定时执行",文档写的是"周期性任务调度",向量空间能把这两句话拉近,召回正确段落。关键词搜索做不到,换个说法就找不到了。

但向量检索有两个硬伤:

专有名词失真。“kubectl”、“@Transactional”、“fibonacci”,tokenizer 会拆成碎片,embedding 模型没见过完整形态,向量空间里的位置基本是随机的。用户精确问这个词,向量检索反而召回一堆无关内容。

低频长尾词消失。文档里只出现过一次的配置项、错误码、函数名,embedding 模型没有足够样本学到语义,向量表示就是噪音。用户问这个词,向量检索直接漏掉。

关键词检索的短板

纯用关键词(全文搜索)也不行。

关键词检索是字面匹配 + TF-IDF 排序,专有名词、错误码能精确命中,但遇到同义表达就完全失效。用户问"怎么让容器重启",文档写的是"pod 自动恢复",关键词搜索两眼一抹黑。

用户的问法和文档的写法永远有 gap。技术文档喜欢用术语(“持久化”、“序列化”),用户喜欢说大白话(“保存到硬盘”、“变成字符串”)。纯关键词检索过不了这道 gap。

现实解:FTS + 向量一起上

两种检索各有盲区,那就混着用。docqa 项目最后的方案:

// 向量检索:召回语义相关的 top 20vectorResults := vectorSearch(query, topK=20)// 关键词检索(Bleve FTS):召回字面匹配的 top 20ftsResults := bleveSearch(query, topK=20)// RRF 融合:把两边的排序归一化后加权合并finalResults := rrfMerge(vectorResults, ftsResults, k=60)

RRF(Reciprocal Rank Fusion)公式:

score = 1/(k + rank_vector) + 1/(k + rank_fts)

结果在两边的排名越靠前,最终分数越高。k=60是经验值,平滑排名差异,避免某一边排名波动主导最终结果。

效果

上线后再测"OpenClaw 的 cron 怎么用":

  • 向量检索召回"定时任务"、"调度器"相关段落(语义泛化)
  • FTS 召回精确包含"cron"的段落(字面匹配)
  • RRF 融合后,包含"cron"的那段排到第一位,因为它同时在两边都有较高排名

用户问"怎么让任务每天跑一次"(没提 cron):

  • 向量检索召回 cron、定时任务相关段落
  • FTS 召回"每天"、"任务"的段落(虽然不精确)
  • 融合后依然能把 cron 文档排上来

专有名词有保障,同义表达也能覆盖。单用任何一种检索都做不到。

为什么不用纯向量 + rerank

有人会说:直接向量检索 recall top 100,再上个 rerank 模型不就行了?

理论上可以,但:

Rerank 模型也不认专有名词。它本质还是语义模型,"kubectl"这种词它也没学好。向量检索没召回的东西,rerank 救不回来。

成本高。Rerank 要对每个候选段落跑一次模型推理,top 100 就是 100 次。混合检索在召回阶段就解决了问题。

Rerank 适合做最后的精排(top 20 → top 5),不是用来补救召回阶段的缺陷。

我的判断

混合检索是 RAG 在生产环境的现实选择。向量检索负责语义泛化,覆盖同义表达;关键词检索负责精确匹配,保住专有名词和低频词;RRF 融合两边结果,让排序更稳健。

如果你的 RAG 系统只用了向量检索,加上全文搜索试试。改动不大,召回质量能上一个台阶。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

http://www.cnnetsun.cn/news/4022597.html

相关文章:

  • 为什么越来越多的南宁律师开始重视南宁律师网站建设以及如何通过专业形象赢得客户信任
  • 揭秘福建西南建设有限公司网站背后的匠心坚守与工程美学:从蓝图到现实的信任之旅
  • 揭秘行业真相:成品网站建设价格到底贵不贵?从起步到进阶的深度解析
  • Android RecyclerView 四级缓存详解
  • 联盟链用链成本怎么算?主流计费模式盘点与选型参考
  • 校园后勤数字化改革之路:深度解析学校网站总务建设的痛点与破局
  • 无名杀网页版免费即开即玩:浏览器里体验完整三国杀的全指南
  • 医疗网站建设管理:从底层逻辑到长期运营的系统化思维与实战指南
  • 电视盒子从吃灰到真香:TVBoxOSC 大屏使用从零到一终极指南
  • Windows激活和Office激活一劳永逸:KMS_VL_ALL_AIO 本地KMS工具零基础指南
  • 视觉中国网站建设公司如何打造高转化率落地页提升品牌影响力的深度解析
  • B站视频解析API实战:一套PHP代码,让视频直链5分钟到手
  • NCM音乐转换不再愁:ncmdump免费工具手把手一学就会
  • 从0到1打造高转化页面:电梯网站建设的全流程深度解析与避坑指南
  • 网站建设先进材料如何赋能企业数字化升级并提升行业竞争力
  • 电商实战指南:一份保姆级的电子商务网站建设规划书范文,帮你避坑省钱
  • 网站建设的小故事:新手站长如何从0到1打造高转化官网的蜕变之旅
  • 南充网站建设费用大揭秘:2024普通企业建站到底要花多少钱才不吃亏
  • 从0到1打造高转化私域帝国深度解析专业网站建设微信商城开发的底层逻辑与实战指南
  • Wand-Enhancer 快速上手指南:免费解锁 WeMod 完整功能,手机也能远程操控
  • 昆明网站建设技术研发中心深度解析:如何打造高转化率的数字化营销平台
  • 深入了解灌云县建设局网站:获取最新城建资讯与便民服务指南
  • Adafruit_NeoPixel 1.14.0 更新解读:PY32 新平台入列,你的灯带能跑得更顺
  • 深度解析企业必备的网站系统安全防护体系建设方案 下载与实操指南
  • 像这些问题,我又想能显示在我前面,但是又不是越加越多。因为我要处理的事情会越来越多。那么这些 提词问题会越来越多。我又不想加在本地的 检索,因为本地检索 加一个问题配置起来好麻烦,搞来搞去又影响到之前
  • 零许可费起步企业碳核算:openLCA 开源LCA工具实用指南
  • 南宁百度 网站正在建设中:一家深耕本地市场的数字服务商的致用户公开信与未来展望
  • WebPShop 插件深度解析:Photoshop 里被低估的 WebP 动画与压缩控制
  • 合肥网站建设怎么样
  • 2024年深度解析建设银行网站会员:权益解析、避坑指南与省钱实操手册