向量数据库实战:选型、调优与落地~系列文章20:向量数据库在推荐系统中的应用:从协同过滤到向量召回
向量数据库在推荐系统中的应用:从协同过滤到向量召回 🎯
🔥本文是《向量数据库实战:选型、调优与落地》专栏第 20 篇
⏱️阅读时间:约 13 分钟
🎯 开篇:推荐系统的"召回"革命
传统推荐系统的核心流程 👇
┌─────────────────────────────────────────────────────────┐ │ 推荐系统经典架构 │ ├─────────────────────────────────────────────────────────┤ │ │ │ 用户请求 │ │ │ │ │ ▼ │ │ ┌──────────┐ ┌──────────┐ ┌──────────┐ │ │ │ 召回层 │ → │ 粗排层 │ → │ 精排层 │ │ │ │ (Recall) │ │ (Pre- │ │ (Rank) │ │ │ │ │ │ ranking) │ │ │ │ │ │ 百万→千 │ │ 千→百 │ │ 百→几十 │ │ │ └──────────┘ └──────────┘ └──────────┘ │ │ │ │ │ ▼ │ │ ┌──────────┐ │ │ │ 重排层 │ │ │ │ (Re-rank)│ │ │ │ 几十→展示 │ │ │ └──────────┘ │ │ │ │ 召回层是核心!它决定了推荐的"天花板" │ │ → 向量数据库就是召回层的"发动机" │ │ │ └─────────────────────────────────────────────────────────┘🧠 从协同过滤到向量召回
传统协同过滤的问题
用户 A 喜欢:[商品1, 商品2, 商品3] 用户 B 喜欢:[商品2, 商品3, 商品4] → A 和 B 有相似偏好 → 给用户 A 推荐商品4 问题: ❌ 只能发现"显式相似"的用户/物品 ❌ 稀疏性问题:大部分用户-物品对没有交互 ❌ 无法理解"为什么"相似向量召回的优势
商品1 的向量: [0.12, -0.34, ...] ← learned representation 商品2 的向量: [0.13, -0.33, ...] ← 语义相近! 商品3 的向量: [0.89, 0.12, ...] ← 语义远 向量召回: ✅ 能发现"隐式相似"(语义相近但没交互过的) ✅ 不受稀疏性影响 ✅ 能理解"为什么"相似(向量空间中的距离)💻 向量召回实战
Step 1:训练双塔模型
importtorchimporttorch.nnasnnclassTwoTowerModel(nn.Module):"""双塔模型:用户塔 + 物品塔"""def__init__(self,user_dim,item_dim,embedding_dim=128):super().__init__()# 用户塔self.user_tower=nn.Sequential(nn.Linear(user_dim,256),nn.ReLU(),nn.Linear(256,128),nn.ReLU(),nn.Linear(128,embedding_dim),nn.LayerNorm(embedding_dim))# 物品塔self.item_tower=nn.Sequential(nn.Linear(item_dim,256),nn.ReLU(),nn.Linear(256,128),nn.ReLU(),nn.Linear(128,embedding_dim),nn.LayerNorm(embedding_dim))defforward(self,user_features,item_features):user_emb=self.user_tower(user_features)item_emb=self.item_tower(item_features)# 内积作为相似度return(user_emb*item_emb).sum(dim=-1)defget_user_embedding(self,user_features):returnself.user_tower(user_features)defget_item_embedding(self,item_features):returnself.item_tower(item_features)Step 2:生成物品向量并存入数据库
frompymilvusimportCollection# 为所有物品生成向量item_embeddings=[]foriteminall_items:item_features=extract_features(item)# 类别、价格、标签等withtorch.no_grad():vec=model.get_item_embedding(item_features)item_embeddings.append(vec.numpy()[0])# 存入向量数据库data=[[item.idforiteminall_items],item_embeddings,[{"category":item.category,"price":item.price}foriteminall_items]]collection.insert(data)collection.flush()# 建索引collection.create_index("embedding",{"index_type":"HNSW","metric_type":"IP",# 推荐系统用内积!"params":{"M":32,"efConstruction":256}})Step 3:在线召回
defrecall_for_user(user_id,user_features,collection,model,top_k=100):"""为单个用户做向量召回"""# 1. 生成用户向量withtorch.no_grad():user_vec=model.get_user_embedding(user_features).numpy()[0]# 2. 向量检索collection.load()results=collection.search(data=[user_vec.tolist()],anns_field="embedding",param={"metric_type":"IP","params":{"ef":128}},limit=top_k,output_fields=["category","price"])# 3. 过滤已购买purchased=get_purchased_items(user_id)filtered=[hitforhitinresults[0]ifhit.idnotinpurchased]returnfiltered[:top_k]📊 多路召回架构
┌─────────────────────────────────────────────────────────┐ │ 多路召回架构 │ ├─────────────────────────────────────────────────────────┤ │ │ │ 用户请求 │ │ │ │ │ ├──→ 向量召回(语义相似)→ 100 个候选 │ │ │ │ │ ├──→ 热门召回(全局热门)→ 50 个候选 │ │ │ │ │ ├──→ 协同过滤召回 → 50 个候选 │ │ │ │ │ ├──→ 标签召回(同类目)→ 50 个候选 │ │ │ │ │ └──→ 实时召回(最近浏览的相似品)→ 50 个候选 │ │ │ │ ↓ 合并去重 │ │ ~300 个候选 │ │ ↓ │ │ 粗排 → 精排 → 重排 → 展示 │ │ │ └─────────────────────────────────────────────────────────┘🔑 本篇核心要点回顾
| 要点 | 说明 |
|---|---|
| 向量召回 | 用双塔模型生成用户/物品向量,向量数据库检索 |
| 度量选择 | 推荐系统用内积(IP),不是余弦 |
| 多路召回 | 向量召回只是其中一路,需要多路融合 |
| 性能要求 | 召回层要求极低延迟(< 10ms) |
📌下篇预告:《向量数据库在图像搜索引擎中的应用:以图搜图的完整实现 📸》
💬有问题欢迎评论区讨论,觉得有用请点赞收藏 👍
作者:高炉炼铁智能化技术研究者,专注钢铁冶金与人工智能 交叉领域。
👍 如果觉得有帮助,请点赞、收藏、转发!
版权归作者所有,未经许可请勿抄袭,套用,商用(或其它具有利益性行为)。
🔔 关注专栏,不错过后续精彩内容
