LeadQualifier 10分钟快速上手:从安装到跑通你的第一个线索资格审查模型
LeadQualifier 10分钟快速上手:从安装到跑通你的第一个线索资格审查模型
【免费下载链接】LeadQualifier:dart: Qualify sales leads with machine learning项目地址: https://gitcode.com/gh_mirrors/le/LeadQualifier
LeadQualifier是一个用机器学习做销售线索资格审查(Qualify Sales Leads)的开源项目:它读取公司的描述文本,自动判断每条销售线索是否"合格"(qualified),帮你把精力集中在最有价值的客户上。本文带你用 10 分钟完成从安装依赖、准备数据,到训练并预测出你的第一个线索资格审查模型的全部流程。
📌 LeadQualifier 是什么?
LeadQualifier 是一套可直接运行的 Python 脚本集合,核心思路:
- 训练:用带标签的公司描述数据(合格/不合格),训练一个文本分类器(默认随机森林)
- 预测:对新线索的描述打标签,输出
1 = 合格、0 = 不合格
它支持两种玩法:
- 🧪用 Xeneta 的公开数据,挑战它的排行榜成绩
- 🏭用自己的数据,为公司搭建专属线索资格审查器
📁 项目结构速览
LeadQualifier/ ├── train_algorithm/ # 第一步:训练你的模型 │ └── input/ # 放入 qualified.xlsx / disqualified.xlsx ├── qualify_leads/ # 第二步:对线索批量预测 │ ├── input/ # 放入 data.xlsx │ ├── algorithms/ # 训练产出的模型文件 │ └── output/ # 生成 predictions.xls ├── xeneta_qualifier/ # 进阶:挑战 Xeneta 官方数据 └── requirements.txt # 依赖清单🚀 第 1 步:克隆仓库并安装依赖
git clone https://gitcode.com/gh_mirrors/le/LeadQualifier cd LeadQualifier pip install -r requirements.txt依赖非常轻量:requirements.txt 中只有nltk、numpy、sklearn、xlrd、xlwt五个库。
另外,文本预处理需要 NLTK 的英文停用词表,在 Python 解释器中执行一次即可:
import nltk nltk.download('stopwords')💡版本提示:项目脚本为 Python 2 风格编写(
cPickle、xrange、
📊 第 2 步:准备训练数据
训练脚本 train_algorithm/run.py 会从 train_algorithm/input/ 读取两个 Excel 文件,每个文件两列:URL和Description:
qualified.xlsx—— 已验证为合格客户的描述disqualified.xlsx—— 已验证为不合格客户的描述
仓库中已附带示例数据,可直接运行。数据格式如下图所示:
真实场景下,公司描述可以从 FullContact 等企业信息接口获取,把 URL 和描述整理进这两个表格即可。
🏋️ 第 3 步:训练你的第一个线索资格审查模型
进入训练目录,执行:
cd train_algorithm python run.py脚本自动完成整条流水线(见 train_algorithm/run.py):
| 环节 | 说明 |
|---|---|
| 文本清洗 | 去标点、Snowball 词干提取、过滤停用词 |
| 特征化 | CountVectorizer词频向量 +TfidfTransformer加权 |
| 训练 | RandomForestClassifier(90 棵树),预留 30% 测试集评估 |
| 保存 | 模型、向量器、TF-IDF 转换器存入 qualify_leads/algorithms/ |
运行结束后,控制台会打印随机森林的 Precision / Recall / F1 分数,三个模型文件已就绪,下一步就可以开始预测了。
🎯 第 4 步:批量预测你的销售线索
把待审查的线索放入 qualify_leads/input/data.xlsx,格式与示例文件相同(URL+Description两列),然后执行:
cd qualify_leads python run.py预测逻辑见 qualify_leads/run.py:加载模型 → 同样规则清洗文本 → 向量化 → 输出预测。结果会写入 qualify_leads/output/predictions.xls,新增一列Prediction:1表示线索合格,0表示不合格:
至此,你的线索资格审查流程已全部跑通 🎉
🏆 进阶:挑战 Xeneta 官方数据
Xeneta 开放了他们向量化后的数据(xeneta_qualifier/data/ 下的train.csv/test.csv),你可以把自己的算法加入 xeneta_qualifier/run.py 中实测打分,冲上排行榜:
| 算法 | Precision | Recall | F1 Score |
|---|---|---|---|
| SGD Classifier | 0.872 | 0.940 | 0.905 |
| Random Forest | 0.845 | 0.915 | 0.878 |
仓库中还附带了一个 TensorFlow 神经网络实验脚本 xeneta_qualifier/nn.py,可作为调优起点。
💡 小贴士
- 两个脚本都支持"替换数据直接重跑",换一批 Excel 文件即可复训 / 复测
- 想要更好成绩,可尝试替换分类器(SGD、Naive Bayes、KNN 等在源码中留有注释入口)
- 预测分数不理想时,优先检查训练数据量与标签质量,而不是急着换算法
10 分钟,从pip install到拿到带预测结果的 Excel,现在就去跑通你的第一个线索资格审查模型吧!
【免费下载链接】LeadQualifier:dart: Qualify sales leads with machine learning项目地址: https://gitcode.com/gh_mirrors/le/LeadQualifier
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
