算法思想(一)
一、Bagging思想
典型代表:随机森林
1.1Bagging
通俗理解:集思广益
原理案例:
- 如果只使用单一模型,那么这个模型频繁使用一定会有误差。
- 如果使用多个单一模型,假如现在我们规定baseline为5.0
- A_model:bisa+1,B_model:bisa-1,那么这两个模型相加求平均,bias会发现稳定了,这表明使用多个模型平权投票表现比单一模型更稳定。
由此可以推出Bagging思想:消除噪声
bagging原理图示:
1.2随机森林
基座:决策树
解决方向:分类|回归 问题
基础概念:
熵:混乱程度越大,熵越大;
信息增益:按某个特征划分数据集,划分好以后约规整,那么信息增益越大。
- 比如按照身份证划分每一个人的数据集,划分以后熵直接变成0.那么此时信息增益最大。但是这个特征毫无意义,因为对于训练集来说他确实可以精准识别,但是新来一个人,那他就完全没有办法识别,这就是过拟合。这也引出了信息增益率的概念。
信息增益率:对取值特别多的特征进行惩罚,值越多,信息增益率越小。
基尼系数:类似于熵的概念,也是衡量混乱程度,取值范围是0~0.5。熵的取值范围是0~1或者更大。
单模型训练场景
优点:如果单个模型的性能比较好,他基于某一个属性达到了一个很好的分类
缺点:每次重复,模型严重依赖某一属性
随机森林概念拆解:
随机:
- 样本随机抽取并放回:样本分布差异化
- 属性随机:属性划分差异性(a_tree:年龄、职业、收入 b_tree:消费金额、还款记录、卡级别)
随机优势:
- 特征多元化
- 鲁棒性更强
森林:多个模型一起决策
随机森林原理图示
二、停用词
作用:非核心词意义很小比如连词语气词等
剔除停用词步骤:
- 分词(jieba)
- 剔除停用词:作用是减少词表的长度和减少一句话分词以后的有效长度
- 垂直领域:针对专业领域有专业词汇词表
三、tf-idf
背景:基于词之间的独立性|无关联性
基础算法:
- one-hot:基于词出现的索引,出现就为1,得到一个非常稀疏的向量
- bag-of-word:基于词频,也是得到一个非常稀疏的向量
但是出现词频不能表明这个词很有意义,比如连词和语气词有很多,但是意义不大,所以要引出代表性的概念。
tf-idf融合了词频和词的重要程度
tf(词频)越大越好,idf(逆文档频率)越小越好
四、混淆矩阵
精确率(Precision)
精确率表示模型预测为正例的样本中,真正为正例的比例,反映模型预测正例的准确性。其计算公式为:
准确率(Accuracy)
准确率是模型预测正确的样本占总样本的比例,计算公式为:
召回率(Recall)
召回率也称灵敏度、真正例率,指实际为正例的样本中,被模型正确预测为正例的比例,用于衡量模型对正例的识别能力。其计算公式为:
F1 值
F1 值是精确率和召回率的调和平均数,综合反映模型性能。当精确率和召回率都高时,F1 值才会高。其计算公式为:
F1 值的引入是为了平衡精确率和召回率这两个指标。因为在实际应用中,精确率和召回率往往是相互制约的关系。
