二元Logit回归分析报告(修正版):模型诊断与稳健性检验
消费者购买决策影响因素的二元Logit回归分析
摘要:基于320份消费者样本数据,运用二元Logit回归模型考察价格感知、品牌信任、感知风险与会员身份对购买决策的影响。结果表明:价格感知(β=2.040,OR=7.691)与品牌信任(β=1.043,OR=2.837)对购买决策具有显著正向影响,感知风险(β=-0.895,OR=0.409)具有显著负向影响,会员身份影响不显著(p=0.332)。模型似然比检验χ²=180.435(p<0.001),Hosmer-Lemeshow检验p=0.524,Nagelkerke R²=0.575,预测准确率80.94%,模型整体有效且拟合优度良好。
1引言
消费者购买决策是市场营销领域的重要研究议题。在影响购买行为的诸多因素中,价格感知、品牌信任与感知风险被认为是核心驱动变量。二元Logit回归模型因适用于因变量为二分类场景而广泛应用于消费者行为研究。本文基于SPSSAU平台输出的二元Logit回归分析结果,系统检验上述变量对消费者"是否购买"决策的影响方向、影响程度及统计显著性,并通过似然比检验、Hosmer-Lemeshow拟合优度检验、边际效应分析及多重共线性诊断等多维指标对模型进行综合评价。
2数据来源与模型构建
本研究共收集320份有效消费者问卷数据,无缺失值。因变量为二分类变量"是否购买"(0=未购买,1=购买),自变量包括三个连续变量(价格感知、品牌信任、感知风险)与一个二分类变量(会员身份,以0为参照组)。采用二元Logit回归模型进行参数估计,模型基本形式为:ln[p/(1-p)] = β₀ + β₁X₁ + β₂X₂ + β₃X₃ + β₄X₄,其中p为购买概率,βᵢ为各自变量的回归系数。回归系数通过最大似然估计法(MLE)求得,并采用Wald统计量检验各系数的显著性。
表1二元Logit回归分析基本汇总
表1报告了因变量的频数分布与样本汇总情况。在320个有效观测值中,选择"购买"的样本为164个(51.25%),选择"未购买"的样本为156个(48.75%),两组比例接近1:1,分布较为均衡。样本缺失值为0,数据完整性良好。因变量两类别的均衡分布有利于Logit回归模型的参数估计与分类预测,避免了因类别严重失衡可能导致的模型偏倚问题。
3实证分析结果
在SPSSAU【进阶方法】模块选择【二元logit】,将变量拖拽至右侧对应分析框,设置定类变量SPSSAU自动进行哑变量处理,操作如下图:
3.1模型整体有效性检验
表2二元Logit回归模型似然比检验结果
表2展示了似然比检验(Likelihood Ratio Test)的结果。仅截距模型(Null Model)的-2倍对数似然值(-2LL)为443.414,引入四个自变量后的最终模型(Full Model)-2LL降至262.979,二者之差即为似然比卡方统计量χ²=180.435。在自由度df=4的条件下,对应的p值<0.001,远小于0.05的显著性水平,表明加入自变量后模型对因变量的解释力显著提升,模型整体具有统计学意义。此外,最终模型的AIC值为272.979,BIC值为291.820,信息准则值均处于合理范围,表明模型在拟合优度与简洁性之间取得了较好的平衡。综上,所构建的二元Logit回归模型整体有效,可用于后续的系数估计与解释。
3.2回归系数估计与显著性检验
表3二元Logit回归分析结果汇总
表3报告了各自变量的回归系数(β)、标准误(SE)、z值、Wald卡方统计量、p值、优势比(OR)及其95%置信区间等关键估计结果。Wald统计量用于检验单个回归系数是否显著不同于零,其值越大表明该自变量对因变量的影响越显著。OR值(Odds Ratio)则反映自变量每变化一个单位时,因变量取"购买"的相对优势比的变化倍数:OR>1表示正向影响,OR<1表示负向影响,OR=1表示无影响。
具体而言,价格感知的回归系数β=2.040(SE=0.243,z=8.395,Wald χ²=70.477,p<0.001),OR=7.691,95%置信区间为[4.777, 12.383],表明价格感知对购买决策具有显著正向影响。在控制其他变量不变的条件下,价格感知每提升一个单位,消费者选择购买的胜算(odds)扩大约7.69倍,说明消费者对价格合理性的感知越积极,其购买意愿越强烈。品牌信任的回归系数β=1.043(SE=0.190,z=5.478,Wald χ²=30.014,p<0.001),OR=2.837,95%置信区间为[1.954, 4.120],同样具有显著正向影响,即品牌信任每提升一个单位,购买的胜算约增至原来的2.84倍。
感知风险的回归系数β=-0.895(SE=0.175,z=-5.101,Wald χ²=26.015,p<0.001),OR=0.409,95%置信区间为[0.290, 0.576],呈显著负向影响。OR<1表明感知风险每增加一个单位,购买的胜算降至原来的约40.9%,即消费者感知到的风险越高,购买概率越低。会员身份(以0为参照组)的回归系数β=0.302(SE=0.311,z=0.970,Wald χ²=0.941,p=0.332),OR=1.353,95%置信区间为[0.735, 2.491],由于置信区间包含1且p值远大于0.05,说明会员身份对购买决策的影响不具有统计显著性。截距项β=0.009(p=0.965)不显著,表明在所有自变量取零值时,购买与不购买的胜算比接近1。
此外,模型拟合优度方面,McFadden R²=0.407,Cox & Snell R²=0.431,Nagelkerke R²=0.575。其中McFadden R²值在0.2~0.4之间通常被认为具有较好的拟合效果[1],本研究McFadden R²=0.407已超过该阈值上限,Nagelkerke R²=0.575表明模型解释了因变量方差的57.5%,拟合优度处于较高水平。
3.3边际效应分析
表4边际效应结果
表4报告了各自变量对购买概率的边际效应(Marginal Effect, dy/dx)。边际效应衡量的是在其他条件不变的情况下,自变量每变化一个单位时因变量取"购买"的概率变化量,其优势在于可以直接以概率形式解释影响程度,较OR值更为直观。
价格感知的边际效应dy/dx=0.271(SE=0.015,z=18.171,p<0.001,95%CI: [0.241, 0.300]),表明在其他变量保持不变时,价格感知每提升一个单位,消费者购买概率平均增加27.1个百分点,是所有变量中边际影响最大的因素。品牌信任的边际效应dy/dx=0.138(SE=0.021,z=6.716,p<0.001,95%CI: [0.098, 0.179]),即品牌信任每提升一个单位,购买概率平均增加13.8个百分点。感知风险的边际效应dy/dx=-0.119(SE=0.020,z=-6.035,p<0.001,95%CI: [-0.157, -0.080]),表明感知风险每增加一个单位,购买概率平均下降11.9个百分点。会员身份的边际效应dy/dx=0.040(SE=0.042,z=0.967,p=0.334,95%CI: [-0.042, 0.122]),置信区间包含0,进一步验证了会员身份对购买决策影响不显著的结论。综合来看,价格感知对购买概率的边际贡献最为突出,品牌信任次之,感知风险具有中等程度的负向抑制作用。
3.4模型预测准确率
表5二元Logit回归预测准确率汇总
表5以混淆矩阵(Confusion Matrix)的形式呈现了模型的分类预测表现。在真实值为"未购买"(0)的156个样本中,模型正确预测了122个,预测准确率为78.205%(即特异度,Specificity),误判34个为"购买"(假阳性率21.795%)。在真实值为"购买"(1)的164个样本中,模型正确预测了137个,预测准确率为83.537%(即敏感度/召回率,Sensitivity),误判27个为"未购买"(假阴性率16.463%)。
模型整体预测准确率为80.938%,即320个样本中约259个被正确分类。整体来看,模型对"购买"类别的识别能力(83.54%)略优于对"未购买"类别的识别能力(78.21%),两类别的预测准确率均超过75%,表明模型具有较好的分类判别能力。结合前述似然比检验与拟合优度指标,模型在统计显著性与实际预测效能两个维度均表现良好。
3.5 Hosmer-Lemeshow拟合优度检验
表6 Hosmer-Lemeshow拟合度检验
表7 Hosmer-Lemeshow检验过程
表6与表7报告了Hosmer-Lemeshow(HL)拟合优度检验结果。HL检验通过将样本按预测概率从低到高分为10个等距分位数组别,比较各组内观测频数(Observation)与期望频数(Expectation)的差异,构造卡方统计量来评估模型预测概率与实际结果的一致性。其原假设为"模型拟合良好",当p值大于0.05时不拒绝原假设,即认为模型不存在拟合不足。
由表6可知,HL检验统计量χ²=7.118,自由度df=8,p=0.524,远大于0.05的显著性水平,表明模型预测概率与实际观测值之间无显著偏差,模型拟合优度良好。表7进一步展示了10个分位数组别的详细比较结果。以第1组([0,10])为例,预测概率最低的32个样本中,实际未购买32个、购买0个,期望值分别为31.420和0.580,观测值与期望值高度吻合。在第10组((90,100])中,预测概率最高的32个样本实际购买31个、未购买1个,期望值分别为31.440和0.560,同样吻合良好。各组的观测值与期望值差异均较小,从分组层面进一步验证了模型的校准能力(Calibration),说明模型预测的概率值能够较为准确地反映实际事件发生的可能性。
3.6多重共线性诊断
表8共线性诊断
表8报告了各自变量的方差膨胀因子(VIF)与容忍度(Tolerance)指标,用于诊断自变量之间是否存在严重的多重共线性问题。容忍度等于1减去该自变量对其余自变量进行回归所得的决定系数(Tolerance = 1 - R²),取值范围0~1,值越接近1表明该变量与其他自变量的共线性越弱。VIF为容忍度的倒数(VIF = 1/Tolerance),通常认为VIF<10(严格标准VIF<5)且容忍度>0.1时,不存在严重的多重共线性问题。
由表8可知,价格感知的VIF=1.012(容忍度=0.988),品牌信任的VIF=1.013(容忍度=0.987),感知风险的VIF=1.001(容忍度=0.999),会员身份的VIF=1.022(容忍度=0.978)。所有变量的VIF值均接近1,远低于临界阈值10,容忍度均接近1,表明自变量之间几乎不存在线性相关关系,多重共线性问题可以忽略。这一结果确保了回归系数估计的稳定性,各变量的效应可以被独立、准确地识别与解释。
4可视化结果
图1二元Logit回归路径系数图
图2 OR值95%置信区间森林图
图1以路径系数图的形式直观展示了各自变量对购买决策的影响方向与强度。正向系数以箭头指向因变量表示促进作用,负向系数表示抑制作用,路径上标注的数值即为回归系数β。图2以森林图(Forest Plot)形式呈现了各变量OR值及其95%置信区间。图中垂直参考线位于OR=1处,代表无效应。价格感知(OR=7.691,CI: [4.777, 12.383])与品牌信任(OR=2.837,CI: [1.954, 4.120])的置信区间完全位于1的右侧,表明其对购买决策具有显著正向影响;感知风险(OR=0.409,CI: [0.290, 0.576])的置信区间完全位于1的左侧,表明其具有显著负向影响;会员身份(OR=1.353,CI: [0.735, 2.491])的置信区间跨越1,与回归分析中p=0.332>0.05的结论一致,证实其影响不具有统计显著性。
5结论与建议
本研究基于320份消费者样本数据,运用二元Logit回归模型系统检验了价格感知、品牌信任、感知风险与会员身份对购买决策的影响。研究结果表明:(1)价格感知对购买决策具有最强的正向影响(β=2.040,OR=7.691,边际效应=0.271),是驱动消费者购买行为的核心因素;(2)品牌信任亦具有显著正向影响(β=1.043,OR=2.837,边际效应=0.138),但影响程度弱于价格感知;(3)感知风险对购买决策具有显著负向影响(β=-0.895,OR=0.409,边际效应=-0.119),是抑制购买行为的重要障碍因素;(4)会员身份对购买决策的影响不具有统计显著性(p=0.332)。模型整体通过似然比检验(χ²=180.435,p<0.001)与HL拟合优度检验(χ²=7.118,p=0.524),Nagelkerke R²=0.575,预测准确率80.94%,且不存在多重共线性问题,模型具有良好的统计有效性与实际解释力。上述发现为企业制定差异化营销策略提供了实证依据。
