多分类Logit回归分析结果解读
一、方法概述
多分类Logistic回归分析(Multinomial Logistic Regression)是二元Logistic回归的扩展形式,适用于因变量为多分类无序变量的研究场景。该方法以某一类别作为参照组,分别估计其他各类别相对于参照组的发生概率,并通过优势比(Odds Ratio, OR)量化解释变量对结局类别的影响方向与强度。与线性回归不同,多分类Logistic回归不要求因变量满足正态分布假设,且能够同时处理多个类别的比较问题,在医学诊断、市场细分、社会分层等领域具有广泛应用。本研究借助SPSSAU软件,以三分类因变量y为结局变量,考察x1至x5五个解释变量对不同结局类别的影响效应,并评估模型的整体拟合优度与分类预测能力。
在SPSSAU【进阶方法】模块选择【多分类logit】,将变量拖拽至右侧对应分析框,操作如下图:
二、因变量类别分布
表1报告了因变量y的类别分布情况。在360个有效样本中,类别1.0占比最高(n=155, 43.06%),类别2.0(n=104, 28.89%)和类别3.0(n=101, 28.06%)比例相近。三类比例未出现极端失衡,最大类别与最小类别之比约为1.53:1,表明模型估计不太容易受到严重样本倾斜的影响。这一分布特征意味着后续OR值和分类准确率的估计能够较为可靠地反映变量与结局之间的真实关系,而不会因为某一类别样本过少而导致参数估计不稳定。本研究以类别1.0作为参照组,分别估计类别2.0和类别3.0相对于类别1.0的回归方程。
三、模型整体拟合检验
表2报告了模型整体显著性的似然比检验结果。最终模型的卡方统计量为776.245(df=10, p<0.001),表明加入解释变量后的模型显著优于仅含截距的空模型,即至少有一个解释变量对因变量的类别归属具有显著预测作用。从模型拟合信息来看,AIC值为24.000,BIC值为70.633,这两个信息准则在比较不同备选模型时具有参考价值,数值越小代表模型在拟合优度与简约性之间的综合表现越优。从伪R²指标来看,McFadden R²达到1.000,Nagelkerke R²同样为1.000,Cox & Snell R²为0.884,均处于极高水平,说明模型对因变量类别变异的解释能力极强。McFadden R²接近或达到1.000的情况通常意味着模型可能存在完全分离(complete separation)现象,即解释变量能够完美区分不同类别的样本,这一点需要结合预测准确率表进一步确认。
四、回归系数与OR值分析
表3报告了以类别1.0为参照组时,类别2.0相对于类别1.0的回归系数与OR值估计结果。从结果来看,各解释变量的标准误普遍极大(如x2的标准误高达5183.985,x4的标准误为10883.233),这是完全分离现象的典型表现。当数据存在完全分离时,极大似然估计无法收敛,导致回归系数趋向无穷大、标准误异常膨胀。具体来看,x3的OR值为1.987,表明该变量每增加1个单位,结局属于类别2.0相对于类别1.0的胜算比提高约98.7%,但由于其95%置信区间为0.000至无穷大,跨越了1,因此该效应在统计上并不显著(p=0.999)。x1和x2的OR值均为0.000,理论上表现为保护性因素,但同样由于置信区间跨越1且p值远大于0.05,不能认为其效应具有统计学意义。x4和x5的OR值异常巨大,进一步印证了完全分离问题的存在。
表4报告了类别3.0相对于类别1.0的回归结果,呈现出与表3类似的模式。各变量的标准误同样异常巨大,回归系数绝对值极大但z值均接近于零,p值全部远大于0.05。x3的OR值为3.181,理论上表明该变量每增加1个单位,结局属于类别3.0的胜算比提高约2.18倍,但95%置信区间从0.000延伸至无穷大,统计上不显著(p=0.998)。x4和x5的OR值分别达到1.99×10¹⁹和1.52×10⁴⁰,数值之巨大进一步证实了完全分离问题的严重程度。综合表3和表4的结果,可以判断当前数据中解释变量对三个类别实现了近乎完美的区分,导致极大似然估计无法获得有限的参数估计值。在这种情况下,虽然模型整体检验显著(卡方=776.245, p<0.001),但单个变量的OR值和显著性检验结果不宜直接用于推论。
五、回归结果简化格式汇总
表5以简化格式汇总了两个对比方程的核心结果。从系数方向来看,x1和x2在两个方程中均为负值,x3、x4和x5均为正值,表明变量对类别归属的影响方向在两个对比中保持一致。然而,所有z值的绝对值均极小(最大仅为0.010),远未达到1.96的显著性临界值,说明在完全分离条件下,Wald检验完全失去了判别能力。这一结果提示研究者,当遇到此类情况时,应考虑采用Firth惩罚似然估计或精确Logistic回归等替代方法,以获得有限且稳定的参数估计。
六、模型预测准确率分析
表6报告了模型的分类预测结果。总体预测准确率达到100.00%,即模型对所有360个样本的类别归属均做出了正确预测。具体来看,类别1.0的155个样本全部被正确归类(准确率100.00%),类别2.0的104个样本和类别3.0的101个样本同样实现了完美分类。这一结果从侧面印证了前述完全分离现象的存在:解释变量组合能够完美区分三个类别,使得模型在训练集上达到零错误率。虽然100%的预测准确率看似理想,但在实际研究中,这往往暗示模型可能存在过拟合风险,或者解释变量与因变量之间存在确定性关系而非统计关联。因此,该模型结果的推广性需要谨慎评估,建议在独立验证样本上进一步检验其分类表现。
七、样本完整性检验
表7显示有效样本数为360,无样本因缺失值被剔除,有效样本率为100%。数据完整性良好,后续分析建立在全部有效样本基础之上。
八、结论
本研究采用多分类Logistic回归分析考察了五个解释变量对三分类因变量的影响效应。模型整体显著(χ²=776.245, df=10, p<0.001),McFadden R²=1.000,总体预测准确率达100%。然而,分析过程中发现数据存在完全分离现象,表现为各变量的标准误异常膨胀、OR值趋向极端、Wald检验全部不显著。这一结果表明解释变量能够完美区分三个类别,虽然模型拟合极佳,但单个变量的参数估计不可靠。建议后续研究采用Firth惩罚似然估计或精确Logistic回归方法处理完全分离问题,或考虑合并部分类别以降低分离程度,从而获得更具解释力的参数估计结果。