spssau 多分类logistic回归.docx

资源描述

spssau 多分类logistic回归.docx

《spssau 多分类logistic回归.docx》由会员分享，可在线阅读，更多相关《spssau 多分类logistic回归.docx（7页珍藏版）》请在冰豆网上搜索。

spssau 多分类logistic回归.docx

spssau多分类logistic回归

Logistic回归之多分类logistic回归分析

Logistic回归分析（logit回归）一般可分为3类：

分别是二元Logistic回归分析、多分类Logistic回归分析和有序Logistic回归分析。

logistic回归分析类型如下所示。

Logistic回归选择

自变量X

因变量Y

研究方法

研究场景

定量数据/分类数据

分类数据（2组）

二元Logistic回归分析

数据间影响关系情况如何

定量数据/分类数据

分类数据（多组且有序）

多分类Logistic回归分析

数据间影响关系情况如何

定量数据/分类数据

分类数据（多组且有序）

有序Logistic回归分析

数据间影响关系情况如何

Logistic回归分析用于研究X对Y的影响，并且对X的数据类型没有要求，X可以为定类数据，也可以为定量数据，但要求Y必须为定类数据，并且根据Y的选项数，使用相应的数据分析方法。

●如果Y有两个选项，如愿意和不愿意、是和否，那么应该使用二元Logistic回归分析（SPSSAU进阶方法->二元logit）;

●如果Y有多个选项，并且各个选项之间可以对比大小，例如，1代表“不愿意”，2代表“无所谓”，3代表“愿意”，这3个选项具有对比意义，数值越高，代表样本的愿意程度越高，那么应该使用多元有序Logistic回归分析（SPSSAU进阶方法->有序logit）；

●如果Y有多个选项，并且各个选项之间不具有对比意义，例如，1代表“淘宝”，2代表“天猫”，3代表“京东”，4代表“亚马逊中国”，数值仅代表不同类别，数值大小不具有对比意义，那么应该使用多元无序Logistic回归分析（SPSSAU进阶方法->多分类logit）。

1多分类logistic回归分析基本说明

只要是logistic回归，都是研究X对于Y的影响，区别在于因变量Y上，logistic回归时，因变量Y是看成定类数据的，如果为二元（即选项只有2个），那么就是二元logistic回归；如果Y是多个类别且类别之间无法进行对比程度或者大小，则为多分类logistic回归；如果Y是多个类别且类别之间可以对比程度大小（也称为定量数据，或者有序定类数据），此时则使用有序logistic回归。

多分类logistic回归的难点在于：

因变量为类别数据，研究X对Y的影响时，如果为类别数据，那么不能说越如何越如何，比如不能说越满意越愿意购买；而只能说相对小米手机来说，对于手机外观越满意越愿意购买苹果手机。

这就是类别数据的特点，一定是相对某某而言。

这就导致了多分类logistic回归分析时，文字分析的难度加大，最好是使用SPSSAU的智能文字分析对应查看。

单独进行多分类logistic回归时，通常需要有以下步骤，分别是数据处理，模型似然比检验，参数估计分析和模型预测效果分析共4个步骤。

1）数据处理

如果说因变量Y的类别个数很多，比如为10个，此时建议时对类别进行组合下，尽量少的减少类别数量，便于后续进行分析。

此步骤可通过SPSSAU数据处理模块的数据编码功能完成。

如果说自变量X是定类数据，那么可对X进行虚拟哑变量处理，使用SPSSAU数据处理模块的生成变量功能。

关于虚拟哑变量问题，可参阅SPSSAU的手册。

其实定类数据在做影响关系研究时，通常都会做虚拟哑变量处理。

而且做完之后，放入模型时一定要少放一项，比如专业分成理工科，文科类，体育艺术类。

那么分析时一定要少放一项（少放的项是参考项），因为这涉及到分析时进行文字描述。

至于少放那一项，由研究者自行决定即可。

处理完成数据，确保数据没有问题后，直接进入SPSSAU的进阶方法找到“多分类logit”进行分析即可。

2）模型似然比检验

模型似然比检验用于对整个模型的有效性进行分析，一般对应的P值小于0.05即可。

同时SPSSAU还提供AIC和BIC这两个指标值，如果模型有多个，而且希望进行模型之间的优劣比较，可使用此两个指标，此两个指标是越小越好。

具体可直接查看SPSSAU的智能分析和分析建议即可。

3）参数估计分析

参数估计分析其实就已经开始进入实质性的分析了。

首先可分析R方，即模型的拟合水平情况，SPSSAU提供3个R方值指标，分别是McFadden R 方、Cox&Snell R 方和Nagelkerke R 方。

此3个R 方均为伪R 方值，其值越大越好，但其无法非常有效的表达模型的拟合程度，意义相对交小，而且多数情况此3个指标值均会特别小，研究人员不用过分关注于此3个指标值。

一般报告其中任意一个R方值指标即可。

接着分析回归系数，即X对于Y的影响。

一定记住，分析时是先基于以***作为参照时，X对于**有正向影响。

比如相对于小米手机作为参照项，用户对于手机外观的在乎程度会正向影响到用户选择苹果手机。

简而言之即说明，相对小米手机，用户越在乎外观时，更加可能选择苹果手机。

4）模型预测效果分析

多分类logistic回归建模时，还可以对模型的预测效果进行分析，当然一般情况下我们关注于影响关系，因而对于预测效果等不那么看重。

即模型预测质量的关注乎相对较低，多数时候直接忽略它。

2如何使用SPSSAU进行多分类logistic回归操作

关于多分类logistic回归的操作上，SPSSAU操作如下：

此处的X为3个，分别是性别，学历和年龄，学历和年龄是定量数据直接纳入模型中即可。

但是性别是定类数据，所以先做了虚拟哑变量（数据处理->生成变量功能），然后性别分为两项分别是男和女，以男作为参照项，因此把女放入了模型中。

至于分析结果如下：

多分类Logistic回归模型似然比检验

似然比卡方值

AIC值

BIC值

-2LLNULL值

-2LLF值

91.573

0.000

3625.256

3669.427

3700.829

3609.256

此处模型检验的原定假设为：

是否放入自变量（性别_女,学历,年龄）两种情况时模型质量均一样；这里p值小于0.05，因而说明拒绝原定假设，即说明本次构建模型时，放入的自变量具有有效性，本次模型构建有意义。

多分类Logistic回归分析结果汇总

华为

回归系数

标准误

z值

p值

OR值

OR值95%CI

性别_女

-0.309

0.145

-2.127

0.033

0.734

0.552~0.976

学历

-0.065

0.062

-1.053

0.292

0.937

0.829~1.058

年龄

-0.437

0.072

-6.076

0.000

0.646

0.561~0.744

截距

0.390

0.227

1.722

0.085

1.477

0.948~2.303

苹果

回归系数

标准误

z值

p值

OR值

OR值95%CI

性别_女

0.436

0.104

4.192

0.000

1.546

1.261~1.896

学历

-0.002

0.043

-0.054

0.957

0.998

0.917~1.085

年龄

0.076

0.050

1.516

0.130

1.079

0.978~1.191

截距

-0.124

0.179

-0.694

0.488

0.883

0.623~1.254

McFaddenR方：

0.025

模型的R方值仅为0.025，但一般报告下即可，伪R方值一般都比较低。

特别需要注意分析：

上表格加蓝色底纹的项为P值小于0.05即呈现出显著的项，接下来逐一说明下，

性别_女的回归系数值为-0.309，并且呈现出0.05水平的显著性（z=-2.127，p=0.033<0.05），这说明相对于男性来讲，女性更加偏好于小米手机。

为什么这样阐述呢，首先在多分类logistic回归，SPSSAU将因变量Y的第1项（此处为小米手机）作为参照项。

那么性别_女呈现出负向影响，就说明‘越女性，越偏向于小米手机’，因而结论就是，相对于华为手机来讲，女性明显更加偏好于小米手机。

相对小米手机来讲，年龄的回归系数值为-0.437，并且呈现出0.01水平的显著性（z=-6.076，p=0.000<0.01），负向影响，即说明年龄越大（此处年龄是定量数据所以可以说年龄越大越如何），用户越不偏好华为手机。

那就是说年龄越大用户越偏好于小米手机。

接着，相对于小米手机来讲，在苹果手机进行对比时，性别_女的回归系数值为0.436，并且呈现出0.01水平的显著性（z=4.192，p=0.000<0.01），意味着相对小米手机，性别_女会对苹果显著的正向影响关系。

那就是说相对小米手机来讲，女性更加偏好于苹果手机的意思。

3多分类logistic相关问题？

在使用SPSSSAU进行多分类logistic回归时，可能会出现一些问题，比如提示奇异矩阵，质量异常，Y值只能为0或1等，接下来一一说明。

第1点：

出现奇异矩阵或质量异常

如果做多分类logsitic回归时提示奇异矩阵，通常有两个原因，一是虚拟哑变量设置后，本应该少放1项作为参考项但是并没有，而是把所有的哑变量项都放入框中，这会导致绝对的共线性问题即会出现奇异矩阵矩阵。

二是X之间有着太强的共线性（可使用通用方法的线性回归查看下VIF值），此时也可能导致模型无法拟合等。

先找出原因，然后把有问题的项移出模型中即可。

同时，如果因变量Y的分布极其不均匀，SPSSAU建议可先对类别进行组合，可使用数据处理里面的数据编码完成。

第2点：

提示“Y的选项过少或过多”?

如果出现此提示，意味着因变量Y的选项不符合多分类logistic回归分析要求，通常情况下因变量Y的分类个数应该介于3~8个之间。

1.用户可使用频数分析功能进行查看因变量Y的选项个数情况；

2.如果选项个数过多需要进行合并处理等，可使用【数据处理->数据编码】功能操作。

第3点：

OR值的意义

OR值=exp（b）值，即回归系数的指数次方，该值在医学研究里面使用较多，实际意义是X增加1个单位时，Y的增加幅度。

如果仅仅是研究影响关系，该值意义较小。

第4点：

wald值或z值

z值=回归系数/标准误，该值为中间过程值无意义，只需要看p值即可。

有的软件会提供wald值（但不提供z值，该值也无实际意义），wald值=z值的平方。

第5点：

McFadden R 方、Cox&Snell R 方和Nagelkerke R 方相关问题？

Logit回归时会提供此3个R 方值（分别是McFadden R 方、Cox&Snell R 方和Nagelkerke R 方），此3个R 方均为伪R 方值，其值越大越好，但其无法非常有效的表达模型的拟合程度，意义相对交小，而且多数情况此3个指标值均会特别小，研究人员不用过分关注于此3个指标值。

一般报告其中任意一个R方值指标即可。

展开阅读全文