
简介这份PPT系统讲解第5章SPSS的方差分析面向需要掌握统计检验方法的学生、科研人员或数据分析初学者。内容从方差分析概念入手厘清因素、水平、单元、元素与交互作用等关键术语再说明其基本思想、系统性差异与随机性差异的区分以及正态性、独立性、方差齐性等假设条件。围绕单因素方差分析详细介绍SPSS操作流程与结果解读并给出LSD、Bonferroni、Scheffe等常用多重比较方法以及各组均值精细比较的扩展思路适合课堂教学配套或自学查漏补缺。资源包为单个PPT文件约2.04MB共1个文件格式便于直接用来备课或预习复习。已有317人浏览学习可帮助读者从原理到实操快速打通方差分析应用链条。1. 为什么多个均值不能直接两两 t 检验——SPSS方差分析的第一课表 5-1 里四种销售方式的均值分别是 83、90、74、79方式二明显偏高。但如果你直接把方式一和方式二拿去做 t 检验再把另外几对也做一遍总共 6 次 t 检验即使四个总体均值实际上完全相等出现一次假阳性的概率也不是 0.05而是约 0.26。方差分析用一次 F 检验回答“四个总体的均值是否相等”从根子上控制住第一类错误这也是 SPSS 里 One-Way ANOVA 这组命令存在的意义。下面从方差分解、前提假设、菜单操作到多重比较和 Bootstrap 展开除了讲菜单在哪里还会解释参数怎么选、输出怎么判、踩过哪些坑。适合经常处理多组实验数据、需要写分析报告或想从点菜单切换到 Syntax 脚本的人。2. 方差分析的核心组间与组内方差怎么拆2.1 为什么总差异要拆成两部分在讲 SPSS 操作之前先回到表 5-1。四种销售方式各 5 个数据共 20 个观测值总均值是 81.5。每个观测值都不同差异来自两个来源第一种是推销方式本身带来的系统性差异比如方式二确实更能刺激购买第二种是随机性差异比如某一天客流大、服务员状态好。方差分析的做法是把总离差平方和SST拆成组间离差平方和SSA和组内离差平方和SSE。SST代表所有观测值围绕总均值的波动SSA代表各水平均值围绕总均值的波动SSE代表每个观测值围绕自己组均值的波动。SSA里既包含系统性差异也包含随机性差异SSE里只有随机性差异。如果SSA相对SSE足够大说明水平之间的差异不是随机波动能解释的。F 统计量就是这两个方差的比值$$F \frac{SSA / (k-1)}{SSE / (n-k)}$$其中 k 是水平个数n 是总样本量。SPSS 会同时给出 F 值和相伴概率 P 值P 值小于等于显著性水平默认 0.05就拒绝原假设认为不同水平对观测变量有显著影响。这里有个容易错的地方F 值大不代表效应一定“大”它只说明差异在统计上显著。真正的大小要看均值差、置信区间或效应量而不是看 F 的小数点后几位。2.2 使用方差分析前必须查的三件事方差分析的结论有效性依赖三个假设每个假设在 SPSS 里的检查方式不一样。假设含义SPSS 里的检查位置独立性各组观测值从相互独立的总体中抽取实验设计阶段SPSS 无法直接检验正态性各水平的因变量近似服从正态分布Analyze - Descriptive Statistics - Explore画直方图或做 K-S 检验方差齐性各水平总体方差相等One-Way ANOVA 的 Options 里勾选 Homogeneity-of-variance读取 Levene 统计量独立性是前提中的前提。像销售方式这组数据如果同一个人被重复测量多次或者数据来自同一批门店连续几天的记录样本就不独立不能用 One-Way ANOVA。正态性在社会经济数据里经常只能近似满足只要不是严重偏态SPSS 的方法还算稳健。方差齐性用 Levene 统计量判断它基于均值或中位数构造比传统 F 检验更抗异常值。Options 里勾选之后结果表会输出 Levene Statistic、df1、df2 和 Sig.如果 Sig. 小于 0.05就不能再默认数据满足方差齐性。2.3 方差不齐时的替代统计量Welch 与 Brown-Forsythe实际数据分析中方差不齐是常态尤其是各组样本量差异较大时普通 F 检验会变得不稳定。SPSS 在 Options 里提供了 Welch 和 Brown-Forsythe 两个统计量它们都对自由度做了校正不要求方差齐性也能得到近似有效的检验结果。我一般在报告里这样处理先看 Levene如果 P 小于 0.05就直接读 Welch 的 P 值不再纠结 F 检验那一行。对应的 SPSS Syntax 如下注意 Statistics 子命令里同时写 DESCRIPTIVES、HOMOGENEITY、WELCH 和 BROWNFORSYTHEONEWAY 销量 BY 销售方式 /STATISTICS DESCRIPTIVES HOMOGENEITY WELCH BROWNFORSYTHE /MISSING ANALYSIS.这段代码表示调用 ONEWAY 过程因变量是销量因子变量是销售方式。/STATISTICS后面的参数里DESCRIPTIVES要求输出每组样本量、均值、标准差、标准误和 95% 置信区间HOMOGENEITY输出 Levene 方差齐性检验WELCH和BROWNFORSYTHE分别输出两个校正统计量Welch 更常用Brown-Forsythe 在组间均值差异大时也表现稳定。/MISSING ANALYSIS表示按分析过程逐变量排除缺失值避免把某个变量缺失的个案整个删掉。如果是纯菜单操作这些选项都在 Options 按钮里勾选输出描述统计、方差齐性检验和均值图即可。3. SPSS 单因素方差分析操作从菜单到 Syntax3.1 主操作窗口和四个关键按钮SPSS 里做单因素方差分析菜单路径是 Analyze - Compare Means - One-Way ANOVA。打开主对话框后把连续型因变量放进 Dependent List把一个分类变量放进 Factor。这里要注意因子变量必须是数值型或定义好值标签的变量。如果原始数据里“销售方式”是文本“方式一”最好先建一个数值分组变量 1、2、3、4再写编码值标签否则 SPSS 会按字符编码顺序排列分组结果表读起来很别扭多重比较的系数顺序也会跟着错。对话框右侧有 Contrasts、Post Hoc、Options 和 Bootstrap 四个按钮。Contrasts 用来做事先指定的均值精细比较比如把方式一和方式二合并后与方式三、方式四合并比较Post Hoc 做的是事后两两比较解决“到底哪两组不一样”Options 里管描述统计、方差齐性检验和均值图Bootstrap 则用来给小样本或非正态数据补一个更稳健的置信区间。这四个按钮对应的问题在数据分析流程里是有先后关系的通常先看方差齐性再读 F 检验然后决定用哪一种多重比较或对比。3.2 一次完整运行的 SPSS 语法用菜单操作时每次点击都会在 Syntax 窗口生成对应代码把它存成.sps文件就可以反复使用。一次完整的单因素方差分析加上方差齐性检验和多重比较通常长这样ONEWAY 传播度 BY 信息来源 /STATISTICS DESCRIPTIVES HOMOGENEITY WELCH /PLOT MEANS /MISSING ANALYSIS /POSTHOCLSD TUKEY SCHEFFE ALPHA(0.05).逐行解释一下。第一行是过程名和变量关系传播度是数值型因变量信息来源是分组变量。/PLOT MEANS要求生成均值折线图对排查单调趋势或组间差异方向很有用。/POSTHOC后面写三种方法分别是较宽松的 LSD、控制总体错误率的 Tukey 和适合复杂组合的 Scheffe一次指定多种方法是常见做法方便在报告里互相印证。ALPHA(0.05)指定显著性水平如果要看 0.01 水平的结果改成ALPHA(0.01)即可。注意前面加了WELCH后方差不齐时常用的 Games-Howell 不会自动出现在这个/POSTHOC列表里需要在对话框里单独勾选。结果输出会按表顺序排列。第一个值得看的是描述统计表确认各组样本量没有 0以及均值排序是否符合预期。然后是 Levene 检验表记录 F 值和 Sig.。方差齐性假设成立时看 ANOVA 表的 F不成立时看 Robust Tests of Equality of Means 里的 Welch。最后是多重比较表两两比较的显著差异会用星号或“*”标记同时给出均值差和置信区间。3.3 结果表的坑不要只看 Sig.还要看置信区间和缺失值口径ANOVA 表的格式基本固定我用教材输出常见格式说明一下变异来源离差平方和自由度均方FSig.组间856.203285.409.740.001组内468.801629.30总计1325.0019这里的 F 是组间均方 285.40 除以组内均方 29.30 得到的 9.74Sig.0.001 意味着在 0.05 水平下拒绝原假设。很多人只盯住 Sig.忽略表格上方 SPSS 可能打印的提示比如“正在使用假定等方差的分析”或者方差不齐时建议运行 Welch 检验。遇到这类提示都要回到 Levene 检验重新判断。另一个常见坑是缺失值。Options 里的 Missing Values 默认是“按分析排除个案”如果某个样本在传播度上有缺失它只在本次分析里被排除不影响其他变量。但如果你同时把多个因变量放进 Dependent ListSPSS 会对每个因变量分别排除缺失这会导致两个分析的实际样本量不同。严谨的做法是先用 Data - Select Cases 或 Data - Split File 统一样本口径再跑分析而不是依赖默认的缺失值处理。3.4 数据分拆文件与分组比较的配合热词里常看到 SPSS 数据分拆文件它在方差分析里也很有用。如果因子变量是“地区”你不只想比较地区间的总体水平还想看每个地区内部的不同工厂类型是否有差异可以用 Data - Split File 按地区分拆后跑 ONEWAY。分拆后每个地区会输出一张独立的 ANOVA 表样本量、均值、F 值一目了然比反复用 Select Cases 筛选再跑要方便很多。但 Split File 不是筛选数据它只是让后续过程按分组执行。跑完之后一定要回到 Data 菜单选 Analyze all cases, do not create groups否则之后的所有分析包括描述统计、相关分析都会被分拆这是最容易忘的一步。建议把“Split File”和“Delete split file”写进操作清单每次分拆完都顺手恢复。4. 多重比较与精细比较LSD、Tukey 和 Contrasts 怎么选4.1 为什么 F 显著之后不能直接读两两 t 检验方差分析的 F 检验回答的问题很窄它只告诉你“多个均值之间有显著差异”但不告诉你哪些组之间有差异。比如表 5-1 的四种方式F 显著后可能只是方式二显著高于其他三种也可能四种方式两两之间都不同。直接把四组数据两两做 t 检验总共 6 次每次错误率 0.05犯一次假阳性的概率会膨胀到约 0.26这在统计上不成立。多重比较方法就是在控制总错误率的前提下完成两两检验Post Hoc 对话框就是干这个的。4.2 方差齐性时的常用方法选型Post Hoc 对话框在“方差齐性假设成立”这一栏下会列出十几种方法但日常分析真正常用的没那么多。下面这张表可以当选择题用方法控制错误率的方式适用场景特点LSD不校正比较次数少、事前确定最宽松容易显著Bonferroni每个检验的错误率除以比较次数组数少样本量大保守显著更难Sidak调整显著性水平略宽松于 Bonferroni和前人类似但更灵活较保守Tukey用 Student Range 分布控制总错误率组数较多样本量平衡推荐结果清晰Scheffe基于 F 分布可检查所有线性组合涉及复杂对比非常保守S-N-K同类子集分组探索性分析略激进这些方法不是随便选的。LSD 本质上是把 t 检验重复做多次但不校正适合已经明确只有少数几个对比要检验的场景如果用在全量两两比较上假阳性会变高。Tukey 是我在探索性报告里最常写的它在控制家族错误率的同时检验效力不弱。Scheffe 只在你打算事后检查许多非两两的线性组合时才值得考虑单纯两两比较用它有点浪费。对应的 Syntax 就是前面提到的/POSTHOCLSD TUKEY SCHEFFE ALPHA(0.05)。ALPHA指定判定显著的水平。如果要同时看 95% 和 99% 两种置信区间可以写成ALPHA(0.05 0.01)SPSS 会输出两套比较结果省得跑两遍。4.3 方差不齐时的替代方法当 Levene 检验拒绝方差齐性Post Hoc 对话框的“方差不齐假设成立”区域会激活里面有 Tamhanes T2、Dunnetts T3、Games-Howell 和 Dunnetts C。这里面 Games-Howell 是处理方差不齐的最常用选择它基于 Welch 框架对各组样本量和方差做单独估计比较灵活结果也容易解释。Tamhanes T2 更保守一些。如果组数多且方差不齐我一般直接看 Games-Howell 的结果并在报告里注明“已使用方差不齐条件下的多重比较方法”。4.4 用 Contrasts 做精细比较不只是两两配对有时你并不关心所有两两组合只关心某个线性组合。比如想知道方式一和方式二的平均销售量是否和方式三与方式四的平均销售量有差别。这就是“各组均值的精细比较”在 One-Way ANOVA 里通过 Contrasts 对话框完成。在 Contrasts 对话框的 Coefficients 栏按因子分组的顺序输入系数系数之和应为 0。四组对应的系数是 1、1、-1、-1意思就是前两组均值合并与后两组均值合并做比较。如果要看方式一单独与其他三组的均值比较输入系数 3、-1、-1、-1 即可。SPSS 会输出对比的值、标准误、t 统计量和 P 值。如果用更通用的 UNIANOVA 过程等价 Syntax 是UNIANOVA 销量 BY 销售方式 /CONTRAST(销售方式)SPECIAL(1 1 -1 -1) /DESIGN销售方式.解释一下UNIANOVA是更通用的方差分析过程/CONTRAST(销售方式)表示针对销售方式这个因子定义对比SPECIAL后面的数字就是线性组合系数。SPSS 输出里会给出该对比的差值估计、标准误、t 值、自由度和 Sig.同时附 95% 置信区间。需要强调这种对比逻辑和/POSTHOC完全不同。对比是事先根据研究假设制定的不能等看完 F 结果之后再临时挑一个看起来显著的组合去跑否则就失去确认性分析的意义也容易犯数据窥探的错误。5. 实例复现与 Bootstrap 技巧信息传播数据5.1 把“信息来源”案例跑完整原案例研究信息来源对信息传播的影响信息来源分为上级、同级和下级每组测一个传播度数值分数越高传播越广。操作上把三组传播度录入同一个变量“传播度”分组变量“来源”取值 1、2、3然后运行完整 SyntaxONEWAY 传播度 BY 来源 /STATISTICS DESCRIPTIVES HOMOGENEITY WELCH /PLOT MEANS /POSTHOCTUKEY GAMESHOWELL /MISSING ANALYSIS.输出里先看描述统计表确认三组的均值和标准差再看 Levene 检验如果 P 小于 0.05后续结果读 Games-Howell否则读 Tukey。ANOVA 表的 F 显著说明信息来源对传播度有影响再根据多重比较表定位是“上级 vs 同级”显著还是“上级 vs 下级”显著。5.2 Bootstrap 在这里解决什么问题Bootstrap 在 One-Way ANOVA 对话框底部的 Bootstrap 按钮里。它不替代 F 检验而是给置信区间提供另一种生成方式。小样本、非正态或方差不齐时均值差的置信区间经常不对称Bootstrap 通过有放回重采样估计标准误和置信区间比纯公式计算更抗数据形状的影响。在 Bootstrap 对话框里通常设置样本数为 1000勾选“计算样本校验的置信区间”区间类型建议选 BCa偏差校正加速区间。跑完后结果表里会多出 Bootstrap 相关部分提供均值差、标准误和置信区间的 Bootstrap 估计。一个可复用技巧在对话框里点好 Bootstrap 后把生成的 Syntax 保存下来后续换数据时只要改变量名和分组水平就能保持同一套抽样设置和分析口径。5.3 用均值图核对效应方向Options 里的 Means plot 会输出一张折线图横轴是分组纵轴是均值。对三组信息来源来说均值图能一眼看出哪个组传播度最高。但要注意SPSS 默认把相邻点连成折线很容易让人误以为分组之间存在连续趋势。分组变量是名义型时建议在图表编辑器里把连线去掉只保留点。另一种办法是复制描述统计表里的均值在 Excel 里画散点图这样就不存在误导连线也更方便贴到汇报材料里。本文还有配套的精品资源点击获取