回归、方差、t检验讲解:核心概念原理与应用场景梳理

实证分析高分写法:数据到结论的呈现 约 10 分钟
本文目录

1. 入门必知:回归、方差、t检验的核心定位与适用场景区分

很多刚接触统计学的大学生、研究生甚至一线科研人员都会遇到这样的困惑,拿到一手调研或者实验数据,明明要做的是多组样本的差异比较,却随便套用t检验就得出结果,或者搞不清楚回归分析和相关性分析的本质区别,最后得出的显著性结论经不起同行审稿的质疑。统计学三大核心方法回归、方差、t检验讲解的价值就在于帮你理清不同的数据场景下应该用哪种方法来分析,避免从第一步开始就出现方法误用的低级错误。

根据浙大版《概率论与数理统计》的规范定义,这三种方法都属于推断统计学模块的主要工具,回归分析用来发现变量之间的量化影响关系,供后面趋势预测使用,方差是所有统计显著性判定的底层核心统计量,支撑着方差分析(ANOVA)和t检验的运算逻辑,t检验是小样本场景下两组均值差异判定的经典方法。为了帮助新手快速地分辨出三者之间的界限,我们先给出回归、方差、t检验的核心参数对照表,将最容易混淆的属性一目了然地展示出来。

核心参数回归分析(以线性回归为例)方差/方差分析ANOVAt检验
核心目标构建自变量到因变量的量化映射模型,用于预测与影响权重拆解分解数据离散来源,判定多组样本均值的整体差异显著性小样本下两组样本均值差异的精准显著性校验
最少样本量要求自变量个数的20倍以上(经验阈值)每组样本量≥3,总样本量≥10单样本≥30(小样本场景可放宽至15)
核心输出指标回归系数、决定系数R²、显著性P值组间均方、组内均方、F值、P值t值、自由度、显著性P值
一类错误控制逻辑纳入回归方程时同步校验整体显著性F检验通过整体校验规避多组对比的假阳性膨胀仅针对两组对比,无需额外校正
典型适用场景气温对奶茶销量的影响建模、用户行为对转化率的关联预测3种以上产品配方的口味评分差异对比、不同班级的考试成绩整体差异判定新旧两款奶茶的单日销量均值对比、干预前后同一组用户的评分变化校验

用线下奶茶店日常运营场景来类比抽象的统计概念,把抽象的统计概念具体化到日常决策中,线性回归就是用门店客流、当日气温、周边活动这三个变量来准确预测当天奶茶总销量,帮助老板提前备料减少浪费,方差分析就是找30个用户分成3组,每组测试3种不同的糖度同款奶茶,判断三组用户的平均评分是否有整体层面的显著差异,t检验就是精确比较全糖款和零糖款这两种特定配方的奶茶,连续一周的日均销量均值差是否达到统计显著水平,确定口味调整是否真的带动了销量上涨。

很多新手最容易犯的两类混用误区已经被统计教学领域反复指出,第一类是把3组及以上样本的差异比较直接拆成N次独立样本t检验,导致一类错误(假阳性)概率从预设的0.05直接升高;第二类是把相关分析和回归分析等同起来,认为算出两个变量的相关系数大于0.7就可以直接进行预测,忽略了变量之间可能存在的第三方混淆因素干扰。下文将对这三种方法的核心原理进行拆解,帮你避开这些高频陷阱。

2.回归分析:变量关系建模和预测的主要方法

回归分析基础是变量相关性分析的进阶方法,也是所有想建立量化预测模型的研究者必须要掌握的入门知识。很多入门用户会把线性回归和相关分析的界限搞混,相关分析只能证明两个变量之间的相关程度,而线性回归可以通过最小二乘估计来得到自变量对因变量的影响权重。

2.1 一元线性回归的核心推导逻辑

按照统计学导论中一般的规范,一元线性回归的基本假定就是自变量x和因变量y之间存在线性相关关系,所要拟合的模型表达式为

其中 0%5C)">β0\beta0 是截距项,代表自变量取值为0时因变量的理论数值,1%5C)">β1\beta1 是回归系数,代表x每变动1个单位时y的平均变动幅度,ε\varepsilon 是随机扰动项,代表所有未被纳入模型的其他干扰因素。

而最小二乘估计的核心逻辑,就是找到一组 0%5C)">β0\beta01%5C)">β1\beta1 的取值,让所有样本点的实际y值和模型预测的 y^\hat{y} 值之间的误差平方和达到最小,从数学层面保证拟合出的直线是最贴合真实样本分布的最优解。整个建模的完整流程可以梳理为标准化步骤:

1. 采集配对的样本数据,保证每一个自变量和因变量的取值一一对应;

2. 绘制x和y的散点图,直观地判断两者之间是否存在明显的线性趋势,如果呈现非线性形态,则需要先进行变量转换,不能直接强行套用线性回归模型;

3. 用最小二乘估计法求出回归截距和回归系数,写出完整的回归方程;

4. 对回归模型进行整体F检验和回归系数的t检验,检验变量之间关系是否统计显著;

5. 检验模型残差是否符合正态性、独立性、同方差的前提假设,剔除模型偏误;

6. 输入新的自变量取值,得到对应的因变量预测结果。

2.2 决定系数R²的通俗拆解

决定系数R²是评价回归模型效果最主要的指标,很多入门用户只知道R²越接近1模型拟合效果越好,但是不知道它的底层计算逻辑。我们完全不用死记硬背复杂的公式,用误差拆解的思路就可以完全理解:把所有的样本因变量y的总波动(总平方和SST)拆成两部分,一部分是回归模型可以解释的波动(回归平方和SSR),另一部分是模型不能解释的随机误差波动(残差平方和SSE),三者满足SST=SSR+SSE的恒等关系。

对应的决定系数R²的计算逻辑就是:

举个实际的例子,用气温预测奶茶销量的线性回归模型得到的R²为0.72,说明当日气温可以解释72%的奶茶销量波动,剩下的28%的波动是由客流、周边活动等未被模型包含的因素引起的。这里必须提醒新手一个常见的误区,R²高并不表示x和y之间一定存在因果关系,只是说明二者的线性相关程度很高,要确定因果关系还需要通过实验设计来排除混淆变量的干扰。

2.3 回归分析的常见使用注意事项

很多新手刚开始做回归分析时很容易忽略三个重要的问题,最后得到的结果是毫无意义的。

  • 自变量和因变量的逻辑顺序不能颠倒,不能用奶茶销量来预测当日气温,即使两者相关性很高,也不符合现实世界的因果逻辑;
  • 必须避免多重共线性问题,如果同时将当日最低气温和当日最高气温这两个高度相关的自变量纳入模型,会导致回归系数的估计值出现很大的偏差,甚至会出现符号与现实逻辑完全相反的情况;
  • 不能随意做外推预测,用夏季30℃到38℃的气温数据建立的销量预测模型,不能直接用来预测0℃冬天的奶茶销量,超出样本取值范围的预测结果是没有可信度的。

3.方差:衡量数据离散程度和多组差异的主要指标

很多用户第一次学习方差的时候,只把方差当作描述数据分布离散程度的一个普通指标,但是浙大版《概率论与数理统计》中给出的定义是:方差是回归分析、t检验两者共同使用的底层统计量支撑,所有的显著性判定的核心逻辑都建立在方差分解的基础上,可以说对方差的理解程度决定了你对各种统计检验的理解程度。

3.1 基础方差的数学定义与计算逻辑

对于包含n个样本的数据序列 1%2Cx2...xn%5C)">x1,x2...xnx1,x2...xn ,我们先算出所有数据的均值 xˉ\bar{x} ,方差的计算方式就是所有数据点和均值的差值做平方之后求平均值,公式表达为:

分母用n-1而不是n的原因是为了通过自由度校正,防止用样本方差估计总体方差时出现系统性的低估,这也是所有统计分析软件默认的样本方差计算规则。

3.2 方差分析ANOVA的核心原理拆解

很多新手第一次接触方差分析ANOVA的时候会问,明明是要检验多组样本的均值是否有差异,为什么名字要叫“方差分析”呢?它的主要思想就是通过对均值差异显著性的判断来间接判断方差的来源。

我们把所有的样本总方差分成两部分,第一部分是组内方差,即同一个组内各个数据点之间的离散程度,这部分波动完全是由随机误差造成的;第二部分是组间方差,即各个组的均值与总体总均值之间的离散程度,这部分波动既有随机误差,又有不同组本身处理因素所引起的系统性差异。

当组间方差远远大于组内方差的时候,就可以认为不同的组之间均值的差异不是由于随机波动造成的,而是有统计上的显著性差异。根据SPSS官方统计指南的判定规则,方差分析最后得到的F值就是组间均方除以组内均方,当F值对应的P值小于0.05的时候,就可以认为多组样本的总体均值差异是显著的。

这里可以回答新手最常问的一个误区对比问题,即为什么三组样本的差异对比不能拆成三次t检验?

我们做个简单的计算,假设我们设定的单轮检验一类错误概率为0.05,那么三次独立检验之后,总体的一类错误概率就变成了 1(10.05)30.1426 1 - (1-0.05)^3 \approx 0.1426 ,远远大于我们设定的5%的假阳性阈值,很容易得到大量的虚假显著性结论,方差分析用整体检验的方法,从根源上把一类错误控制在0.05的预设范围内。

3.3 单因素方差分析的执行与校验流程

完整的单因素方差分析执行步骤是标准化的,很多科研人员为了省事而省略了前置校验,最终得到的结果是没有统计意义的。

1. 将多组样本的全部数据整理成长格式数据,每一行代表一个观测值,一列标明所属组别,一列是对应的观测数值;

2. 先进行方差齐性检验,根据SPSS官方的判定标准,方差齐性检验对应的P值大于0.05时,才能认为各组的方差没有显著性差异,满足方差分析的前提假设;

3. 运行单因素方差分析,得到F值以及对应的整体显著性P值;

4. 若整体P值小于0.05,则认为多组之间存在显著的整体差异,再进行LSD、Tukey等事后多重比较检验,找出具体是哪两组之间的均值差达到显著水平。

4. t检验:小样本场景下的均值差异显著性检验方法

t检验是应用最广的一种显著性差异检验方法,所有的t检验都是以t分布为基础的,它主要是针对总体标准差未知、样本量较小的情况而设计的,解决了正态分布Z检验在小样本情况下统计结果偏差较大的问题。

t分布与正态分布形态对比示意图

4.1 t分布的核心特征

相比于标准正态分布,t分布的形态会随着自由度的变化而发生变化,自由度越小,t分布的尾部就越厚,出现极端值的概率就越高;当自由度逐渐增大到30以上时,t分布的形态就会无限接近标准正态分布,这时用Z检验得到的结果和t检验几乎没有差别。根据SPSS官方统计指南中的临界值规则,当自由度为29、双侧检验显著性水平为0.05时,t分布的临界值是2.045,标准正态分布的临界值是1.96,在小样本情况下,如果误用正态分布的临界值来判定,就会变相提高一类错误的出现概率。

4.2 三类常见t检验的适用条件

常规t检验分为三个类别,分别对应不同的应用场景,很多新手会随便套用一个独立样本t检验,完全不符合数据的特征

  • 单样本t检验:用来检验某一组样本的均值是否与一个已知的固定总体均值有显著性差异,例如你要检验某高校大一新生的平均英语考试成绩是否显著高于70分的及格线标准,就可以用单样本t检验;
  • 独立样本t检验:用来检验两组完全互相独立的样本的均值是否存在显著差异,例如你想检验实验组和对照组两组用户的产品使用时长均值是否有差异,就可以使用独立样本t检验,但是必须提前满足方差齐性的前提假设;如果方差齐性检验结果P值小于0.05,就改用校正的Welch t检验结果,不能直接读取默认的检验输出;
  • 配对样本t检验:核心逻辑是差值转化,适用于两组数据存在一一对应配对关系的情况,比如同一组用户在产品改版前后的满意度评分,同一只小白鼠在给药前后的体重数据,不需要直接比较两组的整体均值,而是先算出每一对数据的差值,将问题转化为检验差值序列的均值是否显著不等于0,这样可以完全排除配对个体本身的异质性干扰,统计效能比独立样本t检验高很多。

4.3 t检验的标准结果解读规则

根据国内高校通用的统计学教材规范,t检验结果的解读要严格按照标准化的逻辑进行,即先看自由度对应的t统计量数值,再根据当前样本情况判断是单侧检验还是双侧检验,最后看对应的显著性P值。若P值小于0.05,则可以认为两组样本的均值差异具有统计学意义;若P值小于0.01,则可以认为差异具有极显著性。

这里还要提醒新手一个高频误区,P值不显著并不等于两组数据没有差异,很多人样本量只收集了不到10个,统计效能严重不足,即使两组之间确实存在真实的差异,也很难通过t检验得到显著的结果,不能直接下绝对的否定结论。

5. 三大方法的组合应用与实战案例参考

很多用户学完三个独立的方法之后,不知道如何将它们结合起来应用到真实的科研场景中去,下面是一位传播学研究生的真实实践经历,希望能给大家提供一些贯通的应用逻辑。

某传播学研究生准备做短视频平台用户行为调研,最初计划招募120名用户,随机分成3组,每组观看时长分别为15秒、30秒、60秒的同一款产品广告,之后比较三组用户的后续购买意愿评分差异。一开始他的想法很简单,3组样本拆成3次两两独立样本t检验,直接比较差异即可。结果他的统计学课程导师当场指出了这个严重的错误,三次t检验之后一类错误概率已经达到了14%以上,得到的显著性结果很可能是假阳性。

之后他按照规范的统计学流程对整个分析方案进行了调整,最终顺利通过了论文开题答辩,他所整理出的实操避坑笔记可以作为同类调研的参考标准。

1. 对所有的调研样本的购买意愿评分做基础的方差统计,保证所有的数据整体离散程度在合理的范围内,没有极端异常值影响整体分布。

2. 运行单因素方差分析,先检验三组样本的方差齐性,得到方差齐性检验的P值为0.72,远大于0.05,满足方差分析的前提要求;然后得到整体F值为4.26,对应的P值为0.016,小于0.05,说明三组用户的购买意愿评分存在显著的整体差异。

3.

用Tukey事后检验来定位具体的差异,发现30秒广告组的购买意愿评分显著高于15秒组和60秒组,但是15秒组和60秒组之间的评分差异不显著;

4.最后他建立了线性回归模型,把用户广告观看完成时长当作自变量,把之后的购买意愿评分当作因变量,得到回归系数为0.32,P值小于0.001,说明用户每多看10秒广告,购买意愿评分平均会提高3.2分,R²为0.41,说明观看时长可以解释41%的购买意愿波动,得到了比单纯差异检验更深入的量化结论。

除此之外,在医学实验中三类方法的结合使用也很普遍,例如要比较两种降压药的降压效果,可以先收集服药前和服药后患者血压的数据,用配对样本t检验分别检验两种药物是否都能显著降低患者血压,再用独立样本t检验比较两种药物的平均降压幅度是否有显著差异,最后还可以建立线性回归模型,将患者的年龄、基础血压值作为控制变量,服药后血压下降幅度作为因变量,得到更准确的药物效果影响权重结果。

结果输出和业务落地环节还要注意一个重要的原则,即统计显著并不等于业务上有价值,例如通过t检验得出两款奶茶日均销量差统计显著,差值为每天多卖0.5杯,该差异在统计上成立,但是从业务角度来看,并没有实际的优化价值,需要结合统计结果和现实场景来做出判断,不能只看P值就下结论。

常见问题

常见问题

共 4 个问题,点击展开查看答案

  • 相关性分析只用来衡量两个变量之间的线性关系,不区分自变量和因变量,而回归分析会明确自变量和因变量,并且可以得到变量之间具体的影响关系表达式。

  • 两者都是描述数据离散程度的统计量,方差是数据值与均值差的平方的平均值,单位是原始数据单位的平方;标准差是方差的算术平方根,单位与原始数据相同,更便于直观地理解数据波动的幅度。

  • 不是的,t检验结果不显著可能是由于样本量不够、数据中有异常值、变量测量误差大等原因造成的统计效能不足,不能直接完全否定两组数据之间存在真实的差异,需要结合样本特征、业务场景等进行进一步的验证分析。

  • 不可以,t检验只适用于两组样本的均值差异比较,方差分析可以对三组及以上样本的均值差异显著性进行检验,如果对多组样本反复进行t检验会增大一类错误(假阳性)的概率,两者的适用场景有明确的界限。