∫π每天一道数学题
← 返回概率统计
概率统计 · 第 11 讲 · 2026-09-19 · 约 10 分钟

第11讲 回归分析与独立性检验——从数据中发现关系

变量之间有没有关系?有多强?是巧合还是真的相关?回归分析和卡方检验就是回答这些问题的工具。

从一个朴素的问题开始

你是否注意过:一般来说,身高越高的人,体重也越重?但也不完全如此——有人很高但很瘦,有人不胖但也很高。身高和体重之间有关系,但不是确定的函数关系。

这种"有关系但不确定"的关系,叫做相关关系。和函数关系不同,相关关系中一个变量的变化会引起另一个变量的趋势性变化,但不能精确地由一个变量算出另一个变量。

统计学的任务之一就是:从数据中发现变量之间的相关关系,并用数学模型来刻画它。

变量间的相关关系

正相关、负相关与不相关

两个变量之间的关系有三种基本类型:

  • 正相关:一个变量增大,另一个变量也倾向于增大。比如身高和体重、学习时间和个人成绩。在散点图中,点云大致从左下往右上分布。
  • 负相关:一个变量增大,另一个变量倾向于减小。比如气温和暖气费用、汽车速度和到达目的地所需时间。在散点图中,点云大致从左上往右下分布。
  • 不相关:两个变量之间没有明显的趋势关系。比如人的鞋码和智商、某天的气温和你的考试成绩。

散点图

散点图是研究两个变量关系最直观的工具:把每个观测数据作为一个点画在坐标系中,横轴是一个变量,纵轴是另一个变量。

如果点大致分布在一条直线附近,就称为线性相关;如果点呈现出某种曲线形态,就是非线性相关;如果点杂乱无章,就没有明显的相关关系。

比如研究 20 个学生的身高和体重,画出的散点图可能显示:大部分点在一条从左下到右上的带状区域内——这就是正相关。

示意图

散点图与线性回归

散点图中找出"最佳拟合直线"——最小二乘法就是让所有点到直线的距离平方和最小

线性回归方程

当两个变量呈线性相关时,我们可以用一条直线来近似描述它们的关系:

y^=b^x+a^\hat{y} = \hat{b}x + \hat{a}

其中 y^\hat{y} 是对 yy 的估计值,b^\hat{b} 是回归系数(斜率),a^\hat{a} 是截距。

最小二乘法

如何确定这条"最佳"直线?最常用的是最小二乘法:找到一条直线,使得所有数据点到这条直线的竖直距离的平方和最小。

具体地,对于 nn 组数据 (x1,y1),(x2,y2),…,(xn,yn)(x_1, y_1), (x_2, y_2), \ldots, (x_n, y_n),我们要最小化:

Q=∑i=1n(yi−y^i)2=∑i=1n(yi−b^xi−a^)2Q = \sum_{i=1}^{n} (y_i - \hat{y}_i)^2 = \sum_{i=1}^{n} (y_i - \hat{b}x_i - \hat{a})^2

通过求导并令导数为零,可以解得:

b^=∑i=1n(xi−xˉ)(yi−yˉ)∑i=1n(xi−xˉ)2=∑xiyi−nxˉyˉ∑xi2−nxˉ2(1)\hat{b} = \dfrac{\sum\limits_{i=1}^{n} (x_i - \bar{x})(y_i - \bar{y})}{\sum\limits_{i=1}^{n} (x_i - \bar{x})^2} = \dfrac{\sum x_i y_i - n\bar{x}\bar{y}}{\sum x_i^2 - n\bar{x}^2} \qquad (1) a^=yˉ−b^xˉ(2)\hat{a} = \bar{y} - \hat{b}\bar{x} \qquad (2)

记住这两个公式的关键:回归直线一定经过点 (xˉ,yˉ)(\bar{x}, \bar{y})——样本均值点。这是验证计算是否正确的一个好方法。

一个例子

假设我们研究了 5 个学生的每日学习时间和数学成绩:

学习时间 xx(小时)34567
数学成绩 yy(分)7278859095

计算得 xˉ=5\bar{x} = 5,yˉ=84\bar{y} = 84。代入公式:

b^=(3−5)(72−84)+(4−5)(78−84)+(5−5)(85−84)+(6−5)(90−84)+(7−5)(95−84)(3−5)2+(4−5)2+(5−5)2+(6−5)2+(7−5)2\hat{b} = \dfrac{(3-5)(72-84)+(4-5)(78-84)+(5-5)(85-84)+(6-5)(90-84)+(7-5)(95-84)}{(3-5)^2+(4-5)^2+(5-5)^2+(6-5)^2+(7-5)^2} =(−2)(−12)+(−1)(−6)+0+1⋅6+2⋅114+1+0+1+4=24+6+0+6+2210=5810=5.8= \dfrac{(-2)(-12)+(-1)(-6)+0+1\cdot6+2\cdot11}{4+1+0+1+4} = \dfrac{24+6+0+6+22}{10} = \dfrac{58}{10} = 5.8 a^=84−5.8×5=84−29=55\hat{a} = 84 - 5.8 \times 5 = 84 - 29 = 55

所以回归方程为 y^=5.8x+55\hat{y} = 5.8x + 55。这意味着每多学 1 小时,成绩平均提高约 5.8 分。当学习时间为 0 时,预测成绩为 55 分(这只是一个模型外推,不一定合理)。

相关系数

有了回归方程还不够,我们还需要知道两个变量的相关关系有多强。这就用到相关系数 rr:

r=∑i=1n(xi−xˉ)(yi−yˉ)∑i=1n(xi−xˉ)2∑i=1n(yi−yˉ)2(3)r = \dfrac{\sum\limits_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum\limits_{i=1}^{n}(x_i - \bar{x})^2 \sum\limits_{i=1}^{n}(y_i - \bar{y})^2}} \qquad (3)

相关系数 rr 的取值范围是 [−1,1][-1, 1]:

  • r>0r > 0 表示正相关,r<0r < 0 表示负相关
  • ∣r∣|r| 越接近 1,相关程度越强;∣r∣|r| 越接近 0,相关程度越弱
  • r=1r = 1 或 r=−1r = -1 表示完全线性相关(所有点都在一条直线上)
  • r=0r = 0 表示没有线性相关关系

一个重要的直觉:相关系数衡量的是线性相关的强弱,不是所有关系。两个变量可能有很强的非线性关系,但相关系数接近 0。所以看相关系数之前,一定要先看散点图。

相关系数与回归系数的关系

相关系数 rr 和回归系数 b^\hat{b} 的符号总是相同的:

b^=r⋅sysx\hat{b} = r \cdot \dfrac{s_y}{s_x}

其中 sx,sys_x, s_y 分别是 xx 和 yy 的样本标准差。因为标准差恒为正,所以 b^\hat{b} 和 rr 同号。

深入理解

相关关系 ≠ 因果关系

这是统计学中最重要的一句话。两个变量相关,并不意味着一个导致了另一个。

比如研究表明:冰淇淋销量和溺水事故数量之间存在很强的正相关。但这并不意味着"吃冰淇淋导致溺水"——真正的原因是一个混杂变量:气温。夏天天气热,既导致冰淇淋销量增加,也导致更多人去游泳(从而增加了溺水风险)。

再比如:戴头盔的人发生事故的概率更低。这说明戴头盔是原因吗?不一定——也可能是"安全意识强的人既更可能戴头盔,也更可能遵守交通规则"。

相关是因果的必要不充分条件:有因果必有相关,但有相关未必有因果。要确定因果关系,需要更严谨的实验设计(如随机对照试验)。

残差分析——检验回归模型的好坏

回归方程给出的只是预测值 y^\hat{y},实际值 yy 和预测值之间总有差距,这个差距叫做残差:

ei=yi−y^ie_i = y_i - \hat{y}_i

残差分析可以帮我们判断回归模型是否合适:

  • 如果残差随机散布在 0 附近,说明线性模型比较合适
  • 如果残差呈现某种规律(比如随着 xx 增大而变大),说明可能存在非线性关系或异方差
  • 残差中如果有明显偏离的点,可能是异常值

独立性检验——分类变量的关系

除了两个数值变量之间的相关关系,我们还需要研究两个分类变量之间是否有关系。比如:性别和是否喜欢数学、吸烟和是否患肺癌。

这就是独立性检验的任务。核心思想是:先假设两个变量无关(原假设),然后看数据是否提供了足够的证据来拒绝这个假设。

列联表是整理分类数据的基本工具。对于两个分类变量(各有两类),我们用 2×22 \times 2 列联表:

B 发生B 不发生合计A 发生aba+bA 不发生cdc+d合计a+cb+dn\begin{array}{c|cc|c} & \text{B 发生} & \text{B 不发生} & \text{合计} \\ \hline \text{A 发生} & a & b & a+b \\ \text{A 不发生} & c & d & c+d \\ \hline \text{合计} & a+c & b+d & n \end{array}

卡方检验(χ² 独立性检验)

卡方统计量

独立性检验的核心是计算 卡方统计量:

χ2=n(ad−bc)2(a+b)(c+d)(a+c)(b+d)(4)\chi^2 = \dfrac{n(ad - bc)^2}{(a+b)(c+d)(a+c)(b+d)} \qquad (4)

其中 n=a+b+c+dn = a + b + c + d 是样本总量。

这个公式的含义是:分子 (ad−bc)2(ad - bc)^2 衡量了实际数据偏离"独立假设"的程度——如果 A 和 B 独立,应该有 aa+b≈cc+d\dfrac{a}{a+b} \approx \dfrac{c}{c+d},即 ad≈bcad \approx bc,此时 ad−bcad-bc 接近 0。分母是对样本量的标准化。

判断标准

计算出 χ2\chi^2 后,我们需要判断它是否「足够大」——大到足以让我们拒绝"两个变量独立"的原假设。

查卡方分布表(高中阶段一般直接给出临界值),常用的临界值为:

  • χ2>3.841\chi^2 > 3.841 时,有 95% 的把握认为两个变量有关(犯错误的概率不超过 5%)
  • χ2>6.635\chi^2 > 6.635 时,有 99% 的把握认为两个变量有关
  • χ2>10.828\chi^2 > 10.828 时,有 99.9% 的把握认为两个变量有关

注意说法:我们有 "95% 的把握认为有关",不是说"有 5% 的概率无关"。前者是频率学派的解释——在重复抽样中,约有 5% 的独立案例也会被误判为有关。

一个小例子

为研究"吸烟是否增加患肺癌的风险",调查了 200 人,得到以下列联表:

患肺癌未患肺癌合计吸烟3090120不吸烟107080合计40160200\begin{array}{c|cc|c} & \text{患肺癌} & \text{未患肺癌} & \text{合计} \\ \hline \text{吸烟} & 30 & 90 & 120 \\ \text{不吸烟} & 10 & 70 & 80 \\ \hline \text{合计} & 40 & 160 & 200 \end{array}

计算卡方统计量:

χ2=200×(30×70−90×10)2120×80×40×160=200×(2100−900)2120×80×40×160=200×1,440,00061,440,000≈4.69\chi^2 = \dfrac{200 \times (30 \times 70 - 90 \times 10)^2}{120 \times 80 \times 40 \times 160} = \dfrac{200 \times (2100 - 900)^2}{120 \times 80 \times 40 \times 160} = \dfrac{200 \times 1{,}440{,}000}{61{,}440{,}000} \approx 4.69

4.69>3.8414.69 > 3.841,所以在 95% 的置信水平下,我们有理由认为吸烟与患肺癌有关。

在高中数学体系里的位置

回归分析和独立性检验是统计部分应用性最强的内容。

思想延伸:这两块内容体现了统计学的核心思想——从数据中找规律,再用规律做推断。回归分析用模型刻画变量间的定量关系,独立性检验用概率判断定性关系的显著性。这种"用数据说话"的思维方式,在社会科学研究、医学研究、商业决策等领域广泛应用。

运算练兵场:回归分析的计算主要是公式代入,需要细心但不会太复杂;独立性检验的计算也很直接,关键是正确列出列联表、正确识别 a,b,c,da, b, c, d。高考中这两类题通常出现在解答题中,和概率、统计图表结合考查。

易错点:

  1. 混淆相关与因果:这是最常见的概念错误,看到正相关就说是"A 导致 B"
  2. 列联表的 a,b,c,da, b, c, d 标错位置:要严格按定义对应
  3. 卡方值与临界值比较时混淆水平:3.841 对应 95%,6.635 对应 99%,不要记混

思考与拓展

  1. 已知 xx 和 yy 的样本数据为:(1,2),(2,3),(3,5),(4,4),(5,6)(1,2), (2,3), (3,5), (4,4), (5,6)。求回归方程 y^=b^x+a^\hat{y} = \hat{b}x + \hat{a} 和相关系数 rr。
  2. 某工厂生产的产品尺寸 X∼N(10,0.04)X \sim N(10, 0.04)(单位 cm),规定尺寸在 [9.7,10.3][9.7, 10.3] cm 内为合格品。从一批产品中随机抽取 500 件,大约有多少件不合格?(提示:先算合格率,再用 3σ 原则近似)
  3. 研究"每天睡眠时间与考试成绩"的关系,得到数据后发现 r=0.12r = 0.12。这说明睡眠时间和成绩几乎无关吗?为什么?
  4. 某医院调查了 300 名患者,得到列联表:吸烟者中患肺癌 25 人、未患 75 人;不吸烟者中患肺癌 10 人、未患 190 人。在 99% 的置信水平下,能否认为吸烟与患肺癌有关?

一句话总结

回归分析用直线拟合数据的趋势,相关系数衡量线性相关的强弱,卡方检验判断两个分类变量是否独立——三者都是从数据中寻找关系的不同工具。

— Y. · 2026-09-19