从一个朴素的问题开始
你是否注意过:一般来说,身高越高的人,体重也越重?但也不完全如此——有人很高但很瘦,有人不胖但也很高。身高和体重之间有关系,但不是确定的函数关系。
这种"有关系但不确定"的关系,叫做相关关系。和函数关系不同,相关关系中一个变量的变化会引起另一个变量的趋势性变化,但不能精确地由一个变量算出另一个变量。
统计学的任务之一就是:从数据中发现变量之间的相关关系,并用数学模型来刻画它。
变量间的相关关系
正相关、负相关与不相关
两个变量之间的关系有三种基本类型:
- 正相关:一个变量增大,另一个变量也倾向于增大。比如身高和体重、学习时间和个人成绩。在散点图中,点云大致从左下往右上分布。
- 负相关:一个变量增大,另一个变量倾向于减小。比如气温和暖气费用、汽车速度和到达目的地所需时间。在散点图中,点云大致从左上往右下分布。
- 不相关:两个变量之间没有明显的趋势关系。比如人的鞋码和智商、某天的气温和你的考试成绩。
散点图
散点图是研究两个变量关系最直观的工具:把每个观测数据作为一个点画在坐标系中,横轴是一个变量,纵轴是另一个变量。
如果点大致分布在一条直线附近,就称为线性相关;如果点呈现出某种曲线形态,就是非线性相关;如果点杂乱无章,就没有明显的相关关系。
比如研究 20 个学生的身高和体重,画出的散点图可能显示:大部分点在一条从左下到右上的带状区域内——这就是正相关。
示意图

散点图中找出"最佳拟合直线"——最小二乘法就是让所有点到直线的距离平方和最小
线性回归方程
当两个变量呈线性相关时,我们可以用一条直线来近似描述它们的关系:
y^=b^x+a^
其中 y^ 是对 y 的估计值,b^ 是回归系数(斜率),a^ 是截距。
最小二乘法
如何确定这条"最佳"直线?最常用的是最小二乘法:找到一条直线,使得所有数据点到这条直线的竖直距离的平方和最小。
具体地,对于 n 组数据 (x1,y1),(x2,y2),…,(xn,yn),我们要最小化:
Q=i=1∑n(yi−y^i)2=i=1∑n(yi−b^xi−a^)2
通过求导并令导数为零,可以解得:
b^=i=1∑n(xi−xˉ)2i=1∑n(xi−xˉ)(yi−yˉ)=∑xi2−nxˉ2∑xiyi−nxˉyˉ(1)
a^=yˉ−b^xˉ(2)
记住这两个公式的关键:回归直线一定经过点 (xˉ,yˉ)——样本均值点。这是验证计算是否正确的一个好方法。
一个例子
假设我们研究了 5 个学生的每日学习时间和数学成绩:
| 学习时间 x(小时) | 3 | 4 | 5 | 6 | 7 |
|---|
| 数学成绩 y(分) | 72 | 78 | 85 | 90 | 95 |
计算得 xˉ=5,yˉ=84。代入公式:
b^=(3−5)2+(4−5)2+(5−5)2+(6−5)2+(7−5)2(3−5)(72−84)+(4−5)(78−84)+(5−5)(85−84)+(6−5)(90−84)+(7−5)(95−84)
=4+1+0+1+4(−2)(−12)+(−1)(−6)+0+1⋅6+2⋅11=1024+6+0+6+22=1058=5.8
a^=84−5.8×5=84−29=55
所以回归方程为 y^=5.8x+55。这意味着每多学 1 小时,成绩平均提高约 5.8 分。当学习时间为 0 时,预测成绩为 55 分(这只是一个模型外推,不一定合理)。
相关系数
有了回归方程还不够,我们还需要知道两个变量的相关关系有多强。这就用到相关系数 r:
r=i=1∑n(xi−xˉ)2i=1∑n(yi−yˉ)2i=1∑n(xi−xˉ)(yi−yˉ)(3)
相关系数 r 的取值范围是 [−1,1]:
- r>0 表示正相关,r<0 表示负相关
- ∣r∣ 越接近 1,相关程度越强;∣r∣ 越接近 0,相关程度越弱
- r=1 或 r=−1 表示完全线性相关(所有点都在一条直线上)
- r=0 表示没有线性相关关系
一个重要的直觉:相关系数衡量的是线性相关的强弱,不是所有关系。两个变量可能有很强的非线性关系,但相关系数接近 0。所以看相关系数之前,一定要先看散点图。
相关系数与回归系数的关系
相关系数 r 和回归系数 b^ 的符号总是相同的:
b^=r⋅sxsy
其中 sx,sy 分别是 x 和 y 的样本标准差。因为标准差恒为正,所以 b^ 和 r 同号。
深入理解
相关关系 ≠ 因果关系
这是统计学中最重要的一句话。两个变量相关,并不意味着一个导致了另一个。
比如研究表明:冰淇淋销量和溺水事故数量之间存在很强的正相关。但这并不意味着"吃冰淇淋导致溺水"——真正的原因是一个混杂变量:气温。夏天天气热,既导致冰淇淋销量增加,也导致更多人去游泳(从而增加了溺水风险)。
再比如:戴头盔的人发生事故的概率更低。这说明戴头盔是原因吗?不一定——也可能是"安全意识强的人既更可能戴头盔,也更可能遵守交通规则"。
相关是因果的必要不充分条件:有因果必有相关,但有相关未必有因果。要确定因果关系,需要更严谨的实验设计(如随机对照试验)。
残差分析——检验回归模型的好坏
回归方程给出的只是预测值 y^,实际值 y 和预测值之间总有差距,这个差距叫做残差:
ei=yi−y^i
残差分析可以帮我们判断回归模型是否合适:
- 如果残差随机散布在 0 附近,说明线性模型比较合适
- 如果残差呈现某种规律(比如随着 x 增大而变大),说明可能存在非线性关系或异方差
- 残差中如果有明显偏离的点,可能是异常值
独立性检验——分类变量的关系
除了两个数值变量之间的相关关系,我们还需要研究两个分类变量之间是否有关系。比如:性别和是否喜欢数学、吸烟和是否患肺癌。
这就是独立性检验的任务。核心思想是:先假设两个变量无关(原假设),然后看数据是否提供了足够的证据来拒绝这个假设。
列联表是整理分类数据的基本工具。对于两个分类变量(各有两类),我们用 2×2 列联表:
A 发生A 不发生合计B 发生aca+cB 不发生bdb+d合计a+bc+dn
卡方检验(χ² 独立性检验)
卡方统计量
独立性检验的核心是计算 卡方统计量:
χ2=(a+b)(c+d)(a+c)(b+d)n(ad−bc)2(4)
其中 n=a+b+c+d 是样本总量。
这个公式的含义是:分子 (ad−bc)2 衡量了实际数据偏离"独立假设"的程度——如果 A 和 B 独立,应该有 a+ba≈c+dc,即 ad≈bc,此时 ad−bc 接近 0。分母是对样本量的标准化。
判断标准
计算出 χ2 后,我们需要判断它是否「足够大」——大到足以让我们拒绝"两个变量独立"的原假设。
查卡方分布表(高中阶段一般直接给出临界值),常用的临界值为:
- χ2>3.841 时,有 95% 的把握认为两个变量有关(犯错误的概率不超过 5%)
- χ2>6.635 时,有 99% 的把握认为两个变量有关
- χ2>10.828 时,有 99.9% 的把握认为两个变量有关
注意说法:我们有 "95% 的把握认为有关",不是说"有 5% 的概率无关"。前者是频率学派的解释——在重复抽样中,约有 5% 的独立案例也会被误判为有关。
一个小例子
为研究"吸烟是否增加患肺癌的风险",调查了 200 人,得到以下列联表:
吸烟不吸烟合计患肺癌301040未患肺癌9070160合计12080200
计算卡方统计量:
χ2=120×80×40×160200×(30×70−90×10)2=120×80×40×160200×(2100−900)2=61,440,000200×1,440,000≈4.69
4.69>3.841,所以在 95% 的置信水平下,我们有理由认为吸烟与患肺癌有关。
在高中数学体系里的位置
回归分析和独立性检验是统计部分应用性最强的内容。
思想延伸:这两块内容体现了统计学的核心思想——从数据中找规律,再用规律做推断。回归分析用模型刻画变量间的定量关系,独立性检验用概率判断定性关系的显著性。这种"用数据说话"的思维方式,在社会科学研究、医学研究、商业决策等领域广泛应用。
运算练兵场:回归分析的计算主要是公式代入,需要细心但不会太复杂;独立性检验的计算也很直接,关键是正确列出列联表、正确识别 a,b,c,d。高考中这两类题通常出现在解答题中,和概率、统计图表结合考查。
易错点:
- 混淆相关与因果:这是最常见的概念错误,看到正相关就说是"A 导致 B"
- 列联表的 a,b,c,d 标错位置:要严格按定义对应
- 卡方值与临界值比较时混淆水平:3.841 对应 95%,6.635 对应 99%,不要记混
思考与拓展
- 已知 x 和 y 的样本数据为:(1,2),(2,3),(3,5),(4,4),(5,6)。求回归方程 y^=b^x+a^ 和相关系数 r。
- 某工厂生产的产品尺寸 X∼N(10,0.04)(单位 cm),规定尺寸在 [9.7,10.3] cm 内为合格品。从一批产品中随机抽取 500 件,大约有多少件不合格?(提示:先算合格率,再用 3σ 原则近似)
- 研究"每天睡眠时间与考试成绩"的关系,得到数据后发现 r=0.12。这说明睡眠时间和成绩几乎无关吗?为什么?
- 某医院调查了 300 名患者,得到列联表:吸烟者中患肺癌 25 人、未患 75 人;不吸烟者中患肺癌 10 人、未患 190 人。在 99% 的置信水平下,能否认为吸烟与患肺癌有关?
一句话总结
回归分析用直线拟合数据的趋势,相关系数衡量线性相关的强弱,卡方检验判断两个分类变量是否独立——三者都是从数据中寻找关系的不同工具。
— Y. · 2026-09-19