第10讲 统计基础——抽样、用样本估计总体
想知道一锅汤的味道,不需要喝完整锅——抽样和统计推断就是用一小部分数据来认识整体。
从一个朴素的问题开始
某工厂生产了一批灯泡,想知道这批灯泡的平均寿命。能把每一只灯泡都测到坏掉吗?显然不行——那样就没有灯泡可以卖了。那该怎么办?
答案是:抽一部分灯泡来测——这就是统计的基本思想。
但问题随之而来:随便抓几只测行不行?怎样才算"抓得准"?从这几只灯泡推断出来的平均寿命,靠谱吗?这些问题,就是这一讲要解决的。
抽样方法
要"用样本估计总体",首先得从总体中抽取样本。抽样方法决定了样本是否具有代表性。
简单随机抽样
简单随机抽样是最基本的抽样方法:从总体中逐个抽取个体,每个个体被抽到的可能性相等。最简单的做法是抽签法或随机数表法。
比如从 500 个灯泡中抽取 20 个来测试,就给 500 个灯泡编号 1–500,用随机数表选出 20 个编号对应的灯泡。这种方法的优点是每个个体被抽到的机会完全均等,缺点是当总体很大时操作起来不方便。
分层抽样
如果总体由差异明显的几部分组成,简单随机抽样可能会漏掉某些重要的子群体。这时候用分层抽样:先按某种特征把总体分成若干层(比如男/女、高/中/低年级),然后在每一层内按比例抽取样本。
比如某校有高一 400 人、高二 350 人、高三 250 人,要抽取一个容量为 100 的样本。按分层抽样,各层应抽取的人数分别为:
分层抽样的关键是先分层、再按比例抽样,确保每层都有代表。
系统抽样
系统抽样(也叫等距抽样)的操作步骤是:先把总体中的个体编号,然后计算分段间隔 ( 是总体容量, 是样本容量),在第一段中用简单随机抽样确定一个起始号码,然后每隔 个抽取一个个体。
比如从 500 个产品中抽取 50 个,间隔 。先在 1–10 中随机选一个号码,比如 7,然后抽取 7、17、27、37、……、497,共 50 个。
系统抽样比简单随机抽样更容易操作,但要小心:如果总体中存在周期性规律,系统抽样可能会引入偏差。比如生产线上每隔 10 个产品有一个固定的质量波动,而你的间隔恰好也是 10,就会抽样到偏差最大的那些产品。
示意图
用样本数据刻画分布
拿到样本数据后,我们需要"描述"它的分布情况。高中数学中有几种常见的方法。
频率分布直方图
把数据分成若干组,统计每一组的频率(频数/样本容量),然后画成直方图。每个小矩形的面积代表该组的频率,所有矩形的面积之和为 1。
画直方图的关键步骤:
- 求极差:最大值减去最小值
- 决定组数和组距:组数一般取 5–15 组,组距 = 极差 / 组数
- 决定分点:分点要比数据多一位小数,避免数据落在边界上
- 列频率分布表:统计各组频数和频率
- 画直方图:以组距为底边,以频率/组距为高
注意:纵轴是「频率/组距」,不是「频率」。矩形的面积才是频率。
茎叶图
茎叶图是一种简单直观的数据表示方法。把每个数据分成「茎」(高位数)和「叶」(低位数),茎放在左边,叶从小到大排列在右边。
比如 12 组学生的考试成绩(满分 100):
茎 | 叶
5 | 8
6 | 2 4 7
7 | 0 3 5 8
8 | 1 4 6 9
9 | 2 5
这表示分数为:58, 62, 64, 67, 70, 73, 75, 78, 81, 84, 86, 89, 92, 95。
茎叶图的优点是保留了原始数据的所有信息,同时能直观看出数据的分布形态和集中趋势。缺点是数据量大时比较繁琐。
频率分布直方图 vs 茎叶图
| 频率分布直方图 | 茎叶图 | |
|---|---|---|
| 优点 | 适合大量数据,直观显示分布形状 | 保留全部原始数据 |
| 缺点 | 丢失了原始数据的精确值 | 数据多时不易操作 |
| 适用 | 大数据量 | 中小数据量 |
样本数字特征
描述一组数据,光看分布形状不够,还需要一些数字特征来刻画其集中趋势和离散程度。
平均数
样本平均数(简称均值)是所有数据的算术平均:
平均数是最常用的"中心位置"度量,但它对极端值很敏感——如果有几个特别大或特别小的数据,平均数会被"拉偏"。
中位数
中位数是将数据从小到大排列后,位于中间位置的数:
- 如果 是奇数,中位数是第 个数
- 如果 是偶数,中位数是第 个数和第 个数的平均值
中位数的优点是不受极端值影响。比如班里大多数同学月薪 5000 元,但有一个人月薪 50 万——平均工资会被拉高到远高于大多数人的水平,而中位数更能反映"典型情况"。
众数
众数是数据中出现次数最多的数值。一组数据可以有多个众数,也可以没有。
方差与标准差
平均数、中位数只能告诉你数据的"中心"在哪里,但还需要知道数据有多分散。方差和标准差就是衡量离散程度的指标。
方差:
标准差是方差的算术平方根:
标准差的单位和原始数据相同,因此比方差更直观。标准差越大,说明数据越分散;标准差越小,数据越集中在均值附近。
注意区分样本方差 和总体方差 。在高中阶段,通常用样本方差来估计总体方差。
用样本估计总体
以上所有方法都是描述统计——对已有的数据做整理和描述。但统计的最终目的是推断统计:用样本的信息来推测总体的特征。
核心思想是:样本的数字特征可以作为总体相应数字特征的估计值。
- 用样本平均数 估计总体平均数
- 用样本方差 估计总体方差
- 用样本的频率分布估计总体的概率分布
这个估计是有误差的,样本容量越大,估计通常越准确。但统计推断的本质是带着不确定性的判断——我们永远无法 100% 确定总体参数的精确值,只能给出一个"大概的范围"和"可信的程度"。这正是统计的魅力:承认不确定性,但仍然从中提取有用的信息。
深入理解
平均数、中位数、众数的关系
在对称的单峰分布中,平均数、中位数、众数三者重合。但在偏斜分布中,它们的位置各不相同:
- 右偏分布(长尾在右侧):众数 < 中位数 < 平均数
- 左偏分布(长尾在左侧):平均数 < 中位数 < 众数
理解这一点很重要:当你看到一组数据的平均数明显大于中位数时,就说明这组数据中有少数很大的值,把平均数"拉高"了。
方差公式的另一种形式
方差还有一个计算公式,有时候用起来更方便:
这个公式的含义是:方差 = 平方的平均 − 平均的平方。记忆方法:「先平方再平均,减去平均的平方」。
为什么不用极差?
极差(最大值减最小值)是最简单的离散程度度量,但它只用了两个数据,忽略了其他所有数据的信息。比如两组数据:
- A: 1, 2, 3, 4, 5 → 极差 = 4
- B: 1, 1, 1, 1, 5 → 极差 = 4
两组极差相同,但 A 的数据分布更均匀,B 的数据大部分挤在 1 附近。极差无法区分这两种情况,而方差可以。所以方差的参考价值更高。
在高中数学体系里的位置
统计在高中数学中是一个相对独立的板块,但和其他知识联系紧密。
思想延伸:统计的核心思想是"用样本估计总体",这是一种基于部分认识整体的科学方法。这种思想不仅适用于数学,也适用于社会科学、经济学、医学等各个领域。
运算练兵场:统计的计算相对简单(主要是平均数、方差的计算),但需要细心。高考中统计题目通常不会很难,重点在于理解题意、正确选择方法。
易错点:
- 混淆样本方差和总体方差:样本方差公式有时除以 (无偏估计),有时除以 ,高中一般用除以 的版本
- 直方图纵轴误读:纵轴是「频率/组距」,不是频率,矩形面积才是频率
- 极端值对平均数的影响:遇到偏斜数据时,平均数可能误导判断,应该参考中位数
思考与拓展
- 一组数据 1, 2, 3, 4, 5, 100,它的平均数、中位数、众数各是多少?哪个最能代表这组数据的"典型值"?
- 某班 50 名学生的成绩如下(单位:分):78, 82, 85, 90, 76, 88, 92, 85, 79, 83, 87, 91, 85, 78, 82, 86, 90, 84, 88, 79, 83, 87, 91, 85, 80, 84, 88, 76, 82, 86, 90, 83, 87, 81, 85, 89, 78, 84, 88, 82, 86, 90, 83, 87, 81, 85, 89, 78, 84, 88, 82。画出一组合适的频率分布直方图,并计算平均数和标准差。
- 用茎叶图表示以下数据:23, 25, 28, 31, 34, 36, 38, 42, 45, 47, 50, 53, 55。从图中你能读出哪些信息?
- 某公司员工的月收入数据中,平均数为 8000 元,中位数为 6000 元。这说明公司的收入分布是右偏还是左偏?老板说"我们平均工资 8000",员工说"我们大多数拿 6000",谁的说法更有道理?
一句话总结
用样本估计总体——先通过抽样获得代表性数据,再用平均数、方差等数字特征描述分布,最后推断总体的情况。统计的本质是在不确定中寻找最合理的判断。