∫π每天一道数学题
← 返回概率统计专题
概率统计 · 第 4 讲 · 2026-09-18 · 约 9 分钟

第4讲 条件概率与全概率公式——在已知信息下重新计算概率

当你知道了一些信息之后,概率应该随之改变。条件概率就是教你怎么「用新信息更新概率」,全概率公式则是把复杂问题拆成简单情况。

从一个朴素的问题开始

医院做体检,你拿到一张化验单,上面写着「阳性」。你心跳加速,心想:我是不是得了这个病?

医生却告诉你:「别急,阳性不等于患病。还得看你得病的概率,以及这个检查在健康人身上出阳性的概率。」

你愣住了——不是说阳性就代表有病吗?怎么还要「算一算」?

这个场景,就是条件概率要解决的问题:当我们知道了一些信息之后,怎么重新计算某个事件发生的概率。

条件概率的定义

先从一个简单的例子入手。

假设一个班级有 30 名同学,其中男生 18 人,女生 12 人。男生中戴眼镜的有 6 人,女生中戴眼镜的有 3 人。现在从班级里随机选一名同学,求这名同学戴眼镜的概率。

这是古典概型:P(戴眼镜)=6+330=930=0.3P(\text{戴眼镜}) = \dfrac{6+3}{30} = \dfrac{9}{30} = 0.3

但如果问题变了:「已知选到的是男生,他戴眼镜的概率是多少?」

这时候,我们的样本空间变了——不再是从全班 30 人中选,而是从 18 名男生中选。18 名男生中有 6 人戴眼镜,所以概率是 618=13\dfrac{6}{18} = \dfrac{1}{3}

这个「在已知 B 发生的条件下,A 发生的概率」,就是条件概率

P(AB)=P(AB)P(B),P(B)>0(1)P(A \mid B) = \dfrac{P(AB)}{P(B)}, \quad P(B) > 0 \qquad (1)

读法:「P of A given B」,意思是:在 B 发生的条件下,A 发生的概率。

从定义看,条件概率的本质是:把样本空间缩小到 B 里面,然后在 B 内部重新计算 A 的概率。

这就是为什么分母是 P(B)P(B)——我们在「归一化」,让 B 内部的概率之和变成 1。

示意图

条件概率的韦恩图

条件概率 P(B|A) = AB面积 / A面积 —— 在 A 的范围内重新看 B

乘法公式

从条件概率的定义(1)出发,直接可以得到一个重要的变形:

P(AB)=P(A)P(BA),P(A)>0(2)P(AB) = P(A) \cdot P(B \mid A), \quad P(A) > 0 \qquad (2)

这个式子叫做乘法公式。它告诉了我们两个事件同时发生的概率怎么算——先把 A 发生的概率算出来,再看在 A 已经发生的条件下 B 发生的概率,两者相乘就是 ABAB 的概率。

乘法公式可以推广到多个事件的情况:

P(ABC)=P(A)P(BA)P(CAB)(3)P(ABC) = P(A) \cdot P(B \mid A) \cdot P(C \mid AB) \qquad (3)

这三个式子看起来简单,但在解决实际问题时非常有用。

乘法公式的一个例子

一个袋子里有 5 个红球和 3 个白球,从中依次取两次,每次取一个(不放回)。求两次都取到红球的概率。

用乘法公式:

第一次取到红球的概率:P(A)=58P(A) = \dfrac{5}{8}

在第一次取到红球的条件下,袋子里还剩 4 红 3 白,共 7 个球,所以第二次取到红球的概率:P(BA)=47P(B \mid A) = \dfrac{4}{7}

两次都取到红球的概率:

P(AB)=58×47=514(4)P(AB) = \dfrac{5}{8} \times \dfrac{4}{7} = \dfrac{5}{14} \qquad (4)

如果不放回,概率就是这样一步步乘下去的。如果是放回的话,第二次取到红球的概率还是 58\dfrac{5}{8},那就是 58×58=2564\dfrac{5}{8} \times \dfrac{5}{8} = \dfrac{25}{64}

全概率公式

现在来看一个更复杂的问题。

还是那个班级,男生 18 人,女生 12 人。男生中戴眼镜的概率是 618=13\dfrac{6}{18} = \dfrac{1}{3},女生中戴眼镜的概率是 312=14\dfrac{3}{12} = \dfrac{1}{4}。随机选一名同学,求他戴眼镜的概率。

这个问题乍一看可以用古典概型:戴眼镜的总共 9 人,概率 930=0.3\dfrac{9}{30} = 0.3。但如果班级人数很多,或者分得更细(比如按性别、年级、班级等),全概率公式就是一个非常高效的工具。

我们引入完备事件组的概念:把样本空间 Ω\Omega 分成若干个互不相容(两两互斥)的事件 B1,B2,,BnB_1, B_2, \ldots, B_n,满足 B1B2Bn=ΩB_1 \cup B_2 \cup \cdots \cup B_n = \Omega,且 P(Bi)>0P(B_i) > 0。这些事件叫做完备事件组。

全概率公式:对任意事件 AA,有

P(A)=P(B1)P(AB1)+P(B2)P(AB2)++P(Bn)P(ABn)(5)P(A) = P(B_1) \cdot P(A \mid B_1) + P(B_2) \cdot P(A \mid B_2) + \cdots + P(B_n) \cdot P(A \mid B_n) \qquad (5)

P(A)=i=1nP(Bi)P(ABi)(6)P(A) = \sum_{i=1}^{n} P(B_i) \cdot P(A \mid B_i) \qquad (6)

用班级问题来理解这个公式:

把全班按性别分为两组:男生 B1B_1、女生 B2B_2

P(戴眼镜)=P(B1)P(戴眼镜B1)+P(B2)P(戴眼镜B2)=1830×13+1230×14=0.3P(\text{戴眼镜}) = P(B_1) \cdot P(\text{戴眼镜} \mid B_1) + P(B_2) \cdot P(\text{戴眼镜} \mid B_2) = \dfrac{18}{30} \times \dfrac{1}{3} + \dfrac{12}{30} \times \dfrac{1}{4} = 0.3

这和直接数 9 除以 30 结果一致。但全概率公式的好处是:把一个复杂事件的概率,分解成几种「简单情况」下的概率的加权和。

深入理解

条件概率不是「因果」,而是「信息更新」

很多人看到 P(BA)P(B \mid A) 会误以为「A 导致了 B」或者「A 是 B 的原因」。但条件概率的本质是信息的更新——我们知道 A 发生了,于是重新评估 B 的可能性。

一个经典例子:掷一枚均匀的骰子,令 AA =「点数小于 4」,BB =「点数为偶数」。

  • P(B)=36=12P(B) = \dfrac{3}{6} = \dfrac{1}{2}(不看任何信息时的概率)
  • P(BA)=P(AB)P(A)=1/31/2=23P(B \mid A) = \dfrac{P(AB)}{P(A)} = \dfrac{1/3}{1/2} = \dfrac{2}{3}(已知点数小于 4,在 {1, 2, 3} 中偶数有 2 个,概率变为 2/3)

注意:这里 AA 并没有「导致」BB,而是告诉我们一些信息后,我们对 BB 的判断更新了。条件概率反映的是认知状态的改变,不是物理因果。

全概率公式的直观理解:分支图

把全概率公式想象成一棵决策树:

从根节点出发,先分两支:走到 B1B_1(概率 P(B1)P(B_1))或走到 B2B_2(概率 P(B2)P(B_2))。然后在每个分支上再分:到达 AA(概率 P(ABi)P(A \mid B_i))或不到达。

整个树所有到达 AA 的路径的概率之和,就是 P(A)P(A)。这就是全概率公式的几何意义:把所有能走到 AA 的路径的概率加起来。

条件概率的四条基本性质

和概率的公理一样,条件概率也有几条基本性质:

  1. 非负性P(AB)0P(A \mid B) \ge 0
  2. 规范性P(ΩB)=1P(\Omega \mid B) = 1(在 B 发生的条件下,必然事件概率为 1)
  3. 可加性:如果 A1,A2A_1, A_2 互斥,则 P(A1A2B)=P(A1B)+P(A2B)P(A_1 \cup A_2 \mid B) = P(A_1 \mid B) + P(A_2 \mid B)
  4. 对立事件P(AˉB)=1P(AB)P(\bar{A} \mid B) = 1 - P(A \mid B)

这四条性质说明:把条件概率 P(B)P(\cdot \mid B) 本身看作一个概率函数,它满足概率的所有公理。也就是说,条件概率是一个「在这个新的样本空间 B 里」的概率。

典型例题:疾病检测的反直觉

回到开头的体检问题。这是一种疾病的检测结果分析,结论往往非常反直觉。

假设某种疾病的发病率是 0.1%0.1\%(即 P(D)=0.001P(D) = 0.001),一种检测方法的灵敏度是 99%99\%(患病的人检测出阳性的概率 P(T+D)=0.99P(T^+ \mid D) = 0.99),假阳性率是 5%5\%(健康的人检测出阳性的概率 P(T+Dˉ)=0.05P(T^+ \mid \bar{D}) = 0.05)。

现在你检测出了阳性,你患病的概率 P(DT+)P(D \mid T^+) 是多少?

直觉上很多人会说「接近 99%」,但正确答案远没有这么乐观。我们用贝叶斯公式来算:

P(DT+)=P(T+D)P(D)P(T+)P(D \mid T^+) = \dfrac{P(T^+ \mid D) \cdot P(D)}{P(T^+)}

分母用全概率公式展开:

P(T+)=P(T+D)P(D)+P(T+Dˉ)P(Dˉ)=0.99×0.001+0.05×0.999=0.00099+0.04995=0.05094P(T^+) = P(T^+ \mid D) \cdot P(D) + P(T^+ \mid \bar{D}) \cdot P(\bar{D}) = 0.99 \times 0.001 + 0.05 \times 0.999 = 0.00099 + 0.04995 = 0.05094

所以:

P(DT+)=0.99×0.0010.05094=0.000990.050940.0194P(D \mid T^+) = \dfrac{0.99 \times 0.001}{0.05094} = \dfrac{0.00099}{0.05094} \approx 0.0194

只有约 1.9% 的概率真的患病!

这个结果看起来很反直觉,但背后的道理很清楚:因为疾病的发病率很低(0.1%),而假阳性率相对较高(5%),所以绝大多数阳性结果其实是健康人的假阳性。

这个例子告诉我们:在已知检测结果的情况下,不能只看检测的准确度,还要考虑基础发病率(先验概率)的影响。 这在医学诊断、司法判断等领域都极为重要。

在高中数学体系里的位置

条件概率和全概率公式是概率统计的核心内容,在高考中占有重要地位。

思想延伸:条件概率体现了「用新信息更新概率」这一核心思想,它是贝叶斯统计的基础。从这个角度看,条件概率不只是高中课本里的一个公式,而是一种重要的思维方式。

运算练兵场:全概率公式和贝叶斯公式的运算,涉及排列组合、分类讨论、方程思想等,是考察学生综合运算能力的典型题材。

高考地位:条件概率和全概率公式通常出现在解答题中(12 分),背景可以是医学检测、产品质量检验、游戏策略等。题目设计越来越贴近实际,阅读量较大,要求学生能把实际问题转化为概率模型。

易错点

  1. 混淆条件概率的方向——P(AB)P(A \mid B)P(BA)P(B \mid A) 一般不相等,很多人会把它们搞混
  2. 全概率公式用错——完备事件组划分不清楚,漏掉了某些情况
  3. 忽略先验概率——像疾病检测那样,只关注检测的准确性,忽视了基础发病率

思考与拓展

  1. 一副扑克牌去掉大小王后共 52 张。先从中任取一张,不放回,再从剩下的 51 张中任取一张。求第二张是 A 的概率。(提示:用全概率公式,按第一张是不是 A 来分情况)
  2. 某厂生产的产品中有 95% 合格,5% 不合格。合格品中有 90% 是一等品,不合格品中有 30% 是一等品(返工后可以当一等品卖)。随机取一件产品,求它是一等品的概率。
  3. 上面疾病检测的例子中,如果发病率降到 0.01%(万分之一),那么检测阳性后患病的概率会变成多少?
  4. 证明:如果 P(AB)>P(A)P(A \mid B) > P(A),那么 P(BA)>P(B)P(B \mid A) > P(B)。这个不等式说明什么?

一句话总结

**条件概率用新信息重新定义概率,全概率公式把复杂事件拆成简单情况的加权和——关键是要搞清楚「在什么条件下」和「哪些情况要加起来」。

— Y. · 2026-09-18