从一个朴素的问题开始
医院做体检,你拿到一张化验单,上面写着「阳性」。你心跳加速,心想:我是不是得了这个病?
医生却告诉你:「别急,阳性不等于患病。还得看你得病的概率,以及这个检查在健康人身上出阳性的概率。」
你愣住了——不是说阳性就代表有病吗?怎么还要「算一算」?
这个场景,就是条件概率要解决的问题:当我们知道了一些信息之后,怎么重新计算某个事件发生的概率。
条件概率的定义
先从一个简单的例子入手。
假设一个班级有 30 名同学,其中男生 18 人,女生 12 人。男生中戴眼镜的有 6 人,女生中戴眼镜的有 3 人。现在从班级里随机选一名同学,求这名同学戴眼镜的概率。
这是古典概型:P(戴眼镜)=306+3=309=0.3。
但如果问题变了:「已知选到的是男生,他戴眼镜的概率是多少?」
这时候,我们的样本空间变了——不再是从全班 30 人中选,而是从 18 名男生中选。18 名男生中有 6 人戴眼镜,所以概率是 186=31。
这个「在已知 B 发生的条件下,A 发生的概率」,就是条件概率。
P(A∣B)=P(B)P(AB),P(B)>0(1)
读法:「P of A given B」,意思是:在 B 发生的条件下,A 发生的概率。
从定义看,条件概率的本质是:把样本空间缩小到 B 里面,然后在 B 内部重新计算 A 的概率。
这就是为什么分母是 P(B)——我们在「归一化」,让 B 内部的概率之和变成 1。
示意图

条件概率 P(B|A) = AB面积 / A面积 —— 在 A 的范围内重新看 B
乘法公式
从条件概率的定义(1)出发,直接可以得到一个重要的变形:
P(AB)=P(A)⋅P(B∣A),P(A)>0(2)
这个式子叫做乘法公式。它告诉了我们两个事件同时发生的概率怎么算——先把 A 发生的概率算出来,再看在 A 已经发生的条件下 B 发生的概率,两者相乘就是 AB 的概率。
乘法公式可以推广到多个事件的情况:
P(ABC)=P(A)⋅P(B∣A)⋅P(C∣AB)(3)
这三个式子看起来简单,但在解决实际问题时非常有用。
乘法公式的一个例子
一个袋子里有 5 个红球和 3 个白球,从中依次取两次,每次取一个(不放回)。求两次都取到红球的概率。
用乘法公式:
第一次取到红球的概率:P(A)=85。
在第一次取到红球的条件下,袋子里还剩 4 红 3 白,共 7 个球,所以第二次取到红球的概率:P(B∣A)=74。
两次都取到红球的概率:
P(AB)=85×74=145(4)
如果不放回,概率就是这样一步步乘下去的。如果是放回的话,第二次取到红球的概率还是 85,那就是 85×85=6425。
全概率公式
现在来看一个更复杂的问题。
还是那个班级,男生 18 人,女生 12 人。男生中戴眼镜的概率是 186=31,女生中戴眼镜的概率是 123=41。随机选一名同学,求他戴眼镜的概率。
这个问题乍一看可以用古典概型:戴眼镜的总共 9 人,概率 309=0.3。但如果班级人数很多,或者分得更细(比如按性别、年级、班级等),全概率公式就是一个非常高效的工具。
我们引入完备事件组的概念:把样本空间 Ω 分成若干个互不相容(两两互斥)的事件 B1,B2,…,Bn,满足 B1∪B2∪⋯∪Bn=Ω,且 P(Bi)>0。这些事件叫做完备事件组。
全概率公式:对任意事件 A,有
P(A)=P(B1)⋅P(A∣B1)+P(B2)⋅P(A∣B2)+⋯+P(Bn)⋅P(A∣Bn)(5)
即
P(A)=i=1∑nP(Bi)⋅P(A∣Bi)(6)
用班级问题来理解这个公式:
把全班按性别分为两组:男生 B1、女生 B2。
P(戴眼镜)=P(B1)⋅P(戴眼镜∣B1)+P(B2)⋅P(戴眼镜∣B2)=3018×31+3012×41=0.3
这和直接数 9 除以 30 结果一致。但全概率公式的好处是:把一个复杂事件的概率,分解成几种「简单情况」下的概率的加权和。
深入理解
条件概率不是「因果」,而是「信息更新」
很多人看到 P(B∣A) 会误以为「A 导致了 B」或者「A 是 B 的原因」。但条件概率的本质是信息的更新——我们知道 A 发生了,于是重新评估 B 的可能性。
一个经典例子:掷一枚均匀的骰子,令 A =「点数小于 4」,B =「点数为偶数」。
- P(B)=63=21(不看任何信息时的概率)
- P(B∣A)=P(A)P(AB)=1/21/3=32(已知点数小于 4,在 {1, 2, 3} 中偶数有 2 个,概率变为 2/3)
注意:这里 A 并没有「导致」B,而是告诉我们一些信息后,我们对 B 的判断更新了。条件概率反映的是认知状态的改变,不是物理因果。
全概率公式的直观理解:分支图
把全概率公式想象成一棵决策树:
从根节点出发,先分两支:走到 B1(概率 P(B1))或走到 B2(概率 P(B2))。然后在每个分支上再分:到达 A(概率 P(A∣Bi))或不到达。
整个树所有到达 A 的路径的概率之和,就是 P(A)。这就是全概率公式的几何意义:把所有能走到 A 的路径的概率加起来。
条件概率的四条基本性质
和概率的公理一样,条件概率也有几条基本性质:
- 非负性:P(A∣B)≥0
- 规范性:P(Ω∣B)=1(在 B 发生的条件下,必然事件概率为 1)
- 可加性:如果 A1,A2 互斥,则 P(A1∪A2∣B)=P(A1∣B)+P(A2∣B)
- 对立事件:P(Aˉ∣B)=1−P(A∣B)
这四条性质说明:把条件概率 P(⋅∣B) 本身看作一个概率函数,它满足概率的所有公理。也就是说,条件概率是一个「在这个新的样本空间 B 里」的概率。
典型例题:疾病检测的反直觉
回到开头的体检问题。这是一种疾病的检测结果分析,结论往往非常反直觉。
假设某种疾病的发病率是 0.1%(即 P(D)=0.001),一种检测方法的灵敏度是 99%(患病的人检测出阳性的概率 P(T+∣D)=0.99),假阳性率是 5%(健康的人检测出阳性的概率 P(T+∣Dˉ)=0.05)。
现在你检测出了阳性,你患病的概率 P(D∣T+) 是多少?
直觉上很多人会说「接近 99%」,但正确答案远没有这么乐观。我们用贝叶斯公式来算:
P(D∣T+)=P(T+)P(T+∣D)⋅P(D)
分母用全概率公式展开:
P(T+)=P(T+∣D)⋅P(D)+P(T+∣Dˉ)⋅P(Dˉ)=0.99×0.001+0.05×0.999=0.00099+0.04995=0.05094
所以:
P(D∣T+)=0.050940.99×0.001=0.050940.00099≈0.0194
只有约 1.9% 的概率真的患病!
这个结果看起来很反直觉,但背后的道理很清楚:因为疾病的发病率很低(0.1%),而假阳性率相对较高(5%),所以绝大多数阳性结果其实是健康人的假阳性。
这个例子告诉我们:在已知检测结果的情况下,不能只看检测的准确度,还要考虑基础发病率(先验概率)的影响。 这在医学诊断、司法判断等领域都极为重要。
在高中数学体系里的位置
条件概率和全概率公式是概率统计的核心内容,在高考中占有重要地位。
思想延伸:条件概率体现了「用新信息更新概率」这一核心思想,它是贝叶斯统计的基础。从这个角度看,条件概率不只是高中课本里的一个公式,而是一种重要的思维方式。
运算练兵场:全概率公式和贝叶斯公式的运算,涉及排列组合、分类讨论、方程思想等,是考察学生综合运算能力的典型题材。
高考地位:条件概率和全概率公式通常出现在解答题中(12 分),背景可以是医学检测、产品质量检验、游戏策略等。题目设计越来越贴近实际,阅读量较大,要求学生能把实际问题转化为概率模型。
易错点:
- 混淆条件概率的方向——P(A∣B) 和 P(B∣A) 一般不相等,很多人会把它们搞混
- 全概率公式用错——完备事件组划分不清楚,漏掉了某些情况
- 忽略先验概率——像疾病检测那样,只关注检测的准确性,忽视了基础发病率
思考与拓展
- 一副扑克牌去掉大小王后共 52 张。先从中任取一张,不放回,再从剩下的 51 张中任取一张。求第二张是 A 的概率。(提示:用全概率公式,按第一张是不是 A 来分情况)
- 某厂生产的产品中有 95% 合格,5% 不合格。合格品中有 90% 是一等品,不合格品中有 30% 是一等品(返工后可以当一等品卖)。随机取一件产品,求它是一等品的概率。
- 上面疾病检测的例子中,如果发病率降到 0.01%(万分之一),那么检测阳性后患病的概率会变成多少?
- 证明:如果 P(A∣B)>P(A),那么 P(B∣A)>P(B)。这个不等式说明什么?
一句话总结
**条件概率用新信息重新定义概率,全概率公式把复杂事件拆成简单情况的加权和——关键是要搞清楚「在什么条件下」和「哪些情况要加起来」。
— Y. · 2026-09-18