我学过概率和统计,却没有真正体验过它们。区别何在?它们试图做什么?
这个类比很有帮助:
- 概率(Probability) 是从一个动物出发,推断它会留下什么样的足迹。
- 统计(Statistics) 是看到一处足迹,猜测是什么动物。

概率(Probability)很直接:你拥有那只熊。测量脚的大小、腿的长度,你就能推导出脚印。"哦,Bubbles 先生重 400 磅,腿长 3 英尺,会留下这样的踪迹。"更学术地说:"我们有一个公平的硬币。抛 10 次后,以下是可能的结果。"
统计更难。我们测量脚印,却必须猜测它可能是哪种动物。熊?人?如果我们得到 6 次正面和 4 次反面,那是公平硬币的概率是多少?
惯犯(The Usual Suspects)
以下是我们如何用统计来"找出动物":
获取足迹。每个数据点都是"连点成线"中的一个点。数据越多,形状越清晰(连点成线中只有一个点没帮助。一个数据点难以发现趋势。)
测量基本特征。每个脚印都有深度、宽度和高度。每个数据集都有一个 平均的、中位数、标准差等等。这些通用的、通用的描述给出了一个 粗略的 收窄:"脚印宽 6 英寸:是小熊,还是大个子的人?"
确定物种。有几十种可能的动物(概率分布)要考虑。我们用对系统的先验知识来缩小范围。在树林里?想想马,而不是斑马。处理是/否问题?考虑二项分布。
查阅具体动物。一旦我们有了分布("熊"),我们就在表中查找通用的测量值。"一个宽 6 英寸、深 2 英寸的爪印最可能是一只 3 岁、400 磅的熊"。查找表由概率分布生成,即在动物在动物园时进行测量。
进行额外的预测。一旦我们知道了动物,我们就能预测未来的行为和其他特征("根据我们的计算,Bubbles 先生会在树林里排便。")。统计(Statistics)帮助我们从数据本身获取关于数据来源的信息。
好的!这个隐喻并不完美,但比 易接受的 "统计是对数据的收集、整理、分析和解释的研究"要更易懂。需要证明?看看我们能否问出直观的"我尝过!"的问题:
- 最常见的物种有哪些?(常见分布)
- 是否有新物种正被发现?
- 我们能预测下一个足迹吗?(外推(Extrapolation))
- 这些足迹是否沿着某条路径?(回归 / 趋势线)
- 这里有两组足迹,哪种动物更快?更大?(来自两次药物试验的数据:哪种更有效?)
- 一种动物是否与另一种朝同一方向移动?(相关性(Correlation))
- 两只动物是否在追踪同一来源?(因果(Causation):两只熊在追同一只兔子)
这些问题比我初学统计时想的要深刻得多。现在每个枯燥的步骤都有了语境:我们是在了解新物种吗?如何取通用的脚印测量值?如何从概率分布制作表格?如何在表中查找测量值?
对统计过程有一个类比,能让后续的数据处理豁然开朗。数学愉快。
PS. 概率(Probability)与统计(Statistics)之间这种前与后的差别,在数学中随处可见。有些过程易于执行(导数(Derivative))却难以逆转(积分(Integral))。(谢谢 Denis)