开篇:那杯奶茶店的事,还没回答完
摸底那天,老夫给馆主出了一道题——
一家奶茶店说「顾客平均等待时间 3 分钟」。这话里藏了哪两个没说的事,让你立刻觉得不可信?
馆主当时给了很礼貌的反馈:「没思路。」
没有关系。摸底本身就是为了找到「无思路」的位置——这一定是你站在分布论门口、还没推门的那个瞬间。这一课,就是给那个瞬间架一座桥。
第一阶:平均值本身在撒谎
不要急着去答那题「藏了什么」。先解决一件更基本的事——
统计学家有句话,**平均值是最不诚实的统计量**。它的「不诚实」不是因为它算错了,而是因为它**省略太多事**。
举个生活场景。馆主每天上班路上要买一杯咖啡,过去 7 天观测到等待时间(按分钟):
10, 2, 2, 2, 2, 2, 2
算一下平均数:是 (10+2+2+2+2+2+2)/7 = 22/7 ≈ 3.14 分钟。这个数差不多 3 分钟。
但如果有一位顾客下周二晚高峰时路过那家店,被卡了 10 分钟,他发了条朋友圈:「等了 10 分钟,以后不去这家店了!」——店家辩解:「我们平均等待时间只有 3 分钟啊。」
数据没错。**但故事丢掉了一半。**
那「丢掉的另一半」是什么?馆主现在能不能凭直觉说出来?
🔍 第一个被平均数丢掉的事,是:
对——**变异性**(也叫做「数据的散开程度」)。馆主摸底时**标准差**答得很准("数据离散程度、越大越散"),但当时这个概念是**孤立的**。现在我们把它的来头摸出来。
第二阶:从一个数到一个形状
上一阶我们看到,平均值告诉你「中心」但掩埋了「散开」。那么问题来了——怎么把「散开的样子」也看见?
答案:画出来。不是数字,是图。
把过去 7 天等待时间**全部标在横轴上**(横轴 = 等待时间,纵轴 = 出现次数):
次数
6 │ █
5 │ █
4 │ █
3 │ █
2 │ █
1 │ █ █
└──┼─────────┼──→ 时间(分钟)
2 10
这是一张最简单的分布(distribution)。它的形状是——一座孤峰在右边,左边挤了一片尖刺。**整张图没有真正意义上的"中间",只有"那座孤峰"和"那条尾巴"。
"分布" 不是数学概念。分布是一张图——告诉你每个值出现了几次,所有次数堆在一起长成什么形状。
第三阶:为什么"看见分布"这么重要?
你可能会问:3 分钟平均数差 0.14 分钟又怎样?急着画图是不是杀鸡用牛刀?
这个反问好。我反回馆主三个**真实工作场景**——回答完这三个,馆主就明白"看见分布"为什么不是花拳绣腿。
🔍 老板说:"上月营收下降 5%"。如果只看 5% 这个平均数(其实是比值,但语法一样),你会立刻怀疑——
🔍 一家公司宣称"客诉率低于行业均值"。但他们的统计方法是把每位顾客的投诉算 1 次,多位顾客投诉同一事件只算 1 次。问题出在哪?
工作场景我们解答完两题就够——馆主这一课的关键不是刷题,而是把"分布"这个词装进口袋。让我用一张图收尾这一阶:
假设你管理一个 7 天周期,每天回看「昨日营收」:
- 如果营收的分布是「紧贴平均数的小鼓包」——业务稳定,异常天少
- 如果营收的分布是「左尾拉得特别长」——少数天拖了后腿,找原因
- 如果营收的分布是「双峰」(两个鼓包)——客户群可能分裂成两群,看分布找分裂原因
分布不是"长什么样" 的艺术问题。分布是决策的形状。
第四阶:用 R 亲手画第一张分布
理论到此打住——**现在动手**。馆主用 R,我们这就开始。
目标:亲眼把一组数据画成柱状图和直方图
用馆主本地 R(Mac R Studio 或 Posit Cloud 都行)。把下面 7 个数(上周咖啡等待时间)喂给 R:
# 在 R 控制台或 RStudio 输入:
wait_times <- c(10, 2, 2, 2, 2, 2, 2)
mean(wait_times) # 查看平均数 — 应该是 3.14 附近
# 第一张图:柱状图(不预先分桶)
barplot(wait_times,
xlab = "第 N 天", ylab = "等待时间(分钟)",
main = "上周每天等待时间")
# 第二张图:直方图(自动分桶)
hist(wait_times,
xlab = "等待时间(分钟)",
main = "等待时间的分布")
回 R 控制台,看图:
barplot给的是「每天一根柱子」——能看到 10 分钟那根"孤立"。hist给的是「按等待时间分桶」——能看到 2 分钟那桶极长,10 分钟那桶孤峰。
这两张图就是「分布」的两种看见方式。
延伸练习(可选):100 个数据点的分布
如果你想看一张更典型的分布图——
set.seed(2026)
random_waits <- rnorm(100, mean = 3, sd = 0.5) # 100 个假顾客,平均 3 分
hist(random_waits, breaks = 20,
xlab = "等待时间(分钟)",
main = "100 个假顾客的等待时间分布")
这一次图长得像一个钟形——这就是 Mission 里说的"正态分布"。**别急,第二课我们专门讲它。**这里先看个图像。
第五阶:回到奶茶店,再答一遍那题
现在你学了「分布是什么」。带着这张图,重新回答摸底那道题——
一家奶茶店说「顾客平均等待时间 3 分钟」。这话里藏了哪两个没说的事?
我猜你现在能说出一件事了——变异性丢了。3 分钟平均数外面那座分布,**有可能是右尾拉得极长的孤峰、有可能是中间紧实的钟形、也可能是双峰**。三种分布下「平均 3 分钟」对顾客的意味完全不同。
第二件事——留给你下一课前自己回答。提示:上次模拟的 7 天数据里,**「3 分钟」这个平均数有几个这样的顾客体验**?
🔍 第二个被平均数丢掉的事,是:
收尾:本课的三件事
回到 Mission——馆主想成为「看见数据能立刻看到分布」的人。这一课我们打了三根钉子:
- 平均值会撒谎——不是算错,是漏掉变异性(数据散开程度)和样本代表性
- 分布是一张图——不是公式,是「每个值出现次数的形状」
- 看见分布比会算平均更重要——因为它直接决定你能看见什么样的故事
"看见分布"不是技能,是习惯。从这一课起,馆主看任何报表、任何数据、任何"平均数",脑子里都该飘过这张图——「它有没有右尾?有没有双峰?有没有孤峰?」
下一课预告
第二课我们将回答一个更具体的问题——
大数定律是什么?为什么抛 1000 次硬币出 500 次正面的概率最大,但不是"必然"?
这一课我们不用公式——用 R 真抛 1000 次,画出每次正面数目的分布,看它为什么"鼓在 500 那里"。
教科书准备:馆主 Calibre 库里 442《深入浅出统计学》第 5 章「随机变量和分布」。
如有疑问,随时问祭酒——老夫在国子监等你。