第一课 · 描述统计 → 概率基础

看见分布——你推开的第一扇门

从「平均等待 3 分钟」的怀疑出发,看见平均值背后的形状。

预计用时
阅读 20–25 分钟 · R 练习 5–10 分钟
核心读本
《深入浅出统计学》第一章 + 《统计学关我有什么事》引子
练习输出
用 R 画第一张分布图(柱状图 + 直方图)
对接 MISSION
填补摸底中 Q3 「不确定性 / 变异思维」空白

开篇:那杯奶茶店的事,还没回答完

摸底那天,老夫给馆主出了一道题——

一家奶茶店说「顾客平均等待时间 3 分钟」。这话里藏了哪两个没说的事,让你立刻觉得不可信?

馆主当时给了很礼貌的反馈:「没思路。」

没有关系。摸底本身就是为了找到「无思路」的位置——这一定是你站在分布论门口、还没推门的那个瞬间。这一课,就是给那个瞬间架一座桥。

馆主在摸底 6 题里,描述统计三种集中趋势分得清、标准差定义准确、概率直觉对("500 次抛硬币接近必然")——但「变异思维」是空白。这是 Mission 里"用数学方法论进行统计实践"的第一道门槛。

第一阶:平均值本身在撒谎

不要急着去答那题「藏了什么」。先解决一件更基本的事——

统计学家有句话,**平均值是最不诚实的统计量**。它的「不诚实」不是因为它算错了,而是因为它**省略太多事**。

举个生活场景。馆主每天上班路上要买一杯咖啡,过去 7 天观测到等待时间(按分钟):

10, 2, 2, 2, 2, 2, 2

算一下平均数:是 (10+2+2+2+2+2+2)/7 = 22/7 ≈ 3.14 分钟。这个数差不多 3 分钟

但如果有一位顾客下周二晚高峰时路过那家店,被卡了 10 分钟,他发了条朋友圈:「等了 10 分钟,以后不去这家店了!」——店家辩解:「我们平均等待时间只有 3 分钟啊。」

数据没错。**但故事丢掉了一半。**

那「丢掉的另一半」是什么?馆主现在能不能凭直觉说出来?

🔍 第一个被平均数丢掉的事,是:

  • 具体哪个顾客被卡了 10 分钟——个案标签丢了
  • 7 天样本量太小,统计不可靠
  • 等待时间差异极大(6 天 2 分、1 天 10 分)——变异性丢了
  • 平均值算错,应该约 3.14 分钟

对——**变异性**(也叫做「数据的散开程度」)。馆主摸底时**标准差**答得很准("数据离散程度、越大越散"),但当时这个概念是**孤立的**。现在我们把它的来头摸出来。

第二阶:从一个数到一个形状

上一阶我们看到,平均值告诉你「中心」但掩埋了「散开」。那么问题来了——怎么把「散开的样子」也看见?

答案:画出来。不是数字,是图。

把过去 7 天等待时间**全部标在横轴上**(横轴 = 等待时间,纵轴 = 出现次数):

  次数
    6 │            █
    5 │            █
    4 │            █
    3 │            █
    2 │            █
    1 │  █         █
      └──┼─────────┼──→ 时间(分钟)
         2         10

这是一张最简单的分布(distribution)。它的形状是——一座孤峰在右边,左边挤了一片尖刺。**整张图没有真正意义上的"中间",只有"那座孤峰"和"那条尾巴"。

"分布" 不是数学概念。分布是一张图——告诉你每个值出现了几次,所有次数堆在一起长成什么形状。

摸底时馆主问:「为什么 500 次抛硬币是中心?」馆主的答案对,但直觉层用了「理论值 / 偏移」这种语言。现在我们升级一档——把 500 次抛硬币想成一张分布图,那张图会"鼓一个峰在 500 那里,左右小幅度散开"。后面第二课我们会亲手画这张图。

第三阶:为什么"看见分布"这么重要?

你可能会问:3 分钟平均数差 0.14 分钟又怎样?急着画图是不是杀鸡用牛刀?

这个反问好。我反回馆主三个**真实工作场景**——回答完这三个,馆主就明白"看见分布"为什么不是花拳绣腿。

🔍 老板说:"上月营收下降 5%"。如果只看 5% 这个平均数(其实是比值,但语法一样),你会立刻怀疑——

  • 老板算错了,下降 5% 是不可能的
  • 5% 其实不小,应该报警
  • 应该看同比、环比、客单价,三个一起对比
  • 不用分析,反正 5% 不会是问题

🔍 一家公司宣称"客诉率低于行业均值"。但他们的统计方法是把每位顾客的投诉算 1 次,多位顾客投诉同一事件只算 1 次。问题出在哪?

  • 客诉分布形状被压扁了——重复投诉的「严重性」被丢掉了
  • 客诉率算错了,应该按订单总数算分母
  • 应该用众数不能用平均
  • 客诉率这种指标本来就不可信

工作场景我们解答完两题就够——馆主这一课的关键不是刷题,而是把"分布"这个词装进口袋。让我用一张图收尾这一阶:

假设你管理一个 7 天周期,每天回看「昨日营收」:

分布不是"长什么样" 的艺术问题。分布是决策的形状。

第四阶:用 R 亲手画第一张分布

理论到此打住——**现在动手**。馆主用 R,我们这就开始。

本课练习 · R 环境 5 分钟

目标:亲眼把一组数据画成柱状图和直方图

用馆主本地 R(Mac R Studio 或 Posit Cloud 都行)。把下面 7 个数(上周咖啡等待时间)喂给 R:

# 在 R 控制台或 RStudio 输入:
wait_times <- c(10, 2, 2, 2, 2, 2, 2)
mean(wait_times)   # 查看平均数 — 应该是 3.14 附近

# 第一张图:柱状图(不预先分桶)
barplot(wait_times,
        xlab = "第 N 天", ylab = "等待时间(分钟)",
        main = "上周每天等待时间")

# 第二张图:直方图(自动分桶)
hist(wait_times,
     xlab = "等待时间(分钟)",
     main = "等待时间的分布")

回 R 控制台,看图:

  • barplot 给的是「每天一根柱子」——能看到 10 分钟那根"孤立"。
  • hist 给的是「按等待时间分桶」——能看到 2 分钟那桶极长,10 分钟那桶孤峰。

这两张图就是「分布」的两种看见方式。

延伸练习(可选):100 个数据点的分布

如果你想看一张更典型的分布图——

set.seed(2026)
random_waits <- rnorm(100, mean = 3, sd = 0.5)   # 100 个假顾客,平均 3 分
hist(random_waits, breaks = 20,
     xlab = "等待时间(分钟)",
     main = "100 个假顾客的等待时间分布")

这一次图长得像一个钟形——这就是 Mission 里说的"正态分布"。**别急,第二课我们专门讲它。**这里先看个图像。

馆主日后还想用 R 跑这张分布图,可以走 Posit Cloud(https://posit.cloud/)——不需要装任何东西。Calibre 库里的《R 语言实战 第2版》(id 509)第十一章也专门讲这。

第五阶:回到奶茶店,再答一遍那题

现在你学了「分布是什么」。带着这张图,重新回答摸底那道题——

一家奶茶店说「顾客平均等待时间 3 分钟」。这话里藏了哪两个没说的事?

我猜你现在能说出一件事了——变异性丢了。3 分钟平均数外面那座分布,**有可能是右尾拉得极长的孤峰、有可能是中间紧实的钟形、也可能是双峰**。三种分布下「平均 3 分钟」对顾客的意味完全不同。

第二件事——留给你下一课前自己回答。提示:上次模拟的 7 天数据里,**「3 分钟」这个平均数有几个这样的顾客体验**?

🔍 第二个被平均数丢掉的事,是:

  • 计算平均时的舍入误差
  • 样本量与代表性——过去 7 天观测能代表「所有顾客」的等待体验吗?
  • 具体哪家奶茶店
  • 顾客的口味偏好

收尾:本课的三件事

回到 Mission——馆主想成为「看见数据能立刻看到分布」的人。这一课我们打了三根钉子:

  1. 平均值会撒谎——不是算错,是漏掉变异性(数据散开程度)和样本代表性
  2. 分布是一张图——不是公式,是「每个值出现次数的形状」
  3. 看见分布比会算平均更重要——因为它直接决定你能看见什么样的故事

"看见分布"不是技能,是习惯。从这一课起,馆主看任何报表、任何数据、任何"平均数",脑子里都该飘过这张图——「它有没有右尾?有没有双峰?有没有孤峰?」

下一课预告

第二课我们将回答一个更具体的问题——

大数定律是什么?为什么抛 1000 次硬币出 500 次正面的概率最大,但不是"必然"?

这一课我们不用公式——用 R 真抛 1000 次,画出每次正面数目的分布,看它为什么"鼓在 500 那里"。

教科书准备:馆主 Calibre 库里 442《深入浅出统计学》第 5 章「随机变量和分布」。

如有疑问,随时问祭酒——老夫在国子监等你。