FINAL TRACK 0 · START HERE

统计语言零基础预备课Before formulas, learn what every symbol is trying to say.

你不是“智商不够”。统计课真正难的地方,是老师常常用一行符号压缩了五六句中文,却只解释那一行符号。这里先把最常见的词全部拆开。你读完后,不要求会做题,只要求看到公式时知道它正在问什么

1 hourno prerequisitestiny examples
人话 → 符号

先翻译,再计算。不会翻译的公式,不值得死背。

一题统计题里,到底谁是谁

教授慢讲

想象你要知道全校学生每天睡多久

全校真实平均睡眠时间存在,但你不可能问完每个人。于是你随机找 10 个人,得到 10 个数字。接下来统计学做的全部事情,都是用看得到的 10 个数字,推测看不到的全校真相

Parameter 参数 θ
看不到的总体真相。例如全校真实平均睡眠时间。它通常固定,但我们不知道。
Random variable 随机变量 X
抽人以前,结果还没出现,所以用大写 X 表示“可能出现的数”。
Observed data 观测 x
抽完以后,纸上真的写下来的数。通常用小写 x。
Statistic 统计量 T(X)
只用样本算出来的东西,例如样本平均。它不能含未知参数。
Estimator 估计量 θ̂
拿来猜参数的随机规则,例如“永远用样本平均猜总体平均”。
Estimate 估计值
把这次真实数据代入 estimator 得到的具体结果。

还没抽样时写 。抽完得到 6、8、7 小时,写 。规则 是 estimator;这次算出的 7 小时是 estimate。

帽子 不是“真正参数变了一顶帽子”,而是“我们用数据做出的猜测”。Bar 表示平均;下标 i 只是第 i 个观察,不是乘法。

“全校学生真实平均睡眠时间”属于哪一类?

概率模型是一台“造数据机器”

给机器一个参数,它就告诉你各种数据出现的可能性。参数不同,机器的行为也不同。统计推断则反过来:我们看到机器吐出的数据,猜机器里的参数。
硬币例子

同一枚硬币,参数 p 控制正面倾向

,机器是公平硬币;若 ,它很爱出正面。Bernoulli 模型 不是说结果一定等于 p,而是说每次 只取 0 或 1,取 1 的概率是 p。

中文给定参数 p,看到一次正面的概率是 p,看到反面的概率是 1−p。
符号

为什么这个短公式同时容纳正反两种情况?当 ,它变成 ;当 ,它变成 。指数 0 相当于把不需要的那项关掉。

三种符号先学会朗读

“把每一项加起来”。 就是所有观察总和。

“把每一项乘起来”。独立数据的联合概率常用乘积。

把乘法变加法,而且不改变谁最大,所以 MLE 很喜欢它。

同一个公式,问题方向反过来

Probability 的问题

参数已知:如果 p=0.7,未来看到 HHT 的可能性是多少?

Likelihood 的问题

数据已知:我们已经看到 HHT,p=0.2、0.5、0.8,哪个更能解释它?

观察到 HHT,也就是两次正面、一次反面。Likelihood 是

  • p 很接近 0:两次正面很难解释。
  • p 很接近 1:最后那次反面又很难解释。
  • 最合理的位置会在中间,而且偏向“正面占 2/3”。

MLE 最后给 ,不是因为背过答案,而是“观测比例最能复现观测数据”。

数据 HHT 已经发生,不再随机变化。

把 p 当成旋钮,从 0 到 1 试不同设定。

每个 p 都会给 HHT 一个可能性

让这个可能性最大的 p,就是 MLE。

Likelihood 不是“p 自己的概率分布”。在频率派 MLE 里,p 是未知常数; 只用来比较不同 p 对当前数据的解释力。

Expected count 不是“我猜会发生”

Expectation 是把同一个实验重复很多很多次以后,长期平均会靠近的数。一次实验完全可以不像 expectation。

90 只老鼠各选三扇门。H₀ 说三扇门没有偏好,每扇概率都是 1/3。那么每扇的 expected count 是

这不是说三扇门一定恰好各 30 只,而是说 30、30、30 是 H₀ 的中心预测。观察到 29、31、30 很普通;观察到 80、5、5 就很难用 H₀ 解释。

中文总共有 n 次机会,每次落进第 i 类的概率是 pᵢ。
符号

χ² statistic 比较的是“实际看到的 O”与“H₀ 预测的 E”。分母用 E,因为我们需要用 H₀ 自己的尺度衡量偏差。

H₀ 是暂时采用的基准,不是真理

法庭类比

“无罪推定”不是“证明无罪”

H₀ 像暂时的无罪假设。我们问:如果 H₀ 真的成立,眼前证据会不会离谱到很难出现?若非常离谱,就拒绝 H₀;若不够离谱,只能说证据不足,不能宣布 H₀ 已被证明。

有人声称一枚硬币公平。只抛 3 次看到 HHH,并不足以确定它有问题;抛 100 次看到 99 次正面就很可疑。p-value 衡量的是:假设硬币真的公平,出现当前结果或更极端结果的概率

p-value 不是“H₀ 为真的概率”。频率派检验没有直接给假设分配概率。也不要写“接受 H₀”;写“没有足够证据拒绝 H₀”。

p-value 很大时,正确结论是什么?

回归证明到底在证明什么

Covariance 问两个随机量是否一起上下移动。正表示常一起同向,负表示常反向,零表示没有线性的共同移动。

气温越高,冰淇淋销量通常越高,所以 covariance 为正。气温越高,暖气用量通常越低,所以 covariance 为负。

回归里 的 covariance 为 0,意思是“整组 Y 一起抬高”会改变平均高度,却不会改变斜率。斜率只关心左右两边的相对差。

Linear combination 就是“加权平均的亲戚”

叫 linear combination。普通平均的权重全是 ;回归斜率也能写成加权和,只是左侧 x 的权重为负、右侧为正。

若 x 只有 0、1、2 三个位置,中心在 1。中间点对斜率没有左右信息,所以权重是 0;两端一负一正。斜率本质上在比较“右端 Y − 左端 Y”。

Covariance 为 0 一般不代表独立。只有本课程回归里,因为相关量都是同一个 joint Normal 向量的线性组合,才能把 zero covariance 升级成 independence。

以后每看到公式,先问这四句

不要急着算:
  1. 现在什么是固定的?什么是随机的?
  2. 这个式子在比较谁和谁?
  3. 每个求和、乘积、log 是从哪句话翻译来的?
  4. 最终答案要用什么中文句子解释?
下一课真正的问题你已经会的地基
MLE哪个参数最能解释数据?模型机器、likelihood 旋钮
χ²观察计数离 H₀ 的期望有多远?expected count、检验语言
Regression如何证明斜率与预测的性质?linear combination、covariance
Bayes Factor哪台模型机器更能生成数据?模型、likelihood 与 hypothesis
预备课 mastery0/4