FINAL TRACK 0 · START HERE
你不是“智商不够”。统计课真正难的地方,是老师常常用一行符号压缩了五六句中文,却只解释那一行符号。这里先把最常见的词全部拆开。你读完后,不要求会做题,只要求看到公式时知道它正在问什么。
先翻译,再计算。不会翻译的公式,不值得死背。
01 · FIVE PEOPLE IN THE STORY
全校真实平均睡眠时间存在,但你不可能问完每个人。于是你随机找 10 个人,得到 10 个数字。接下来统计学做的全部事情,都是用看得到的 10 个数字,推测看不到的全校真相。
还没抽样时写 。抽完得到 6、8、7 小时,写 。规则 是 estimator;这次算出的 7 小时是 estimate。
“全校学生真实平均睡眠时间”属于哪一类?
02 · WHAT A MODEL DOES
若 ,机器是公平硬币;若 ,它很爱出正面。Bernoulli 模型 不是说结果一定等于 p,而是说每次 只取 0 或 1,取 1 的概率是 p。
为什么这个短公式同时容纳正反两种情况?当 ,它变成 ;当 ,它变成 。指数 0 相当于把不需要的那项关掉。
“把每一项加起来”。 就是所有观察总和。
“把每一项乘起来”。独立数据的联合概率常用乘积。
把乘法变加法,而且不改变谁最大,所以 MLE 很喜欢它。
03 · PROBABILITY VS LIKELIHOOD
参数已知:如果 p=0.7,未来看到 HHT 的可能性是多少?
数据已知:我们已经看到 HHT,p=0.2、0.5、0.8,哪个更能解释它?
观察到 HHT,也就是两次正面、一次反面。Likelihood 是 。
MLE 最后给 ,不是因为背过答案,而是“观测比例最能复现观测数据”。
数据 HHT 已经发生,不再随机变化。
把 p 当成旋钮,从 0 到 1 试不同设定。
每个 p 都会给 HHT 一个可能性 。
让这个可能性最大的 p,就是 MLE。
04 · EXPECTATION
90 只老鼠各选三扇门。H₀ 说三扇门没有偏好,每扇概率都是 1/3。那么每扇的 expected count 是 。
这不是说三扇门一定恰好各 30 只,而是说 30、30、30 是 H₀ 的中心预测。观察到 29、31、30 很普通;观察到 80、5、5 就很难用 H₀ 解释。
χ² statistic 比较的是“实际看到的 O”与“H₀ 预测的 E”。分母用 E,因为我们需要用 H₀ 自己的尺度衡量偏差。
05 · HYPOTHESIS TESTING
H₀ 像暂时的无罪假设。我们问:如果 H₀ 真的成立,眼前证据会不会离谱到很难出现?若非常离谱,就拒绝 H₀;若不够离谱,只能说证据不足,不能宣布 H₀ 已被证明。
有人声称一枚硬币公平。只抛 3 次看到 HHH,并不足以确定它有问题;抛 100 次看到 99 次正面就很可疑。p-value 衡量的是:假设硬币真的公平,出现当前结果或更极端结果的概率。
p-value 很大时,正确结论是什么?
06 · COVARIANCE & LINEAR COMBINATIONS
气温越高,冰淇淋销量通常越高,所以 covariance 为正。气温越高,暖气用量通常越低,所以 covariance 为负。
回归里 与 的 covariance 为 0,意思是“整组 Y 一起抬高”会改变平均高度,却不会改变斜率。斜率只关心左右两边的相对差。
叫 linear combination。普通平均的权重全是 ;回归斜率也能写成加权和,只是左侧 x 的权重为负、右侧为正。
若 x 只有 0、1、2 三个位置,中心在 1。中间点对斜率没有左右信息,所以权重是 0;两端一负一正。斜率本质上在比较“右端 Y − 左端 Y”。
07 · FOUR QUESTIONS TO CARRY FORWARD
| 下一课 | 真正的问题 | 你已经会的地基 |
|---|---|---|
| MLE | 哪个参数最能解释数据? | 模型机器、likelihood 旋钮 |
| χ² | 观察计数离 H₀ 的期望有多远? | expected count、检验语言 |
| Regression | 如何证明斜率与预测的性质? | linear combination、covariance |
| Bayes Factor | 哪台模型机器更能生成数据? | 模型、likelihood 与 hypothesis |