这门课后面所有的东西——置信区间、假设检验、p-value——全都长在同一个根上:你算出来的那个数,本身是随机的。这一课把这个根挖出来,然后交给你三件明天考场上直接能用的工具: 的两个数字、标准化、以及 三兄弟。
先给你一张地图,后面每一课你都能在这张图上找到自己站在哪。看一遍就往下走,不用背。
那个看不见的真相,统一叫参数 (parameter),记作 。围绕它只有三个问题,这门课就是这三个问题 × 两条路线:
| 问题 | 要什么 | 频率派 Frequentist | 贝叶斯 Bayesian |
|---|---|---|---|
| ① 点估计 | θ 大概是几? | MLE、MoM | 后验均值 / MAP |
| ② 区间估计 | θ 在哪个范围? | confidence interval | credible interval |
| ③ 假设检验 | θ 等于某个值吗? | 拒绝域、p-value | Bayes factor |
如果这一课你只带走一件事,带走这一节。后面的 CI、p-value、检验全部建立在它上面。
假设真相是:PSU 学生平均身高 cm(上帝知道,你不知道)。你去抽 5 个人量:
所以 有自己的分布。这个分布有个专门的名字——
总体是 。每点一次"抽一次样",就抽 n 个人、算一个 ,往下面的直方图里丢一颗球。看这堆球最后堆成什么形状。
既然 是随机变量,它就有期望和方差。这两个数是后面每一个置信区间和每一个检验的原料。
只用到期望的线性性——"和的期望 = 期望的和",常数可以提到外面:
注意:这一步没用到独立性。期望的线性性对任何随机变量都成立,哪怕它们纠缠在一起。
方差有两个和期望不一样的地方,这正是最容易错的点:常数提出来要平方,和的方差可加需要独立。
正确是 。因为方差量纲是"平方"。这里 ,所以出来的是 。
乘上 个 的和 ,约掉一个 n,得 。中间那个" 个相加"别漏。
知道了 的中心和宽度,下一步就是把它化成标准正态——因为只有标准正态才有现成的表可查(1.96 就是从这来的)。
先补一个 MATH 414 的事实:正态随机变量的线性组合还是正态。所以在总体正态时,
再套标准化的通用公式"减去中心,除以标准差":
上一节有个致命漏洞:公式里的 是总体标准差,你根本不知道它!(你要是知道 σ,多半也知道 μ 了。)这一节就是补这个洞。
用样本方差 顶替 。注意分母是 n−1,不是 n(第 6 节讲为什么)。
原来分母 是固定的数;现在换成 ,分母自己也在抖。分子分母都在抖,整体的波动就比标准正态更大。
尾巴比正态更厚(极端值更容易出现),形状由一个参数决定:自由度 (degrees of freedom) 。
蓝线是标准正态 ,紫线是 。拖动自由度 ν,看紫线怎么慢慢贴上蓝线。
上一节留了两个坑:①为什么 分母是 n−1?②t 构造里那个 从哪来?一起填。
顺带记两个事实(考试会用):,。还有 就是 Gamma 分布的特例——χ²_k = Gamma(shape k/2, rate 1/2) = Gamma(shape k/2, scale 2)。
最后一个兄弟,用得最少,但 T/F 题会问。一分钟讲完。
它是干什么用的? 比较两组数据的方差。因为 ,两组一除,就得到 F。检验"两组方差相等吗"用的就是它。
这张表直接抄进 note sheet。红色标注的是本课程特有的记号陷阱,考场上认错参数化 = 整题归零。
| 分布 | pmf / pdf | E(X) | Var(X) |
|---|---|---|---|
| Bernoulli(θ) | |||
| Binomial(m,θ) | |||
| Poisson(λ) | |||
| Expo 均值形(θ) | |||
| Expo rate 形(λ) | |||
| Gamma(α, λ) rate | |||
| Normal(μ,σ²) | |||
| Uniform(0,θ) | |||
| Beta(α,β) | |||
| = Gamma(k/2, rate 1/2) |
看到 (θ 在分母) → 均值形,。
看到 (λ 在前面当系数) → rate 形,。
先看密度长什么样再动笔,别凭符号猜。
本课 Gamma(α,λ) 的 λ 是 rate,。
但 Gamma(shape ν/2, scale 2) 这个对应关系用的是 scale 写法。
换算:scale = 1/rate。note sheet 上两版并列写。
无限次尝试。全对了再往下走——这一课的每个点后面都会反复用到。
这一步不能跳。明天进考场的不是这个网页,是你手里那张纸。而且亲手敲一遍公式,是今晚效率最高的记忆动作。