FINAL TRACK 2 · PROFESSOR CONFIRMED
GOF 确定考,列联表按考。你不需要算出 19.36;你必须知道期望从哪里来、分母为什么是期望、df 为什么要减参数、三种抽样方案为何用同一个统计量。
χ² 只是在问:观察计数离 H₀ 预测的期望计数有多远?
01 · ONE IDEA, TWO SETTINGS
一个分类变量。问:观察到的类别频数是否符合某个理论分布?
例:三扇门是否各 1/3;事故数是否 Poisson。
两个分类变量。问:行与列是否独立,或各组条件分布是否相同?
例:病例/对照 × 是否暴露二手烟。
这一整块就是本课地图;Page 2 左下「B. GOF / 列联表」是考场作答骨架。
01.5 · A GOF EXAMPLE BEFORE THE FORMULA
你随手拿 12 颗。H₀ 说每种颜色概率都是 1/3,所以如果 H₀ 合理,中心预测就是每色 4 颗。这个 4 不是“必须看到”,只是 H₀ 给出的 expected count。
| 颜色 | Observed O | Expected E | 偏差 O−E |
|---|---|---|---|
| 红 | 6 | 4 | +2 |
| 黄 | 3 | 4 | −1 |
| 蓝 | 3 | 4 | −1 |
为什么偏差平方?正负偏差不能互相抵消;红多 2、黄少 1 都是“不符合”的证据。
为什么除以 E?同样差 2,在 expected=4 的小格很显眼;在 expected=400 的大格几乎不算什么。要用 H₀ 的规模做标准化。
为什么只看右尾?每格贡献 都非负。总和越大,整体越不像 H₀。
02 · FROM LRT TO PEARSON χ²
吃透这条链,你就不会把分母写成观察值,也不会忘记 df 的来源。
分子只允许 H₀ 的参数;分母允许完整模型。因为受限模型不能比无约束模型拟合更好,所以 。
无约束 MLE 让 fitted count 等于观察计数 ;H₀ 下 fitted count 是 。
偏离越大, 越小,所以 越大。
一阶项因总数约束相消;二阶项留下“平方偏差 / 期望”。
是 的自由参数数, 是 的自由参数数。
03 · GOODNESS-OF-FIT
| 情形 | 期望 | df | 例题 |
|---|---|---|---|
| 概率全部指定 | HW4 Q2 三扇门 | ||
| 先估 d 个参数 | HW4 Q3 Poisson |
第一个 “−1” 来自所有类别概率加总为 1;第二个 “−1” 来自用同一批数据估了 。
把小期望类别与有意义的相邻类别合并,然后用合并后的新类别数重算 df。合并不是为了改变数据,而是让 χ² 近似可靠。
一个 GOF 有 7 个合并后的类别,并估了 2 个参数。df 是?
03.5 · SAME TABLE, DIFFERENT STUDY
研究者只决定总共抓 100 人,没有预先规定男女各多少,也没有规定喝/不喝各多少。只固定总数 N,所以是 full multinomial sampling。问题是两个分类变量是否独立。
病例/对照人数是研究设计先固定的,这个边际不会随机变化。每一组内部再像一个独立的 binomial/multinomial 实验,所以叫 product multinomial。问题是两组暴露分布是否相同。
例如 10 张“治疗”标签与 10 张“对照”标签已经固定,成功/失败总数也固定,只看标签如何随机落到结果上。两个边际都固定,因此是 hypergeometric sampling。
04 · CONTINGENCY TABLES
三种方案不是看表长什么样,而是看抽样设计。统计量相同,H₀ 的语言不同。
| 固定 | Sampling | Test | H₀ |
|---|---|---|---|
| 只固定总数 N | full multinomial (FMS) | independence | |
| 固定一个边际 | product multinomial (PMS) | homogeneity | 各组条件分布相同 |
| 两个边际都固定 | hypergeometric (HS) | no association | 行列无关联 |
独立性下,落入 (i,j) 格的概率分解为行概率乘列概率。各自用边际比例估计:
期望表会自动保留原表的 row totals 与 column totals。这是最快的自检。
完整表有 rc 个概率,但总和为 1,少一个;H₀ 下只需选择行边际与列边际,各自也受总和约束。
Case-control 研究预先选定 199 名病例与 375 名对照。为什么是 PMS?
05 · FULL-CREDIT RESPONSE
考场如果卡住,直接按范例的句子结构替换研究对象。不要写“接受 H₀”。
若 p-value 大于 α,正确结论是?
06 · TARGETED DRILLS
不算 2.867。写 、、df=2、右尾拒绝规则与“是否有门偏好”的结论模板。
把 (a) 的 Poisson MLE 完整推出来;再写 与 df=k−2。标注小期望合并规则。
先判 fixed margin,再写 homogeneity 的 H₀。它与 practice exam 一字未改,是最高优先。
Q5(b) 的核心不是算数:所有计数乘 c 时,期望也乘 c,故 乘 c,但 df 不变。
07 · MASTERY GATE