MATH/STAT 415 · Midterm 冲刺 · 第 8 课(最后一课)

列联表 χ² 与线性回归Contingency Tables & Simple Linear Regression

最后一课,也是分值最重的一课。这两块内容有个共同点:它们几乎是纯流程题 —— 概念很浅,但公式必须记准、步骤必须走全。好消息是,只要照着程序卡走,这类题是全卷最容易拿满分的。

✓ 01–05 ✓ 06 检验 ✓ 07 BF ▶ 08 列联表+回归
Hogg 10e Ch.9 课堂补讲内容 ⚠️ 记号需核对课堂笔记
Final 2026:这两块不能再挤在一课已拆成 χ²(GOF + 列联表)回归证明 两个深度工坊。原课只作概览,不作为最后复习版本。
向下滚动开始
00

开始前必须知道的一件事 / Read this first

⚠️ 这一课有一个真实的记号陷阱,必须先讲 好消息:你的 syllabus 明文写着教材是 Hogg, Tanis & Zimmerman《Probability and Statistical Inference》10e,Chapters 6–9。所以这两块内容的记号基准是确定的:列联表在 §9.1–9.2,回归在 §6.5(另见 §9.6)。

坏消息:本地没有这两块的讲义 PDF(Notes 只到 5-6 假设检验),而 Hogg 的回归用的是"中心化参数化",和大多数教科书不同:



在 Hogg 的写法里 不是 y 轴截距,而是 ! 如果考卷问"求 的 MLE"而你答了截距,整题就错了。
所以第 5–6 节我把两种写法并排给你,两边都会。
🛡️ 一个能让记号风险归零的考场技巧(强烈建议用) 在答卷上动笔前,先写一行自己的符号定义:
Let , ; slope .
自己定义了符号,阅卷人就扣不了记号分 —— 你写的每一步都自洽。这比赌对教授用哪套记号可靠得多,而且是可以带到任何考试里的通用技能。
数值层面完全不用担心:斜率 在两种参数化下是同一个数、t 统计量也都一样。有分歧的只是"截距那个字母叫什么"。
这一课的两块内容各自独立 前半(第 1–4 节)列联表 :检验"两个分类变量有没有关系"。
后半(第 5–8 节)简单线性回归:一条直线拟合,外加检验"斜率是不是 0"。
两块之间没有依赖,可以分开学。如果时间不够,先学前半(分值通常更重)。
01

列联表:两个分类变量的交叉计数 / The table

一张 列联表就是把 N 个个体按两个分类变量交叉数一遍:

暴露 Yes暴露 No行合计
病例组 Case
对照组 Control
列合计
要检验的东西
:两个变量无关(independence)/两组的比例相同(homogeneity)
:有关/不同

数学上这两种说法导出完全相同的检验统计量,区别只在抽样是怎么设计的(下一节)。
02

三种抽样方案:一句话判据 / Which sampling scheme?

这是列联表题唯一的概念考点,通常单独占一问。判据极简单:看设计时哪些合计数被事先固定了。

事先固定了什么抽样方案检验的名字
只固定总数 Nfull multinomialindependence(独立性)
固定一个边际(如各组人数)product multinomialhomogeneity(同质性)
两个边际都固定hypergeometricFisher exact test
怎么在题干里识别 · 关键句式 "随机抽取 574 人,记录他们的患病情况与暴露情况" → 只有总数是设计好的 → full multinomial
"选取 199 名病例与 375 名对照,回顾其暴露史"(case-control 研究)→ 两组人数是研究者定的product multinomial
"茶叶实验:8 杯中恰有 4 杯先加奶,品尝者也必须挑出 4 杯" → 行列都锁死 → hypergeometric
最常考的是第二种。识别信号:题目说了"选取 n₁ 名…和 n₂ 名…",说明组的大小是设计出来的,不是随机得到的。
好消息 三种方案用的是同一个检验统计量、同一个自由度。抽样方案只影响你怎么命名这个检验(independence vs homogeneity)和怎么陈述 。计算部分完全一样。
03

期望频数与检验统计量 / Expected counts and T

必背 · 三个公式,这就是全部
① 期望频数 为真时"应该"是多少):


② 检验统计量:


③ 自由度:  表时
① 为什么是"行×列÷总"?
下两变量独立 →
乘以总数 N 得期望个数
③ 自由度怎么数出来的
个格子,减去"总和为 1"这 1 个约束、再减去估计 个行边际和 个列边际:
必记的临界值 · 表几乎必考 时临界值
拒绝 (这是右尾检验 —— 越大说明观测与期望差得越远)。
记忆锚点:。因为 就是标准正态的平方,双侧 z 检验和 df=1 的卡方检验是同一回事。
其他常用:
同族的另一个检验 · goodness-of-fit(Hogg §9.2,列联表建在它上面) 检验"数据是否服从某个指定分布"。把数据分成 个类别,同样算 区别只在自由度:

  =类别数,=为算期望频数而估计的参数个数

例:检验数据是否服从 Poisson 但 未知、要用 估 →
若分布完全指定(如"检验骰子是否均匀", 全给定)→
"每估计一个参数扣一个自由度" —— 这条规律从第 1 课的 一路贯穿到这里。 数错是这类题的头号失分点。

补全行合计、列合计、总数

先把表格边际填满。这一步错了后面全错,算完检查

逐格算

自检:期望频数的行合计列合计必须与观测的一致。这是极好的验算手段。

逐格算 再求和

表只有 4 项。注意分母是期望 E,不是观测 O。

比临界值 / 算 p-value,下结论

。结论要翻回业务语言

04

列联表实战 / Worked example

互动 · 改动任一格子,实时看 T 与结论

拖动滑块改变四个观测频数,下面自动算出期望频数、每格贡献、 与结论。试试把两组的比例调得越来越接近,看 T 怎么掉到 3.84 以下。

病例·暴露 =83
病例·未暴露 =116
对照·暴露 =90
对照·未暴露 =285
例 A ★★★ · 完整手算一遍(case-control 研究)
研究者选取 199 名病例375 名对照,回顾其某项暴露史。病例中 83 人有暴露,对照中 90 人有暴露。
(a) 这是哪种抽样方案? (b) 陈述 (c) 并在 下下结论。
(a) 病例数和对照数是研究者事先定的(选取 199 和 375)→ 固定了一个边际 → product multinomial,检验的是 homogeneity
(b) :病例组与对照组的暴露率相同,即
:两组暴露率不同。
(c) 补全表格 行合计 ;列合计
自检:
(c) 期望频数   
  
自检: ✓ 
(c) 逐格贡献



💡 表的一个特点:四个格子的 绝对值完全相同(这里都是 23.02),只是正负交替。算一个就够了,能省大量时间。
(c) 求和
(c) 结论 拒绝
有很强的证据表明病例组与对照组的暴露率不同。
p-value ,远小于 0.05。
05

换个话题:简单线性回归 / The regression model

模型 · 两种写法并排(务必都认得)
Hogg §6.5 中心化写法本课教材用这个):

 → 不是截距!是 y 的均值)  
 → y 轴截距

通用写法:
 → 

两种写法的斜率是同一个数;拟合出的直线也是同一条。区别只在"另一个参数"指什么。
为什么 Hogg 要中心化?
因为这样 不相关(协方差为 0),数学上干净得多。代价就是 失去了"截距"这个直观含义。
最小二乘 = MLE
误差正态时,最大化 likelihood 等价于最小化平方和,所以 LSE 与 MLE 给出同一组估计。这是常考的 T/F。
一句话记住这个坑 看到 一起出现 → 中心化写法 →
看到 和裸 → 通用写法 →
先看题目怎么写模型,再决定你的答案里那个字母代表什么。
06

五个必背公式 / Five formulas

回归题的全部计算都从这五个来。先记三个记号,公式就变短了。

三个记号(课程用法)

计算捷径:
必背 · 五个公式
① 斜率 

② 截距  (回归直线必过

③ 相关系数 

④ 残差平方和 

⑤ 误差方差的无偏估计 
④ 的含义: 是"解释掉的比例"
说明:总变异 里有 的份额被直线解释掉了,剩下 是残差。
(完美拟合)。
⑤ 为什么除以 ?
估计了两个参数(),扣两个自由度。
是有偏的,无偏的是 —— 和第 2 课正态那个 vs 完全同源。
07

检验斜率是不是 0 / Testing the slope

回归里最常考的推断问题:x 对 y 到底有没有线性影响?

必背 · 斜率的分布与检验
 → 标准误

检验 vs :


的 CI:  来自
还是那个通用形状
—— 和第 6 课一模一样,只是 SE 换成了 自由度是 ,不是
大是好事
:x 的取值越分散,斜率估计越精确。这是实验设计的一个直接指导。
一个漂亮的等价式(可能考证明)
命题
① 代入 MSE (用公式④)
② 代入 由公式③:
③ 组装
④ 约分 全部约掉:  ∎
意义 检验斜率为零 ⟺ 检验相关系数为零,两者是同一个 t 检验。而且只要知道 就能算 t,不需要原始数据
必记的两个 T/F 事实
回归版的 n vs n−2

有偏(低估);无偏的是
问"回归中方差的 MLE 是否无偏" →

另一个 T/F
系数的渐近正态性

正态误差下 线性组合精确正态(不只是渐近)。
问"回归系数的 MLE 是否渐近正态" →

08

回归实战 / Worked example

例 B ★★★ · 从原始数据到斜率检验(全流程)
6 个观测:
(a) (b) (c) 下检验
双侧临界值
(a) 准备量
(a) 偏差 :

(a) 结果
(b)
(b) RSS 用公式④:
交叉验证: ✓(差异是舍入)
(c) MSE 与 SE
(c) t 与结论
拒绝 有极强的证据表明 x 与 y 之间存在线性关系。
用等价式交叉验证: ✓ 与上面完全一致 —— 两条独立路径得到同一个 t,说明整套计算没错。考场上值得花 20 秒做这个验算。
考场省时技巧 如果题目直接给了 ,检验斜率不需要算 —— 直接用 一步到位。
反之如果给的是原始数据,先算三个 ,后面全是代入。
09

随堂小测 / Quick check

Q1. "研究者选取 200 名患者与 400 名健康人,回顾其吸烟史。"这是哪种抽样方案?
Q2. 列联表的 检验,自由度是?
Q3. 某格观测 ,期望 。这一格对 的贡献是?
Q4. 表,,算得 。结论?
Q5. 回归中 的公式是?
Q6. 检验 时,t 统计量的自由度是?
Q7. 回归中 。它无偏吗?
Q8. 已知 。检验 的 t 统计量是?
10

把这一课写进 note sheet / Ship it — 最后一节

敲进 §9 列联表 + 回归这是最后一节内容 —— 敲完就去编译打印。

【列联表
抽样方案:固定总数 N→full multinomial(独立性) · 固定一个边际→product multinomial(同质性) · 两边际都固定→hypergeometric
(行合计×列合计÷总数)
 分母是 E 不是 O;右尾检验
: :5.99,:7.81
技巧: 表四格的 完全相同,算一个即可
goodness-of-fit: 同一个 =估计的参数个数)
  
【简单线性回归】 LSE = MLE;两种参数化(先看题目用哪种):
 Hogg 形 (非截距!),截距
 通用形   斜率是同一个数
 考场保险:答卷开头自己写一行符号定义,阅卷扣不了记号分
  
(斜率,两种写法通用) 直线过点
 
 
检验 :
CI: 来自
T/F: 有偏(无偏 ); 正态误差下精确正态
🏁 八课全部结束 —— 现在立刻做这三件事 1. 敲完 §9,运行 xelatex note-sheet.tex,确认不超过 2 页
2. 打印出来,并把 PDF 发一份到手机(万一打印机出问题)。
3. 剩下的时间做官方 practice exam(限时 75 分钟,独立完成),做完再对答案。
不要再学新内容了。此刻起,把已学的固化下来比多学一个知识点更值钱。