MATH/STAT 415 · Midterm 冲刺 · 第 6 课

假设检验Hypothesis Testing

前两课在问"θ 大概是多少"。这一课改问一个是非题:"θ 等于某个特定值吗?"。好消息是——它是全课程最模板化的部分:一个四步程序套所有题型。坏消息是,那些让人栽跟头的地方(拒绝域朝哪边、p-value 要不要乘 2、"接受"还是"不能拒绝")全是细节。这一课把模板和细节一次讲全。

✓ 01 抽样分布 ✓ 02 点估计 ✓ 03 Fisher ✓ 04 CI ✓ 05 Bayes ▶ 06 检验
Zhewei Zhang · Summer 2026 Notes 5 · Hogg 10e Ch.8 含作业难度实战
向下滚动开始
01

先建直觉:这是一场法庭审判 / The courtroom

整套逻辑照搬"无罪推定"。把这个比喻吃透,后面所有不对称的地方都变得理所当然。

法庭假设检验
被告无罪(默认立场) 零假设 null hypothesis —— 默认成立,除非证据够强
检方指控 备择假设 alternative —— 你想证明的东西
证据检验统计量 test statistic
"排除合理怀疑"的门槛显著性水平 (通常 0.05)
判决"有罪"拒绝
判决"无罪"= 证据不足,不是清白不能拒绝 —— 绝不能说"接受 "或"证明了 "
最容易被扣分的措辞 · 现在就改过来 ❌ "接受 " / "证明了 " / "两组相同"
✓ "不能拒绝 " / "没有足够证据说明 "
原因:证据不足只说明你没抓到差异,不等于差异不存在(也许是样本量太小)。阅卷时这是明确的扣分点。
术语 · 四个必须分清
simple 简单假设:完全确定分布,如
composite 复合假设:含一片取值,如

one-sided 单侧:
two-sided 双侧:
怎么定 ?
你想证明的那件事放 。因为整套程序是"给 举证", 只是等着被推翻的默认值。
等号永远在 一边
;不含等号。因为要在 下算概率,必须有个确定的值可代。
02

四步程序:套所有题 / The four-step recipe

和第 2 课的 MLE 四步一样,这是一条给分流水线。每步独立给分,写全比算对更重要。

写出

参数表述(不是用 )。等号在 。想证明的放

选检验统计量,写出它在 下的分布

σ 已知 → ;σ 未知 → 注意分子用的是 (H₀ 里那个值)。

定拒绝域(或直接算 p-value)

方向跟着 (下一节详讲)。查临界值。

下结论,并翻译回题目语境

"在 下拒绝 ,有证据表明平均寿命超过 40 小时。"——必须写回业务语言,只写"拒绝 H₀"会丢分。

检验统计量的通用形状
和置信区间是同一套零件(估计、H₀ 值、SE),只是重新组装了一下。这就是第 6 节"对偶"的来源。
03

拒绝域朝哪边 / Which tail?

这是四步里唯一需要动脑的地方,也是最常错的地方。一句口诀:箭头指向哪,拒绝域就在哪。

拒绝域临界值p-value
(右)
(左)
(双)
陷阱一:单侧用了
✗ 单侧查 1.96

单侧只有一个尾巴,α 全放那边 → 查 。用 1.96 会让检验过于保守。和第 4 课单侧 CI 是同一个道理。

陷阱二:双侧 p-value 忘了乘 2

双侧的"更极端"包含两个方向,所以要 ×2。忘乘会让 p 偏小,可能导致本不该拒绝的结论变成拒绝。

怎么快速自检方向对不对 问自己:什么样的数据最支持 ?
很大时最支持 → 所以 大(即 Z 大)才拒绝 → 右尾
这个自检 5 秒钟,能避免整题归零。
04

两类错误:α 和 β 此消彼长 / Type I and II errors

真相: 为真真相: 为真
不拒绝 ✓ 正确(Type II 错误(概率
漏报:真有差异却没抓到
拒绝 Type I 错误(概率
误报:冤枉了好人
✓ 正确(power
必背 · 三个定义
 你自己设定的,通常 0.05

 要在某个具体的 下才能算

power(功效)
为什么 β 需要指定 ?
复合假设,里面有无穷多个 μ。真值离 越远越容易抓到,所以 β 是 μ 的函数。
三个提高 power 的办法
① 增大 n(最有效) ② 放宽 α ③ 真实差异更大(不由你控制)。
α 和 β 此消彼长:α 调小,拒绝更难,β 必然变大。
互动 · 亲眼看 α 与 β 的拉锯

蓝曲线 = 下的分布(中心 ),紫曲线 = 在 下的分布(中心 )。竖线是临界值,右侧为拒绝域。

显著性 α =0.05
真实均值 μ₁ =106
样本量 n =16
三个实验: 把 α 从 0.05 调到 0.01 —— 临界线右移,红区(α)缩小橙区(β)变大,这就是"此消彼长" 拉远 —— 两条曲线分开,power 暴涨(差异越大越好抓)。 增大 n —— 两条曲线同时变窄,α 不变而 power 上升,这是唯一能同时改善两者的手段
05

p-value:另一条等价的路 / The p-value

必背 · 定义要能一字不差地写出来
p-value = 假定 为真时,观测到与实际数据同样极端或更极端的检验统计量的概率。

判定规则:  落入拒绝域 拒绝
"更极端"由 定义
右侧检验 →
左侧检验 →
双侧检验 →
⚠️ p-value 不是什么
不是" 为真的概率";不是"结论出错的概率";不是效应大小。
它是"在 H₀ 世界里,看到这么极端的数据有多罕见"。T/F 常考。
为什么大家更爱报 p-value 临界值法只给"拒绝/不拒绝"这一个比特;p-value 给出证据的强度
都"拒绝",但后者的证据强得多。报了 p-value,读者可以用自己的 α 判断。
06

与置信区间的对偶 / Duality with CI

第 4 课埋的伏笔现在收回来。这一节能帮你省下大量考场时间:算过 CI 就等于做完了检验。

必背 · 对偶定理
双侧 CI 与水平 双侧检验等价:

不能拒绝
拒绝
为什么成立?
两者用的是同一个不等式,只是解出来的对象不同:
CI 解 θ:
检验固定 :同一式子。
单侧要配单侧
双侧 CI 只对偶双侧检验。单侧检验要配单侧 CI(用 )。别拿双侧 CI 去回答单侧问题。
考场用法 · 一分钟拿分 题目先让你算 95% CI,后一问再问"能否在 下拒绝 " —— 直接看 100 在不在区间里,不用重算
第 4 课例 C 的 (b) 就是这么做的。这是出题人最爱的组合题型。
07

power 的计算模板 / Computing power

"求在 处的 power"是标准计算题。两步,机械。

下,把拒绝域翻译成对 的条件

例:右侧检验 c 是一个具体的数。

下算这件事的概率

此时 ,于是

头号错误:两步用了同一个中心 第 ① 步的标准化用 (因为在 下定临界值);
第 ② 步的标准化用 (因为要在真实分布下算概率)。
两步的中心不同 —— 这是 power 计算唯一的难点,想清楚就没别的了。
08

Neyman–Pearson 与似然比检验 / NP lemma & LRT

这一节是理论层,考的概率低于前面,但T/F 和概念题会问。理解到"它在说什么"即可。

Neyman–Pearson 引理(简单 vs 简单)
检验 vs (都是简单假设)时,
在所有水平为 的检验中,似然比检验 power 最大:

拒绝 当  (k 由 定)
怎么用
写出似然比 → 化简成关于 (或 )的单调不等式 → 得到熟悉形式的拒绝域 → 用 α 定临界值。
UMP 的存在性(会考)
单侧检验:UMP(一致最优)检验通常存在
双侧检验:UMP 一般不存在 —— 因为让左边 power 最大和让右边最大是冲突的。
广义似然比检验 GLRT(复合假设,讲义 p.16-19 印刷原式)


很小 → 解释得远不如全模型 → 拒绝

大样本近似: 
= 自由参数个数之差

记住 (分子是在更小的集合上取最大)和" 渐近卡方"这两点就够。下一课的列联表 检验思想上正是它的一个特例。

09

作业难度实战 / Homework-level problems

先自己做,再展开。例 C 的 power 计算是最容易在细节上翻车的题型。

例 A ★★☆ · 单样本 t 检验(σ 未知)完整四步
厂商声称某零件平均抗压强度为 500 MPa。质检抽 件,得 ,。在 下,能否认为实际强度低于标称值?
单侧临界值
① 假设 "低于"是要证明的 → 放 :
 vs 左侧检验)
② 统计量 σ 未知、小样本 → t 检验,:
③ 拒绝域与计算 左侧 → 拒绝当

✓ 落入拒绝域
④ 结论拒绝 有证据表明该零件的平均抗压强度低于标称的 500 MPa。
注意最后这句业务语言 —— 只写"拒绝 H₀"会丢分。
附:p-value ,同样结论 ✓(左侧检验不乘 2
例 B ★★★ · 比例检验 + 双侧 p-value
某系统历史故障率为 12%。改造后抽查 次运行,出现 次故障。在 下,故障率是否发生了变化?
"是否变化"= 双侧。;
① 假设  vs 双侧
② 统计量 大样本比例检验。注意标准误用 而不是 (因为要在 下算):
③ 计算

③ 判定 双侧:不落入拒绝域
p-value ✓ 一致
④ 结论 不能拒绝 没有足够证据表明改造后故障率发生了变化(尽管样本比例从 12% 降到 9%)。
⚠️ 若忘记乘 2,会得 p=0.032 < 0.05 从而错误地拒绝 —— 这就是双侧忘乘 2 的代价。
例 C ★★★★ · power 计算 + 反解样本量
, 已知。检验 vs ,取 ,
(a) 写出拒绝域(对 )。(b) 求在真值 处的 power。(c) 若要在 处达到 power ≥ 0.90,至少需要多大的 n?
,;
(a) 右侧检验,在 ,:
拒绝当
(b) 换中心 现在假定真值是 ,此时 :

注意标准化用的是 107 不是 100 —— 这是本题唯一的坎。β = 1 − 0.754 = 0.246。
(c) 反解 n 要求 power ≥ 0.90,即 。通用公式:

代入 ,,,:

向上取整:
自检 时 power 0.754,要提到 0.90 需要 —— 样本量增加但 power 提升递减,符合直觉 ✓
10

随堂小测 / Quick check

Q1. 检验结果 p = 0.21,。正确的结论表述是?
Q2. 。p-value 是?
Q3. 单侧右检验,临界值应查?
Q4. μ 的 95% CI 为 (48.2, 55.9)。在 下检验 vs ,结论?
Q5. 其他条件不变,把 α 从 0.05 降到 0.01,会怎样?
Q6. 算 power 时,第二步标准化应该用哪个中心?
Q7. 关于 p-value,哪个说法?
Q8. 关于 UMP(一致最优功效)检验,哪个说法对?
11

把这一课写进 note sheet / Ship it

敲进 note-sheet.tex§7 假设检验

四步: ①写 (等号在 ,想证的放 ) ②统计量+下分布 ③拒绝域/p ④结论翻回业务语言
统计量通式:  σ已知  σ未知
方向: 右尾   左尾   双侧
p-value: 右  左  双 拒绝
比例检验: (SE 用 不是 )
两类错误:   power
 α↓ ⟹ β↑(此消彼长);n↑ ⟹ α不变而 power↑(唯一双赢)
power 模板: ①下定 换中心到 :
 样本量: ,向上取整
duality: 双侧CI 不拒绝 (单侧配单侧)
NP(简单vs简单): power 最大;单侧常有 UMP,双侧一般无
GLRT: 自由参数个数之差
措辞: 写"不能拒绝",绝不写"接受/证明相同"
做完这两件事再进第 7 课 1. 敲进 §7,重新 xelatex 编译。
2. 例 C 的三问必须自己动笔 —— power 计算"两步换中心"是最容易错的地方,看懂不等于会做。