MATH/STAT 415 · Midterm 冲刺 · 第 7 课

Bayes FactorBayesian Hypothesis Testing

上一课的频率派检验只能回答"拒绝 / 不能拒绝",而且永远无法为 提供正面证据。贝叶斯版本换了个问法:这批数据在哪个模型下更不意外? 答案是一个数——Bayes factor,它可以同时朝两个方向说话。这一课有一个绝对不能违反的操作纪律:全程禁用

✓ 01–05 ✓ 06 检验 ▶ 07 Bayes factor 08 列联表+回归
Zhewei Zhang · Summer 2026 Notes 6 p.21–25 含作业难度实战
Final 2026:核心题型,原课可作第一遍直觉真卷要求完整 Normal 流水线、乘 1 补 PDF、proper prior 与全程禁 ∝。请以 Bayes Factor 满分工坊 为最终版本;Cheatsheet 定位在 Page 1 右栏最上。
向下滚动开始
01

换个问法 / A different question

频率派(第 6 课)贝叶斯(本课)
问题H₀ 下这批数据罕见吗?哪个模型更能解释这批数据?
产物p-value + 拒绝/不拒绝Bayes factor(证据强度的连续刻度)
能支持 H₀ 吗不能 —— 只能"不拒绝" —— B > 1 就是支持 H₀ 的正面证据
对称性H₀ 与 H₁ 地位不对等两个模型平起平坐
核心直觉 · 一句话 看成两个模型 。各自问一句:"如果这个模型是真的,看到我手上这批数据的可能性有多大?"
两个可能性一相除,就是 Bayes factor。它衡量数据把天平往哪边推、推了多少。
02

定义与两种算法 / The definition

必背 · 讲义 p.21–24


分子分母各叫 marginal likelihood(边缘似然),算法取决于假设是简单还是复合:

简单假设):  直接代进 likelihood

复合假设 带先验 ):
怎么读这个数?
:数据在 下出现的可能性是 下的 5 倍 → 支持
:反过来, 倍支持
:数据没有区分力
和后验概率的关系

后验比 = BF × 先验比。等先验(各 0.5)时后验比就等于 B,此时
03

纪律:这一课禁用 ∝ / Keep every constant

讲义对这一点有明文强调。它是本课唯一的操作纪律,违反了整题归零。

为什么第 5 课能扔常数,这一课不能 第 5 课算后验时,分母 只是个归一化常数,扔掉不影响后验的形状 → 可以用
这一课要算的就是 本身 正是那个分母)。把它扔了就什么都不剩了。
所以: —— 一个都不能丢。
配套要求:先验必须是 proper 的 proper prior = 能积分成 1 的真概率分布。
第 5 课那个非信息先验 improper(积分发散)——它做后验没问题,但不能用来算 Bayes factor,因为 marginal 会含一个无法确定的任意常数,B 就没有意义了。
考题里给 BF 的先验一定是 proper 的(如 、Beta、Gamma)。看到 形式的先验要警觉。

写全 ,一个常数不丢

简单假设就是把 代进 likelihood,含 这类因子。

:认核积分

整理成某个已知分布的核,用第 5 课的技术直接查出积分值。

相除,看公共因子约掉多少

好消息:那些吓人的常数通常会成对出现、整片约掉。下一节的恒等式让这一步变成一行。

04

判读量表 / Interpreting B

B 的证据
1 – 30 – 2几乎不值一提 (barely worth mentioning)
3 – 202 – 6正面 (positive)
20 – 1506 – 10强 (strong)
> 150> 10非常强 (very strong)

时反过来看 ,用同一张表读"对 的证据"。
⚠️ 这张表在讲义 PDF 里是留白的(课堂手写填)。上表是 Kass–Raftery (1995) 原文口径 —— 请务必与你的课堂笔记核对一次,教授可能用了不同的分档。

答题模板 · 三句话 ① 算出 ;② 对照量表说出强度;③ 翻回业务语言
例:",落在 1–3 区间,属于 barely worth mentioning —— 数据略微偏向 ,但证据非常弱,不足以下结论。"
05

两个让计算塌缩成一行的恒等式 / Two identities

这两条是 Normal 型 BF 题的全部技术含量。背下来,考场上省十分钟。

恒等式 ① · 平方和分解(第 1 课见过,这里是主力)
它的作用
把 likelihood 里唯一含 μ 的部分压缩成 的一项。前一项 与 μ 无关,会在分子分母里完整约掉
怎么记
"到 μ 的总平方距离 = 到样本均值的距离 + 样本均值到 μ 的距离(×n)"。这就是为什么 是最小二乘点。
恒等式 ② · Normal 边缘化(考题通常直接给作 hint)
,则边缘地

直觉
两层不确定性叠加:数据噪声 加上对 μ 本身的不确定 方差相加,中心还是先验中心。
它把积分变成了查密度
这个积分,直接等于" 在这个边缘正态下的密度"(乘一个与模型无关的公共因子)。
合起来的威力 · 一个可以直接背的结论 vs (σ 已知),所有公共常数约掉后:



展开成可直接代数的形式:
06

Normal 流水线:完整推一遍 / The full derivation

上一节那个结论不是天上掉的。推一遍,你就再也不会在考场上卡住。

从零推到那个 B 的公式(六步)
设定 ,σ 已知。(简单);(复合)。
① 写全 likelihood  常数一个不丢
② 用恒等式①拆开
③ 把右边那块认成密度
,则 C 与 μ 无关。
④ 分子(M₀,简单)
⑤ 分母(M₁,复合)
恒等式②,这个积分正是 的边缘密度:
⑥ 相除 C 完整约掉(这就是为什么第 ①②③ 步那些吓人的常数最后不用真的算):
 ∎
关键领悟 常数最终约掉,但你必须一路带着它们 —— 如果中途用了 ,分子分母各扔掉的东西不一定相同,比值就错了。这就是"禁用 ∝"的真正原因。
互动 · 看 B 怎么随数据与先验变化

vs 已知。蓝= 的分布,紫= 下的(更宽),绿线是你观测到的 。B = 两条曲线在绿线处的高度之比

观测 x̄ =52.0
样本量 n =8
先验 τ =4.0
三个观察: 正好落在 50 时 B 最大(数据完美符合 )。 拉远,B 迅速掉到 1 以下 → 转为支持 把 τ 拉大(先验越松散),即使 离 50 不近,B 也会回升 —— 因为过于松散的 把概率摊得太薄,反而解释不好数据。这叫 Occam 剃刀效应,是 BF 相比 p-value 的一个特点。
07

作业难度实战 / Homework-level problems

例 A ★★★ · Normal 均值的 Bayes factor(全流程代数)
某仪器读数 已知。取 次读数得 。检验 vs 下取先验 。求 Bayes factor 并解读。
① 两个方差   
② 套公式
③ 代数

指数
④ 结果
⑤ 解读 落在 1–3 区间 → barely worth mentioning
"数据略微偏向 ),但证据极弱,不足以下任何结论。"
⑥ 顺带:后验概率 若两模型先验等可能(各 0.5):
 —— 从 50% 只挪到 55%,数据几乎没提供信息
对照频率派 ,双侧 → 也不能拒绝。两种方法结论一致,但 BF 还告诉你"证据弱到什么程度"。
例 B ★★★★ · Beta–Bernoulli 的 BF(简单 vs 复合,一个漂亮的恒等式)
抛一枚硬币 次得 次正面。
(公平) vs (完全不知道)。求
① 分子(简单假设) 直接代:

注意 必须保留 —— 这一课禁用 ∝。
② 分母(复合,认核积分) ,密度为 1:

认出 Beta 核):
② 续
③ 一个值得记住的恒等式 结果恰是 ,而且与 y 无关!

直觉:均匀先验下,"n 次里恰好 y 次成功"这 种结果等可能。考场上认出这一点能秒杀分母。
④ 相除
⑤ 解读 → 支持 。取倒数 ,落在 1–3 区间 → 对 的证据仍然很弱
"10 次里 8 次正面,看起来偏斜,但还不足以认定这枚硬币不公平。"
这个结论很反直觉但很重要:8/10 的偏斜在 BF 眼里几乎不算证据。样本量太小。
08

随堂小测 / Quick check

Q1. Bayes factor 的定义是?
Q2. 算 Bayes factor 时为什么不能 扔常数?
Q3. 。正确解读是?
Q4. 的边缘分布是?
Q5. 为什么 BF 不能用 improper prior(如 )?
Q6. 两模型先验等可能,。则 是?
Q7. 等于?
Q8. BF 相比频率派 p-value 的一个本质优势是?
09

把这一课写进 note sheet / Ship it

敲进 note-sheet.tex§8 Bayes factor

 简单:  复合:
禁用 ,一个常数不丢;先验必须 proper
后验比 = BF × 先验比;等先验时
恒等式①
恒等式②
Normal BF 成品 :
 
Beta 核
 均匀先验恒等式: (与 y 无关)
量表(Kass–Raftery,核对课堂笔记): 1–3 几乎不值一提 · 3–20 正面 · 20–150 强 · >150 非常强
  读对 的证据
⏰ 时间提醒 这是倒数第二课。下一课(列联表 + 回归)学完后就要立刻转入 note sheet 定稿与打印,不要再开新内容。