FINAL TRACK 4 · LONGEST DERIVATION

Bayes Factor 满分工坊Model evidence without losing constants.

Bayes factor 不问“一个参数最可能是多少”,而问“整套模型生成这批数据的能力有多强”。Practice Q1 与 HW4 Q1 同型;真正难点只有两个:复合模型要把参数积分掉,以及全程不能写

3 hoursproper priorno ∝
P₀ / P₁

这是两个完整概率的比,不是两个“差一个常数”的 kernel。

把模型想成两台数据生成器

给两台机器同一批数据

M₀:参数被 H₀ 固定

机器只有一个设定 。模型证据就是 likelihood 在该点的高度。

M₁:参数仍有很多可能

每个参数设定按 prior 权重投票,把所有可能的 likelihood 平均起来。

BF 只负责数据带来的更新;posterior odds 还要乘 prior odds。若模型先验相等,则

CHEATSHEET · PAGE 1 · 左栏最下「② Bayesian」起点,接右栏最上「Bayes Factor」

先用后验公式回忆 prior × likelihood;随后立刻切换纪律:求 posterior 可用 ∝,求 BF 不可用。

Bayes factor 比较的不是“谁更会事后解释”

教授慢讲

把模型想成两台在看数据之前就必须下注的机器。机器 给这批数据一个预测概率,机器 也给一个。Bayes factor 只是两张下注收据相除:

公式
人话这批数据在 0 号机器下出现的可能性,是在 1 号机器下的多少倍。

极小硬币例子:观察到 HHT

硬币固定公平,。因此特定顺序 HHT 的概率为

不知道 p,在 0 到 1 之间给每个 p 同等 prior 权重。给定某个 p,HHT 的 likelihood 是 ;整台机器的证据要把所有可能 p 的表现平均:

所以 。数据对公平硬币只有很弱的优势。

为什么更灵活的 反而没赢?它确实可以事后选 来贴近两正一反,但模型证据不允许只挑它最漂亮的 p。它必须把 p 接近 0、接近 1 等预测得很差的设置也一起平均。这就是 Bayes factor 自带的“复杂度代价”。
不要把 读成“模型为真的概率”。它是“假设模型 M 后,数据有多可能”; 才是看完数据后的模型概率,还需要 model prior。

三条纪律比任何积分技巧都重要

全程禁止

丢掉的常数可能依赖模型;两个模型各丢一次,比例就被改写。

复合 H₁ 必须给 proper prior

必须积分为 1。Improper prior 的任意比例常数会污染模型证据。

无关项要“提出积分号”,不能“忽略”

它们即使与 无关,仍属于 ;很多会在最终比值中约掉,但必须先带到那里。

为什么后验推导常写 ∝,而 BF 不行?

先用 2、4、6 看懂,再背公式

三个数据的平方距离

数据为 2、4、6,样本平均 。若候选总体均值是 ,直接算总平方距离:

同一件事可以拆成两笔账:

第一笔 8 不随 改变;第二笔才衡量候选 离样本中心多远。因此积分时,第一笔可以完整提出积分号,但不能凭空删除。

一般式
人话总不合 = 样本内部本来就不整齐 + 候选中心与样本中心没对准。
“乘 1”到底在干什么?

只有钟形外观的 exponential 还不是 PDF,因为它下面的总面积不一定是 1。我们同时乘、除同一个 normalization constant:括号内补成面积为 1 的 Normal density,倒数留在括号外。就像把“没有单位刻度的钟形曲线”补成合法概率尺;外面的常数是你为换尺付出的价格,绝不能丢。

自检:如果你写到积分号时突然用了 ,立刻停笔。问自己:我刚才丢的因子在 下是否真的完全相同?在证明它会约掉以前,都保留。

Practice Q1 的完整推导路线

,已知 ,而

Step A:永远先做平方和分解

它把“样本内部散布”与“样本中心离参数多远”分开。前一项与 无关,可以完整提出积分号。

Step B:M₀ 是 simple model,直接代

Step C:M₁ 积分,先把无关项提出

Step D:最关键的“乘 1”

积分里的第一个 exponential 长得像 Normal density,但缺 normalization constant。把它补成 的完整 PDF:

方括号里才是完整 density;前面的 必须留在外面。

Step E:用 hint 认出边际分布

。Normal + Normal 卷积告诉我们

Step F:最后才约分,结果只用来自检

几何解释:约分后的 BF 是两条 Normal predictive density 在 处的高度比。H₀ 的预测更窄;数据若靠近 ,窄模型可能更高;离得远,M₁ 更能容纳。
CHEATSHEET · PAGE 1 · 右栏最上「正态流水线 (practice Q1 = HW4 Q1)」

绿色提示正好对应三步:平方和分解 → 提出无关项 → 乘 1 补 PDF → 认边际。考试不要只抄最后绿框。

先判断模型类型,再决定是否积分

Simple vs simple

两个都固定,不用积分。

Bernoulli + Uniform

复合 H₁ 用 Beta kernel。

与 y 无关。

One-sided H₁

时,prior 要截断并重新归一化。

Poisson + Gamma

Packet 6 §6.2 Q1 的复合 H₁ 用 Gamma prior。先把 likelihood 与 prior 的 powers 和 exponential rates 合并,再用 Gamma integral:

单侧最容易翻车:把原 prior 直接拿去只积一半区间,会让 不是模型下的完整概率。

先看方向,再翻回模型语言

B₀₁数据更支持写法
> 1M₀数据在 M₀ 下是 B 倍更可能
< 1M₁,数据在 M₁ 下是 倍更可能
= 1都不偏数据没有改变两模型的相对 odds

课堂量表按 note sheet:1–3 barely worth mentioning;3–20 positive;20–150 strong;>150 very strong。范围文件标注该量表需与课堂笔记核对,考试若题目给量表,以题目为准。

若 B₀₁=0.2,最准确的方向解读是?

一条主线,两个变式

HW4 · Q1 MUST DO

Normal prior 主线

第一次跟着完整答案写;第二次遮住答案,只保留平方和分解与题目 hint。禁止使用捷径 BF 公式起步。

PRACTICE · Q1 MUST DO

同型再现

题型与 HW4 Q1 相同。把数字全部换成 ,写出符号版。

PACKET 6 · §6.2 Q1

Poisson + Gamma prior

目标不是算数,而是会保留 Poisson factorial 常数、合并 Gamma kernel、用完整 Gamma integral。

PACKET 6 · EX 19–21

三种结构辨认

Ex19 Bernoulli + Uniform;Ex20 simple vs simple;Ex21 one-sided prior normalization。每题只写模型证据设定。

不看绿框,能重建整条链

本课 mastery0/5
最后定位 · PAGE 2 · 左下「C. Bayes factor」

用六个动词检查:写模型 → 写 M₀ → 分解 → 提出 → 乘 1 → 认边际 → 比值 → 业务解释。