MATH/STAT 415 · Midterm 冲刺 · 第 5 课

Bayes 估计Bayesian Estimation

前四课里 一直是个固定但未知的常数。现在把这个假设推翻: 本身是随机变量,它有分布。整套推断随之改写——不再是"造区间盖住 θ",而是算出 θ 的完整分布,想要什么都从里面取。这一课的核心技术叫认核积分法,它是本课程 Bayes 计算的通用钥匙,也是 HW2 最难那题的解法本体。

✓ 01 抽样分布 ✓ 02 点估计 ✓ 03 Fisher ✓ 04 CI ▶ 05 Bayes 06 检验
Zhewei Zhang · Summer 2026 Notes 2-3 p.15–19 · Notes 4 p.8–11 含作业难度实战
Final 2026:核心地基,但目标从“估计”切到“模型证据”本课重点只看 posterior ∝ likelihood × prior、共轭更新与 credible interval 措辞;随后进入 Bayes Factor 满分工坊。Cheatsheet:Page 1 左栏底部「② Bayesian」。
向下滚动开始
01

把 θ 当成随机变量 / A different worldview

频率派 Frequentist(前四课)贝叶斯 Bayesian(本课)
θ 是什么固定的未知常数随机变量,有分布
谁随机数据随机 → 估计量随机数据一旦观测就固定;θ 随机
推断产物一个点估计 + 一个区间一整个后验分布
区间含义95% 的区间盖住 θθ 有 95% 概率落在区间内
先验知识无处安放用 prior 显式写进去
三个术语,一次记清 prior 先验 :看数据之前你对 θ 的信念。
likelihood 似然 :第 2 课那个老朋友,数据带来的证据。
posterior 后验 :看完数据之后更新的信念。这是贝叶斯推断的全部产物——点估计、区间、检验统统从它里面取。
02

后验公式与那个可以扔掉的分母 / The posterior

必背 · 讲义 p.15–16 印刷原文


实用形式(考场上几乎只用这个):
分母为什么能扔?
不含 θ —— 对后验(θ 的函数)来说它只是个归一化常数。先算出正比部分,最后再让它积分为 1 即可。
⚠️ 一个致命例外
Bayes factor(第 7 课)时,绝对不能用 —— 那时要的恰恰就是 这个分母本身,所有常数都必须保留。讲义对此有明文强调。

写 likelihood × prior,只保留含 θ 的部分

不含 θ 的因子(如 )统统丢进

把 θ 的幂次/指数合并整理

目标是让式子长得像某个已知分布的密度

认出这个"核"是谁,直接写出后验

认出来了就不用积分——归一化常数由那个分布自动补上。这就是下一节的技术。

03

认核积分法:本课最值钱的技术 / Kernel recognition

HW2 的 hint 里老师专门点名了这个技巧。掌握它,Bayes 题就从"积不出来"变成"看一眼就写答案"。

核心思想 · 一句话 任何 PDF 在其定义域上积分等于 1。所以只要你能认出被积函数是某个已知分布密度的"核"(essential part),那个积分的值就等于该分布归一化常数的倒数——完全不用真的去积。
三个必须认得的核(考场直接查)
Gamma 核): 

Beta 核): 
整数时

Inverse-Gamma 核): 
时用这个 —— HW2 第 4 题的关键
怎么用 · 一个 30 秒的演示

。别急着分部积分。

① 对照 Gamma 核 : , 
② 直接套:

整个过程没有做任何积分,只是模式识别 + 查一个公式。这就是"认核"。考场上遇到 marginal 一律先试这一招。

04

共轭三件套 / The three conjugate pairs

conjugate prior(共轭先验):先验和后验属于同一个分布族,于是更新规则退化成"改改参数"。这三对必须背到条件反射。

必背 · 三条更新规则
① Beta–Bernoulli/Binomial 次成功, 次试验)

陷阱:参数里没有 −1!那个 −1 只在密度的指数上

② Gamma–Poisson(Gamma 用 rate 参数化)

shape 加总和,rate 加样本量

③ Normal–Normal 已知,先验
③ 的记法:用"精度"想
定义精度 = 1/方差。则:
后验精度 = 先验精度 + 数据精度
后验均值 = 两个均值按精度加权平均
比死记公式可靠得多。
为什么共轭这么受欢迎
因为省掉了积分。非共轭情形后验通常没有闭式解,只能数值算 —— 所以考试基本只考这三对。
推一遍 ① Beta–Bernoulli(理解了另外两个同法)
likelihood ,
prior
相乘
认核 这正是 Beta 的核 → 直接写出后验,归一化常数不用管。∎
看清那个 −1 在哪 指数是 ,所以参数。把参数写成 是把指数当成了参数 —— 这就是练习卷 T/F 那个陷阱。
05

从后验里取一个点估计 / Point estimates from the posterior

后验是一整个分布,但题目常要一个数。三种取法,各有各的名字。

必背 · 三选一
posterior mean  最常用;是平方损失下的最优估计

posterior median:后验的 50% 分位数 绝对值损失下最优

posterior mode = MAP(maximum a posteriori):让 最大的那个 θ
MAP 与 MLE 的关系
MAP 最大化 ,MLE 只最大化 likelihood。先验取均匀分布时,MAP = MLE —— 这是常考的 T/F。
算 posterior mean 的捷径
认出后验是哪个分布后,直接查那个分布的期望公式,不要积分。
Beta;Gamma
互动 · 先验 + 数据 → 后验

Beta–Bernoulli。灰虚线=先验,蓝=后验,绿线是后验均值,橙线是 MLE()。拖动看三者怎么互动:

prior α =2
prior β =3
试验数 n =10
成功数 y =7
三个关键观察: 时后验 = 先验(没数据就没更新)。 n 变大时后验越来越窄,而且中心向橙线(MLE)靠拢 —— 数据多到一定程度,先验说什么都不重要了。 后验均值永远夹在先验均值和 MLE 之间,这就是下一节的 shrinkage。
06

Shrinkage:后验均值是个加权平均 / Shrinkage

Normal–Normal 的 shrinkage 形式(讲义 Example 19)
后验均值可以写成先验均值与样本均值的加权平均:


讲义 Example 19 给的是 的版本 ;一般 n 把 换成 【与课堂笔记核对】
B 在说什么?
B 是被拉回先验的比例
数据少或噪声大( 大)→ B 大 → 更信先验。
先验很松( 大)→ B 小 → 更信数据。
两个极端(能考)
:,后验均值 → ,贝叶斯与频率派殊途同归
(先验极其确定):,数据被无视。
07

Credible interval:终于可以说"概率"了 / Credible intervals

必背 · 构造方法极其简单
credible interval(可信区间):

直接取后验分布的 分位数

即找 使
与 CI 的根本差别 · 这是必考的概念题 Confidence interval(频率派):"重复抽样,95% 的区间会盖住 θ。" 不能说 θ 有 95% 概率在里面(θ 是常数)。

Credible interval(贝叶斯):"给定这批数据,θ 有 95% 的概率落在这个区间里。" 这句话在贝叶斯框架下是合法的——因为 θ 本来就是随机变量。

换句话说:那个大家都想说但在频率派里不能说的话,在贝叶斯里可以说。考试问"两者区别"时,这就是标准答案。
08

作业难度实战 / Homework-level problems

例 C 是 HW2 第 4 题同型,也是本课程 Bayes 部分最难的题型。先自己做再展开。

例 A ★★☆ · Beta–Bernoulli 全套
某新药有效率 θ。先验 。对 名患者试验, 人有效。求 (a) 后验分布 (b) 后验均值与 MAP (c) 与 MLE 比较。
(a) 套更新规则:
(b) 后验均值 Beta 的期望 : 
(b) MAP Beta 的众数 ): 
(c) MLE
后验均值 0.64 被先验拉低了 —— 因为 Beta(2,3) 的先验均值是 ,低于数据。0.64 夹在 0.4 和 0.70 之间 ✓ 这正是 shrinkage。
例 B ★★★ · Gamma–Poisson + credible interval
某服务器每分钟请求数 。先验 rate 参数化)。观测 分钟,总请求 。求 (a) 后验 (b) 后验均值 (c) 95% credible interval 的表达式。
(a) 认核推一遍
这是 Gamma 核 →
(b) Gamma(shape , rate ) 期望 : 
对比 MLE ,先验均值 。3.7 夹在中间 ✓
(c) 取 Gamma(37,10) 的 2.5% 与 97.5% 分位数:

考场上如果不给 Gamma 分位数表,写到这一步就是满分答案 —— 写出"取后验的哪两个分位数"本身就是得分点
例 C ★★★★★ · 非信息先验,积掉 σ²,得 t 分布(HW2 第 4 题同型)
,两个参数都未知。取非信息联合先验 。求 μ 的边缘后验 ,并给出 μ 的 95% credible interval。
① 联合后验

⚠️ HW 的 Hint 2 特别警告:此刻先别 拆开,先积
② 认核积 ,对照 Inverse-Gamma 核 :

于是
③ 现在才拆平方和(HW Hint 3):

代回,把不含 μ 的 吸收进 :
④ 认出是谁 对照 scaled-shifted t 的形式 :
指数 ; 中心
分母
⑤ credible interval:

(t 对称),所以也可写成
⑥ 最精彩的一步:和频率派比 第 4 课的 t 区间是 —— 两者数值上完全相同!
解释完全不同:频率派说"95% 的区间盖住 μ";贝叶斯说"μ 有 95% 概率在此区间内"。
这是本题真正的考点:同一个区间,两种世界观。非信息先验下贝叶斯"复现"了频率派的答案,但赋予了它一个更符合直觉的解释。
09

随堂小测 / Quick check

Q1. 先验 Beta(2,5),观测 12 次试验 8 次成功。后验是?
Q2. 等于?
Q3. 关于 credible interval 与 confidence interval,哪个说法对?
Q4. 什么时候 MAP 恰好等于 MLE?
Q5. Gamma(α,β) 先验 + Poisson 数据(n 个观测,和为 )。后验是?
Q6. shrinkage 系数 。当 时后验均值趋向?
Q7. 算后验时可以扔掉不含 θ 的常数(用 )。哪种情况绝对不能这么做?
Q8. 非信息先验 下,μ 的边缘后验是?
10

把这一课写进 note sheet / Ship it

敲进 note-sheet.tex§6 Bayes 估计

后验:  marginal
认核积分(不用真积,认出核直接查):
 Gamma:
 Beta:
 Inv-Gamma:  (积 σ² 用)
共轭三件套:
 Beta+Bern → Beta 无 −1!
 Gam+Pois → Gam (rate)
 + → 精度相加: ,均值按精度加权
点估计: mean (Beta ,Gam )· median · MAP=mode
 Beta mode  均匀先验时 MAP=MLE
shrinkage:
credible interval: 取后验的 分位数
 可以说"θ 有 95% 概率在内";CI 不能这么说
非信息先验 ,区间
 (与频率派 t 区间数值相同、解释不同
做完这两件事再进第 6 课 1. 敲进 §6,重新 xelatex 编译。
2. 例 C 的第 ②③④ 步必须自己动笔推一遍 —— 认核积分是明天 Bayes 大题的唯一通路。