MATH/STAT 415 · Midterm 冲刺 · 第 3 课

Fisher 信息与 CRLBFisher Information, Cramér–Rao, Delta Method

上一课末尾你拖动 时看到似然曲线变尖了。这一课把"有多尖"变成一个数:Fisher information 。它一口气回答三件事——估计量的方差最小能到多少(CRLB)、MLE 的抽样分布长什么样(渐近正态)、怎么给任意函数 造置信区间(Delta method)。这一课是 HW2 的主战场,也是明天所有近似 CI 的引擎。

✓ 01 抽样分布 ✓ 02 点估计 ▶ 03 Fisher/CRLB 04 CI 05 Bayes 06 检验
Zhewei Zhang · Summer 2026 Notes 2 p.6–14 · Hogg 10e Ch.6 含作业难度实战
Final 2026:低成本保险,教授未明确确认只掌握 score、、CRLB 与 MLE 渐近正态;最多投入 20 分钟。Cheatsheet 在 Page 1 左栏 MLE 蓝条底部。
向下滚动开始
01

直觉:尖 = 信息多 / Curvature is information

先建直觉,再给公式。这一节只有一个念头,但它是整课的种子。

核心直觉 · The one idea 看 log-likelihood 在峰顶附近的形状:
又高又尖 → 稍微偏离 ,似然就暴跌 → 数据强烈指认这个 θ → 信息多,估计精确
扁平 → 一大片 θ 的似然都差不多 → 数据说不清到底是哪个 → 信息少,估计不确定

"尖锐度"在数学上就是曲率,也就是二阶导数 的大小。峰顶处 ,它的绝对值越大越尖。Fisher information 干的事,就是把这个量取期望、变成一个只依赖 θ 和 n 的确定数字。

互动 · 曲率、Fisher 信息、抽样分布,其实是同一件事

Bernoulli 数据,观测比例固定在 0.7。上图(蓝)与它在峰顶的抛物线近似(橙虚线);下图是由此得到的 MLE 抽样分布 。拖动 n:

样本量 n =20
三个同步发生的现象: 上图曲线变尖 数值线性增大() 下图抽样分布变窄()。
还要注意橙色虚线:峰顶附近抛物线和真曲线几乎重合——log-likelihood ≈ 抛物线,等价于 likelihood ≈ 高斯。这就是"MLE 渐近正态"的来源。
02

先认识 score / The score function

Fisher 信息有两个等价公式,一个基于 score 的平方,一个基于二阶导。先把 score 讲清楚。

Definition · 讲义 p.7 印刷原文(以 Remark 形式给出)
score 函数:

关键性质:在真值 θ 处,
怎么理解"期望为零"?
MLE 就是解 。这条性质说:如果你恰好站在真值上,score 平均而言就是 0 —— 所以解这个方程去找真值是合理的。
它凭什么成立?
因为 恒成立,两边对 θ 求导得 0,交换求导与积分次序后正好是 。T/F 题可能考这个来源。
03

Fisher information:两个公式,用第二个 / Fisher information

定义有两种等价写法。考场上几乎永远用第二个(二阶导版),因为它算起来简单得多。

必背 · 本课核心


iid 时具有可加性: 
讲义 p.6–7 此处几乎整整两页留白,只印了记号与功能描述。上式是标准定义 —— 请与课堂笔记核对
为什么用第二个?
第一个要算平方的期望(通常很痛苦);第二个只要求两次导、取一次期望、加负号。而且二阶导里常常只剩下 这种简单项。
可加性怎么用?
先算单个观测(把 n 设为 1),再乘 n。很多题这样最快。注意:可加性只在 iid 下成立——第 8 节例 B 就是非同分布的情形,必须老老实实整体算。

与 θ 无关的项直接扔掉——求两次导后它们必然消失。

求二阶导

结果里通常还留着

取期望、加负号:

换成 换成 这一步是全流程唯一需要用到分布性质的地方。

04

四个必背的 Fisher 信息 / Four you must memorize

这四个直接抄进 note sheet。考场上八成会撞见其中之一,现推太慢。

分布MLECRLB
Bernoulli(θ)
Poisson(λ)
Expo rate 形(λ)
Expo 均值形(θ)
Normal(μ, σ² 已知)
推一遍 Poisson,把三步流程走实(其余三个同法)
① ℓ
② 二阶导
③ 取期望加负号
用到 ,所以
检查 正好等于 CRLB 是有效估计量
陷阱 · 两种 Exponential 的 长得一模一样 rate 形 、均值形 —— 形式相同,但 λ 和 θ 互为倒数!
所以代入具体数字时结果完全不同。动笔前先看密度写法确认参数化: 是 rate, 是均值。
05

Cramér–Rao 下界:精度的物理极限 / CRLB

必背 · 讲义 p.9(此处整页留白)
任意无偏估计量 ,



取到等号的无偏估计量称为有效估计量 (efficient estimator)
它在说什么?
不管你多聪明,只要估计量无偏,方差就不可能低于这条线。信息量 越大,这条地板越低,精度上限越高。
"无偏"这个前提不能丢
有偏估计量的方差可以低于 CRLB(极端例子: 方差为 0)。所以考题问"是否达到下界"时,必须先验证无偏
标准三连问 · 讲义 Example 7/8 与 HW 都是这个套路 给一个估计量,问三件事:
① 它无偏吗?,看是否
② 它的方差是多少?
③ 达到 CRLB 了吗?,与②比较。相等 → 有效。
这三步是固定套路,每步都有分。哪怕③算错,①②写对也拿大部分分。
06

MLE 渐近正态 → Wald 置信区间 / Asymptotic normality

这是 Fisher 信息最值钱的用途:它直接给出 MLE 的抽样分布,于是置信区间白送。

必背 · 明天所有"近似 CI"的引擎
n 大时,MLE 近似服从正态:



由此得到 Wald 型近似 置信区间:

注意分母里的帽子
真值 θ 未知,所以把 里的 θ 替换(plug-in)。写答案时这个帽子不能漏,漏了等于用了未知量。
渐近最优
MLE 的渐近方差正好等于 CRLB → 大样本下没有估计量能比 MLE 更准。这是讲义 p.10 印刷的结论。
三个常用分布的 Wald CI(直接背下来) Bernoulli / 比例:
Poisson:
Expo rate 形: 其中
都是把上面那个通式代入第 4 节的 表得到的 —— 不需要单独记,但认得出来能省时间。
07

Delta method:要的不是 θ,是 g(θ) / The Delta method

现实里你常常不关心 θ 本身,而关心它的某个函数——中位数、比值、对数。Delta method 一步把分布传过去。

必背 · HW2 第 3(d) 题的正解
, 可微且 ,则



配合 MLE():
为什么是 ?
一阶 Taylor:。这是个线性变换,而 —— 系数要平方。
考场省时技巧(HW2 原题 hint)
的 CI 时,不必从头推 的 Fisher 信息。直接用上式,最后把 θ 换成 代入方差即可。

先拿到

老流程:MLE 四步 + Fisher 三步。

写出 ,求

纯微积分。注意 里的常数(如 )要带着。

组装方差 ,再把 θ 换成

CI 就是

08

作业难度实战 / Homework-level problems

前面的例子都太软了,这一节才是真实难度。三道题分别对应 HW2 的三种题型。每道请先自己在纸上做完,再展开对答案。

例 A ★★☆ · Poisson 近似 CI(HW2 第 2 题同型)
某长篇文献共 页,记 为第 i 页某个词出现次数,。用 MLE 的渐近性质构造 λ 的近似 95% CI。答案保留为 的函数。
① MLE (第 2 课结论)
② Fisher (第 4 节表)
③ 渐近分布
④ 代 plug-in 方差里的 λ 用 替换 →
⑤ CI
,。题目说没给 ,所以停在这里就是满分答案。
例 B ★★★ · Exponential 全套 + Delta 求中位数 CI(HW2 第 3 题同型)
间歇泉相邻喷发的时间间隔 (rate 形,)。(a) 求 λ 的 MLE (b) (c) 求 λ 的近似 95% CI (d) 中位数 ,用 Delta method 求 θ 的近似 95% CI。
(a) MLE ;
验证:
(b) Fisher
这题特别干净: 里根本没有 ,取期望这步是白送的。
(c) λ 的 CI ,plug-in 后
(d) Delta  →  → 
(d) 组装方差
标准差
(d) plug-in 并写出 CI (因为 ),标准差代入 :
自检 注意 (c) 与 (d) 的相对宽度完全一样(都是 )——因为 是倒数变换,只做了尺度伸缩。考场上这种自洽检查能帮你抓错。
例 C ★★★★ · 非同分布的 Fisher 信息(HW2 第 1 题同型,最难)
独立但不同分布,其中 已知, 未知。(a) 求 θ 的 MLE 与充分统计量 (b) 求 MLE 的渐近分布 (c) 的 MLE 的近似分布。
警告 这里不能用 —— 可加性要求 iid,而这里每个 方差不同。必须整体算。
(a) ℓ

与 θ 无关,扔进常数 C。
(a) 求解
由因子分解可见充分统计量是 ,而 是它的函数
(b) 二阶导
(b) 取期望 关键一步:,于是
 ←  全部约掉了!
(b) 渐近分布
(c) Delta ,:

漂亮之处 方差 完全不含 θ!这叫方差稳定变换 (variance-stabilizing transformation) —— 取对数之后不确定性不再依赖参数本身。这类"结果异常干净"的地方常常就是出题人想让你看见的点。
从这三题提炼的通用套路 几乎所有这类大题都是同一条链:
→ 渐近 → plug-in 得 CI → 要 就再套 Delta
每个箭头都是独立给分点。把这条链默写三遍,明天遇到任何分布都能往上套。
09

随堂小测 / Quick check

Q1. 计算 Fisher 信息时,考场上最省时的公式是?
Q2. , 等于?
Q3. 关于 CRLB ,哪个说法对?
Q4. 写 Wald CI 时, 里的参数应该怎么处理?
Q5. ,。则 的近似方差是?
Q6. 独立但不同分布。能用 吗?
Q7. Expo rate 形 ,,。λ 的 95% Wald CI 的中心是?
Q8. MLE 的渐近方差 恰好等于 CRLB。这说明什么?
10

把这一课写进 note sheet / Ship it

这一节的内容是明天 note sheet 上密度最高的一块。自己敲。

score ,
 iid 时 (非 iid 不可用!)
三步: (把 ,)
四个必背:Bern  Pois  Expo(两形)  Normal(μ)
CRLB: (仅对无偏);取等 = 有效估计量
渐近:
Wald CI: (帽子别漏)
 比例  Pois  Expo-rate
Delta:
 常用:
通用链:
三连问模板:①无偏? ②=? ③ 吗(有效)?
做完这两件事再进第 4 课 1. 上面这段敲进 note-sheet.tex 的 §2 末尾。
2. 回对话交手写题。第 8 节例 B 的完整五步,必须自己动笔走一遍 —— 明天最可能出现的就是这种复合题。