上一课末尾你拖动 时看到似然曲线变尖了。这一课把"有多尖"变成一个数:Fisher information 。它一口气回答三件事——估计量的方差最小能到多少(CRLB)、MLE 的抽样分布长什么样(渐近正态)、怎么给任意函数 造置信区间(Delta method)。这一课是 HW2 的主战场,也是明天所有近似 CI 的引擎。
先建直觉,再给公式。这一节只有一个念头,但它是整课的种子。
"尖锐度"在数学上就是曲率,也就是二阶导数 的大小。峰顶处 ,它的绝对值越大越尖。Fisher information 干的事,就是把这个量取期望、变成一个只依赖 θ 和 n 的确定数字。
Bernoulli 数据,观测比例固定在 0.7。上图是 (蓝)与它在峰顶的抛物线近似(橙虚线);下图是由此得到的 MLE 抽样分布 。拖动 n:
Fisher 信息有两个等价公式,一个基于 score 的平方,一个基于二阶导。先把 score 讲清楚。
定义有两种等价写法。考场上几乎永远用第二个(二阶导版),因为它算起来简单得多。
与 θ 无关的项直接扔掉——求两次导后它们必然消失。
结果里通常还留着 或 。
把 换成 、 换成 。这一步是全流程唯一需要用到分布性质的地方。
这四个直接抄进 note sheet。考场上八成会撞见其中之一,现推太慢。
| 分布 | MLE | CRLB | ||
|---|---|---|---|---|
| Bernoulli(θ) | ||||
| Poisson(λ) | ||||
| Expo rate 形(λ) | ||||
| Expo 均值形(θ) | ||||
| Normal(μ, σ² 已知) |
这是 Fisher 信息最值钱的用途:它直接给出 MLE 的抽样分布,于是置信区间白送。
现实里你常常不关心 θ 本身,而关心它的某个函数——中位数、比值、对数。Delta method 一步把分布传过去。
老流程:MLE 四步 + Fisher 三步。
纯微积分。注意 里的常数(如 )要带着。
CI 就是 。
前面的例子都太软了,这一节才是真实难度。三道题分别对应 HW2 的三种题型。每道请先自己在纸上做完,再展开对答案。
这一节的内容是明天 note sheet 上密度最高的一块。自己敲。