MATH/STAT 415 · Midterm 冲刺 · 第 2 课

点估计与 MLEPoint Estimation & Maximum Likelihood

上一课我们知道了 是随机变量。这一课回答两个问题:① 怎么判断一个估计量好不好(无偏、MSE、效率)、② 拿到一个陌生分布,怎么系统地造出估计量(MoM 与 MLE)。MLE 是全场性价比最高的考点——它是一条四步流水线,而且部分分极厚:哪怕最后代数算崩,写对前两步也能拿一半分。

✓ 01 抽样分布 ▶ 02 点估计 03 Fisher/CRLB 04 CI 05 检验 06 Bayes
Zhewei Zhang · Summer 2026 Notes 2 · Hogg 10e Ch.6 零基础版
Final 2026:最高优先级,但本课原版偏“期中理解”先用这里理解 likelihood;随后必须进入 MLE 满分推导工坊,练完整六步、support 边界、多项约束与 note sheet 定位。
向下滚动开始
01

同一个 θ,可以有好几个估计量 / Why we need criteria

先建立问题意识:估计量不是唯一的。既然能造出好几个,就必须有一把尺子判断谁更好。

想估计正态总体的中心 。至少有三个看起来都合理的做法:

候选 ①  (样本均值)
候选 ②  (就用第一个观测,别的都扔掉)
候选 ③  (最小值与最大值的中点)

三个都是"合理"的估计量,而且——这点很关键——三个都是无偏的。所以光有"无偏"这一条尺子不够用,我们还需要第二条(方差 / MSE)。

Definition · 两个必须分清的词
estimator(估计量): —— 数据还没实现,它是随机变量

estimate(估计值): —— 代入观测到的具体数字,它是一个数
为什么要分清?
因为我们讨论的"无偏""方差""MSE"全都是在说estimator 这个随机变量的性质。对一个具体数字谈方差是没意义的。
考试上怎么体现?
大写 是随机变量、小写 是观测值。写答案时保持这个区分,阅卷会看。
02

第一把尺子:无偏性 / Unbiasedness

最直观的要求:平均而言不偏不倚。反复抽样无数次,这些估计值的平均应该正好落在真值上。

必背 · 讲义 p.1 印刷原文
无偏估计量 (unbiased estimator),当且仅当



偏差 (bias) 定义为 
"对一切 θ" 不能漏
不是碰巧在某一个 θ 处相等就算无偏,必须对参数空间里每一个 θ 都成立。
符号的含义
bias > 0 = 平均高估;bias < 0 = 平均低估;bias = 0 = 无偏。

上一课我们已经证过 ,所以 永远是 的无偏估计——不管总体是什么分布。这是个非常有用的既得结论。

最重要的一个"有偏"例子 · 必考 的 MLE 是 ,它是有偏的:
 → 系统性低估,
无偏的那个是
怎么一眼看出来?上一课讲过:,于是 。MLE 版分母是 n 而不是 n−1,自然偏小。
随堂检查:,。那么 是多少?
03

第二把尺子:MSE = 方差 + 偏差² / Mean squared error

无偏只管"平均对不对",不管"抖得厉害不厉害"。MSE 把两件事合成一个数——这是本课最常考的公式

必背 · 本课头号考点

讲义 p.2 此处留白(正文只印了"MSE strikes a balance between bias and variance"),此式据 HW1 第 7 题解法补齐 —— 请与你的课堂笔记核对一次
怎么用?
比较两个估计量时:无偏的比方差,有偏的比 MSE。MSE 小者胜。
一个重要推论
无偏时 bias = 0,于是 MSE = Var。所以"无偏估计量里挑方差最小的"(MVUE)其实就是挑 MSE 最小的。
分解的推导(考试可能直接让你证,三行)
技巧 在括号里加一项减一项 ,把它拆成"抖动"和"系统偏移"两块:
展开
逐项 (这就是方差的定义);常数,所以
关键 交叉项消失:
因为 B 是常数可以提出来,而
结论  ∎
为什么有时候"有偏"反而更好 · bias–variance trade-off 虽然有偏,但它的方差比 。两者的 MSE 一比,在正态总体下 MLE 版的 MSE 反而更小
这就是讲义那句 "strikes a balance" 的意思:允许一点点系统偏移,换取大幅降低抖动,总误差可以更小。
04

效率与相合性 / Efficiency & consistency

两个次要但会考的判据。效率的分子分母顺序极易记反,这一节重点就在那个顺序。

必背 · 记号方向是陷阱
相对效率 (relative efficiency)



判据(讲义 p.2 印刷原文): 更有效
怎么记住顺序?
括号里第一个,方差在分母。想让比值 > 1,就得让第一个的方差小 —— 而"方差小 = 更有效",逻辑自洽。
用一个具体例子自检
 →  更有效,效率是 的 n 倍。符合直觉 ✓
Definition · 相合性 Consistency
样本越多越准:(依概率收敛),即对任意 ,


考场上的实操判据(这才是你要用的):

bias → 0 且 Var → 0 就够了。

例: 的 bias 恒为 0、,所以 相合。(讲义 p.2 只给了文字表述,ε 形式与 MSE 判据是标准补充,请与课堂笔记核对。)

05

造估计量方法一:矩估计 MoM / Method of Moments

思路朴素得可爱:理论上的平均应该等于数据里的平均。有几个未知参数,就列几个方程。

记号
第 k 阶总体矩(是 θ 的函数):

第 k 阶样本矩(纯粹由数据算):

算总体矩,写成 θ 的函数

有 p 个未知参数就算前 p 阶:……注意 ,这个换算几乎每次都要用。

令总体矩 = 样本矩

,,……列出 p 个方程。

解方程,反解出 θ̂

。解完可以顺手检查一下无偏性(考题常追问)。

例题 A · Poisson 的 MoM(自造数据)

某路口每小时事故数 ,观测 6 小时得 3, 1, 4, 0, 2, 2。求 的 MoM 估计。

① 一个未知参数 → 只需一阶矩:
② 令它等于样本矩:
③ 解出:

顺带检查无偏: ✓ 无偏。

MoM 的经典陷阱题 · 一阶矩退化(讲义 p.4 Example 2 同型),一阶矩 —— 里面根本没有 θ!方程 解不出任何东西。
怎么办:升到二阶矩。
 → 
判别信号:算出来的矩里不含 θ,立刻升阶。
06

似然函数:换一个角度看密度 / What likelihood really is

MLE 是本课重头戏,但在讲"怎么算"之前,必须先讲清楚"似然"到底是什么。这一节不动笔,只建直觉。

一句话 · The one sentence 密度 有两种读法:
固定 θ、把 x 当变量 → 这是概率密度,回答"这个 θ 下,数据长什么样"。
固定观测到的数据 x、把 θ 当变量 → 这是似然 ,回答"哪个 θ 最可能生成我看到的这组数据"。
同一个式子,只是把谁看成变量换了一下。这就是似然的全部秘密。
Definition · Likelihood
观测独立同分布数据 ,则



log-likelihood(讲义 p.5 印刷原文,用 log 表示自然对数):
为什么是连乘?
因为独立 → 联合密度 = 各自密度相乘。这是 MATH 414 的事实,MLE 全靠它起步。
为什么要取 log?
三个理由:①乘积变求和,求导容易一万倍 ②log 严格递增,不改变极大值点 ③数值上不会下溢。
互动 · 亲手找到那个"最可能的 θ"

场景:抛一枚可能不公平的硬币 次,观测到 次正面。曲线是 拖动 θ,看哪里的似然最高。

你猜的 θ =0.30
抛的次数 n =12
正面数 y =9
两个观察: 峰值永远出现在 —— 这就是 MLE,下一节我们用微积分把它出来。 把 n 从 12 拖到 60,曲线明显变尖:数据越多,似然对 θ 的判断越果断,不确定性越小。(这个"尖锐程度"下一课会被量化成 Fisher information。)
07

MLE 四步流水线 / The four-step recipe

这一节是今晚最值钱的三十分钟。把这四步练成肌肉记忆,考场上遇到任何分布都照做。

必背 · MLE 定义

"让观测到的这组数据显得最不意外的那个 θ"。两个 argmax 等价,因为 log 单调递增。

写出 likelihood 

把密度连乘,把同底数的幂合并(指数相加)。这一步就有分。

取对数 

乘积变求和。与 θ 无关的项可以直接扔进常数(求导会消掉),能大幅简化。

求导置零 ,解出 θ̂

这个方程叫 likelihood equation。多参数时对每个参数各求一次偏导,联立解。

验证是极大 

写一行就行。另外必须瞟一眼参数空间 Ω 的边界——第 9 节会给你一个导数法彻底失效的例子。

考场部分分策略 · 请务必记住 这四步是逐步给分的。就算你在第 3 步的代数里翻车,只要 写对,通常已经拿到一半分。
所以策略是:永远先把第 1、2 步工整地写出来,再去啃求导。千万不要因为"不确定最后算不算得出来"就整题空白。
08

三个例子,走满四步 / Worked examples

全部自造数据。建议:每个例子先自己在纸上做一遍,再看展开。

例 1 · Bernoulli:抛 12 次得 9 次正面
设定 ,,,
① L
② ℓ
③ 求导置零
④ 验证 恒成立 → 是极大 ✓
一般式  要背这个结论,考试常直接用。
例 2 · Exponential 均值形:5 个灯泡的寿命
设定 寿命 均值形,,。观测 820, 1100, 640, 1350, 890(小时),,
⚠️ 先确认参数化:θ 在分母的指数上 → 均值形,
① L
② ℓ
③ 求导置零
代数值: 小时。
④ 验证 ,在 处代入得
对照 rate 形 若题目写成 ,同样四步会得到 两种参数化的答案互为倒数 —— 这正是 invariance 性质(见下)。
例 3 · Normal 双参数:同时估 μ 和 σ²
设定 ,两个参数都未知 → 要求两个偏导。
① ② L 与 ℓ
第一项与两个参数都无关,是常数,后面直接忽略。
③a 对 μ
③b 对 σ² 当成一个整体变量求导:
结论
注意分母是 n —— 这正是第 2 节那个有偏的家伙。(讲义 p.14 印刷原文)
附赠考点 · Invariance(不变性),讲义 p.13 印刷原文 的 MLE, 是一一映射,则 的 MLE 就是 —— 直接代进去,不用重求
例:已知 ,问 的 MLE? → ,一行搞定。
例: 的 MLE 是 ,问 logit 的 MLE? → 
09

陷阱:导数法会失效 / When calculus breaks

四步流水线有一个前提:极大值出现在内点。如果参数被数据"卡住"在边界上,求导会得出荒谬结论。这是最经典的送命题。

例 · 平移指数分布(讲义 p.15 练习 2 同型)

,否则为 0。求 的 MLE。

 但要求所有
 ← 导数恒为正,永远解不出驻点!
正确解法:看约束 关于 θ 严格递增 → θ 越大越好。
但约束是"所有 ",即
在允许范围内取最大 →
识别信号
密度里带 indicator

看到 ,或者定义域本身依赖 θ —— 立刻警觉,先别求导,先画出 ℓ(θ) 随 θ 的单调方向

同型的另一个必考题

。关于 θ 递减 → 取允许范围内最小 →
一个取 min 一个取 max,靠单调方向判断,不要背。

10

随堂小测 / Quick check

无限次尝试。这 8 题覆盖本课全部考点。

Q1. 等于?
Q2. 已知 。哪个说法对?
Q3. MLE 四步里,第 ② 步取对数的主要目的是?
Q4. ,观测 2, 5, 3, 2 的 MLE 是?
Q5. 若 , 的 MLE 是?
Q6. 做 MoM 时算出 ,不含参数 θ。该怎么办?
Q7. 已知 的 MLE 是 。那么 的 MLE 是?
Q8. 关于 ,哪个说法对?
11

把这一课写进 note sheet / Ship it

自己敲,不要复制。下面是建议进 §2 的内容。

 无偏 ⟺
 (无偏时 MSE=Var)
更有效 (第一个参数方差在分母!)
相合: 即可(bias→0 且 Var→0)
MoM: 解之;矩不含 θ 就升阶
   (几乎每题都用)
MLE 四步: + 查边界
 常用结论:Bern/Poisson  Expo均值形  Expo rate形
 Normal: (分母 n,有偏)
   无偏
Invariance: 直接代,不重求
边界解:定义域含 θ 时导数法失效 → 看 ℓ 单调方向
   
做完这两件事再进第 3 课 1. 上面这段敲进 note-sheet.tex 的 §2。
2. 回对话交我给你的手写题。MLE 必须自己动笔走一遍四步,光看例子不算会。