FINAL TRACK 1 · HIGHEST PRIORITY

MLE 满分推导工坊Maximum Likelihood from zero to exam proof.

教授会额外加一道 MLE,而且明确说不能直接引用结果。好消息是:MLE 不是几十个公式,而是一台固定的六步机器。你要学会辨认什么时候能求导,什么时候必须看 support。

3 hoursmust deriveboundary aware
L → ℓ

把乘法变加法只是开始;真正的满分点在二阶条件与边界检查。

Likelihood 不是“参数的概率”

先把视角翻转,否则后面每一步都会像魔法。

生成数据时

参数 固定,随机变量 还没出现。模型问:“给定 ,会看到什么数据?”

做 MLE 时

数据 已经钉死。我们转动参数旋钮,问:“哪个 让眼前数据最不意外?”

一句话:likelihood 是同一个 ,但现在把 当常数、把 当自变量。它不需要对 积分为 1。

为什么 i.i.d. 样本的 likelihood 是乘积?

先用 4 次抛硬币,把整台机器走一遍

数据是 1、0、1、1:四次里有三次正面。数字很小,所以你可以把注意力放在“每一步为什么”,而不是算术。

教授慢讲

第一步不是求导,而是问“如果 p 是某个值,这组数据有多合理?”

四次独立,所以把四次概率乘起来:第一次正面给 p,第二次反面给 1−p,后两次正面各给 p。于是 likelihood 是

数据故事3 个 success、1 个 failure;独立所以相乘。
Likelihood

取 log:。log 没有改变最大点,只把乘法拆开。

求导:。第一项想把 p 往大推,第二项代表那一次 failure,不允许 p 到 1。

令零并解:

为什么是最大:,整条 log-likelihood 向下弯。

检查边界:p=0 无法解释任何正面,p=1 无法解释那次反面;3/4 在合法区间内部。

答案 3/4 其实早有直觉:为了让机器重现“4 次里 3 次正面”,最自然的旋钮位置就是 3/4。微积分只是把这个直觉变成可评分的证明。
不要从“Bernoulli 的 MLE 是样本平均”开始写。考试要看的是你如何从四个独立 probability 走到 likelihood,再走到导数。

每个箭头都是独立给分点

CHEATSHEET · PAGE 1 · 左栏最上方蓝条「① MLE — 从头推」

先看“四步模板”,再看 Page 2 右栏「符号版范例:MLE 大题的满分写法」。网页负责讲透,note sheet 负责考场定位。

写 likelihood,连乘且带 support

常数若与参数无关,求 MLE 时可以放着;不要漏掉会改变 support 的 indicator。

取 log,把乘积拆成和

log 单调递增,所以最大化 与最大化 得到同一参数。

求 score 并令零

这只给 stationary point,不自动保证最大值。

解出候选值

把答案写成统计量(大写随机变量)时叫 estimator;代入观测数据后的数字叫 estimate。

验证最大值

若二阶导不便,说明一阶导在候选点前正后负也可以。

最后检查 support / 边界 / invariance

参数空间若有边界,要比较端点;若问 的 MLE,用

最常见的“只拿一半分”写法:直接写 。真卷必须让阅卷人看到 L → ℓ → 导数 → 解 → 二阶 → support。

换分布时,先换故事,不要先换公式

Poisson 与 Exponential

一个数“次数”,一个数“等多久”

Poisson:统计每小时进店人数。三小时分别 2、1、3 人,平均每小时 2 人,所以 rate 的 MLE 是样本平均。

Exponential:记录两次顾客到店之间等待多久。若平均等待 5 分钟,rate 应该是“每分钟 1/5 次”。等待时间越大,rate 越小,所以 MLE 是

Normal

像拿一根图钉找一堆点的中心

Normal likelihood 里, 是所有点离图钉位置 的平方距离总和。把图钉放在样本平均处,平方距离最小,所以 likelihood 最大。估 则是在问:这些点围绕中心散得多开?

Uniform boundary

θ 是盒子的右边墙

Uniform(0,θ) 表示所有数据必须装在 0 到 θ 的盒子里。若最大观察是 8,墙不能放在 7,否则 8 根本装不进去;墙放得越远,密度 越摊薄。所以最好的墙正好贴住最大数据:

看到新密度先问:
  1. 参数控制的是比例、次数、等待、中心,还是 support 的边界?
  2. 数据能被压缩成哪个摘要:success 数、总和、平方距离、最大/最小值?
  3. likelihood 在合法区间里有内部山顶,还是一路走到边界?

不要背五题,要认三种形状

A. “成功次数”形:Bernoulli

样本里只留下两个摘要:成功数 与失败数 。于是数据最支持的成功率就是成功比例。

为什么合理:如果 100 次里 63 次成功,任何离 0.63 很远的 都会让这组数据更意外。

B. “总暴露量”形:Poisson 与 Exponential

Poisson rate

单位观察中的平均计数估计 rate。

Exponential rate

等待越久,事件 rate 越小,所以是平均等待时间的倒数。

C. “中心与散布”形:Normal 两参数

先固定 :最大化 likelihood 等价于最小化平方距离,所以中心落在 。再把这个中心代回去估散布。

陷阱: 型的分母来自最大化 likelihood,不保证无偏。Normal 样本里无偏版本除以 ;回归里除以

D. support 决定答案:Uniform(0, θ)

在允许区间 上, 一直递减。最大值因此出现在最小的合法参数:。这里求导永远不会给出内部解。

识别信号:密度里出现 indicator,或者“ 必须小于/大于参数”。先写合法参数区间,再讨论 likelihood 在区间上递增还是递减。

MLE 是 χ² 与回归的地基

多项分布:约束不能假装不存在

必须加起来等于 1,所以不能各自独立求导。用 Lagrange multiplier:

这就是 GOF 无约束模型的 MLE;列联表在独立性约束下再做一次,才得到

回归:为什么 LSE = MLE

对固定 ,前一项不动;最大化 等价于最小化 residual sum of squares。这一句把“最小二乘”与“正态误差 likelihood”连起来。

CHEATSHEET · PAGE 1 · MLE 蓝条内「多项分布」「列联表独立性下的受限 MLE」「回归的 MLE」

这三块不是额外知识,而是同一台 MLE 机器换了约束。

把过程写成阅卷人能逐项打勾的格式

设 X₁,…,Xₙ iid ~ f(x|θ),θ ∈ Θ。
① L(θ)=∏ f(xᵢ|θ),并写出 support。
② ℓ(θ)=log L(θ)=…
③ ℓ′(θ)=…=0 ⇒ θ̂=…
④ ℓ″(θ̂)=…<0(或说明单调性),故为极大值。
⑤ 检查 θ̂∈Θ 与边界;support 是否依赖 θ。
⑥ 若问 h(θ),由 invariance 得 ĥ=h(θ̂)。

若 score 方程没有解,最合理的下一步是什么?

做三题,覆盖三种形状

PACKET 2–3 · §2.4 Q1 MUST DO

Bernoulli:完整推导而不是只报 x̄

写 MLE、无偏性、MSE、渐近分布。考试化改写:所有数字换成

PACKET 2–3 · §2.4 Q2 MUST DO

Shifted exponential:边界题

密度 。先写 ,再说明 likelihood 随 递增,因此取右端点。

HW4 · Q3(a) MUST DO

Poisson:把“estimate”题升级成真卷推导

不要代 50 周的数字。闭卷写出 的全部六步。

OPTIONAL INSURANCE

Normal 两参数 + 回归 variance

能解释为什么 是 MLE、 才无偏即可。

三项全勾,才进入 χ²

本课 mastery0/4
最后定位 · PAGE 2 · 右栏「符号版范例:MLE 大题的满分写法」

用 Poisson 范例对照自己的手写稿。只检查有没有漏步骤,不要照抄结果。