FINAL TRACK 1 · HIGHEST PRIORITY
教授会额外加一道 MLE,而且明确说不能直接引用结果。好消息是:MLE 不是几十个公式,而是一台固定的六步机器。你要学会辨认什么时候能求导,什么时候必须看 support。
把乘法变加法只是开始;真正的满分点在二阶条件与边界检查。
01 · THE IDEA
先把视角翻转,否则后面每一步都会像魔法。
参数 固定,随机变量 还没出现。模型问:“给定 ,会看到什么数据?”
数据 已经钉死。我们转动参数旋钮,问:“哪个 让眼前数据最不意外?”
为什么 i.i.d. 样本的 likelihood 是乘积?
01.5 · ONE COMPLETE TINY EXAMPLE
数据是 1、0、1、1:四次里有三次正面。数字很小,所以你可以把注意力放在“每一步为什么”,而不是算术。
四次独立,所以把四次概率乘起来:第一次正面给 p,第二次反面给 1−p,后两次正面各给 p。于是 likelihood 是 。
取 log:。log 没有改变最大点,只把乘法拆开。
求导:。第一项想把 p 往大推,第二项代表那一次 failure,不允许 p 到 1。
令零并解:。
为什么是最大:,整条 log-likelihood 向下弯。
检查边界:p=0 无法解释任何正面,p=1 无法解释那次反面;3/4 在合法区间内部。
02 · THE SIX-STEP CHAIN
先看“四步模板”,再看 Page 2 右栏「符号版范例:MLE 大题的满分写法」。网页负责讲透,note sheet 负责考场定位。
常数若与参数无关,求 MLE 时可以放着;不要漏掉会改变 support 的 indicator。
log 单调递增,所以最大化 与最大化 得到同一参数。
这只给 stationary point,不自动保证最大值。
把答案写成统计量(大写随机变量)时叫 estimator;代入观测数据后的数字叫 estimate。
若二阶导不便,说明一阶导在候选点前正后负也可以。
参数空间若有边界,要比较端点;若问 的 MLE,用 。
02.5 · RECOGNIZE THE STORY
Poisson:统计每小时进店人数。三小时分别 2、1、3 人,平均每小时 2 人,所以 rate 的 MLE 是样本平均。
Exponential:记录两次顾客到店之间等待多久。若平均等待 5 分钟,rate 应该是“每分钟 1/5 次”。等待时间越大,rate 越小,所以 MLE 是 。
Normal likelihood 里, 是所有点离图钉位置 的平方距离总和。把图钉放在样本平均处,平方距离最小,所以 likelihood 最大。估 则是在问:这些点围绕中心散得多开?
Uniform(0,θ) 表示所有数据必须装在 0 到 θ 的盒子里。若最大观察是 8,墙不能放在 7,否则 8 根本装不进去;墙放得越远,密度 越摊薄。所以最好的墙正好贴住最大数据:。
03 · FIVE DISTRIBUTIONS, THREE PATTERNS
样本里只留下两个摘要:成功数 与失败数 。于是数据最支持的成功率就是成功比例。
为什么合理:如果 100 次里 63 次成功,任何离 0.63 很远的 都会让这组数据更意外。
单位观察中的平均计数估计 rate。
等待越久,事件 rate 越小,所以是平均等待时间的倒数。
先固定 看 :最大化 likelihood 等价于最小化平方距离,所以中心落在 。再把这个中心代回去估散布。
在允许区间 上, 一直递减。最大值因此出现在最小的合法参数:。这里求导永远不会给出内部解。
04 · WHY MLE REAPPEARS LATER
必须加起来等于 1,所以不能各自独立求导。用 Lagrange multiplier:
这就是 GOF 无约束模型的 MLE;列联表在独立性约束下再做一次,才得到 。
对固定 ,前一项不动;最大化 等价于最小化 residual sum of squares。这一句把“最小二乘”与“正态误差 likelihood”连起来。
这三块不是额外知识,而是同一台 MLE 机器换了约束。
05 · FULL-CREDIT WRITING
若 score 方程没有解,最合理的下一步是什么?
06 · TARGETED DRILLS
写 MLE、无偏性、MSE、渐近分布。考试化改写:所有数字换成 与 。
密度 。先写 ,再说明 likelihood 随 递增,因此取右端点。
不要代 50 周的数字。闭卷写出 到 的全部六步。
能解释为什么 是 MLE、 才无偏即可。
07 · MASTERY GATE
用 Poisson 范例对照自己的手写稿。只检查有没有漏步骤,不要照抄结果。