上一课我们知道了 是随机变量。这一课回答两个问题:① 怎么判断一个估计量好不好(无偏、MSE、效率)、② 拿到一个陌生分布,怎么系统地造出估计量(MoM 与 MLE)。MLE 是全场性价比最高的考点——它是一条四步流水线,而且部分分极厚:哪怕最后代数算崩,写对前两步也能拿一半分。
先建立问题意识:估计量不是唯一的。既然能造出好几个,就必须有一把尺子判断谁更好。
想估计正态总体的中心 。至少有三个看起来都合理的做法:
三个都是"合理"的估计量,而且——这点很关键——三个都是无偏的。所以光有"无偏"这一条尺子不够用,我们还需要第二条(方差 / MSE)。
最直观的要求:平均而言不偏不倚。反复抽样无数次,这些估计值的平均应该正好落在真值上。
上一课我们已经证过 ,所以 永远是 的无偏估计——不管总体是什么分布。这是个非常有用的既得结论。
无偏只管"平均对不对",不管"抖得厉害不厉害"。MSE 把两件事合成一个数——这是本课最常考的公式。
两个次要但会考的判据。效率的分子分母顺序极易记反,这一节重点就在那个顺序。
例:
思路朴素得可爱:理论上的平均应该等于数据里的平均。有几个未知参数,就列几个方程。
有 p 个未知参数就算前 p 阶:
某路口每小时事故数
顺带检查无偏:
MLE 是本课重头戏,但在讲"怎么算"之前,必须先讲清楚"似然"到底是什么。这一节不动笔,只建直觉。
场景:抛一枚可能不公平的硬币
这一节是今晚最值钱的三十分钟。把这四步练成肌肉记忆,考场上遇到任何分布都照做。
把密度连乘,把同底数的幂合并(指数相加)。这一步就有分。
乘积变求和。与 θ 无关的项可以直接扔进常数(求导会消掉),能大幅简化。
这个方程叫 likelihood equation。多参数时对每个参数各求一次偏导,联立解。
写一行就行。另外必须瞟一眼参数空间 Ω 的边界——第 9 节会给你一个导数法彻底失效的例子。
全部自造数据。建议:每个例子先自己在纸上做一遍,再看展开。
四步流水线有一个前提:极大值出现在内点。如果参数被数据"卡住"在边界上,求导会得出荒谬结论。这是最经典的送命题。
看到
一个取 min 一个取 max,靠单调方向判断,不要背。
无限次尝试。这 8 题覆盖本课全部考点。
自己敲,不要复制。下面是建议进 §2 的内容。