FINAL TRACK 3 · PROOF ENGINE

回归证明工坊Simple linear regression as one reusable argument.

回归看起来公式最多,其实证明几乎都从同一个表示开始: 的线性组合。把三个权重恒等式吃透,HW5、Packet 8 与 practice Q3 会收束成一条路。

3.5 hoursproof firstpractice Q3
ΣwᵢYᵢ

不是背五个 variance;是每次从权重性质重新推出。

哪些结论需要正态?先分层

第一层:线性模型

、误差互相独立、 固定。

足够推出:LSE 无偏、variance 公式、Gauss–Markov/BLUE。

第二层:再加 Normal

才可推出:精确正态、/ 分布、CI 与检验、零协方差 ⇒ 独立。

T/F 高频:“β̂ 无偏需要正态”是 FALSE;“LSE 是所有无偏估计中方差最小”也是 FALSE,BLUE 只在线性无偏类中比较。
CHEATSHEET · PAGE 1 · 右栏下部蓝条「简单线性回归」;PAGE 2 · 左栏续篇

Page 1 找模型、假设、wᵢ;Page 2 找推断、practice Q3、ANOVA 与作答骨架。

先别证明:这条线到底在说什么?

教授慢讲

想象每个学生是图上的一个点:横坐标 是复习小时数,纵坐标 是考试分数。同样复习 5 小时的人不可能都考完全相同的分数,所以点会围着一条线上下散开

公式
人话第 i 人的成绩 = 这类人的平均趋势 + 他个人这一次向上或向下的偏差。
· intercept
时,模型预测的平均 Y。若 0 根本不在数据范围内,不要过度解释它。
· slope
x 每增加 1 单位,平均 Y 改变多少。例如 表示多复习 1 小时,预测平均分高 3 分。
· error
第 i 个点离平均直线的垂直距离。正值在直线上方,负值在下方。
· error variance
点云围着直线有多松。它越大,同一个 x 下的 Y 越不稳定。
“Normal errors”不是说 x 或 Y 的直方图必须正态。它说:固定一个 x,沿那条竖线看 Y 围着回归线的上下误差,是钟形的。这一额外假设负责精确的 t/F 分布;斜率无偏本身不需要它。
停一下:如果给每个学生的分数都加 10,斜率会不会变?不会——整片点云只整体上移。这个直觉稍后就是“平均值与斜率不纠缠”的核心。

把斜率改写,证明就开始了

先定义三个中心化和:

因为 ,斜率可以改写为:

三个权重恒等式必须能现场推出

中心化偏差相加为零。

拆开。

平方后分子正好是

证明题开头固定写:,并列出三性质。阅卷人会立刻知道你的路线正确。

用 x = 0, 1, 2,把抽象权重变成三个数字

极小例子:三位学生

。先算中心 ,再算

因此三个权重是

所以斜率立刻变成 。中间点的权重恰好为 0:它在 x 的正中心,主要告诉我们直线的高度,并不告诉我们直线向左还是向右倾斜

检查 :给所有 Y 都加同一个常数 c,新增部分是 ,斜率不变。

检查 :真正的线性趋势 经过加权后,正好留下一个

检查 :独立误差的 variance 相加时,平方权重决定总噪声。

若成绩是 ,斜率为 。若全部加 10 变成 ,斜率还是 3;但平均分从 5 变成 15。这就是“平均负责上下位置,斜率负责倾斜方向”。
常见误区: 不是概率,所以可以为负,也不要求加起来等于 1。它们只是把各个 Y 拼成斜率的代数权重。

把期望与协方差逐项拆开

先学会读双和

看起来吓人,其实只是“把平均里的每个 ,和斜率里的每个 两两配对”。当 ,两位不同学生的独立误差 covariance 为 0;只剩 的对角配对。最后又因为 ,总和归零。

A. 斜率为什么无偏

没有任何一步用到 Normal。只用了 mean model 与权重性质。

B. HW5 Q1:为什么

一定用不同下标 ,否则看不出交叉项为什么消失:

,独立使 covariance 为 0;只剩 ,再用

C. Packet 8 Q3:预测均值的 variance

先用 改写:

交叉项消失,正是因为上一问证了 。离 越远,预测均值越不确定;在样本中心最窄。

把预测区间想成手电筒的光束。样本的 x 大多集中在 附近,所以在那里最有把握,光束最窄。往数据两端之外走,相当于把直线的轻微斜率误差放大,光束就越来越宽。公式里的 正是在计算“离支点多远”。

D. HW5 Q2:零协方差为什么能升级成独立

先用双线性证明 。但一般情形零协方差不等于独立。这里只有一条桥:

残差与 fitted deviation 都是 Normal 的线性组合,因此二者联合正态;联合正态下零协方差等价于独立,故

最可能原样复现的两问

(a) 证明 correlation 与 slope 的关系

关键只有 。所以 同号,但尺度不同。

(b) 把 statistic 改写成

卷面笔误:Practice exam 把 的定义印成了 。应按 理解;你的推导写正确版本。

为什么回归的 error df 是 n−2?

相同三个字母,角色完全不同

MLE of variance

来自对 Normal likelihood 求导。它有偏。

Unbiased MSE

因为

正态误差下:

CHEATSHEET · PAGE 2 · 左栏「正态假设下的分布与推断」「practice Q3 的两问」

考试若问证明,先去 Page 1 的 wᵢ;若问分布,再到 Page 2 找 t statistic。

“Normal regression 中 variance 的 MLE 总是无偏。”

“Normal error 下 β̂₁ 是精确正态,而不仅是渐近正态。”

按依赖关系做,不按题号做

HW5 · Q1 MUST DO

先证 Cov(Ȳ, β̂₁)=0

这是后面 与 intercept variance 的前置。务必用 i/j 双下标。

PACKET 8 · §7.4 Q3 MUST DO

推导 Var(ŷ*) 并解释距离项

这是既没进 HW 又没进 practice 的唯一 Packet 8 练习,风险很高。

HW5 · Q2 MUST DO

ANOVA covariance + independence

最后一句“joint Normal, hence uncorrelated implies independent”必须写。

PRACTICE · Q3 MUST DO

r 与 slope;r 形式的 t statistic

完整展开 至少一次;第二遍只写关键链。

HW5 · Q3 / Q4 · CONCEPT ONLY

LSE = MLE、CI 宽度、logistic

不做数值。只回答:Normal error 让 LSE 成 MLE; 最窄;logistic 把实数映到 (0,1)。

从 wᵢ 出发,闭卷推三条

本课 mastery0/5
最后定位 · PAGE 2 · 左下「D. 回归证明题」

这四行是所有证明的最短入口:线性组合 → wᵢ 性质 → 双线性拆 covariance → joint Normal 负责独立。