老赵写字的地方

拟合的基本理论 (Fundamentals of Fitting)

给定 N 个观测点$(x_i, y_i)$,拟合的目标是找到一个函数 $f$,使模型 $y_i = f(x_i) + \epsilon_i$ 在某种意义下最优,其中 $\epsilon_i$ 是不可观测的噪声。拟合问题可以形式化地写成一个优化问题: \begin{equation} min_f L(f) = \sum_{i=1}^N ρ( yᵢ − f(xᵢ) ) \end{equation} 其中$\rho$是损失函数(度量单个点误差的代价),函数空间的选择(线性/多项式/样条等)与 $\rho$的选择(平方/绝对值等)共同定义了一个具体的拟合问题——换掉任何一个,就是另一个拟合问题

最小二乘:拟合理论的中心

当假设 $f$ 是参数的线性组合($f(x) = \sum_j \beta_j \phi_j(x)$,$\phi_j$ 为基函数),且 $\rho$ 取平方,就得到经典最小二乘: \begin{equation} min_\beta ‖y − Xβ‖² \end{equation} 其中 X 是设计矩阵(N×p,第 j 列是第 j 个基函数在所有点上的取值)。

解的存在与唯一

目标函数$‖y − X\beta‖²== \beta^T (XᵀX)\beta − 2(Xᵀy)ᵀ\beta + yᵀy$是 $\beta$ 的凸二次型:

  • 它是 $\beta$ 的二次函数:二次项 βᵀ(XᵀX)β 的系数矩阵是 XᵀX
  • 凸是因为 XᵀX 半正定(任何 $\beta$,βᵀXᵀXβ = ‖Xβ‖² ≥ 0)——碗口永远朝上,只有一个谷底

令其梯度为零给出正规方程: \begin{equation} (XᵀX) \beta = Xᵀy \end{equation} 当 XᵀX 可逆(基函数线性无关且 N ≥ p)时,解唯一: \begin{equation} β̂ = (XᵀX)⁻¹Xᵀy \end{equation} 不可逆时(多重共线性/欠定),解不唯一——这正是正则化登场的入口。

几何直觉:投影。把 y 看作 N 维空间里的一个向量,X 的列张成一个 p 维子空间(列空间)。最小二乘解就是把 y 正交投影到这个子空间上:Xβ̂ 恰好是 y 在列空间上的投影,残差 y − Xβ̂ 与列空间垂直。拟合就是投影——这个视角是理解一切拟合方法的钥匙。

统计性质(高斯-马尔可夫定理):若噪声 ε 均值为零、方差 σ²、互不相关,则 β̂ 是所有线性无偏估计中方差最小的(BLUE)。这是最小二乘在统计上“最优”的严格表述——不需要假设正态,只需一阶二阶矩条件。

与最大似然的联系:若再假设 ε 是独立同分布的高斯噪声,则最小二乘解恰好等于最大似然估计(高斯对数似然的梯度项就是平方和)。这解释了为什么平方损失是默认选择——它是“高斯噪声世界”里的正确损失。

偏差-方差分解:为什么不是误差越小越好

对均方误差(MSE)做分解: \begin{equation} E[(y₀ − f̂(x₀))²] = σ²(噪声) + Bias²(f̂) + Var(f̂) \end{equation}

  • σ²:不可约噪声,任何模型都躲不掉,是误差的下限
  • Bias²:模型系统性偏差——假设空间表达不了真函数的部分(欠拟合的来源)
  • Var:估计的波动——对训练样本的敏感度(过拟合的来源)

三个量在模型复杂度上此消彼长:模型越复杂,Bias 越小但 Var 越大;越简单则反之。最优模型在中间某处,这就是偏差-方差权衡。交叉验证、信息准则(AIC/BIC)、正则化——全是这个权衡的不同实现方式。

正则化:显式地管理权衡

把目标改成带惩罚的形式: \begin{equation} min_β ‖y − Xβ‖² + λ·P(β) \end{equation}

  • Ridge(P = Σβⱼ²):解变成 β̂ = (XᵀX + λI)⁻¹Xᵀy——XᵀX 加了个正定项,奇异性消失,同时把 β 向零收缩。λ 越大,β̂ 越小(偏差增大、方差减小)。
  • Lasso(P = Σ|βⱼ|):除了收缩,还会把部分 βⱼ 精确压成 0——自动做特征选择(几何上是因为 L1 球的角落在坐标轴上)。

λ 的选择本身也是个估计问题:通常用交叉验证选使验证误差最小的 λ。正则化的理论意义在于:它把“选择模型复杂度”这个离散问题变成了“调整连续参数 λ”——数学上更好处理,把偏差-方差权衡装进了一个显式公式。

拟合优度与诊断

* R² = 1 − SS_res/SS_tot:模型解释的方差比例。但它只衡量对训练数据的解释力,不能衡量泛化——R² 高完全可能是过拟合 * 残差分析:残差应当随机、无结构。残差里出现系统性模式(弯曲、异方差、自相关)说明模型形式不对 * 杠杆点/异常点:个别点可能主导拟合结果(高杠杆点),用 Cook 距离、影响图等诊断方法发现

总结:三个问题

拟合的基本理论可以压缩成三个问题:

1. 怎么算:凸优化 + 正规方程(投影视角) 2. 为什么可信:高斯-马尔可夫(最优性)+ 最大似然(概率基础) 3. 怎么避免自欺:偏差-方差分解(知道误差从哪来)+ 正则化(显式权衡)+ 交叉验证(选复杂度)

而这一切的底层图像始终是那张投影图:把观测向量 y 投影到模型子空间上,投影点的位置由误差度量决定,投影的可靠性由偏差-方差权衡决定。

数学,数值分析,数值逼近,拟合

zh/mathematics/numerical_analysis/approximation/fitting_theory.txt · 最后更改: 由 tom