给定 N 个观测点$(x_i, y_i)$,拟合的目标是找到一个函数 $f$,使模型 $y_i = f(x_i) + \epsilon_i$ 在某种意义下最优,其中 $\epsilon_i$ 是不可观测的噪声。拟合问题可以形式化地写成一个优化问题: \begin{equation} min_f L(f) = \sum_{i=1}^N ρ( yᵢ − f(xᵢ) ) \end{equation} 其中$\rho$是损失函数(度量单个点误差的代价),函数空间的选择(线性/多项式/样条等)与 $\rho$的选择(平方/绝对值等)共同定义了一个具体的拟合问题——换掉任何一个,就是另一个拟合问题
当假设 $f$ 是参数的线性组合($f(x) = \sum_j \beta_j \phi_j(x)$,$\phi_j$ 为基函数),且 $\rho$ 取平方,就得到经典最小二乘: \begin{equation} min_\beta ‖y − Xβ‖² \end{equation} 其中 X 是设计矩阵(N×p,第 j 列是第 j 个基函数在所有点上的取值)。
目标函数$‖y − X\beta‖²== \beta^T (XᵀX)\beta − 2(Xᵀy)ᵀ\beta + yᵀy$是 $\beta$ 的凸二次型:
令其梯度为零给出正规方程: \begin{equation} (XᵀX) \beta = Xᵀy \end{equation} 当 XᵀX 可逆(基函数线性无关且 N ≥ p)时,解唯一: \begin{equation} β̂ = (XᵀX)⁻¹Xᵀy \end{equation} 不可逆时(多重共线性/欠定),解不唯一——这正是正则化登场的入口。
几何直觉:投影。把 y 看作 N 维空间里的一个向量,X 的列张成一个 p 维子空间(列空间)。最小二乘解就是把 y 正交投影到这个子空间上:Xβ̂ 恰好是 y 在列空间上的投影,残差 y − Xβ̂ 与列空间垂直。拟合就是投影——这个视角是理解一切拟合方法的钥匙。
统计性质(高斯-马尔可夫定理):若噪声 ε 均值为零、方差 σ²、互不相关,则 β̂ 是所有线性无偏估计中方差最小的(BLUE)。这是最小二乘在统计上“最优”的严格表述——不需要假设正态,只需一阶二阶矩条件。
与最大似然的联系:若再假设 ε 是独立同分布的高斯噪声,则最小二乘解恰好等于最大似然估计(高斯对数似然的梯度项就是平方和)。这解释了为什么平方损失是默认选择——它是“高斯噪声世界”里的正确损失。
对均方误差(MSE)做分解: \begin{equation} E[(y₀ − f̂(x₀))²] = σ²(噪声) + Bias²(f̂) + Var(f̂) \end{equation}
三个量在模型复杂度上此消彼长:模型越复杂,Bias 越小但 Var 越大;越简单则反之。最优模型在中间某处,这就是偏差-方差权衡。交叉验证、信息准则(AIC/BIC)、正则化——全是这个权衡的不同实现方式。
把目标改成带惩罚的形式: \begin{equation} min_β ‖y − Xβ‖² + λ·P(β) \end{equation}
λ 的选择本身也是个估计问题:通常用交叉验证选使验证误差最小的 λ。正则化的理论意义在于:它把“选择模型复杂度”这个离散问题变成了“调整连续参数 λ”——数学上更好处理,把偏差-方差权衡装进了一个显式公式。
* R² = 1 − SS_res/SS_tot:模型解释的方差比例。但它只衡量对训练数据的解释力,不能衡量泛化——R² 高完全可能是过拟合 * 残差分析:残差应当随机、无结构。残差里出现系统性模式(弯曲、异方差、自相关)说明模型形式不对 * 杠杆点/异常点:个别点可能主导拟合结果(高杠杆点),用 Cook 距离、影响图等诊断方法发现
拟合的基本理论可以压缩成三个问题:
1. 怎么算:凸优化 + 正规方程(投影视角) 2. 为什么可信:高斯-马尔可夫(最优性)+ 最大似然(概率基础) 3. 怎么避免自欺:偏差-方差分解(知道误差从哪来)+ 正则化(显式权衡)+ 交叉验证(选复杂度)
而这一切的底层图像始终是那张投影图:把观测向量 y 投影到模型子空间上,投影点的位置由误差度量决定,投影的可靠性由偏差-方差权衡决定。
数学,数值分析,数值逼近,拟合