机器学习速成·线性回归(1/4):线性回归——从方程、参数到多特征模型
本文参考 Google 机器学习速成课程 - 线性回归(Linear Regression)模块 的核心内容撰写,重点讲清线性回归方程、参数含义,以及如何用一条”最佳拟合线”做预测。
一、什么是线性回归?
线性回归(Linear Regression) 是一种用于查找变量之间关系的统计技术。在机器学习背景下,线性回归用于查找特征(Feature) 与标签(Label) 之间的线性关系。
最经典的例子:根据汽车重量,预测其燃油效率(每加仑英里数 MPG)。
现有数据集(简化版):
| 以千磅计的重量(特征) | 每加仑英里数(标签) |
|---|---|
| 3.5 | 18 |
| 3.69 | 15 |
| 3.44 | 18 |
| 3.43 | 16 |
| 4.34 | 15 |
| 4.42 | 14 |
| 2.37 | 24 |
把这些点画在图上,会发现一条大致向下倾斜的趋势:汽车越重,每加仑能跑的英里数通常越低。我们的目标,就是在这堆散点中间画出一条最佳拟合线,用这条线来预测。
二、线性回归方程
2.1 从代数方程说起
我们都学过一条直线的代数方程:
y = mx + b
其中:
- y:要预测的值(如燃油行驶里程)
- m:直线的斜率
- x:输入值(如重量)
- b:y 轴截距
2.2 机器学习中的标准写法
在机器学习中,线性回归模型写作:
y′ = b + w₁x₁
这个式子和代数方程一一对应,只是换了机器学习术语:
| 代数写法 | 机器学习写法 | 含义 | 术语 |
|---|---|---|---|
| y | y′ | 预测标签(输出) | 预测值 |
| m | w₁ | 斜率 | 权重(Weight) |
| x | x₁ | 输入值 | 特征(Feature) |
| b | b | y 轴截距 | 偏差(Bias) |
两个重要术语
- 偏差(Bias,b):与代数方程里的 y 轴截距概念相同。在机器学习中,偏差有时也记作
w₀。它是模型的参数(Parameter),在训练期间计算得出。 - 权重(Weight,w₁):与代数方程里的斜率 m 概念相同。权重同样是模型的参数(Parameter),在训练期间计算得出。
👉 训练的目标,就是算出最合适的权重和偏差,让这条线尽可能贴合数据。
三、用具体数值举例:从图上读出参数
以燃油效率数据集为例,我们画出最佳拟合线后,可以从图上读出:
偏差 b = 34 (直线与 y 轴的交点)
权重 w₁ = -4.6 (直线的斜率,向下倾斜所以为负)
模型:y′ = 34 + (−4.6)·x₁
于是可以做预测:一辆 4,000 磅(x₁ = 4.0)的汽车,预测燃油效率为:
y′ = 34 + (−4.6) × 4.0
= 34 − 18.4
= 15.6 (每加仑英里)
👉 权重为负,表示”重量越大,油耗越高(每加仑英里数越低)“,这和直觉完全一致。斜率(权重)的符号本身就揭示了特征与标签的相关方向。
四、具有多种特征的模型
前面的例子只用了一个特征(汽车重量),但真实模型往往依赖多个特征,为每个特征都配一个单独的权重(w₁、w₂、w₃…)。
一个依赖 5 个特征的模型可以写成:
y′ = b + w₁x₁ + w₂x₂ + w₃x₃ + w₄x₄ + w₅x₅
例如,预测燃油效率的模型除了重量,还可以加入这些特征:
| 特征 | 与标签(MPG)的关系 |
|---|---|
| 发动机排量 | 引擎越大,每加仑里程越低(负相关) |
| 加速度 | 加速时间越长,MPG 通常越高(正相关) |
| 气缸数 | 气缸越多,通常越费油(负相关) |
| 马力 | 马力越大,通常 MPG 越低(负相关) |
多特征模型的意义在于:综合多个维度的信息,比单一特征预测得更准。
五、训练期间:到底更新什么?
这是理解线性回归最关键的一个问题:
在训练期间,线性回归方程的哪些部分会被更新?
答案是:偏差(b)和权重(w)。
| 部分 | 训练期间会更新吗? | 原因 |
|---|---|---|
| 特征值(x) | ❌ 不会 | 特征值是数据集的一部分,是给定输入,不会在训练中改变 |
| 预测(y′) | ❌ 不会 | 预测只是模型的输出结果 |
| 偏差(b)和权重(w) | ✅ 会 | 它们是模型的参数,训练过程就是不断调整它们以拟合数据 |
训练循环:
1. 用当前参数(w, b)做预测
2. 用损失函数计算预测误差(损失)
3. 用梯度下降调整参数,减小误差
4. 重复,直到损失足够小
六、关键术语速查
- 偏差(Bias / b / w₀):公式中的截距项,是训练期间计算出的模型参数。
- 特征(Feature / x):模型的输入变量。
- 标签(Label / y):模型要预测的真值。
- 线性回归(Linear Regression):找特征与标签线性关系的统计/机器学习技术。
- 参数(Parameter):训练期间由模型学习得到的值(如权重、偏差)。
- 权重(Weight / w):公式中的斜率项,衡量特征对预测的影响程度,是训练期间计算出的模型参数。
总结
| 核心要点 | 关键结论 |
|---|---|
| 线性回归方程 | y′ = b + w₁x₁,与代数 y = mx + b 一一对应 |
| 偏差 / 权重 | 即截距 b 和斜率 w₁,是模型参数 |
| 训练更新什么 | 只更新偏差和权重,特征值是固定的 |
| 多特征模型 | y′ = b + w₁x₁ + w₂x₂ + …,为每个特征配一个权重 |
| 下一步 | 损失函数 → 梯度下降,是优化参数的关键 |
一句话:线性回归就是找一条”最佳拟合线”,用权重(斜率)和偏差(截距)来描述特征与标签的线性关系——而训练的过程,就是不断调整这两个参数的过程。