它是什么
梯度下降是一种迭代优化方法:先计算目标函数对各个参数的梯度,再沿着让目标下降的方向调整参数。梯度描述当前位置附近目标上升最快的方向,取反后可用于寻找更低的损失,但它不是对整个参数空间的完整搜索。[S1][S2]
为什么需要它
现代模型可能包含大量参数,无法逐一尝试所有组合。只要目标函数能够提供局部变化信号,梯度下降就能用重复的小步更新逐渐找到较低损失的参数,因此成为训练线性模型和神经网络的基础工具。
它如何工作
模型先用当前参数产生预测并计算损失,再求损失对每个参数的梯度。更新时,用旧参数减去“学习率乘以梯度”,然后重新计算并继续迭代。[S1][S2] 学习率决定步长:太小会让进展缓慢,太大可能跨过较低区域并持续震荡。实际训练还会用一批或部分样本估计梯度,并观察损失是否趋于稳定。
真实例子
一个配送时长模型起初总是低估。训练过程发现,提高某些特征权重能降低当前批次的误差,于是按梯度方向更新参数。连续多轮后训练损失下降,但团队仍要检查验证数据;若只有训练数据改善,优化过程虽然在工作,模型却可能正在过拟合。
什么时候适合与不适合
适合参数可微、目标函数能够提供有用梯度的大规模优化问题,优势是不用穷举参数。代价是结果依赖初始化、学习率、数据批次和目标形状;复杂目标可能包含平坦区域、鞍点或多个低点。梯度下降找到较低训练损失,不等于找到全局最低点,也不保证业务指标或泛化表现同步提高。
亲自试一下
目标是观察步长如何影响优化。画一条 U 形曲线,在左侧任选起点,分别用“小、中、大”三种固定步长向低处移动五次,并记录是否接近最低处、移动太慢或来回跨越。判断标准不是哪条轨迹最漂亮,而是哪种步长能稳定降低目标且不会持续震荡。
接下来学什么
先学习损失函数理解要降低的目标,再学习学习率分析步长;结合反向传播区分梯度计算与参数更新,最后用优化器了解梯度下降的工程变体。
来源与修订
迭代更新、负梯度方向和线性回归示例参考 Google 梯度下降课程 [S1];批量训练、随机梯度方法和深度模型优化边界参考 MIT Press《Deep Learning》优化章节 [S2]。本文不承诺梯度下降在所有目标上收敛到唯一最优解。
Learning navigation
学习导航
同领域兜底:当前词条暂时没有下一站或真实语义关系,先从同一领域的其他入口继续探索。
Source register
核验来源
- Linear Regression: Gradient DescentGoogle for Developers · 访问于 2026-07-29
- Deep Learning: Optimization for Training Deep ModelsMIT Press · 访问于 2026-07-29
发布 2026-07-29 · 更新 2026-07-29 · 核验 2026-07-29