)
本課學習駐點求解海塞矩陣極值判定對應AI訓練核心問題尋找損失函數最小值、區分局部最優/全局最優、識別鞍點。開篇前簡述二元函數駐點、極值判別、海塞(Hessian)矩陣 在大模型中的應用一、基礎概念二元函數 f(x,y)駐點一階偏導數全部為0的點\frac{\partial f}{\partial x}0,\quad \frac{\partial f}{\partial y}0駐點只是坡度0的平地不一定是極值可以是極小、極大、鞍點。海塞矩陣H二階偏導構成對稱方陣H\begin{bmatrix}\frac{\partial^2 f}{\partial x^2} \frac{\partial^2 f}{\partial x\partial y}[4pt]\frac{\partial^2 f}{\partial y\partial x} \frac{\partial^2 f}{\partial y^2}\end{bmatrix}混合偏導連續時 \displaystyle \frac{\partial^2 f}{\partial x\partial y}\frac{\partial^2 f}{\partial y\partial x}矩陣對稱。行列式\boldsymbol D\det(H)f_{xx}f_{yy}-(f_{xy})^2。駐點處二階判別法則D0,\ f_{xx}0H正定 → 局部極小值碗底D0,\ f_{xx}0H負定 → 局部極大值山頂D0H不定 → 鞍點馬鞍點一個方向向上彎、一個方向向下彎不是極值D0二階信息失效無法判斷要看更高階導數。幾何理解梯度一階告訴你往哪走海塞矩陣二階描述曲面局部曲率告訴你腳下地形是碗、山峰、馬鞍還是平坦地面。二、推廣到大模型高維損失函數 L(\boldsymbol w)大模型損失是百萬?億維參數\boldsymbol w的標量函數。梯度\nabla L一階每一個參數的偏導數海塞矩陣\boldsymbol H二階導數矩陣尺寸【參數量 × 參數量】現實中根本無法完整存儲參數量幾十億矩陣規模爆炸工程只做近似、海塞?向量乘積HVP不構造完整矩陣。海塞矩陣特征值含義高維全部特征值0正定局部極小全部特征值0負定局部極大高維損失曲面極少出現特征值有正有負不定鞍點大模型訓練大量遇到部分特征值≈0半定平坦極小區域參數改動很多損失幾乎不變。大模型里面海塞矩陣4個核心原理與應用7. 區分極小值和鞍點最關鍵梯度等于0不一定到達谷底很可能卡在鞍點馬鞍地形。普通SGD只看梯度分不清海塞矩陣看曲率識別鞍點。高維空間鞍點數量極多是訓練停滯的重要來源 。8. 區分尖銳極小 vs 平坦極小關聯模型泛化能力海塞特征值整體大尖銳谷底參數稍微擾動損失暴漲容易過擬合大量特征值接近0平坦谷底參數擾動損失變化小泛化能力往往更好。這是深度學習理論重要結論模型不一定收斂到“損失最低點”平坦極小往往實際效果更好。9. 二階優化器牛頓法為代表理論基礎梯度下降只利用一階信息牛頓法利用海塞矩陣修正更新方向會根據曲率自適應調整步長。現實大模型不會直接用完整牛頓法海塞太大衍生各類近似二階優化器。10. 泰勒二次近似損失函數在參數點附近局部展開L(\boldsymbol w\Delta\boldsymbol w)\approx L(\boldsymbol w)\nabla L^T\Delta\boldsymbol w\frac12\Delta\boldsymbol w^T H\Delta\boldsymbol w海塞矩陣決定二次項刻畫局部彎曲程度是幾乎全部優化理論分析的數學底座。三、現實工程提醒大模型不會顯式計算完整海塞矩陣維度爆炸內存裝不下。實際做法海塞?向量乘積(HVP)只算矩陣乘向量不生成完整矩陣用來做理論分析、近似二階優化、評估樣本影響等。極簡總結記憶11. 梯度坡度海塞矩陣地形曲率駐點坡度為零但地形有碗頂、馬鞍、平地。12. 二元看行列式D高維看海塞矩陣特征值符號。13. 大模型損失空間大量鞍點、平坦區域海塞矩陣是理解訓練收斂、泛化能力的數學工具但工程上只能做近似不直接構造完整矩陣。核心知識點14. 駐點定義梯度 \nabla f(x,y)(0,0) 的點即滿足\begin{cases}\dfrac{\partial f}{\partial x}0[4pt]\dfrac{\partial f}{\partial y}0\end{cases}駐點分三類極小值點、極大值點、鞍點。海塞矩陣二元H\begin{pmatrix}\dfrac{\partial^2 f}{\partial x^2} \dfrac{\partial^2 f}{\partial x\partial y}[4pt]\dfrac{\partial^2 f}{\partial y\partial x} \dfrac{\partial^2 f}{\partial y^2}\end{pmatrix}判別式 D\displaystyle \frac{\partial^2 f}{\partial x2}\cdot\frac{\partial2 f}{\partial y2}-\left(\frac{\partial2 f}{\partial x\partial y}\right)^2判定規則D0,\ \dfrac{\partial^2 f}{\partial x^2}0極小值點損失最低點訓練目標D0,\ \dfrac{\partial^2 f}{\partial x^2}0極大值點D0鞍點梯度為0但不是最優大模型訓練易停滯D0判別失效無法判定AI對應邏輯17. 損失函數極小值 模型訓練收斂目標18. 鞍點梯度為0但曲面是馬鞍形普通梯度下降會卡在這19. 海塞矩陣二階優化器牛頓法能識別鞍點、跳出局部最優。10道二元極值計算題步驟AI工程解讀題1f(x,y)x24y2求駐點并判定極值20. 一階偏導f_x2x,\ f_y8y21. 令梯度為02x0,\ 8y0駐點 (0,0)22. 二階偏導f_{xx}2,\ f_{yy}8,\ f_{xy}023. D2\times8 - 0^2160,\ f_{xx}0結論(0,0) 極小值點極小值 f(0,0)0AI解讀標準二維MSE損失全局唯一極小值梯度下降一定收斂無局部最優干擾。題2f(x,y)-x2-3y25求駐點與極值f_x-2x,\ f_y-6y駐點(0,0)f_{xx}-2,\ f_{yy}-6,\ f_{xy}0D120,\ f_{xx}0極大值點極大值5AI解讀反向損失曲面現實訓練不會出現僅用于對比凹凸邏輯。題3f(x,y)x2-y2判別駐點類型f_x2x,\ f_y-2y駐點(0,0)f_{xx}2,\ f_{yy}-2,\ f_{xy}0D2\times(-2)-0-40結論鞍點AI解讀典型馬鞍形損失曲面梯度歸零但不是最優普通SGD極易卡在鞍點停滯。題4f(x,y)x2xy2y2求駐點并判定f_x2xy,\ f_yx4y聯立\begin{cases}2xy0\x4y0\end{cases}解得駐點(0,0)f_{xx}2,\ f_{yy}4,\ f_{xy}1D2\times4 - 170,\ f_{xx}0極小值點AI解讀帶權重耦合的損失函數混合偏導不為0但整體正定依舊穩定收斂。題5f(x,y)x3-3xyy3求全部駐點并判定f_x3x2-3y, f_y-3x3y2聯立yx2, xy2解得駐點(0,0)、(1,1)24. (0,0)f_{xx}0,f_{yy}0,f_{xy}-3,\ D0-9-90 → 鞍點25. (1,1)f_{xx}6,f_{yy}6,f_{xy}-3,\ D36-9270,f_{xx}0 → 極小值點AI解讀存在鞍點局部極小模型初始化位置不同可能收斂到不同結果。題6f(x,y)e{x2y^2}求駐點判定f_x2x e{x2y^2},\ f_y2y e{x2y^2}駐點(0,0)f_{xx}2e{x2y2}(12x2),\ f_{yy}2e{x2y2}(12y2),\ f_{xy}4xy e{x2y^2}(0,0)處f_{xx}2,f_{yy}2,f_{xy}0,\ D40極小值點AI解讀指數型正則損失曲面平滑且僅一個全局最小值訓練十分穩定。題7f(x,y)4-x2-xy-y2駐點極值判斷f_x-2x-y,\ f_y-x-2y聯立解得駐點(0,0)f_{xx}-2,f_{yy}-2,f_{xy}-1D4-130,f_{xx}0極大值點AI解讀負向損失曲面無實際訓練意義用于區分極大/極小判定邏輯。題8f(x,y)xy駐點類型判定f_xy,\ f_yx駐點(0,0)f_{xx}0,f_{yy}0,f_{xy}1D0-1-10鞍點AI解讀純權重交叉項損失全局無最小值訓練會持續震蕩無法收斂。題9f(x,y)x22y2-2x4y求駐點、極小值f_x2x-2,\ f_y4y4令梯度為0x1,\ y-1駐點(1,-1)f_{xx}2,f_{yy}4,f_{xy}0,\ D80極小值點極小值f(1,-1)-3AI解讀帶偏移參數的二維損失存在唯一全局最低點梯度下降可穩定收斂。題10 壓軸綜合f(x,y)x^2 e^{y}-2y求駐點并判定極值一階偏導f_x2x e^y,\quad f_yx^2 e^y -2聯立方程2x e^y0 \Rightarrow x0代入第二式0-20方程無解結論無駐點函數無極大、極小值AI解讀特殊復合損失曲面不存在梯度歸零的位置模型訓練會持續迭代永遠無法完全收斂。課程核心總結銜接第38課梯度下降完整數學推導26. 駐點是梯度為0的位置分為極小、極大、鞍點三類27. 海塞判別式D是區分鞍點與極值的核心工具28. AI訓練目標是找到損失函數極小值點鞍點會造成訓練停滯29. 若不存在駐點代表損失無下限模型會持續發散震蕩。訓練大模型時經常遇到卡在鞍點、局部最優的問題你知道哪些優化算法可以緩解這個現象歡迎評論區交流