上接 梯度尋優
擴充:
逐次逼近法
問題 1: \(Ax = b\)
對於問題 1, 當 \(A\) 的階數很大, 且零元素很多的大型疏鬆陣列方程組, 使用主元消去法求解將是一個很大的挑戰. 為此, 逐次逼近法 (或稱為迭代法) 應運而生, 具體參考迭代法. (比如 共軛梯度法 便是一個不錯的迭代方法)
下面我們來看看迭代法的具體操作:
首先將 \(Ax=b\) 改寫為 \(x = Bx + f\), 使用公式:
\[x^{k+1} = Bx^k + f\]
其中 \(k\) 為迭代次數 \((k=0, 1, 2, \cdots)\)
逐步代入求近似解的方法稱為迭代法.
若 \(\underset{k \to \infty}\lim x^k\) 存在 (記作 \(x^*\)), 稱此迭代法收斂, 顯然 \(x^*\) 就是方程組的解, 否則稱此迭代法發散.
研究 \(\{x^k \}\) 的收斂性
引入誤差向量:
\[ε^{k+1} = x^{k+1} - x^*\]
得到
\[ε^{k+1} = (Bx^k + f) - (Bx^* + f) = Bε^k = B^kε^0\]
故而, 要研究 \(\{x^k \}\) 的收斂性, 只需要研究 \(\underset{k \to \infty}\lim ε^k = 0\) 或 \(\underset{k \to \infty}\lim B^k = 0\) 滿足的條件.
下面以 python 的形式呈現迭代的結果:
import numpy as np%pylab inline
Populating the interactive namespace from numpy and matplotlib
求解方程組 \(Ax=b\)消元法
A = mat([[8, -3, 2], [4, 11, -1], [6, 3, 12]])b = mat([20, 33, 36])result = linalg.solve(A, b.T)print(result)
[[3.] [2.] [1.]]
迭代求原方程組的解:\(x^{k+1}=B x^k+f\)
B = mat([[0.0, 3.0 / 8.0, -2.0 / 8.0], [-4.0 / 11.0, 0.0, 1.0 / 11.0], [-6.0 / 12.0, -3.0 / 12.0, 0.0]])m, n = shape(B)f = mat([[20.0 / 8.0], [33.0 / 11.0], [36.0 / 12.0]])
error = 1.0e-7 # 誤差閾值steps = 100 # 迭代次數xk = zeros((n, 1)) # 初始化 xk = x0errorlist = [] # 記錄逐次逼近的誤差列表for k in range(steps): # 主程式 xk_1 = xk # 上一次的 xk xk = B * xk + f # 本次 xk errorlist.append(linalg.norm(xk - xk_1)) # 計算並儲存誤差 if errorlist[-1] < error: # 判斷誤差是否小於閾值 print(k + 1) # 輸出迭代次數 breakprint(xk) # 輸出計算結果
18[[2.99999998] [2.00000003] [1.00000003]]
繪製誤差收斂散佈圖
def drawScatter(plt, mydata, size=20, color='blue', mrkr='o'): m, n = shape(mydata) if m > n and m > 2: plt.scatter(mydata.T[0], mydata.T[1], s=size, c=color, marker=mrkr) else: plt.scatter(mydata[0], mydata[1], s=size, c=color, marker=mrkr)
matpts = zeros((2, k + 1))matpts[0] = linspace(1, k + 1, k + 1)matpts[1] = array(errorlist)drawScatter(plt, matpts)plt.show()
, 可以看出誤差收斂很快, 從第四次就開始接近最終結果, 後面的若干次迭代都是對結果的微調.
通過誤差收斂與否判斷解的存在性, 只要誤差能夠收斂, 方程組就會有解, 但若目標函數是非線性, 為了更快的收斂, 我們需要找到收斂最快的方向 (梯度方向).
梯度下降
參考: 梯度下降法
假設目標函數是一個凸函數, 在最佳化方法中被表示為:
\[\underset{x}{\arg\min} \;\;f(x),\;\;x\in \mathbb{R}^n\]
假如 \(f(x)\) 在 \(x_0\) 處可微, 則 \(∇f(x_0)\) 便是 \(x_0\) 處的變化最快的方向.
為了求解 \(f(x)\) 的最小值, 可以選擇任意初始點 \(x_0\), 從 \(x_0\) 出發沿著負梯度方向走, 可使得 \(f(x)\) 下降最快. 引入新的參數 \(\rho_k\) 被稱為步長, 有
\[x_{k+1} = x_k - \rho_k\frac{∇f(x_k)}{||∇f(x_k)||}\]
詳細見 梯度相關代碼