梯度尋優 (二)

來源:互聯網
上載者:User

上接 梯度尋優

擴充:

  • 機器學習中的幾個概念的關係
逐次逼近法

問題 1: \(Ax = b\)

對於問題 1, 當 \(A\) 的階數很大, 且零元素很多的大型疏鬆陣列方程組, 使用主元消去法求解將是一個很大的挑戰. 為此, 逐次逼近法 (或稱為迭代法) 應運而生, 具體參考迭代法. (比如 共軛梯度法 便是一個不錯的迭代方法)

下面我們來看看迭代法的具體操作:

首先將 \(Ax=b\) 改寫為 \(x = Bx + f\), 使用公式:

\[x^{k+1} = Bx^k + f\]

其中 \(k\) 為迭代次數 \((k=0, 1, 2, \cdots)\)

逐步代入求近似解的方法稱為迭代法.

若 \(\underset{k \to \infty}\lim x^k\) 存在 (記作 \(x^*\)), 稱此迭代法收斂, 顯然 \(x^*\) 就是方程組的解, 否則稱此迭代法發散.

研究 \(\{x^k \}\) 的收斂性

引入誤差向量:
\[ε^{k+1} = x^{k+1} - x^*\]

得到
\[ε^{k+1} = (Bx^k + f) - (Bx^* + f) = Bε^k = B^kε^0\]

故而, 要研究 \(\{x^k \}\) 的收斂性, 只需要研究 \(\underset{k \to \infty}\lim ε^k = 0\) 或 \(\underset{k \to \infty}\lim B^k = 0\) 滿足的條件.

下面以 python 的形式呈現迭代的結果:

import numpy as np%pylab inline
Populating the interactive namespace from numpy and matplotlib
求解方程組 \(Ax=b\)消元法
A = mat([[8, -3, 2], [4, 11, -1], [6, 3, 12]])b = mat([20, 33, 36])result = linalg.solve(A, b.T)print(result)
[[3.] [2.] [1.]]
迭代求原方程組的解:\(x^{k+1}=B x^k+f\)
B = mat([[0.0, 3.0 / 8.0, -2.0 / 8.0], [-4.0 / 11.0, 0.0, 1.0 / 11.0],         [-6.0 / 12.0, -3.0 / 12.0, 0.0]])m, n = shape(B)f = mat([[20.0 / 8.0], [33.0 / 11.0], [36.0 / 12.0]])
error = 1.0e-7  # 誤差閾值steps = 100  # 迭代次數xk = zeros((n, 1))  # 初始化 xk = x0errorlist = []  # 記錄逐次逼近的誤差列表for k in range(steps):  # 主程式    xk_1 = xk  # 上一次的 xk    xk = B * xk + f  # 本次 xk    errorlist.append(linalg.norm(xk - xk_1))  # 計算並儲存誤差    if errorlist[-1] < error:  # 判斷誤差是否小於閾值        print(k + 1)  # 輸出迭代次數        breakprint(xk)  # 輸出計算結果
18[[2.99999998] [2.00000003] [1.00000003]]
繪製誤差收斂散佈圖
def drawScatter(plt, mydata, size=20, color='blue', mrkr='o'):    m, n = shape(mydata)    if m > n and m > 2:        plt.scatter(mydata.T[0], mydata.T[1], s=size, c=color, marker=mrkr)    else:        plt.scatter(mydata[0], mydata[1], s=size, c=color, marker=mrkr)
matpts = zeros((2, k + 1))matpts[0] = linspace(1, k + 1, k + 1)matpts[1] = array(errorlist)drawScatter(plt, matpts)plt.show()

, 可以看出誤差收斂很快, 從第四次就開始接近最終結果, 後面的若干次迭代都是對結果的微調.

通過誤差收斂與否判斷解的存在性, 只要誤差能夠收斂, 方程組就會有解, 但若目標函數是非線性, 為了更快的收斂, 我們需要找到收斂最快的方向 (梯度方向).

梯度下降

參考: 梯度下降法

假設目標函數是一個凸函數, 在最佳化方法中被表示為:

\[\underset{x}{\arg\min} \;\;f(x),\;\;x\in \mathbb{R}^n\]

假如 \(f(x)\) 在 \(x_0\) 處可微, 則 \(∇f(x_0)\) 便是 \(x_0\) 處的變化最快的方向.

為了求解 \(f(x)\) 的最小值, 可以選擇任意初始點 \(x_0\), 從 \(x_0\) 出發沿著負梯度方向走, 可使得 \(f(x)\) 下降最快. 引入新的參數 \(\rho_k\) 被稱為步長, 有

\[x_{k+1} = x_k - \rho_k\frac{∇f(x_k)}{||∇f(x_k)||}\]

詳細見 梯度相關代碼

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.