[編程技巧] 巧用CPU緩衝最佳化代碼:數組 vs. 鏈表

來源:互聯網
上載者:User

 一個常見的編程問題: 遍曆同樣大小的數組和鏈表, 哪個比較快? 如果按照大學教科書上的演算法分析方法,你會得出結論,這2者一樣快, 因為時間複雜度都是 O(n)。 但是在實踐中, 這2者卻有極大的差異。   通過下面的分析你會發現, 其實數組比鏈表要快很多。

 

首先介紹一個概念:memory hierarchy (儲存層次結構),電腦中存在多種不同的儲存空間,如下表

  • CPU 寄存器 – immediate access (0-1個CPU刻度)
  • CPU L1 緩衝  – fast access (3個CPU刻度)
  • CPU L2 緩衝 – slightly slower access (10個CPU刻度)
  • 記憶體 (RAM)   – slow access (100個CPU刻度)
  • 硬碟 (file system) – very slow (10,000,000個CPU刻度)

      (資料來自 http://www.answers.com/topic/locality-of-reference)

 

各層級的儲存空間速度差異非常大,CPU寄存器速度是記憶體速度的100倍! 這就是為什麼CPU產商發明了CPU緩衝。 而這個CPU緩衝,就是數組和鏈表的區別的關鍵所在。

 

CPU緩衝會把一片連續的記憶體空間讀入, 因為數組結構是連續的記憶體位址,所以數組全部或者部分元素被連續存在CPU緩衝裡面, 平均讀取每個元素的時間只要3個CPU刻度。   而鏈表的節點是分散在堆空間裡面的,這時候CPU緩衝幫不上忙,只能是去讀取記憶體,平均讀取時間需要100個CPU刻度。 這樣算下來,數組訪問的速度比鏈錶快33倍! (這裡只是介紹概念,具體的數字因CPU而異)

 

因此,程式中盡量使用連續的資料結構,這樣可以充分發揮CPU緩衝的威力。 這種對緩衝友好的演算法稱為 Cache-oblivious algorithm, 有興趣可以參考相關資料。再舉一個簡單例子:

 

對比

for i in 0..n
  for j in 0..m
    for k in 0..p
      C[i][j] = C[i][j] + A[i][k] * B[k][j];

for i in 0..n

  for k in 0..p
    for j in 0..m
      C[i][j] = C[i][j] + A[i][k] * B[k][j];

 

雖然兩者執行結果一樣,演算法複雜度也一樣,但是你會發現第二種寫法要快很多。 

 

總結一下, 各種儲存空間的速度差異很大,在編程中絕對有必要考慮這個因素。 比如,記憶體速度比硬碟快1萬倍,所以程式中應該盡量避免頻繁的硬碟讀寫;CPU緩衝比記憶體快幾十倍,在程式中盡量多加利用。

 

 

 >> 原創文章的著作權屬於作者,轉載請註明出處和作者資訊(http://blog.csdn.net/WinGeek/), 謝謝。 <<

 

 

 

 

 

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.