目前,嵌入式多核處理器已經在嵌入式裝置領域得到廣泛運用,但嵌人式系統軟體開發技術還停留在傳統單核模式,並沒有充分發揮多核處理器的效能。程式並行化最佳化目前在PC平台上有一定運用,但在嵌入式平台上還很少,另外,嵌入式多核處理器與PC平台多核處理器有很大不同,因此不能直接將PC平台的並行化最佳化方法應用到嵌人式平台。本文分別從任務並行和緩衝最佳化兩方面進行並行化最佳化的研究,探索在嵌人式多核處理器上對程式進行並行化最佳化的方法。
1 嵌入式多核處理器結構
嵌人式多核處理器的結構包括同構(Symmetric)和異構(Asymmetric)兩種。同構是指內部核的結構是相同的,這種結構目前廣泛應用在PC多核處理器;而異構是指內部核的結構是不同的,這種結構常常在嵌入式領域使用,常見的是通用嵌入式處理器+DSP核。本文探究的嵌入式多核處理器採用同構結構,實現同一段代碼在不同處理器上的並存執行。
圖1 ARM SMP處理器結構
在目前嵌入式領域中,使用最為廣泛的為ARM 處理器,因此以ARM 雙核處理器OMAP4430作為研究對象。ARM 對稱式多處理(Symmetric Multi-Processing,SMP)結構如圖1所示,根據程式的局部性原理,每一個處理器都具有私人的記憶體(Local Memory),常見的是一級緩衝(L1Cache)。然而,多個處理器之間又涉及到相互連信問題,因此在常見的ARM 處理器中使用二級緩衝(L2 Cache)來解決這一問題。基於對稱式多處理器結構,所有的處理器(通常為2的倍數)在硬體結構上都是相同的,在使用系統資源上也是平等的。更重要的是,由於所有的處理器都有權利去訪問相同的記憶體空間,在共用記憶體地區中,任何一個進程或者線程都可以運行在任意一個處理器之上,這樣就使得程式的並行化成為可能。2在嵌入式多核平台上進行並行化最佳化,需要考慮以下問題:
① 並行化程式的效能取決於程式中序列化部分,程式效能不會隨著並行線程數目的提升而不斷提升;
② 嵌入式多核處理器相對於PC處理器而言,其匯流排速度較慢,並且緩衝(Cache)更小,會造成大量資料在記憶體(Memory)和緩衝(Cache)問不斷拷貝,因此在進行並行化最佳化的過程中,應考慮緩衝友好性(Cache friendly);
③ 程式並行化執行線程數目應當小於或等於物理處理器的數目,線程過多會造成線程間搶佔處理器資源,致使並行化效能下降。
2 OpenMP並行化最佳化
2.1 0penMP工作原理簡介
OpenMP是一個基於共用記憶體模式的跨平台多線程並行的編程介面。主線程產生一系列的子線程,並將任務映射到子線程進行執行,這些子線程並存執行,由運行時環境將線程分配給不同的物理處理器。預設情況下,各個線程獨立執行並列區域的代碼。可以使用work-sharingconstructs來劃分任務,使每個線程執行其分配部分的代碼。通過這種方式,使用OpenMP可以實現任務並行和資料並行。
圖2 任務並行模型
任務並行模式建立一系列獨立的線程,每一個線程運行一個任務,線程之間相互獨立,如圖2所示。OpenMP使用編譯原語session directive和task directive來實現任務分配,每個線程可以獨立運行不同的代碼地區,同時支援任務的嵌套和遞迴。一旦建立任務,該任務就可能會線上程池(其大小等於物理線程數目)中閒置線程上執行。
資料並行也就是資料級並行,對任務中處理的資料進行分塊並存執行,如圖3所示。C語言中的for迴圈最適合使用資料並行。
圖3 資料並行模型
2.2 快速排序演算法原理
快速排序演算法是一種遞迴分治演算法,演算法中最為關鍵的就是確定哨兵元素(pivot data)。資料序列中小於哨兵的資料將會放在哨兵元素的左側,序列中大於哨兵的資料將會被放在哨兵元素的右側。當完成資料掃描後,哨兵元素分成的左右兩個部分就會調用快速排序演算法遞迴進行。
快速排序演算法中涉及演算法的遞迴調用,會產生大量任務,並且這些任務相互獨立,非常適合OpenMP的任務並行模式;另外,就一次快速排序搜尋演算法而言,哨兵元素對於左右子區間資料容量大小具有決定性作用,考慮到嵌入式平台的緩衝(Cache)空間較小,需要對哨兵元素篩選演算法進行最佳化,盡量使得劃分出來的左右子區間更均衡,滿足負載平衡的要求。
2.3 任務並行化最佳化
通過對快速排序演算法的分析,快速排序是一個遞迴調用演算法,演算法的執行過程中會產生大量重複函數調用,並且函數的執行相互獨立。對於快速排序的一次掃描運算而言,演算法首先確定哨兵元素(pivot),並對資料序列進行一次調整,然後對哨兵元素的左右區間再次進行遞迴調用演算法。
如下所示,對任務並行化最佳化針對每次掃描調整後的左右子區間,將每個子區間的運算抽象為一個任務,並通過OpenMP中的任務並行化原語#pragma omp task實現任務的並行化執行,從而實現了快速排序的任務並行化最佳化。
任務空間中的資料大小取決於哨兵元素,因此,演算法選取的劃分演算法(Partition Algorithm)應盡量將資料序列的劃分均衡化,本文使用簡單劃分演算法和三元中值法(Median-of-Three Method)進行測試。
2.4 緩衝最佳化
緩衝最佳化(Cache friendly)的目標是減少資料在記憶體和緩衝之間的拷貝。對於220個整型資料而言,資料大小為4 MB,本文的測試平台()MAP4430的二級緩衝為1 MB,需要將資料劃分為4個部分。
如下所示,演算法將4部分資料分為4個快速排序任務,4部分任務並存執行,完成後每部分資料序列排序完成,需要將4部分資料進行合并形成完成資料序列,因此在並行任務結束後,需要對資料進行歸併排序。
3 並行化效能分析
3.1 實驗環境介紹
本文採用德州儀器(Texas Instruments)的OMAP4430嵌入式開發平台。OMAP443O為嵌入式多核處理器,擁有對稱式多處理雙核ARM 處理器(Dual-core ARM Cortex-A、一級緩衝32 KB、二級緩衝1 MB,嵌入式作業系統採用Ubuntul2.O4核心,編譯器為arm-Linux-gnueabihf-gcc,使用GNU gprof擷取演算法執行時間。
3.2 效能測試
如下式所示,採用計算加速比的方式來分析並行最佳化的效能,加速比數值越大表示演算法的並行程度越高,最低為1.效能測試採用4個演算法版本,包括串列版本、並行2線程、並行4線程和緩衝最佳化版,從不同角度來分析效能。
如圖4所示,從折線圖可以看出,3種並行化最佳化演算法相對於串列版本,演算法的並行效能都有較大提升,如表1所列,其並行加速比分別為1.30、1.29和1.21.對任務並行最佳化方案而言,分別使用2線程和4線程版本進行測試,從加速比的分析結果看來,2線程版本較4線程版本略好。理論上並行線程的數目越多效能越好,但本文採用OMAP443O只有兩個對稱式多處理核心,即使演算法擁有4個並行線程,但實際執行的線程只有2個,同時4個線程在擷取2個物理處理器時存在競爭關係,因而造成效能較之2線程版本有所下降。
圖4 演算法執行時間
評價並行演算法優劣還需考慮演算法的負載平衡性,如表1、表2所列,緩衝最佳化方案標準差遠遠小於任務並行化方案。究其原因,對於任務並行化方案而言,不同的測試資料以及劃分演算法(partition)對區間的劃分有重要影響,從而造成任務執行時間變化範圍很大;對於緩衝最佳化方案而言,其實質是資料並行,其每一個任務都是根據緩衝大小進行劃分,因此每一個任務處理的資料規模基本一致,每一個任務執行的時間更確定,但由於並行任務執行完成後,需要對資料進行歸併,造成一定的效能下降。
結語
本文通過對嵌入式多核處理器硬體結構的分析,從對稱式多處理角度對串列快速排序演算法進行並行化最佳化,取得了很好的效果。
以ARM 雙核處理器(OMAP4430)作為測試平台,從任務並行和緩衝最佳化實現並行最佳化,從效能測試的結果看,任務並行具有良好的加速比,但負載平衡性差,並行線程數目不應超過物理處理器核的數目,過多的並行線程競爭處理器資源,造成效能下降。緩衝最佳化具有良好的負載平衡性,但需要後續進行歸併操作,造成效能有所下降。
總之,在嵌入式多核處理器上進行並行化最佳化,一方面要充分發掘嵌人式多核處理器的並行效能,提高程式的並行性;另一方面也要考慮程式演算法的負載平衡性,確保在不同應用環境中程式效能一致。