標籤:smart zabbix 硬碟壽命 硬碟健康監控
騷年有夢
E-mail:[email protected]
一、SMART概述
硬碟的故障一般分為兩種:可預測的(predictable)和不可預測的(unpredictable)。後者偶而會發生,也沒有辦法去預防它,例如晶片突然失效,機械撞擊等。但像電機軸承磨損、碟片磁介質效能下降等都屬於可預測的情況,可以在在幾天甚至幾星期前就發現這種不正常的現象。如果發生這種問題,SMART功能會在開機時響起警報,至少讓使用者有足夠的時間把重要資料轉移到其它儲存裝置上。
最早期的硬碟監控技術起源於1992年,IBM在AS/400電腦的IBM 0662 SCSI 2代硬碟中使用了後來被命名為Predictive Failure Analysis(故障預警分析技術)的監控技術,它是通過在韌體中測量幾個重要的硬碟安全參數和評估他們的情況,然後由監視軟體得出兩種結果:“硬碟安全”或“不久後會發生故障”。
不久,當時的微機製造商康柏和硬碟製造商希捷、昆騰以及康納共同提出了名為IntelliSafe的類似技術。通過該技術,硬碟可以測量自身的的健康指標並將參量值傳送給作業系統和使用者的監視軟體中,每個硬碟生產商有權決定哪些指標需要被監控以及設定它們的安全閾值。
1995年,康柏公司將該技術方案提交到Small Form Factor(SFF)委員會進行標準化,該方案得到IBM、希捷、昆騰、康納和西部資料的支援,1996年6月進行了1.3版的修正,正式更名為S.M.A.R.T.(Self-Monitoring Analysis And Reporting Technology),全稱就是“自我檢測分析與報告技術”,成為一種自動監控硬碟完好狀況和報告潛在問題的技術標準。
作為行業規範,SMART規定了硬碟製造廠商應遵循的標準,滿足SMART標準的條件主要包括:
1)在裝置製造期間完成SMART需要的各項參數、屬性的設定;
2)在特定系統平台下,能夠正常使用SMART;通過BIOS檢測,能夠識別裝置是否支援SMART並可顯示相關資訊,而且能辨別有效和失效的SMART資訊;
3)允許使用者自由開啟和關閉SMART功能;
4)在使用者使用過程中,能提供SMART的各項有效資訊,確定裝置的工作狀態,並能發出相應的修正指令或警告。在硬碟及作業系統都支援SMART技術並且開啟的情況下,若硬碟狀態不良,SMART技術能夠在螢幕上顯示英文警告資訊:“WARNING:IMMEDIATLY BACKUP YOUR DATA AND REPLACE YOUR HARD DISK DRIVE,A FAILURE MAY BE IMMINENT.”(警告:立刻備份你的資料並更換硬碟,硬碟可能失效。)
SMART功能不斷從硬碟上的各個感應器收集資訊,並把資訊儲存在硬碟的系統保留區(service area)內,這個地區一般位於硬碟0物理面的最前面幾十個物理磁軌,由廠商寫入相關的內部管理程式。這裡除了SMART資訊表外還包括低階格式化程式、加密解密程式、自監控程式、自動修複程式等。使用者使用的監測軟體通過名為“SMART Return Status”的命令(命令代碼為:B0h)對SMART資訊進行讀取,且不允許終端使用者對資訊進行修改。
是的,我們要通過SMART來監控硬碟的健康狀態和硬碟組件得壽命。下面是我這邊監控效果:
SSD硬碟硬體監控情況:
650) this.width=650;" src="http://s3.51cto.com/wyfs02/M02/79/91/wKiom1aUu2mzmaOlAAESbDAjEPU067.png" title="clipboard.png" alt="wKiom1aUu2mzmaOlAAESbDAjEPU067.png" />
監控內容解釋:
編程錯誤計數塊數 : 字面意思
通電次數 : 字面意思
硬碟使用時間百分比 : 這個參數的含義一目瞭然,表示硬碟通電的時間,資料值直接累計了裝置通電的時間長度,新硬碟當然應該接近0,但不同硬碟的計數單位有所不同,有以小時計數的,也有以分、秒甚至30秒為單位的,這由磁碟製造商來定義。接近臨界值表明硬碟已接近預計的設計壽命,當然這並不表明硬碟將出現故障或立即報廢。參考磁碟製造商給出的該型號硬碟的MTBF(平均無故障時間)值,可以大致估計剩餘壽命或故障機率。
硬碟溫度 : 字面意思
硬碟元件擦寫壽命百分比 :所有好塊的平均擦寫次數。 Flash晶片有寫入次數限制,當使用FAT檔案系統時,需要頻繁地更新檔案配置表。如果快閃記憶體的某些地區讀寫過於頻繁,就會比其它地區磨損的更快,這將明顯縮短整個硬碟的壽命(即便其它地區的擦寫次數還遠小於最大限制)。所以,如果讓整個地區具有均勻的寫入量,就可明顯延長晶片壽命,這稱為磨損均衡措施。 通俗意思就是硬碟塊擦寫壽命。
硬碟錯誤偵測和糾正(ECC)次數 : ECC(Error Correcting Code)的意思是“錯誤檢查和糾正”,這個技術能夠容許錯誤,並可以將錯誤更正,使讀寫操作得以持續進行,不致因錯誤而中斷。這一項的資料值記錄了磁頭在碟片上讀寫時通過ECC技術校正錯誤的次數
剩餘退役塊計數百分比 :已經被確認損壞的flush晶片,會記錄到退役塊中,將不再使用,自動將備用得映射到原壞得退役塊中。
使用備用塊數量百分比 :即上中用來替換退役塊得備份塊數量,當這個使用到100%時,硬碟將不要再使用,因為沒有可用備用塊,在有故障塊得時候沒法替換,造成資料丟失。
SATA硬碟硬體監控情況:
650) this.width=650;" src="http://s3.51cto.com/wyfs02/M02/79/8F/wKioL1aUu6rTsj81AAJFpKTxFQY510.png" title="clipboard1.png" alt="wKioL1aUu6rTsj81AAJFpKTxFQY510.png" />
監控內容解釋:
被掛起得扇區數 :這個參數的資料表示了“不穩定的”扇區數,即等待被映射的扇區(也稱“被掛起的扇區”)數量。如果不穩定的扇區隨後被讀寫成功,該扇區就不再列入等待範圍,資料值就會下降。僅僅讀取時出錯的扇區並不會導致重新對應,只是被列入“等待”,也許以後讀取就沒有問題,所以只有在寫入失敗時才會發生重新對應。下次對該扇區寫入時如果繼續出錯,就會產生一次重新對應操作,此時重新對應扇區計數(05)與重新對應事件計數(C4)的資料值增加,此參數的資料值下降。
離線無法校正得扇區計數 :這個參數的資料累計了讀寫扇區時發生的無法校正的錯誤總數。資料值上升表明碟片表面介質或機械子系統出現問題,有些扇區肯定已經不能讀取,如果有檔案正在使用這些扇區,作業系統會返回讀盤錯誤的資訊。下一次寫操作時會對該扇區執行重新對應。
磁頭載入次數 :對於過去的硬碟來說,碟片停止旋轉時磁頭臂停靠於碟片中心軸處的停泊區,磁頭與碟片接觸,只有當碟片旋轉到一定轉速時,磁頭才開始漂浮於碟片之上並開始向外側移動至資料區。這使得磁頭在硬碟啟停時都與碟片發生摩擦,雖然碟片的停泊區不儲存資料,但無疑啟停一個迴圈,就使磁頭經曆兩次磨損。所以對以前的硬碟來說,磁頭起降(載入/卸載)次數是一項重要的壽命關鍵參數。 而在現代硬碟中,平時磁頭臂是停靠於碟片之外的一個專門設計的停靠架上,遠離碟片。只有當碟片旋轉達到額定轉速後,磁頭臂才開始向內(碟片軸心)轉動使磁頭移至碟片地區(載入),磁頭臂向外轉動返回至停靠架即卸載。這樣就徹底杜絕了硬碟啟停時磁頭與碟片接觸的現象,西部資料公司將其稱為“斜坡載入技術”。由於磁頭在載入/卸載過程中始終不與碟片接觸,不存在磁頭的磨損,使得這一參數的重要性已經大大下降。 這個參數的資料值就是磁頭執行載入/卸載操作的累計次數。從原理上講,這個載入/卸載次數應當與硬碟的啟停次數相當,但對於筆記本內建硬碟以及台式機新型節能硬碟來說,這一項的資料量會很大。這是因為磁頭臂組件設計有一個固定的返回力矩,保證在意外斷電時磁頭能靠彈簧力自動離開碟片半徑範圍,迅速返回停靠架。所以要讓硬碟運行時磁頭保持在碟片的半徑之內,就要使磁頭臂驅動電機(尋道電機)持續通以電流。而讓磁頭臂在硬碟空閑幾分鐘後就立即執行卸載動作,返回到停靠架上,既有利於節能,又降低了硬碟受外力衝擊導致磁頭與碟片接觸的機率。雖然再次載入會增加一點尋道時間,但畢竟弊大於利,所以在這類硬碟中磁頭的載入/卸載次數會遠遠大於通電周期計數(0C)或啟停計數(04)的資料量。不過這種載入/卸載方式已經沒有了磁頭與碟片的接觸,所以設計值也已大大增加,通常筆記本內建硬碟的磁頭載入/卸載額定值在30~60萬次,而台式機新型節能硬碟的磁頭載入/卸載設計值可達一百萬次。
硬碟通電次數 :字面意思
硬碟軸電機壽命 :字面意思
硬碟使用時間百分比 :字面意思
硬碟溫度 : 字面意思
硬碟意外斷電次數 :字面意思
底層資料讀取錯誤百分比 :底層資料讀取錯誤率是磁頭從磁碟表面讀取資料時出現的錯誤,對某些硬碟來說,大於0的資料表明磁碟表面或者讀寫磁頭髮生問題,如介質損傷、磁頭汙染、磁頭共振等等。
尋道錯誤百分比 :這一項表示磁頭尋道時的錯誤率,有眾多因素可導致尋道錯誤率上升,如磁頭組件的機械繫統、伺服電路有局部問題,碟片表面介質不良,硬碟溫度過高等等。
剩餘備用扇區百分比 :當硬碟的某扇區持續出現讀/寫/校正錯誤時,硬碟韌體程式會將這個扇區的物理地址加入缺陷表(G-list),將該地址重新定向到預先保留的備用扇區並將其中的資料一併轉移,這就稱為重新對應。執行重新對應操作後的硬碟在Windows常規檢測中是無法發現不良扇區的,因其地址已被指向備用扇區,這等於屏蔽了不良扇區。因為不同硬碟保留的備用扇區數並不相同),表示缺陷表已滿或備用扇區已用盡,已經失去了重新對應功能,再出現不良扇區就會顯現出來並直接導致資料丟失。 這一項不僅是硬碟的壽命關鍵參數,而且重新對應扇區的數量也直接影響硬碟的效能,例如某些硬碟會出現資料量很大,但當前值下降不明顯的情況,這種硬碟儘管還可正常運行,但也不宜繼續使用。因為備用扇區都是位於磁碟尾部(靠近碟片軸心處),大量的使用備用扇區會使尋道時間增加,硬碟效能明顯下降。
主軸起旋重試次數 :主軸起旋重試次數的資料值就是主軸電機嘗試重新啟動的計數,即主軸電機啟動後在規定的時間裡未能成功達到額定轉速而嘗試再次啟動的次數。資料量的增加表示電機驅動電路或是機械子系統出現問題,整機供電不足也會導致這一問題。
主軸起旋時間健康狀態 :主軸起旋時間就是主軸電機從啟動至達到額定轉速所用的時間,資料值直接顯示時間,單位為毫秒或者秒,因此資料值越小越好。不過對於正常硬碟來說,這一項僅僅是一個參考值,硬碟每次的啟動時間都不相同,某次啟動的稍慢些也不表示就有問題。硬碟的主軸電機從啟動至達到額定轉速大致需要4秒~15秒左右,過長的啟動時間說明電機驅動電路或者軸承機構有問題。旦這一參數的資料值在某些型號的硬碟上總是為0,這就要看當前值和最差值來判斷了。
具體實現方法稍後會總結後寫到部落格中。
本文出自 “一個夢” 部落格,請務必保留此出處http://yigemeng.blog.51cto.com/8638584/1734250
(玩轉zabbix)硬碟硬體健康狀態監控,組件壽命監控