shell指令碼監控系統負載、CPU和記憶體使用量情況_linux shell

來源:互聯網
上載者:User

在沒有nagios監視軟體的情況下,只要伺服器能上互連網,就可通過發郵件的方式來提醒管理員系統負載與CPU佔用的使用方式。

一、安裝linux下面的一個郵件用戶端msmtp軟體(類似於一個foxmail的工具)

 1、下載安裝:
 http://downloads.sourceforge.net/msmtp/msmtp-1.4.16.tar.bz2?modtime=1217206451&big_mirror=0

複製代碼 代碼如下:

# tar jxvf msmtp-1.4.16.tar.bz2
# cd msmtp-1.4.16
# ./configure --prefix=/usr/local/msmtp
# make && make install

 2、建立msmtp設定檔和記錄檔(host為郵件網域名稱,郵件使用者名fuquanjun,密碼fuquanjun)

複製代碼 代碼如下:

# vim /root/.msmtprc

account default 
host xxxxx.com 
from fuquanjun@xxxx.com 
auth login 
user fuquanjun
password fuquanjun
logfile ~/.msmtp.log
 # chmod 600  /root/.msmtprc
 # touch ~/.msmtp.log

3、mutt安裝配置:(一般linux下有預設安裝mutt)

如果沒有安裝,則使用yum安裝

複製代碼 代碼如下:

yum -y install mutt
# vim /root/.muttrc
set sendmail="/usr/local/msmtp/bin/msmtp"
set use_from=yes
set realname="moniter"  
set from=fuquanjun@xxx.com 
set envelope_from=yes
set rfc2047_parameters=yes
set charset="utf-8

4、郵件發送測試(-s郵件標題,-a表加附件)

複製代碼 代碼如下:

 # echo "郵件內容123456" | mutt -s "郵件標題測試郵件" -a /scripts/test.txt  fuquanjun@xxxx.com

出現下面報錯資訊:
複製代碼 代碼如下:

msmtp: account default not found: no configuration file available

發送信件出錯,子進程已退出 78 ()。
無法發送此信件。
解決方案:

單獨使用msmtp發送測試:/usr/local/msmtp/bin/msmtp -S  發現是設定檔沒找到

複製代碼 代碼如下:

msmtp: account default not found: no configuration file available

查看當前的設定檔路徑:/usr/local/msmtp/bin/msmtp -P
複製代碼 代碼如下:

ignoring system configuration file/work/target/etc/msmtprc: No such file or directory
ignoring user configuration file /root/.msmtprc: No such file ordirectory
falling back to default account
msmtp: account default not found: no configuration file available

故將/usr/local/etc/msmtprc  複製為/root/.msmtprc
查看一下mutt檔案安裝目錄情況
複製代碼 代碼如下:

rpm -ql mutt

故將/etc/Muttrc  複製為/root/.muttrc即可發送郵件。

二、監控伺服器系統負載情況:

1、用uptime命令查看當前負載情況(1分鐘,5分鐘,15分鐘平均負載情況)在蘋果公司的Mac電腦上也適用

複製代碼 代碼如下:

# uptime
   15:43:59 up 186 days, 20:04,  1 user,  load average:  0.01,    0.02,   0.00

"load average"意思分別是1分鐘、5分鐘、15分鐘內系統的平均負荷。
(1) 主要觀察"15分鐘系統負荷",將它作為電腦正常啟動並執行指標。
(2) 如果15分鐘內,(系統負荷除以CPU核心數目之後的)平均負荷大於1.0,表明問題持續存在,不是暫時現象。
(3) 當系統負荷持續大於0.7,你必須開始調查了,問題出在哪裡,防止情況惡化。
(4) 當系統負荷持續大於1.0,你必須動手尋找解決辦法,把這個值降下來。
(5) 當系統負荷達到5.0,就表明你的系統有很嚴重的問題,長時間沒有響應,或者接近死機了。
假設你的電腦只有1個CPU。如果你的電腦裝了2個CPU,意味著電腦的處理能力翻了一倍,能夠同時處理的進程數量也翻了一倍。
2個CPU表明系統負荷可以達到2.0,此時每個CPU都達到100%的工作量。推廣開來,n個CPU的電腦,可接受的系統負荷最大為n.0。

2、查看伺服器cpu的總核心數

複製代碼 代碼如下:

 # grep -c 'model name' /proc/cpuinfo  或者       cat /proc/cpuinfo

3、截取伺服器1分鐘、5分鐘、15分鐘的負載情況
複製代碼 代碼如下:

# uptime | awk '{print $8,$9,$10,$11,$12}'
   load average:  0.01,    0.02,   0.00

4、查看截取15分鐘的平均負載

複製代碼 代碼如下:

# uptime | awk '{print $12}' (用 '{print $12}' 這個擷取的不夠準確,如果都用awk取第12個欄位的話,結果有可能為空白了。而用$NF表輸出最後一段的內容)
# uptime | awk '{print $NF}'

5、編寫系統負載監控的指令檔:
複製代碼 代碼如下:

# vim /scripts/load-check.sh
[code]
#!/bin/bash 
#使用uptime命令監控linux系統負載變化 
 
#取系統目前時間(以追加的方式寫入檔案>>) 
date >> /scripts/datetime-load.txt    
 
#提取伺服器1分鐘、5分鐘、15分鐘的負載情況 
uptime | awk '{print $8,$9,$10,$11,$12}' >> /scripts/load.txt 
 
#逐行串連上面的時間和負載相關行資料(每次重新寫入檔案>) 
paste  /scripts/datetime-load.txt /scripts/load.txt   > /scripts/load_day.txt
# chmod a+x /scripts/load-check.sh

6、編寫系統負載結果檔案郵件發送指令碼:

複製代碼 代碼如下:

# vim /scripts/sendmail-load.sh

#!/bin/bash 
#把系統負載監控產生的load_day.txt檔案通過郵件發送給使用者 
 
#提取本伺服器的IP地址資訊 
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` 
 
#提取當前日期 
today=`date -d "0 day" +%Y年%m月%d日` 
 
#發送系統負載監控結果郵件 
echo "這是$IP伺服器$today的系統負載監控報告,請下載附件。" | mutt -s "$IP伺服器$today的系統負載監控報告" -a /scripts/load_day.txt  fuquanjun@xxx.com
# chmod a+x /scripts/sendmail-load.sh

7、編寫系統負載監控的指令檔:

複製代碼 代碼如下:

# vim /scripts/load-warning.sh

#!/bin/bash 
#使用uptime命令監控linux系統負載變化 
 
#提取本伺服器的IP地址資訊 
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` 
 
#抓取cpu的總核心數 
cpu_num=`grep -c 'model name' /proc/cpuinfo` 
 
#抓取當前系統15分鐘的平均負載值 
load_15=`uptime | awk '{print $NF}'` 
 
#計算當前系統單個核心15分鐘的平均負載值,結果小於1.0時前面個位元補0。 
average_load=`echo "scale=2;a=$load_15/$cpu_num;if(length(a)==scale(a)) print 0;print a" | bc` 
 
#取上面平均負載值的個位整數 
average_int=`echo $average_load | cut -f 1 -d "."` 
 
#設定系統單個核心15分鐘的平均負載的警示值為0.70(即使用超過70%的時候警示)。 
load_warn=0.70 
 
#當單個核心15分鐘的平均負載值大於等於1.0(即個位整數大於0) ,直接發郵件警示;如果小於1.0則進行二次比較 
if (($average_int > 0)); then 
      echo "$IP伺服器15分鐘的系統平均負載為$average_load,超過警戒值1.0,請立即處理!!!" | mutt -s "$IP 伺服器系統負載嚴重警示!!!"  fuquanjun@xxx.com 
else 
#當前系統15分鐘平均負載值與警示值進行比較(當大於警示值0.70時會返回1,小於時會返回0 ) 
load_now=`expr $average_load \> $load_warn` 
 
#如果系統單個核心15分鐘的平均負載值大於警示值0.70(傳回值為1),則發郵件給管理員 
 if (($load_now == 1)); then 
    echo "$IP伺服器15分鐘的系統平均負載達到 $average_load,超過警戒值0.70,請及時處理。" | mutt -s "$IP 伺服器系統負載警示"  fuquanjun@xxx.com 
 fi 
fi
 # chmod a+x /scripts/load-warning.sh

三、監控伺服器系統cpu佔用情況:

1、使用top命令查看linux系統cpu使用方式:

複製代碼 代碼如下:

#  top -b -n 1 | grep Cpu   (-b -n 1 表只需要1次的輸出結果)
     Cpu(s):  0.0%us,  0.0%sy,  0.0%ni, 99.9%id,  0.0%wa,  0.0%hi,  0.0%si,  0.0%st

2、查看截取空閑cpu的百分比數值命令(只取整數部分):
複製代碼 代碼如下:

# top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."

3、編寫cpu監控的指令檔:
複製代碼 代碼如下:

# vim /scripts/cpu-check.sh

#!/bin/bash 
#使用top命令監控linux系統cpu變化 
 
#取系統目前時間(以追加的方式寫入檔案>>) 
date >> /scripts/datetime-cpu.txt    
 
#抓取當前cpu的值(以追加的方式寫入檔案>>) 
top -b -n 1 | grep Cpu  >> /scripts/cpu-now.txt  
 
#逐行串連上面的時間和cpu相關行資料(每次重新寫入檔案>) 
paste  /scripts/datetime-cpu.txt   /scripts/cpu-now.txt  > /scripts/cpu.txt
# chmod a+x /scripts/cpu-check.sh

4、查看CPU監控的結果檔案:

複製代碼 代碼如下:

# cat /scripts/cpu.txt

5、編寫cpu結果檔案郵件發送指令碼:
複製代碼 代碼如下:

# vim /scripts/sendmail-cpu.sh
#!/bin/bash 
#把產生的cpu.txt檔案通過郵件發送給使用者 
 
#提取本伺服器的IP地址資訊 
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` 
 
#提取當前日期
today=`date -d "0 day" +%Y年%m月%d日` 
 
#發送cpu監控結果郵件 
echo "這是$IP伺服器$today的cpu監控報告,請下載附件。" | mutt -s "$IP伺服器$today的CPU監控報告" -a /scripts/cpu.txt  fuquanjun@xxx.com
 # chmod a+x /scripts/sendmail-cpu.sh
 

四、監控系統cpu的情況,當使用超過80%的時候發警示郵件:

複製代碼 代碼如下:

# vim /scripts/cpu-warning.sh
#!/bin/bash 
#監控系統cpu的情況指令碼程式 
 
#提取本伺服器的IP地址資訊 
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` 
 
#取當前空閑cpu百份比值(只取整數部分) 
cpu_idle=`top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."` 
 
#設定空閑cpu的警示值為20%,如果當前cpu使用超過80%(即剩餘小於20%),立即發郵件警示 
if (($cpu_idle < 20)); then 
      echo "$IP伺服器cpu剩餘$cpu_idle%,使用率已經超過80%,請及時處理。" | mutt -s "$IP 伺服器CPU警示"  fuquanjun@xxx.com 
fi
# chmod a+x /scripts/cpu-warning.sh

五、使用free命令監控系統記憶體:

1、使用free命令查看linux系統記憶體使用量情況:(以M為單位)

複製代碼 代碼如下:

# free -m 
             total       used       free     shared    buffers     cached
Mem:          3952       3414        538          0        168        484
-/+ buffers/cache:       2760       1191
Swap:         8191         86       8105

2、查看截取剩餘記憶體free的數值命令:

(1) 實體記憶體free值: # free -m | grep Mem | awk '{print $4}'
(2) 緩衝區的free值: # free -m | grep - | awk '{print $4}'
(3) Swap分區free值: # free -m | grep Swap | awk '{print $4}'

3、編寫記憶體監控的指令檔:

複製代碼 代碼如下:

# vim /scripts/free-mem.sh
#!/bin/bash 
#使用free命令監控linux系統記憶體變化 
 
#取系統目前時間(以追加的方式寫入檔案>>) 
date >> /scripts/date-time.txt    
 
#抓取實體記憶體free值(以追加的方式寫入檔案>>) 
echo Mem-free: `free -m | grep Mem | awk '{print $4}'`M >> /scripts/mem-free.txt  
 
#抓取緩衝區的free值(以追加的方式寫入檔案>>) 
echo buffers/cache-free: `free -m | grep - | awk '{print $4}'`M  >> /scripts/buffers-free.txt 
 
#抓取Swap分區free值(以追加的方式寫入檔案>>) 
echo Swap-free: `free -m | grep Swap | awk '{print $4}'`M  >> /scripts/swap-free.txt 
 
#逐行串連上面的時間和記憶體相關行資料(每次重新寫入檔案>) 
paste  /scripts/date-time.txt /scripts/mem-free.txt  /scripts/buffers-free.txt   /scripts/swap-free.txt   > /scripts/freemem.txt
# chmod a+x /scripts/free-mem.sh

4、查看記憶體監控的結果檔案:
複製代碼 代碼如下:

# cat /scripts/freemem.txt

5、編寫free結果檔案郵件發送指令碼:
複製代碼 代碼如下:

# vim /scripts/sendmail-mem.sh
#!/bin/bash 
#把產生的freemem.txt檔案通過郵件發送給使用者 
 
#提取本伺服器的IP地址資訊 
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` 
 
#提取當前日期時間 
today=`date -d "0 day" +%Y年%m月%d日` 
 
#發送記憶體監控結果郵件 
echo "這是$IP伺服器$today的記憶體監控報告,請下載附件。" | mutt -s "$IP伺服器$today記憶體監控報告" -a /scripts/freemem.txt fuquanjun@xxx.com
# chmod a+x /scripts/sendmail-mem.sh

六、監控系統交換分區swap的情況,當使用超過80%的時候發警示郵件:

複製代碼 代碼如下:

# vim /scripts/swap-warning.sh
#!/bin/bash 
 
#提取本伺服器的IP地址資訊 
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "` 
 
#系統分配的交換分區總量 
swap_total=`free -m | grep Swap | awk '{print  $2}'` 
 
#當前剩餘的交換分區free大小 
swap_free=`free -m | grep Swap | awk '{print  $4}'` 
 
#當前已使用的交換分區used大小 
swap_used=`free -m | grep Swap | awk '{print  $3}'` 
 
 
if (($swap_used != 0)); then 
 
#如果交換分區已被使用,則計算當前剩餘交換分區free所佔總量的百分比,用小數來表示,要在小數點前面補一個整數位0 
   swap_per=0`echo "scale=2;$swap_free/$swap_total" | bc` 
 
#設定交換分區的警示值為20%(即使用超過80%的時候警示)。 
   swap_warn=0.20 
 
#當前剩餘交換分區百分比與警示值進行比較(當大於警示值(即剩餘20%以上)時會返回1,小於(即剩餘不足20%)時會返回0 ) 
   swap_now=`expr $swap_per \> $swap_warn` 
 
#如果當前交換分區使用超過80%(即剩餘小於20%,上面的傳回值等於0),立即發郵件警示 
  if (($swap_now == 0)); then 
    echo "$IP伺服器swap交換分區只剩下 $swap_free M 未使用,剩餘不足20%,使用率已經超過80%,請及時處理。" | mutt -s "$IP 伺服器記憶體警示"  fuquanjun@xxx.com 
  fi 
fi
# chmod a+x /scripts/swap-warning.sh

七、加入任務計劃:系統負載與CPU佔用率每十分鐘檢測一次,有警示則立即發郵件(十分鐘發一次),負載與CPU檢測結果郵件每天早上8點發一次。


複製代碼 代碼如下:
# crontab -e
*/10 * * * *  /scripts/load-check.sh > /dev/null 2>&1
*/10 * * * *  /scripts/load-warning.sh 
0 8 * * *  /scripts/sendmail-load.sh 
 
*/10 * * * *  /scripts/cpu-check.sh 
*/10 * * * *  /scripts/cpu-warning.sh 
0 8 * * *  /scripts/sendmail-cpu.sh
 
*/10 * * * *  /scripts/free-mem.sh 
*/10 * * * *  /scripts/swap-warning.sh 
0 8 * * *  /scripts/sendmail-mem.sh
# service crond restart

相關文章

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.