一次伺服器宕機後的日誌分析 在這裡先吐槽一下,NND寫好的報告突然消失了,唉,難道是昨天看片的原因,360什麼的果然是不可靠的啊,算了。 根據/va/log/message分析10月11日之前系統還是能正常提供服務,如果是服務導致的系統宕機則會產生其他日誌,10月11日19:44:20系統啟動長生日誌。初步判斷可能是硬體或者系統其他原因。系統重啟之後業務還是能夠正常運行說明其他的服務或者是配置應該沒有出錯,查看登陸日誌排除入侵和人為的因素導致系統宕機,判斷為硬體或者系統其他原因,但是伺服器指示燈沒有報錯,硬碟記憶體電源主板都是在正常工作說明還得細緻分析。Oct 6 04:03:02 epmttetla syslogd 1.4.1: restart.Oct 1119:44:20 epmttetla syslogd 1.4.1: restart.Oct 1119:44:20 epmttetla kernel: klogd 1.4.1, log source = /proc/kmsg started.Oct 1119:44:20 epmttetla kernel: Linux version 2.6.18-164.el5(mockbuild@x86-003.build.bos.redhat.com)(gcc version 4.1.2 20080704 (Red Hat 4.1.2-46)) #1 SMP Tue Aug 18 15:51:48 EDT2009Oct 11 19:44:20epmttetla kernel: Command line: ro root=LABEL=/ rhgb quietOct 11 19:44:20epmttetla kernel: BIOS-provided physical RAM map: Oct11 19:44:20 epmttetla kernel: PNP: No PS/2 controller found. Probing portsdirectly。 初步判斷是核心對雙核支援的不完善,或者是系統核心其他問題,但是對應該不會導致系統宕機,這些報錯的地方都不是致命錯誤,也不是核心自身可以探測到的錯誤,也就是說核心初始化自己的時候,莫名其妙的就宕了。可能是是硬體的關係,可行的測試方法: 1、把主板的電池哪下來,再按上去,並保證能正常,在看系統啟動的情況。2、若1不行,把各個硬體逐個更換,分別看情況。3、若1、2都不行,則需判斷其他服務是否出現報錯導致伺服器宕機。以上都是看網上別人分析,個人覺得系統核心可能是一個出錯的原因,查看所有的日誌判斷該系統上線時間不是很久,許可權不夠啊,不能拿到更多的東西來分析是否是系統業務導致的服務停止從而導致系統宕機。 Oct 11 19:44:20 epmttetlakernel: usbcore: registered new driver hiddevOct 11 19:44:20epmttetla kernel: usbcore: registered new driver usbhidOct 11 19:44:20epmttetla kernel: drivers/usb/input/hid-core.c: v2.6:USB HID core driverOct 1119:44:20 epmttetla kernel: PNP: No PS/2 controller found. Probing portsdirectly.Oct 11 19:44:20epmttetla kernel: Failed to disable AUX port, but continuing anyway... Is thisa SiS?Oct 11 19:44:20epmttetla kernel: If AUX port is really absent please use the 'i8042.noaux'option.Oct 11 19:44:20epmttetla kernel: serio: i8042 KBD port at 0x60,0x64 irq 1Oct 11 19:44:20epmttetla kernel: mice: PS/2 mouse device common for all miceOct 11 19:44:20epmttetla kernel: md: md driver 0.90.3 MAX_MD_DEVS=256, MD_SB_DISKS=27Oct 11 19:44:20 epmttetlakernel: md: bitmap version 4.39Oct 11 19:44:20epmttetla kernel: TCP bic registered 硬碟smart報錯,判斷可能是當業務訪問量過大時,硬碟讀寫速度過快,導致系統宕機。而硬碟使用的時間快要超過它自身的生命週期,伺服器啟動後硬碟指示燈沒有警示,但硬碟smart報錯不會導致伺服器指示燈警示,建議準備備份硬碟,一個一個更換硬碟保證服務的正常提供和防止資料的丟失。其實這也只是可能,伺服器只有兩塊硬碟,估計是做了RAID1,上面跑了個tomcat還有mysql,業務訪問量過大的時候會不會出現硬碟假死呢?反正現在伺服器是正常運行著,備盤在庫房也應該有,祈禱吧,資料別丟失就可以。Oct 11 19:47:27smartd version 5.38 [x86_64-redhat-linux-gnu] Copyright (C) 2002-8 Bruce AllenOct 11 19:47:27epmttetla smartd[6384]: Home page ishttp://smartmontools.sourceforge.net/ Oct 11 19:47:27epmttetla smartd[6384]: Opened configuration file/etc/smartd.confOct 11 19:47:27epmttetla smartd[6384]: Configuration file /etc/smartd.confwas parsed, foundDEVICESCAN, scanning devicesOct 11 19:47:27epmttetla smartd[6384]: Problem creating device name scan listOct 11 19:47:27epmttetla smartd[6384]: Device: /dev/sda, openedOct 1119:47:27 epmttetla smartd[6384]: Device: /dev/sda, IE (SMART) not enabled, skipdevice Try 'smartctl -s on /dev/sda' to turn on SMART featuresOct 1119:47:27 epmttetla smartd[6384]: Monitoring 0 ATA and 0 SCSI devicesOct 1119:47:27 epmttetla smartd[6386]: smartd has fork()ed into background mode. NewPID=6386.Oct 11 19:47:28epmttetla avahi-daemon[6324]: Server startup complete. Host name isepmttetla.local. Local service cookie is 417669660.Oct 11 19:47:29epmttetla avahi-daemon[6324]: Service "SFTP File Transfer onepmttetla" (/services/sftp-ssh.service) successfully established.Oct 11 19:47:30epmttetla kernel: mtrr: type mismatch for f9000000,400000 old: write-back new:write-combiningOct 11 19:47:30epmttetla kernel: mtrr: type mismatch for f9000000,1000000 old: write-back new:write-combiningOct 11 19:47:31epmttetla pcscd: winscard.c:304:SCardConnect() Reader E-Gate 0 0 Not FoundOct 11 19:47:31epmttetla last message repeated 3 timesOct 12 21:40:01epmttetla auditd[5661]: Audit daemon rotating log files