關於Spark運行流式計算程式中跑一段時間出現GC overhead limit exceeded

來源:互聯網
上載者:User

最近在升級一個架構的時候,發現某個流式計算程式每隔一定的時間就會出現GC overhead limit exceeded的錯誤問題。


這個問題肯定是記憶體不夠,但是初始設定的記憶體是夠的啊,於是進行各種記憶體最佳化,如將變數定義在迴圈體外等控制,但是發現只是將這個間隔時間往後推了一下而已。


還是沒有找到癥結所在。


後來再分析了下,可能是哪些變數佔了記憶體沒有及時釋放掉,


看到了好幾個dataframe的cache代碼,但這個cache應該 spark有個自動釋放清理的機制的。


為了進行測試,手動添加unpersist進行記憶體釋放,再上線,發現問題果然消失了。


原來這個問題真的是記憶體的問題。


再仔細看了下官方說明。

Spark automatically monitors cache usage on each node and drops out old data partitions in a least-recently-used (LRU) fashion. If you would like to manually remove an RDD instead of waiting for it to fall out of the cache, use the RDD.unpersist() method.


可能還是這個自動機制在流式計算中有點趕不上,導致出現的錯誤。這個坑還是非常深。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.