最近處理文字文件時(檔案約2GB大小),出現memoryError錯誤和檔案讀取太慢的問題,後來找到了兩種比較快Large File Reading 的方法,本文將介紹這兩種讀取方法。
Preliminary
我們談到“文本處理”時,我們通常是指處理的內容。Python 將文字檔的內容讀入可以操作的字串變數非常容易。檔案對象提供了三個“讀”方法: .read()、.readline() 和 .readlines()。每種方法可以接受一個變數以限制每次讀取的資料量,但它們通常不使用變數。 .read() 每次讀取整個檔案,它通常用於將檔案內容放到一個字串變數中。然而.read() 組建檔案內容最直接的字串表示,但對於連續的面向行的處理,它卻是不必要的,並且如果檔案大於可用記憶體,則不可能實現這種處理。下面是read()方法樣本:
try:f = open('/path/to/file', 'r')print f.read()finally:if f:f.close()
如果檔案很小,read()一次性讀取最方便;如果不能確定檔案大小,反覆調用read(size)比較保險;如果是設定檔,調用readlines()最方便:
for line in f.readlines():process(line) # <do something with line>
Read In Chunks
處理大檔案是很容易想到的就是將大檔案分割成若干小檔案處理,處理完每個小檔案後釋放該部分記憶體。這裡用了iter & yield:
def read_in_chunks(filePath, chunk_size=1024*1024):"""Lazy function (generator) to read a file piece by piece.Default chunk size: 1MYou can set your own chunk size"""file_object = open(filePath)while True:chunk_data = file_object.read(chunk_size)if not chunk_data:breakyield chunk_dataif __name__ == "__main__":filePath = './path/filename'for chunk in read_in_chunks(filePath):process(chunk) # <do something with chunk>
Using with open()
with語句開啟和關閉檔案,包括拋出一個內部塊異常。for line in f檔案對象f視為一個迭代器,會自動的採用緩衝IO和記憶體管理,所以你不必擔心大檔案。
#If the file is line basedwith open(...) as f:for line in f:process(line) # <do something with line>
Conclusion
在使用python進行大檔案讀取時,應該讓系統來處理,使用最簡單的方式,交給解譯器,就管好自己的工作就行了