解析器對象:lxml.etree在預設情況下使用帶預設配置的標準解析器,如果想配置解析器,可以建立自己的執行個體。
>>> parser = etree.XMLParser(remove_blank_text=True) # lxml.etree only!
本例在解析的時候建立了一個移除tags之間的空的文本的解析器,這可以減少tree的大小以及避免不定的tail,如果你知道空白內容對你來說是沒有任何意義的話。
>>> root = etree.XML("<root> <a/> <b> </b> </root>", parser)
>>> etree.tostring(root)
b’<root><a/><b> </b></root>’
>>> for element in root.iter("*"):
... if element.text is not None and not element.text.strip():
... element.text = None
>>> etree.tostring(root)
b’<root><a/><b/></root>’
遞增解析:
lxml.etree提供了兩種方法來實現遞增的逐步的解析。一個方法是通過類檔案對象,它重複調用read() 方法。
>>> class DataSource:
... data = [ b"<roo", b"t><", b"a/", b"><", b"/root>" ]
... def read(self, requested_size):
... try:
... return self.data.pop(0)
... except IndexError:
... return b’’
>>> tree = etree.parse(DataSource())
>>> etree.tostring(tree)
b’<root><a/></root>’
第二個方法是通過feed解析器介面,由feed(data) 和 close() 方法提供
>>> parser = etree.XMLParser()
>>> parser.feed("<roo")
>>> parser.feed("t><")
>>> parser.feed("a/")
>>> parser.feed("><")
>>> parser.feed("/root>")
>>> root = parser.close()
>>> etree.tostring(root)
’<root><a/></root>’
在調用close() 方法(或者當有exception發生的時候),可以通過調用feed() 方法重新使用parser:
>>> parser.feed("<root/>")
>>> root = parser.close()
>>> etree.tostring(root)
b’<root/>’