python 貪婪 非貪婪 匹配,python匹配

來源:互聯網
上載者:User

python 貪婪 非貪婪 匹配,python匹配

python re模組還是需要重新學習。
python readline 和 readlines(), readline() , read() 三者之間的區別,以前一直都不清楚,現在搞清楚是怎麼回事了。
readlines() 可以一起顯示出整個檔案,這個也是迭代顯示的,需要追行顯示,迭代器的指標會被消耗的。

python 中的正則是匹配換行以外的所有的字元。.* 是匹配不了所有的字元的。在某些情況下,我的結論是正確的,但是在某些情況下,我的結論又是錯誤的。剛才遇到的問題,現在終於知道是怎麼回事了,原來是貪婪匹配和非貪婪匹配的問題,對於這種情況,我也是相對遲鈍了。
save.html 是我隨便抓來的一個html,我要從這個html中抓出所有的 javascript程式碼片段。

def getcss():    fh = open('save.html')    html =fh.read()    #js_pattern = re.compile(r'<script .*?">');    ans = re.findall(r'<script .*?>.*?</script>',html,re.S)    src_pattern = re.compile(r'^"http.*"');    for i in ans:        #ret = re.findall(src_pattern,i)        print i

通過上面的程式,我得到了下面的結果。源檔案是一個html,格式一般,這些程式碼片段是分行的,我的目的是找出所有的程式碼片段。下面做一個簡單的解釋。在嘗試的過程中,我試了好幾種Regex,下面講一下我遇到的問題。

實現是跨行匹配的問題,.*是無法匹配\n的,所以如果標籤分布在不同的行,那麼如何匹配中間的內容呢。為瞭解決跨行匹配的問題,找到了這個解決方案,可以用([\d\D]*)或([\w\W]*) 或([\s\S]*) 來代替。
然後又遇到了問題,我的正則總是會匹配太多的內容,最後發現,我的匹配模式是按照最多內容匹配的。預設的匹配模式是貪婪匹配,所以如果用了.*的話,總會匹配更多的內容。所以找到了這個參考。python貪婪匹配看到了貪婪匹配和非貪婪匹配的核心在一個?上,re.S標記是多行匹配的關鍵,類似的標記還有re.M標記,這個是一行的標記。re.M:^$標誌將會匹配每一行,預設^和$只會匹配第一行,文章裡有幾個例子還是很不錯的,值得仔細研究一下,建議自己執行一下這些代碼,看下結果,如果這些都很清楚,那麼正則掌握的還算不錯。

re.findall(r"a(\d+?)", "a23b")re.findall(r"a(\d+)", "a23b")re.findall(r"a(\d+)b.+a(\d+)b", "a23b\na34b")re.findall(r"a(\d+)b.+a(\d+)b", "a23b\na34b", re.S)

最後,實現了上面我提出的需求,主要利用了跨行匹配和非貪婪匹配。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.