什麼是正則:
Regex是可以匹配文本片段的模式。
Regex'Python'可以匹配'python'
正則是個很牛逼的東西,python中當然也不會缺少。
所以今天的Python就跟大家一起討論一下python中的re模組。
re模組包含對Regex的支援。
萬用字元
.表示匹配任何字元:
‘.ython'可以匹配'python'和'fython'
對特殊字元進行轉義:
‘python\.org'匹配‘python.org'
字元集
‘[pj]ython'能夠匹配'python'和'jython'
反轉字元集
‘[^abc]'可以匹配除了abc之外的任何字元
選擇符
使用管道符號|
可選項
加上問好就變為了可選項:
r'(http://)?(www.)?python.org‘只能匹配下面幾種:
'http://www.python.org'
'http://python.org'
'www.python.org'
'python.org'
重複子模式
*:允許模式重複0次或多次
+:允許模式重複1次或多次
{m, n}允許模式重複m-n次
當然,正則文法規則很多,遠不止上面的這些。但是我們只能點到為止了,因為這篇部落格的目的是介紹Python中的模組,re模組。
re 模組使 Python 語言擁有全部的Regex功能。
compile 函數根據一個模式字串和可選的標誌參數產生一個Regex對象。該對象擁有一系列方法用於Regex匹配和替換。
re 模組也提供了與這些方法功能完全一致的函數,這些函數使用一個模式字串做為它們的第一個參數。
re中重要的函數:
compile(pattern[, flags]) 根據包含Regex的字串建立模式對象
search(pattern, string[, flags]) 在字串中尋找模式
match(pattern, string[, flags]) 在字串的開始處匹配模式
split(pattern, string[, maxsplit=0]) 根據匹配項分割字串
findall(pattern, string) 列出字串中模式的所有匹配項
sub(pat, rep, string[, count=0]) 字串中所有pat的匹配項用repl替換
escape(string) 將字串中所有特殊運算式字元轉義
下面就進行簡單的應用:
使用match
import reprint(re.match('www', 'www.runoob.com').span()) # 在起始位置匹配print(re.match('com', 'www.runoob.com')) # 不在起始位置匹配
使用search
import reprint(re.search('www', 'www.runoob.com').span()) # 在起始位置匹配print(re.search('com', 'www.runoob.com').span()) # 不在起始位置匹配
這時候需要停一下,match和search的區別呢?
看看結果先:
match例子中結果:
(0, 3)
None
search例子中結果:
(0, 3)
(11, 14)
match()函數只檢測RE是不是在string的開始位置匹配,search()會掃描整個string尋找匹配;
也就是說match()只有在0位置匹配成功的話才有返回,如果不是開始位置匹配成功的話,match()就返回none。
search()會掃描整個字串並返回第一個成功的匹配。
使用sub
Python 的re模組提供了re.sub用於替換字串中的匹配項。
#!/usr/bin/pythonimport rephone = "2004-959-559 # This is Phone Number"# Delete Python-style commentsnum = re.sub(r'#.*$', "", phone)print "Phone Num : ", num# Remove anything other than digitsnum = re.sub(r'\D', "", phone) print "Phone Num : ", num
結果:
Phone Num : 2004-959-559
Phone Num : 2004959559
最後獻上菊花:
^ 匹配字串的開頭
$ 匹配字串的末尾。
. 匹配任一字元,除了分行符號,當re.DOTALL標記被指定時,則可以匹配包括分行符號的任一字元。
[...] 用來表示一組字元,單獨列出:[amk] 匹配 'a','m'或'k'
[^...] 不在[]中的字元:[^abc] 匹配除了a,b,c之外的字元。
re* 匹配0個或多個的運算式。
re+ 匹配1個或多個的運算式。
re? 匹配0個或1個由前面的Regex定義的片段,非貪婪方式
re{ n}
re{ n,} 精確匹配n個前面運算式。
re{ n, m} 匹配 n 到 m 次由前面的Regex定義的片段,貪婪方式
a| b 匹配a或b
(re) G匹配括弧內的運算式,也表示一個組
(?imx) Regex包含三種可選標誌:i, m, 或 x 。隻影響括弧中的地區。
(?-imx) Regex關閉 i, m, 或 x 可選標誌。隻影響括弧中的地區。
(?: re) 類似 (...), 但是不表示一個組
(?imx: re) 在括弧中使用i, m, 或 x 可選標誌
(?-imx: re) 在括弧中不使用i, m, 或 x 可選標誌
(?#...) 注釋.
(?= re) 前向肯定界定符。如果所含Regex,以 ... 表示,在當前位置成功匹配時成功,否則失敗。但一旦所含運算式已經嘗試,匹配引擎根本沒有提高;模式的剩餘部分還要嘗試界定符的右邊。
(?! re) 前向否定界定符。與肯定界定符相反;當所含運算式不能在字串當前位置匹配時成功
(?> re) 匹配的獨立模式,省去回溯。
\w 匹配字母數字
\W 匹配非字母數字
\s 匹配任意空白字元,等價於 [\t\n\r\f].
\S 匹配任意非Null 字元
\d 匹配任一數字,等價於 [0-9].
\D 匹配任意非數字
\A 匹配字串開始
\Z 匹配字串結束,如果是存在換行,只匹配到換行前的結束字串。c
\z 匹配字串結束
\G 匹配最後匹配完成的位置。
\b 匹配一個單詞邊界,也就是指單詞和空格間的位置。例如, 'er\b' 可以匹配"never" 中的 'er',但不能匹配 "verb" 中的 'er'。
\B 匹配非單詞邊界。'er\B' 能匹配 "verb" 中的 'er',但不能匹配 "never" 中的 'er'。
\n, \t, 等. 匹配一個分行符號。匹配一個定位字元。等
\1...\9 匹配第n個分組的子運算式。
\10 匹配第n個分組的子運算式,如果它經匹配。否則指的是八進位字元碼的運算式。
re的Regex文法
Regex文法表如下:
| 文法 |
意義 |
說明 |
| "." |
任一字元 |
|
| "^" |
字串開始 |
'^hello'匹配'helloworld'而不匹配'aaaahellobbb' |
| "$" |
字串結尾 |
與上同理 |
"*" |
0 個或多個字元(貪婪匹配) |
<*>匹配 |
"+" |
1 個或多個字元(貪婪匹配) |
與上同理 |
"?" |
0 個或多個字元(貪婪匹配) |
與上同理 |
*?,+?,?? |
以上三個取第一個匹配結果(非貪婪匹配) |
<*>匹配 |