PythonRegex
Regex是一個特殊的字元序列,它能協助你方便的檢查一個字串是否與某種模式比對。
Python 自1.5版本起增加了re 模組,它提供 Perl 風格的Regex模式。
re 模組使 Python 語言擁有全部的Regex功能。
compile 函數根據一個模式字串和可選的標誌參數產生一個Regex對象。該對象擁有一系列方法用於Regex匹配和替換。
re 模組也提供了與這些方法功能完全一致的函數,這些函數使用一個模式字串做為它們的第一個參數。
本章節主要介紹Python中常用的Regex處理函數。
re.match函數
re.match 嘗試從字串的起始位置匹配一個模式,如果不是起始位置匹配成功的話,match()就返回none。
函數文法:
re.match(pattern, string, flags=0)
函數參數說明:
| 參數 |
描述 |
| pattern |
匹配的Regex |
| string |
要匹配的字串。 |
| flags |
標誌位,用於控制Regex的匹配方式,如:是否區分大小寫,多行匹配等等。
|
匹配成功re.match方法返回一個匹配的對象,否則返回None。
我們可以使用group(num) 或 groups() 匹配對象函數來擷取匹配運算式。
| 匹配對象方法 |
描述 |
| group(num=0) |
匹配的整個運算式的字串,group() 可以一次輸入多個組號,在這種情況下它將返回一個包含那些組所對應值的元組。 |
| groups() |
返回一個包含所有小組字串的元組,從 1 到 所含的小組號。 |
執行個體 1:
#!/usr/bin/python# -*- coding: UTF-8 -*- import reprint(re.match(‘www‘, ‘www.runoob.com‘).span()) # 在起始位置匹配print(re.match(‘com‘, ‘www.runoob.com‘)) # 不在起始位置匹配
以上執行個體運行輸出結果為:
(0, 3)None
執行個體 2:
#!/usr/bin/pythonimport reline = "Cats are smarter than dogs"matchObj = re.match( r‘(.*) are (.*?) .*‘, line, re.M|re.I)if matchObj: print "matchObj.group() : ", matchObj.group() print "matchObj.group(1) : ", matchObj.group(1) print "matchObj.group(2) : ", matchObj.group(2)else: print "No match!!"
以上執行個體執行結果如下:
matchObj.group() : Cats are smarter than dogsmatchObj.group(1) : CatsmatchObj.group(2) : smarter
re.search方法
re.search 掃描整個字串並返回第一個成功的匹配。
函數文法:
re.search(pattern, string, flags=0)
函數參數說明:
| 參數 |
描述 |
| pattern |
匹配的Regex |
| string |
要匹配的字串。 |
| flags |
標誌位,用於控制Regex的匹配方式,如:是否區分大小寫,多行匹配等等。
|
匹配成功re.search方法返回一個匹配的對象,否則返回None。
我們可以使用group(num) 或 groups() 匹配對象函數來擷取匹配運算式。
| 匹配對象方法 |
描述 |
| group(num=0) |
匹配的整個運算式的字串,group() 可以一次輸入多個組號,在這種情況下它將返回一個包含那些組所對應值的元組。 |
| groups() |
返回一個包含所有小組字串的元組,從 1 到 所含的小組號。
|
執行個體 1:
#!/usr/bin/python# -*- coding: UTF-8 -*- import reprint(re.search(‘www‘, ‘www.runoob.com‘).span()) # 在起始位置匹配print(re.search(‘com‘, ‘www.runoob.com‘).span()) # 不在起始位置匹配
以上執行個體運行輸出結果為:
(0, 3)(11, 14)
執行個體 2:
#!/usr/bin/pythonimport reline = "Cats are smarter than dogs";searchObj = re.search( r‘(.*) are (.*?) .*‘, line, re.M|re.I)if searchObj: print "searchObj.group() : ", searchObj.group() print "searchObj.group(1) : ", searchObj.group(1) print "searchObj.group(2) : ", searchObj.group(2)else: print "Nothing found!!"
以上執行個體執行結果如下:
searchObj.group() : Cats are smarter than dogssearchObj.group(1) : CatssearchObj.group(2) : smarter
re.match與re.search的區別
re.match只匹配字串的開始,如果字串開始不符合Regex,則匹配失敗,函數返回None;而re.search匹配整個字串,直到找到一個匹配。
執行個體:
#!/usr/bin/pythonimport reline = "Cats are smarter than dogs";matchObj = re.match( r‘dogs‘, line, re.M|re.I)if matchObj: print "match --> matchObj.group() : ", matchObj.group()else: print "No match!!"matchObj = re.search( r‘dogs‘, line, re.M|re.I)if matchObj: print "search --> matchObj.group() : ", matchObj.group()else: print "No match!!"
以上執行個體運行結果如下:
No match!!search --> matchObj.group() : dogs
檢索和替換
Python 的 re 模組提供了re.sub用於替換字串中的匹配項。
文法:
re.sub(pattern, repl, string, count=0, flags=0)
參數:
- pattern : 正則中的模式字串。
- repl : 替換的字串,也可為一個函數。
- string : 要被尋找替換的原始字串。
- count : 模式比對後替換的最大次數,預設 0 表示替換所有的匹配。
執行個體:
#!/usr/bin/python# -*- coding: UTF-8 -*-import rephone = "2004-959-559 # 這是一個國外電話號碼"# 刪除字串中的 Python注釋 num = re.sub(r‘#.*$‘, "", phone)print "電話號碼是: ", num# 刪除非數字(-)的字串 num = re.sub(r‘\D‘, "", phone)print "電話號碼是 : ", num
以上執行個體執行結果如下:
電話號碼是: 2004-959-559 電話號碼是 : 2004959559
repl 參數是一個函數
以下執行個體中將字串中的匹配的數字乘於 2:
#!/usr/bin/python# -*- coding: UTF-8 -*-import re# 將匹配的數字乘於 2def double(matched): value = int(matched.group(‘value‘)) return str(value * 2)s = ‘A23G4HFD567‘print(re.sub(‘(?P<value>\d+)‘, double, s))
執行輸出結果為:
A46G8HFD1134
Regex修飾符 - 可選標誌
Regex可以包含一些可選標誌修飾符來控制匹配的模式。修飾符被指定為一個可選的標誌。多個標誌可以通過按位 OR(|) 它們來指定。如 re.I | re.M 被設定成 I 和 M 標誌:
| 修飾符 |
描述 |
| re.I |
使匹配對大小寫不敏感 |
| re.L |
做本地化識別(locale-aware)匹配 |
| re.M |
多行匹配,影響 ^ 和 $ |
| re.S |
使 . 匹配包括換行在內的所有字元 |
| re.U |
根據Unicode字元集解析字元。這個標誌影響 \w, \W, \b, \B. |
| re.X |
該標誌通過給予你更靈活的格式以便你將Regex寫得更易於理解。 |
Regex模式
模式字串使用特殊的文法來表示一個Regex:
字母和數字表示他們自身。一個Regex模式中的字母和數字匹配同樣的字串。
多數字母和數字前加一個反斜線時會擁有不同的含義。
標點符號只有被轉義時才匹配自身,否則它們表示特殊的含義。
反斜線本身需要使用反斜線轉義。
由於Regex通常都包含反斜線,所以你最好使用原始字串來表示它們。模式元素(如 r‘/t‘,等價於‘//t‘)匹配相應的特殊字元。
下表列出了Regex模式文法中的特殊元素。如果你使用模式的同時提供了可選的標誌參數,某些模式元素的含義會改變。
| 模式 |
描述 |
| ^ |
匹配字串的開頭 |
| $ |
匹配字串的末尾。 |
| . |
匹配任一字元,除了分行符號,當re.DOTALL標記被指定時,則可以匹配包括分行符號的任一字元。 |
| [...] |
用來表示一組字元,單獨列出:[amk] 匹配 ‘a‘,‘m‘或‘k‘ |
| [^...] |
不在[]中的字元:[^abc] 匹配除了a,b,c之外的字元。 |
| re* |
匹配0個或多個的運算式。 |
| re+ |
匹配1個或多個的運算式。 |
| re? |
匹配0個或1個由前面的Regex定義的片段,非貪婪方式 |
| re{ n} |
|
| re{ n,} |
精確匹配n個前面運算式。 |
| re{ n, m} |
匹配 n 到 m 次由前面的Regex定義的片段,貪婪方式 |
| a| b |
匹配a或b |
| (re) |
G匹配括弧內的運算式,也表示一個組 |
| (?imx) |
Regex包含三種可選標誌:i, m, 或 x 。隻影響括弧中的地區。 |
| (?-imx) |
Regex關閉 i, m, 或 x 可選標誌。隻影響括弧中的地區。 |
| (?: re) |
類似 (...), 但是不表示一個組 |
| (?imx: re) |
在括弧中使用i, m, 或 x 可選標誌 |
| (?-imx: re) |
在括弧中不使用i, m, 或 x 可選標誌 |
| (?#...) |
注釋. |
| (?= re) |
前向肯定界定符。如果所含Regex,以 ... 表示,在當前位置成功匹配時成功,否則失敗。但一旦所含運算式已經嘗試,匹配引擎根本沒有提高;模式的剩餘部分還要嘗試界定符的右邊。 |
| (?! re) |
前向否定界定符。與肯定界定符相反;當所含運算式不能在字串當前位置匹配時成功 |
| (?> re) |
匹配的獨立模式,省去回溯。 |
| \w |
匹配字母數字及底線 |
| \W |
匹配非字母數字及底線 |
| \s |
匹配任意空白字元,等價於 [\t\n\r\f]. |
| \S |
匹配任意非Null 字元 |
| \d |
匹配任一數字,等價於 [0-9]. |
| \D |
匹配任意非數字 |
| \A |
匹配字串開始 |
| \Z |
匹配字串結束,如果是存在換行,只匹配到換行前的結束字串。c |
| \z |
匹配字串結束 |
| \G |
匹配最後匹配完成的位置。 |
| \b |
匹配一個單詞邊界,也就是指單詞和空格間的位置。例如, ‘er\b‘ 可以匹配"never" 中的 ‘er‘,但不能匹配 "verb" 中的 ‘er‘。 |
| \B |
匹配非單詞邊界。‘er\B‘ 能匹配 "verb" 中的 ‘er‘,但不能匹配 "never" 中的 ‘er‘。 |
| \n, \t, 等. |
匹配一個分行符號。匹配一個定位字元。等 |
| \1...\9 |
匹配第n個分組的子運算式。 |
| \10 |
匹配第n個分組的子運算式,如果它經匹配。否則指的是八進位字元碼的運算式。 |
Regex執行個體字元匹配
| 執行個體 |
描述 |
| python |
匹配 "python". |
字元類
| 執行個體 |
描述 |
| [Pp]ython |
匹配 "Python" 或 "python" |
| rub[ye] |
匹配 "ruby" 或 "rube" |
| [aeiou] |
匹配中括弧內的任意一個字母 |
| [0-9] |
匹配任何數字。類似於 [0123456789] |
| [a-z] |
匹配任何小寫字母 |
| [A-Z] |
匹配任何大寫字母 |
| [a-zA-Z0-9] |
匹配任何字母及數字 |
| [^aeiou] |
除了aeiou字母以外的所有字元 |
| [^0-9] |
匹配除了數字外的字元 |
特殊字元類
| 執行個體 |
描述 |
| . |
匹配除 "\n" 之外的任何單個字元。要匹配包括 ‘\n‘ 在內的任何字元,請使用象 ‘[.\n]‘ 的模式。 |
| \d |
匹配一個數字字元。等價於 [0-9]。 |
| \D |
匹配一個非數字字元。等價於 [^0-9]。 |
| \s |
匹配任何空白字元,包括空格、定位字元、換頁符等等。等價於 [ \f\n\r\t\v]。 |
| \S |
匹配任何非空白字元。等價於 [^ \f\n\r\t\v]。 |
| \w |
匹配包括底線的任何單詞字元。等價於‘[A-Za-z0-9_]‘。 |
| \W |
匹配任何非單詞字元。等價於 ‘[^A-Za-z0-9_]‘。 |