標籤:
Regex通常包含字母文本(Literaltext)和元字元(metacharacter)
字母文本指的是普通文本如"abcde"可匹配字串中任何包含"abcde"的字串。
元字元則更加靈活運用通用的運算式匹配所有符合此運算式規律的字串。
C#Regex文法一、
匹配單個字元 []——從中選擇一個字元匹配
中間支援的類型:單詞字元([ae])、非單詞字元([!?,;@#$*])、字母範圍([A-Z])、數字範圍([0])
eg.Regex[ae]ffect
可匹配字串 affect,effect
(此例中"[ae]"為元字元,"ffect"為字母文本)
注意:
1.要在字元類中匹配連字號,那麼把連字號號作為第一個字元列出即可。
2.可以在單個Regex中包含多個字元類。
eg.[01][0-9]:[0-5][0-9][ap]m可以用來匹配如12:59pm格式的所有時間
^——排除某些字元(在[]中表此意,還可表示字串的開頭)
eg.Regexm[^a]t
可匹配字串
不可匹配字串 met,mit,m&t……mat
C#Regex文法
二、匹配特殊字元
可以使用的特殊字元:
\t——匹配製表符
\r——匹配硬斷行符號符
\f——匹配換頁符
\n——匹配分行符號
描述表示字元類的元字元:
.——匹配任何除了\n以外的字元(或者在單行模式中的任何字元)
\w——匹配任何單詞字元(任何字母或數字)
\W——匹配任何非單詞字元(除了字母和數字以外的任何字元)
\s——匹配任何空白字元(包括空格、換行、定位字元等)
\S——匹配任何非空白字元(除了空格、換行、定位字元等的任何字元)
\d——匹配任何數字字元(0~9的數字)
\D——匹配任何非數字字元(除了0~9以外的任何字元)
表示字串中字元位置:
^——匹配字串的開頭(或者多行模式下行的開頭)。
$——匹配字串的結尾,或者是字串結尾“\n”之前的最後一個字元,或者是多行模式中的行結尾。
\A——匹配字串的開頭(忽略多行模式)
\Z——匹配字串的結尾或字串結尾“\n”之前的最後一個字元(忽略多行模式)。
\z——匹配字串的結尾。
\G——匹配當前搜尋開始的位置。
\b——匹配單詞的邊界。
\B——匹配單詞的非邊界。
注意:
1.句點字元(.)特別有用。可以用它來表示任何一個字元。
eg.Regex01.17.84
可匹配字串 01/17/84,01-17-84,011784,01.17.84
2.可以使用\b匹配單詞的邊界
eg.Regex
可匹配字串 \blet\blet
不可匹配字串letter,hamlet
3.\A和\z在確保字串所包含的是某個運算式,而不是其他內容時很用。
eg.要判斷Text控制項是否包含單詞"sophia",而不含任何額外的字元、分行符號或者空白。
\Asophia\z
4.句點字元(.)具有特殊的含義,若要表示字母字元本身的含義,在前面加一個反斜線:\.
C#Regex文法三、
匹配二選一的字元序列
|——匹配二選一
eg.Regexcol(o|ou)r
可匹配字串 color,colour
注意:\b(bill|ted)和\bbill|ted是不同的。
後者還可以匹配"malted"因為\b元字元只應用於"bill"。
C#Regex文法四、
用量詞匹配 *——匹配0次或多次 +——匹配1次或多次 ?——匹配0次或1次 {n}——恰好匹配n次 {n,}——至少匹配n次 {n,m}——至少匹配n次,
但不多於m次
eg.Regexbrothers?
可匹配字串 brother,brothers
eg.Regex\bp\d{3,5}
可匹配字串 \b以p開頭,且後跟3~5個數字結尾
注意:也可以把量詞與()一起使用,以便把該量詞應用到整個字母序列。
eg.Regex(The)?schoolisbeautiful.
可匹配字串 schoolisbeautiful,Theschoolisbeautiful.
C#Regex文法五、
識別Regex和貪婪 有些量詞是貪婪的(greedy).他們會儘可能多的匹配字元。
如量詞*匹配0個或多個字元。假設要匹配字串中任何HTML標籤。你可能會用如下Regex:
<.*>
現有字串A<i>quantifier</i>canbe<big>greedy</big>
結果<.*>把<i>quantifier</i>canbe<big>greedy</big>都匹配上了。
要解決該問題,需要與量詞一起使用一個特殊的非貪婪字元“?”,因此運算式變化如下:
<.*?>
這樣就可以正確匹配<i>、</i>、<big>、</big>。
?能強制量詞儘可能少地匹配字元,?還可以用在以下幾個量詞中:
*?——非貪婪的量詞* +?——非貪婪的量詞+ ??——非貪婪的量詞? {n}?——非貪婪的量詞{n} {n,}?——非貪婪的量詞
{n,} {n,m}?——非貪婪的量詞{n,m}
C#Regex文法六、
捕獲和反向引用 擷取的群組(capturegroup)就像是Regex中的變數。
擷取的群組可以捕獲Regex中的字元模式,並且由Regex後面的編號或名稱來引用改模式。
()——用來捕獲其中的字串
\數字——用編號來引用
eg.
Regex (\w)(\w)\2\1
可匹配字串abba
注意:
1.反向引用用來匹配html標籤非常有效如<(\w+)></\1>可以匹配<table></table>等類似格式的標籤。
2.預設情況下,只要使用圓括弧,就會捕獲圓括弧內所包含的字元,可以使用n選項來禁用這個預設行為(在第7條裡會詳細介紹),
或者添加?:到圓括弧中。eg.(?:sophia)或(?n:sophia)此時不會捕獲sophia。
(?<擷取的群組名稱>)\k<擷取的群組名稱>——用名稱來引用
eg.
Regex(?<sophia>\w)abc\k<sophia>
可匹配字串 xabcx
注意:在替換模式中使用擷取的群組的格式略有不同,要用$1、$2等來按數值引用捕獲,用${sophia}等名稱來按名稱引用擷取的群組
C#Regex文法七、
設定Regex的選項
eg.
stringstr="<h4>sophia</h4>"
RegExobjRegEx=newRegEx("<h(d)>(.*?)</h1>");
Response.Write(objRegEx.Replace(str,"<fontsize=$1>$2</font>"));
i——所執行的匹配是不區分大小寫(.net中的屬性為IgnoreCase) m——指定多行模式(.net中的屬性為Multiline)
n——只捕獲顯示命名或編號的組(.net中的屬性為ExplicitCapture) c——編譯Regex,這樣會產生較快的執行速度,但啟動會變慢(.net中的屬性為Compiled)
s——指定單行模式(.net中的屬性為SingleLine) x——消除非轉義空白字元和注釋(.net中的屬性為IgnorePatternWhitespace)
r——搜尋從右至左進行(.net中的屬性為RightToLeft) -——表示禁用。
eg.(?im-r:sophia)允許不區分大小寫匹配sophia,使用多行模式,但禁用了從右至左的匹配。
注意:
1.m會影響如何解析起始元字元(^)和結束元字元($)。
在預設情況^和$只匹配整個字串的開頭,即使字串包含多行文本。如果啟用了m,那麼它們就可以匹配每行文本的開頭和結尾。
2.s會影響如何解析句點元字元(.)。通常一個句點能匹配除了分行符號以外的所有字元。但在單行模式下,句點也能匹配一個分行符號。
C#Regex文法規則詳解