正则表达式——选择、分组和后向引用

发布时间:2026/8/6 18:45:02
正则表达式——选择、分组和后向引用 选择、分组和后向引用1、选择操作2、子模式3、捕获分组和后向引用4、非捕获分组1、选择操作简单地说选择操作可在多个可选模式中匹配一个。例如你想在“The Rime of the Ancyent Mariner”中找出the出现过多少次包括THE、The和the等形式。为此就可以使用选择操作。在顶部的文本框中输入(the|The|THE)可以使用一个选项来使分组更简短。借助选项可以指定查找模式的方式。例如选项(?i)让你的模式不再区分大小写。因此原来带选择操作的模式可以简写成(?i)the还可以在RegExr中勾选ignoreCase来设定不区分字母大小写这两种方式都可以。下表中列出了以上选项以及其他各种选项和修饰符。接下来我们在grep中使用选择操作。表中的选项并不适用于grep所以你要使用原来的选择模式。要对单词the出现一次或多次的行的数目进行统计且不区分大小写则用grep-Ec(the|The|THE)rime2.txt可以得到这个结果327这个结果还不能说明一切。欲知原因请继续阅读。以下是对上面的grep命令的分析。-E选项表示使用扩展的正则表达式ERE​而不用基本正则表达式BRE​。本例省去了将括号和竖线符转义的步骤如果使用BRE则必须进行转义像这样(THE|The|the)。-c选项返回匹配的行数不是匹配的单词​。括号将对the、The以及THE的选择操作归为一个分组。竖线符将备选项分开对备选项求值的顺序是从左至右。下面的方法会将单词的每一次出现都作为一行内容返回这样就可以得到实际的出现次数grep-Eo(the|The|THE)rime2.txt|wc-l这个命令返回的是412以下是对命令的分析。-o选项表示只显示一行中与指定模式匹配的部分而由于导向wc的管道|​该选项的作用不太直观。在此上下文中竖线符将grep命令的输出通过管道导向wc命令的输入。wc是单词计数命令而-l对输入的行数进行统计。为什么有327与412这样大的差异呢因为-c给出的是匹配的行的数目但是一行中可能有多个单词匹配。若使用-o和wc -l则指定单词不管以哪一种形式出现每次出现都会作为单独的一行统计这样结果值就会更大。要使用Perl执行同种匹配则这样写perl-neprint if /(the|The|THE)/rime2.txt再进一步改善就是将i修饰符加在定界符之后perl-neprint if /the/irime2.txt结果相同但命令是越简单越好。下表中列出了更多的修饰符也称为标记符​。2、子模式多数情况下提到正则表达式中的子模式subpattern​就是指分组中的一个或多个分组。子模式就是模式中的模式。多数情况下子模式中的条件能得到匹配的前提是前面的模式得到匹配但也有例外。子模式的写法可以有很多种这里我们主要关注括号中的子模式。从某种意义上说你之前所见的模式(the|The|THE)有三个子模式the是第一个子模式The是第二个而THE是第三个。但是这种情况下匹配第二个子模式不依赖于是否匹配第一个。​最左边的模式会首先匹配。​而在以下的模式中子模式依赖于前面的模式(t|T)h(e|eir)通俗地讲这个模式会匹配字面值t或T然后是一个h接下来就是一个e或者是eir。相应地这个模式会匹配以下所有情况theThetheirTheir在以上情况中第二个子模式(e|eir)依赖于第一个子模式(tT)。括号对于子模式不是必需的。下面是一个使用字符组的子模式示例\b[tT]h[ceinry]*\b这个模式会匹配the或The还有thee、thy以及thence等单词。两个单词边界\b表示该模式只匹配整个单词而不会匹配单词中的某几个字母。以下是对这个模式的解析。\b匹配单词起始边界。[tT]是字符组它匹配小写字母t或者大写字母T。可以将其看做是第一个子模式。然后匹配或尝试匹配小写字母h。第二个也就是最后一个子模式也表示为字符组[ceinry]​其后用量词表示零个或多个。最后该模式以另外一个\b结束。3、捕获分组和后向引用当一个模式的全部或者部分内容由一对括号分组时它就对内容进行捕获并临时存储于内存中。可以通过后向引用重用捕获的内容形式为\1或$1这里\1或$1引用的是第一个捕获的分组而\2或$2引用第二个捕获的分组以此类推。sed只接受\1这种形式而Perl则两种都接受。下面再展示一下后向引用的使用方法。我们将使用它来重新排序诗文中的一行词在此先跟作者柯勒律治道个歉。点击RegExr的Repalce标签在顶部的文本框中输入下面的模式(It is)(an ancyent Marinere)向下滚动主文本框第三个文本区直到你可以看到被标亮的那一行然后在第二个文本框中输入$2 $1就可以看到在最下面的文本框中那一行被重新排列为an ancyent Marinere It is,要用sed得到相同结果可以这样做sed-Ens/(It is) (an ancyent Marinere)/\2 \1/prime2.txt和RegExr中一样。为了帮助你理解每个细节下面我们来分析一下这个sed命令。-E选项仍然是调用ERE扩展的正则表达式​因此括号可以直接当成字面值来使用了。-n选项覆盖打印每一行的默认设置。替换命令搜索与文本“ It is an ancyent Marinere, ”匹配的内容再将其捕获放入两个分组中。替换命令还将捕获的文本重排为先是后向引用 \2的内容再是\1的内容再将匹配的文本替换为重排后的内容并输出。替换命令结尾处的p表示要打印该行。Perl中类似的命令会做相同的事perl-neprint if s/(It is) (an ancyent Marinere)/\2 \1/rime2.txt注意该命令使用了\1风格的语法。当然你也可以使用$1语法perl-neprint if s/(It is) (an ancyent Marinere)/$2 $1/rime2.txt但关于输出还有一点要注意的是an ancyent Marinere It is,在转换过程中某些单词首字母的大小写被打乱了。Perl可以使用\u和\l来修正这个问题就是这样perl-neprint if s/(It is) (an ancyent Marinere)/\u$2 \l$1/rime2.txt接下来解释一下原因。\l语法并不匹配任何字符而是会将紧接其后的字母变为小写。\u语法将紧接其后的字母变为大写。\U指令未展示将紧接其后的文本字符串全部变为大写。\L指令未展示将紧接其后的文本字符串全部变为小写。这些指令在文本中出现其他指令比如\l或\E作为文字使用的字符串的结尾之前都是起作用的。请自己动手试试这些指令。命名分组命名分组named group就是有名字的分组。这样就可以通过名字而不是数字来引用分组。下面展示一下Perl语言中如何使用命名分组perl-neprint if s/(?oneIt is) (?twoan ancyent Marinere)/\u${two} \l${one}/rime2.txt我们来看看这个命令在括号内添加?one和将分组分别命名为one和two${one}引用名为one的分组而${two}则引用名为two的分组。如果在一个模式中有分组被命名那么你还可以重用该命名分组。解释一下这句话的意思假设你要查找含有连续六个0的字符串000000这个例子很浅显但可以说明其工作原理。用这一模式对连续三个0的分组命名其中z是分组名可以任意取​(?z0{3})然后你可以再使用该分组就像这样(?z0{3})\kz或者(?z0{3})\kz或者(?z0{3})\g{z}下表列出了命名分组可能使用的各种语法。4、非捕获分组还有一种分组是非捕获分组Non-CapturingGroup​。非捕获分组不会将其内容存储在内存中。在你并不想引用分组的时候可以使用它。由于不存储内容非捕获分组就会带来较高的性能。还记得第一个分组吗就是这个(the|The|THE)你不需要任何后向引用因此可以这样写一个非捕获分组(?:the|The|THE)你可以添加选项将其变为不区分大小写的模式就像这样(?i)(?:the)或者你也可以这样做(?:(?i)the)不过下面这种写法最值得推荐(?i:the)该选项i可以放在问号和冒号之间。原子分组另一种非捕获分组是原子分组atomic group​。如果你使用的正则表达式引擎进行回溯操作这种分组就可以将回溯操作关闭但它只针对原子分组内的部分而不针对整个正则表达式。其语法如下(?the)什么时候你会想使用原子分组呢正则表达式处理过程缓慢的一个因素就是回溯操作。其原因就是回溯操作会尝试每一种可能性这会消耗时间和计算资源。有时它会占用大量时间。回溯有可能产生巨大的负面效应这被称为灾难性回溯。使用像re2http://code.google.com/p/re2/这样的非回溯引擎可彻底关闭回溯操作而使用原子分组可以关闭正则表达式的部分回溯操作。