正则表达式

正则表达式

在线正则表达式测试工具:http://tool.oschina.net/regex/

1.常见匹配模式

 
模式描述
\w 匹配字母数字及下划线
\W 匹配非字母数字下划线
\s 匹配任意空白字符,等价于 [\t\n\r\f].
\S 匹配任意非空字符
\d 匹配任意数字,等价于 [0-9]
\D 匹配任意非数字
\A 匹配字符串开始
\Z 匹配字符串结束,如果是存在换行,只匹配到换行前的结束字符串
\z 匹配字符串结束
\G 匹配最后匹配完成的位置
\n 匹配一个换行符
\t 匹配一个制表符
^ 匹配字符串的开头
$ 匹配字符串的末尾。
. 匹配任意字符,除了换行符,当re.DOTALL标记被指定时,则可以匹配包括换行符的任意字符。
[...] 用来表示一组字符,单独列出:[amk] 匹配 'a','m'或'k'
[^...] 不在[]中的字符:[^abc] 匹配除了a,b,c之外的字符。
* 匹配0个或多个的表达式。
+ 匹配1个或多个的表达式。
? 匹配0个或1个由前面的正则表达式定义的片段,非贪婪方式,+?,*?,??,{n,m}?
{n} 精确匹配n个前面表达式。
{n, m} 匹配 n 到 m 次由前面的正则表达式定义的片段,贪婪方式
a|b 匹配a或b
( )

匹配括号内的表达式,也表示一个组

\.

匹配.号

 \b  匹配一个单词边界,也就是指单词和空格间的位置。例如, 'er\b' 可以匹配"never" 中的 'er',但不能匹配 "verb" 中的 'er'。
 \B  匹配非单词边界。'er\B' 能匹配 "verb" 中的 'er',但不能匹配 "never" 中的 'er'。
完整列表 菜鸟教程:http://www.runoob.com/regexp/regexp-metachar.html

 

2.re.match

从字符串的起始位置匹配一个模式,如果不是起始位置匹配成功的话,match()就返回none

re.match(pattern, string, flags=0)

2.1参数

pattern:正则表达式

string:待匹配的字符串

flags:修饰符,匹配模式(re.S表示.匹配换行符,re.I表示对大小写不敏感)

2.2返回结果的方法

result.group(num=0):匹配的整个表达式的字符串,group() 可以一次输入多个组号,在这种情况下它将返回一个包含那些组所对应值的元组。

result.groups():

result.span():可以输出匹配的范围

2.3例子

import re

content = '''Hello 1234567 World_This
is a Regex Demo
'''
result = re.match('^He.*?(\d+).*?Demo$', content, re.S)#.*?非贪婪匹配任意字符,\.转义
print(result.group(1))

3.re.search

 扫描整个字符串并返回第一个成功的匹配

*4.re.findall

搜索字符串,以列表形式返回全部能匹配的子串

*5.re.sub

re.sub(pattern, repl, string, count=0, flags=0)

替换字符串中每一个匹配的子串后返回替换后的字符串(pattern是正则表达式,repl是替换成的字符串,也可为一个函数对匹配值的操作,string是查找的字符串,count是模式匹配后替换的最大次数,默认 0 表示替换所有的匹配)

import re

content = 'Extra stings Hello 1234567 World_This is a Regex Demo Extra stings'
content = re.sub('(\d+)', r'\1 8910', content)
print(content)

*6.re.compile

将正则字符串编译成正则表达式对象

 

regax = re.compile('Hello.*Demo', re.S)
result = re.match(regax, content)
print(result)

regax有以下方法:

regex.search() 在一个字符串中搜索匹配正则表达式的第一个位置,返回match对象
regex.match() 从一个字符串的开始位置起匹配正则表达式,返回match对象
regex.findall() 搜索字符串,以列表类型返回全部能匹配的子串
regex.split() 将一个字符串按照正则表达式匹配结果进行分割,返回列表类型
regex.finditer() 搜索字符串,返回一个匹配结果的迭代类型,每个迭代元素是match对象
regex.sub() 在一个字符串中替换所有匹配正则表达式的子串,返回替换后的字符串

 

 7.修饰符

  1. re.I 忽略大小写
  2. re.L 表示特殊字符集 \w, \W, \b, \B, \s, \S 依赖于当前环境
  3. re.M 多行模式
  4. re.S 即为 . 并且包括换行符在内的任意字符(. 不包括换行符)
  5. re.U 表示特殊字符集 \w, \W, \b, \B, \d, \D, \s, \S 依赖于 Unicode 字符属性数据库
  6. re.X 为了增加可读性,忽略空格和 # 后面的注释
posted @ 2018-07-22 17:25  WY~记录  阅读(153)  评论(0编辑  收藏  举报