Python正则表达式

Python正则常用匹配

1 匹配手机号码

import re

txt = '我的电话是13988886666,订单号:223547896442344874662,商品名:哇哈哈'
pattern = r'1[3-9]\d{9}'
print(re.findall(pattern, txt))

2.匹配小说中人物名出线的次数

import jieba.posseg as posseg
import pandas as pd

with open("小说.txt", "r", encoding="utf-8") as f:
    txt = f.read().encode("utf-8")

name_list = []
for word, flag in posseg.cut(txt):
    if flag == "nr":
        name_list.append(word)

print(pd.Series(name_list).value_counts()[:20])

3.其他常用正则表达式

匹配HTML标记
------------------------------------------------
<(\S*?)[^>]*>.*?</\1>|<.*? />
评注:网上流传的版本太糟糕,上面这个也仅仅能匹配部分,对于复杂的嵌套标记依旧无能为力

匹配链接地址
------------------------------------------------
href *= *['"]*(\S+)["']评注:匹配网页上的链接地址

匹配链接地址和标题
------------------------------------------------
\<a href *= *['"]*(\S+)["'].*\>(.[^\<]*)?\</a>
评注:匹配网页上的链接地址及标题

匹配网址URL
------------------------------------------------
[a-zA-z]+://[^\s]*
评注:网上流传的版本功能很有限,上面这个基本可以满足需求

匹配网站域名
------------------------------------------------
[a-zA-Z0-9][-a-zA-Z0-9]{0,62}(\.[a-zA-Z0-9][-a-zA-Z0-9]{0,62})+\.?
评注:一个完整的域名,由根域、顶级域、二级、三级……域名构成,每级域名之间用点分开,每级域名由字母、数字和减号构成(第一个字母不能是减号),不区分大小写,长度不超过63。
很显然,单独的名字可以由正则表达式[a-zA-Z0-9][-a-zA-Z0-9]{0,62}来匹配,而完整的域名至少包括两个名字(比如google.com,由google和com构成),最后可以有一个表示根域的点(在规范中,最后有一个点的才是完整域名,但一般认为包括两个以上名字的域名也是完整域名,哪怕它后面没有点)。

匹配IP地址
------------------------------------------------
\d+\.\d+\.\d+\.\d+
评注:提取ip地址时有用

匹配Email地址
------------------------------------------------
\w+([-+.]\w+)*@\w+([-.]\w+)*\.\w+([-.]\w+)*
评注:表单验证时很实用

匹配图片引用地址
------------------------------------------------
\<img.*src *= *['"]*(\S+)["'].*\>
评注:可用在网页图片提取等地方

匹配帐号是否合法
------------------------------------------------
匹配帐号是否合法(字母开头,允许5-16字节,允许字母数字下划线):^[a-zA-Z][a-zA-Z0-9_]{4,15}$
评注:表单验证时很实用

匹配密码是否合法
------------------------------------------------
^[a-zA-Z]\w{5,17}$
评注:密码正确格式为:以字母开头,长度在6-18之间,只能包含字符、数字和下划线。

匹配国内电话号码
------------------------------------------------
\d{3,4}[\s,-]?\d{7,8}
评注:匹配形式如 0511-4405222 或 021-87888822

匹配手机号码
------------------------------------------------
1[3,4,5,8]\d[\s,-]?\d{4}[\s,-]?\d{4}+
评注:校验手机号码:必须以数字开头,除数字外,可含有“-” 或空格

匹配腾讯QQ号
------------------------------------------------
[1-9][0-9]{4,}
评注:腾讯QQ号从10000开始

匹配中国邮政编码
------------------------------------------------
[1-9]\d{5}(?!\d)
评注:中国邮政编码为6位数字

匹配身份证号码
------------------------------------------------
[1-9][0-9,X]{14,17}
评注:中国的身份证为15位或18位


匹配特定的数字
------------------------------------------------
^[1-9]\d*$    //匹配正整数
^-[1-9]\d*$   //匹配负整数
^-?[1-9]\d*$   //匹配整数
^[1-9]\d*|0$  //匹配非负整数(正整数 + 0)
^-[1-9]\d*|0$   //匹配非正整数(负整数 + 0)
^[1-9]\d*\.\d*|0\.\d*[1-9]\d*$   //匹配正浮点数
^-([1-9]\d*\.\d*|0\.\d*[1-9]\d*)$  //匹配负浮点数
^-?([1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0)$  //匹配浮点数
^[1-9]\d*\.\d*|0\.\d*[1-9]\d*|0?\.0+|0$    //匹配非负浮点数(正浮点数 + 0)
^(-([1-9]\d*\.\d*|0\.\d*[1-9]\d*))|0?\.0+|0$ //匹配非正浮点数(负浮点数 + 0)
评注:处理大量数据时有用,具体应用时注意修正

posted @ 2022-06-10 11:16  『侠客行』  阅读(51)  评论(0编辑  收藏  举报