python入门教程爬虫基础(十二)正则表达式 regular expression
yuyutoo 2024-10-18 12:14 3 浏览 0 评论
一 正则表达式
正则表达式是各种字符串操作的强大工具.
它们对于以下两种主要任务是有用的:
--验证字符串是否匹配模式(pattern)例如:字符串具有电子邮件地址的格式
--对字符串中某些字符进行替换(例如:将所有美式拼写改为英式拼写)
正则表达式是一个高度专业化的迷你编程语言.与SQL(用于数据库操作)类似,适用于多种编程环境.
正则表达式可以使用re模块来访问,它是标准库的一部分
定义正则表达式之后,可以使用re.match函数来确定字符串的开头是否匹配.
如果匹配,match返回匹配的对象,否则返回None.
为了避免在处理正则表达式时出现混淆,我们使用原始字符串r"expression"
原始字符串不会转义任何东西,这使得使用正则表达式更容易.
r取自raw(原始的,未加处理的)
●其他的正则函数:
re.search和re.findall
re.search函数在字符串中的任何位置找到匹配模式.
re.findall函数返回一个与模式匹配的所有子串的列表.
例如:
●函数re.finditer和re.findall类似,不过它返回一个迭代器,而不是一个列表.
正则表达式搜索(search)使用多个方法返回一个对象,提供有关它的详细信息.
这些方法包括返回搜索到的字符串,返回第一个搜索到的模式在原始字符串中开始和结束下标索引,以及将开始和结束下标索引作为元组返回的索引.
例如:
搜索和替换:
使用正则表达式的最重要的re方法是sub
语法:
re.sub(pattern,repl,string)
此方法用repl(replace)替换字符串中所有出现的模式(pattern),
sub方法返回修改后的字符串.
例如:
二 简单的元字符
元字符使正则表达式比普通的字符串方法更强大.
它们允许你创建正则表达式来表示像"一个或多个元音的重复"这样的概念([aeiou]+)
如果要创建与元字符(例如$)匹配的正则表达式,则元字符的存在会造成问题,你可以通过在它们前面加一个反斜杠来转义元字符.
但是,这可能导致问题,因为反斜杠在正常的python字符串中也有一个转义的功能.
这可能意味着需要连续放置三到四个反斜杠来完成所有的转义.
为了避免这种情况,你可以使用一个原始字符串,这是一个前面带有"r"的普通字符串.
元字符
.(点)它匹配任何字符,但不匹配新的行(\n).
例如:
^和$:分别匹配字符串的开头和结尾
例如:
三 字符类
字符类:通过将匹配的字符放在方括号内来创建字符类,这样可以实现只匹配特定字符集中的一个.
字符类也可以匹配字符的范围:
[a-z]匹配任何小写字母字符
[G-P]匹配从G到P的任何大写字符
[0-9]匹配任何数字
一个字符类可以包含多个范围.例如,[A-Za-z]匹配任何一个字母
例如:
在字符类的开头放置一个^来反转它
这使得它匹配除包含的字符之外的任何字符.其他元字符(.和$)在字符类中没有意义
元字符^是字符类中的第一个字符时,才有意义
例如:
r"[^A-Z]"":表示匹配不包括大写字母的所有字符.(即不能全是大写字母)
四 更多的元字符
元字符(*):表示零次或多次重复.*前可以是一个单独的字符,一个类或一组括在括号中的字符
例如:
上面的例子,匹配以"egg"开头的字符串,并跟随零个或多个"spam"
[a^]*:表示匹配零个或多个"a"或"^"
元字符+和*非常相似.+表示一个或多个重复
例如:
*:匹配0个或多个前面的表达式
+:匹配1个或多个前面的表达式
?:匹配0个或一个前面的表达式
例如:
大括号可以用来表示两个数字之间的重复次数
正则表达式{x,y}表示重复x次-y次之间
因此{0,1}与?相同
大括号如果第一个数字缺失,则将其视为零.如果第二个数字丢失,则被认为是无限的.
例如:
"9{1,3}$"匹配具有1到3个9的字符串
关注小编不迷路,下节我们继续介绍正则表达式!
相关推荐
- 高一高二第一次月考认真作答(高二第一次月考的重要性)
-
正在进行高一、高二第一次月考,同学们正在认真完成化学试卷,研究考纲,探究考点,夯实基础,迎战高考!
- 山清水秀,盛世今朝(山清水秀出处)
-
万千星河,神州妖娆!山清水秀,盛世今朝!龙腾虎跃,锦绣前程!千里婵娟,祝福永远!
- 我校二模成绩已新鲜出炉(二模考试成绩)
-
充电加油备战高考,积极努力再拼一搏...
- Argon Design向瑞萨电子有限公司提供Argon Streams VP9许可证
-
英国剑桥--(美国商业资讯)--领先的先进视频验证解决方案提供商ArgonDesignLtd已与日本半导体公司瑞萨电子有限公司(RenesasElectronicsCorporation)签署...
- 高考倒计时75天(高考倒计时75天励志语)
-
今天是2022年3月24日星期四,距离2022年高考还有75天时间对于十八岁的高三学子来说,有些事情的确会影响你们的一生,但是没有一件事能决定你们的一生!努力的意义,就是:以后的日子里,放眼望去,全...
- 期中考试正在进行(期中考试在即)
-
转眼即瞬,期中考试已到,紧张忙碌的两个月学习,检验的时刻到了。让我们拿出信心和勇气,来挑战自我。面对考验,我们该做的就是沉着,冷静。让知识来一次次洗礼我们的灵魂,让失败和成功迎接一次次的成长。你们可以...
- 不要浪费了你NAS上的HDMI接口!详解华硕NAS上HDMI接口的妙用
-
不要浪费了你NAS上的HDMI接口!详解华硕NAS上HDMI接口的妙用之前我在本站分享我使用的华硕(ASUS)AS6704T...
- Java通过Kafka Streams库来实现数据流处理
-
#暑期创作大赛#...
- From abandoned mines to limpid streams waters: how banks profit from EOD
-
ByZENGYanglinInthecurrentpursuitofthe“dualcarbon”target(carbonpeakingandcarbonneutra...
- SPSS与Streams的集成实现实时预测
-
SPSSModeler是一个数据挖掘工作台,提供了一个可了解数据并生成预测模型的最先进的环境。Streams提供了一个可伸缩的高性能环境,对不断变化的数据进行实时分析,这些数据中包括传统结构的数据...
- Kafka Streams, 我还会再使用它吗?
-
DeeptiMittal4分钟阅读...
- 大数据Hadoop之——Kafka Streams原理介绍与简单应用示例
-
一、KafkaStreams概述官网文档:https://kafka.apache.org/32/documentation/streams/...
- Android上的TCP今天开始向用户推出,并将在下个月向所有用户提供
-
据extends网3月15日报道,Firefox今天宣布,其保护用户免受跟踪器攻击的全面cookie保护(TCP)功能现已在Android上可用。该功能默认启动模式,这样,跟踪器将无法收集有关用户的浏...
- Linux curl命令(linux curl命令安装)
-
Linuxcurl命令是一个利用URL规则在命令行下工作的文件传输工具。它支持文件的上传和下载,所以是综合传输工具,但按传统,习惯称curl为下载工具。作为一款强力工具,curl支持包括HTTP、H...
- go语言http服务入门详解(go语言http服务器)
-
当你在浏览器中输入URL时,实际上是在发送一个对Web页面的请求。该请求被发送到服务器。服务器的工作是获取适当的页面并将其作为响应发送回浏览器。在Web的早期,服务器通常读取服务器硬盘上HTML文件的...
你 发表评论:
欢迎- 一周热门
-
-
前端面试:iframe 的优缺点? iframe有那些缺点
-
带斜线的表头制作好了,如何填充内容?这几种方法你更喜欢哪个?
-
漫学笔记之PHP.ini常用的配置信息
-
推荐7个模板代码和其他游戏源码下载的网址
-
其实模版网站在开发工作中很重要,推荐几个参考站给大家
-
[干货] JAVA - JVM - 2 内存两分 [干货]+java+-+jvm+-+2+内存两分吗
-
正在学习使用python搭建自动化测试框架?这个系统包你可能会用到
-
织梦(Dedecms)建站教程 织梦建站详细步骤
-
【开源分享】2024PHP在线客服系统源码(搭建教程+终身使用)
-
2024PHP在线客服系统源码+完全开源 带详细搭建教程
-
- 最近发表
-
- 高一高二第一次月考认真作答(高二第一次月考的重要性)
- 山清水秀,盛世今朝(山清水秀出处)
- 我校二模成绩已新鲜出炉(二模考试成绩)
- Argon Design向瑞萨电子有限公司提供Argon Streams VP9许可证
- 高考倒计时75天(高考倒计时75天励志语)
- 期中考试正在进行(期中考试在即)
- 不要浪费了你NAS上的HDMI接口!详解华硕NAS上HDMI接口的妙用
- Java通过Kafka Streams库来实现数据流处理
- From abandoned mines to limpid streams waters: how banks profit from EOD
- SPSS与Streams的集成实现实时预测
- 标签列表
-
- mybatis plus (70)
- scheduledtask (71)
- css滚动条 (60)
- java学生成绩管理系统 (59)
- 结构体数组 (69)
- databasemetadata (64)
- javastatic (68)
- jsp实用教程 (53)
- fontawesome (57)
- widget开发 (57)
- vb net教程 (62)
- hibernate 教程 (63)
- case语句 (57)
- svn连接 (74)
- directoryindex (69)
- session timeout (58)
- textbox换行 (67)
- extension_dir (64)
- linearlayout (58)
- vba高级教程 (75)
- iframe用法 (58)
- sqlparameter (59)
- trim函数 (59)
- flex布局 (63)
- contextloaderlistener (56)