爬虫必备(7)- 网络请求利器requests库
yuyutoo 2025-06-09 07:04 3 浏览 0 评论
在先前的文章中,我们深入讲解了Python标准库(Standard Library)`urllib`通讯库的实际运用。`urllib`作为Python编程语言的重要组成部分之一,其主要职责在于支持 HTTP 和 FTP 等主流网络协议,并内置多样化的函数及功能,旨在有效便捷地检索各类网页数据以及实现基础性的网络爬虫任务等。本文,则将向您介绍一个更为广泛应用且便利的通讯库——`requests`。
`requests`系一款简洁易用、功能完善的HTTP库,基于`urllib`开发,以轻量级的方式表现HTTP处理能力。在继承其丰富功能特性的基础上,还呈现出更具人性化、用户友好的API接口设计,进而大幅度提升了使用者对该通讯库的接受度与满意度,使得在实践运用过程中能够得心应手。已经成为Python事实上的通讯请求库。
requests 是一个三方库,因此在使用之前需要提前安装。
pip install requests
GET 请求
GET 作为 HTTP 通讯中最为常见的请求方式,我们优先来看一下如何使用 requests 来完成一个 GET 请求。
此处案例依然使用 httpbin 的接口来测试
import requests as req
res = req.get("https://httpbin.org/get")
if res.status_code == 200:
print(res.text)
else:
print(f"Error: {res.status_code}")
# {
# "args": {},
# "headers": {
# "Accept": "*/*",
# "Accept-Encoding": "gzip, deflate",
# "Host": "httpbin.org",
# "User-Agent": "python-requests/2.31.0",
# "X-Amzn-Trace-Id": "Root=1-65981de0-38498b4b13dce608142e59cb"
# },
# "origin": "110.176.23.189",
# "url": "https://httpbin.org/get"
# }
可以看到,使用 requests 可以非常方便的发起一个 GET 请求,而且语义更加明确,相较于 urllib 中的 urlopen 更为方便。
POST 请求
requests 发起 post 同样非常简单,方便,如下方代码:
import requests as req
res = req.post("https://httpbin.org/post", data={"name": "John", "age": 30})
print(res.status_code)
# 200
可以看到,通过 post 方法,并直接指定 data 传递参数就可以发起 post 请求。
响应处理
requests 在获取响应数据时同样非常方便,返回的结果被封装到了 response 对象中,并通过 text 和 content 属性即可获取到数据,另外还可以获取到状态码,响应头,Cookies 等数据。
import requests as req
res = req.get("https://httpbin.org/get")
if res.status_code == 200:
print("响应码:", res.status_code)
print("响应头:", res.headers)
print("Cookies:", res.cookies)
print("响应内容:", res.text)
print("url:", res.url)
print("请求历史:", res.history)
# 响应码: 200
# 响应头: {'Date': 'Sun, 07 Jan 2024 09:15:29 GMT', 'Content-Type': 'application/json', 'Content-Length': '308', 'Connection': 'keep-alive', 'Server': 'gunicorn/19.9.0', 'Access-Control-Allow-Origin': '*', 'Access-Control-Allow-Credentials': 'true'}
# Cookies: <RequestsCookieJar[]>
# 响应内容: {
# "args": {},
# "headers": {
# "Accept": "*/*",
# "Accept-Encoding": "gzip, deflate",
# "Host": "httpbin.org",
# "User-Agent": "python-requests/2.31.0",
# "X-Amzn-Trace-Id": "Root=1-659a6bb1-18aed04963d8a8e02865f827"
# },
# "origin": "110.176.23.189",
# "url": "https://httpbin.org/get"
# }
# url: https://httpbin.org/get
# 请求历史: []
如上边的代码,通讯响应成功后,就会获取到 response 对象,通过status_code 可以获取到响应码,我们一般会通过响应码来判断此次通讯是否成功,来继续后续的操作。requests 中有 codes 类封装了所有的状态码,如下图:
因此还可以使用如下表示来判断通信的状态。
res.status_code == req.codes.ok
response 还可以通过其他属性来获取相关内容,如下:
headers: 读取响应头信息,其中包含了服务器返回的各种元数据,如:Conntent-Type 等。
url: 请求的 url
content: 响应的内容,一般是字符串或字节数组(二进制文件)
encoding: 响应编码格式
elapsed:请求和响应的时间差,单位为秒
history: 请求历史记录,如果有值则是一个列表,包含了请求的 URL,状态码和头信息等内容
response 中还提供额外的方法来获取更多的内容,如下:
json():将相应内容解析为 Python 对象,这是一个非常有用的方法,对于 Ajax 方法获取的 json 字符串就不需要手动做转换了。
text():将响应内容作为字符串返回,此方法可以直接获取文本数据。
content():获取响应内容的二进制数据,一般用来获取影音,图片等。
raise_for_status():一般用来检查通讯是否成功,因为此方法在状态码不是 200 的时候会抛出一个异常。
close():关闭响应对象,释放相关资源。
到这里你可能会问,像 text,content 两个既有属性,又有方法,那到底该用哪个?
response.text 属性会自动将响应的内容解码为字符串,所以再使用的时候就不需要手动处理编解码的问题,可以直接使用。相对的 text()方法会将响应的内容解码为字节数组,然后再转为字符串,所以在解码之前对响应内容进行一些额外的处理(比如编解码)。
response.content 属性是一个只读属性,返回响应内容的二进制数据,所以在使用的时候可以直接访问原始的二进制数据,无需手动解码。而 content()方法是一个可读写的方法,虽然也是返回的二进制内容,但是与属性不同的是,调用 content()方法时,requests 会先讲相应内容解码为字节数组,再将其转换为二进制数据,因此在解码之前可以对响应内容做一些额外的处理。
请求参数设置
requests 中设置请求参数同样非常简单,而且支持高级的功能设置,本文简单介绍一下 get 和 post 如何设置请求参数。
# get请求设置query参数和header
requests.get("https://httpbin.org/get",
params={"name": "John", "age": 30},
headers={"User-Agent": "Mozilla/5.0"})
# post请求设置query参数和header
requests.post("https://httpbin.org/post",
data={"name": "John", "age": 30},
headers={"User-Agent": "Mozilla/5.0"})
相关推荐
- 高一高二第一次月考认真作答(高二第一次月考的重要性)
-
正在进行高一、高二第一次月考,同学们正在认真完成化学试卷,研究考纲,探究考点,夯实基础,迎战高考!
- 山清水秀,盛世今朝(山清水秀出处)
-
万千星河,神州妖娆!山清水秀,盛世今朝!龙腾虎跃,锦绣前程!千里婵娟,祝福永远!
- 我校二模成绩已新鲜出炉(二模考试成绩)
-
充电加油备战高考,积极努力再拼一搏...
- Argon Design向瑞萨电子有限公司提供Argon Streams VP9许可证
-
英国剑桥--(美国商业资讯)--领先的先进视频验证解决方案提供商ArgonDesignLtd已与日本半导体公司瑞萨电子有限公司(RenesasElectronicsCorporation)签署...
- 高考倒计时75天(高考倒计时75天励志语)
-
今天是2022年3月24日星期四,距离2022年高考还有75天时间对于十八岁的高三学子来说,有些事情的确会影响你们的一生,但是没有一件事能决定你们的一生!努力的意义,就是:以后的日子里,放眼望去,全...
- 期中考试正在进行(期中考试在即)
-
转眼即瞬,期中考试已到,紧张忙碌的两个月学习,检验的时刻到了。让我们拿出信心和勇气,来挑战自我。面对考验,我们该做的就是沉着,冷静。让知识来一次次洗礼我们的灵魂,让失败和成功迎接一次次的成长。你们可以...
- 不要浪费了你NAS上的HDMI接口!详解华硕NAS上HDMI接口的妙用
-
不要浪费了你NAS上的HDMI接口!详解华硕NAS上HDMI接口的妙用之前我在本站分享我使用的华硕(ASUS)AS6704T...
- Java通过Kafka Streams库来实现数据流处理
-
#暑期创作大赛#...
- From abandoned mines to limpid streams waters: how banks profit from EOD
-
ByZENGYanglinInthecurrentpursuitofthe“dualcarbon”target(carbonpeakingandcarbonneutra...
- SPSS与Streams的集成实现实时预测
-
SPSSModeler是一个数据挖掘工作台,提供了一个可了解数据并生成预测模型的最先进的环境。Streams提供了一个可伸缩的高性能环境,对不断变化的数据进行实时分析,这些数据中包括传统结构的数据...
- Kafka Streams, 我还会再使用它吗?
-
DeeptiMittal4分钟阅读...
- 大数据Hadoop之——Kafka Streams原理介绍与简单应用示例
-
一、KafkaStreams概述官网文档:https://kafka.apache.org/32/documentation/streams/...
- Android上的TCP今天开始向用户推出,并将在下个月向所有用户提供
-
据extends网3月15日报道,Firefox今天宣布,其保护用户免受跟踪器攻击的全面cookie保护(TCP)功能现已在Android上可用。该功能默认启动模式,这样,跟踪器将无法收集有关用户的浏...
- Linux curl命令(linux curl命令安装)
-
Linuxcurl命令是一个利用URL规则在命令行下工作的文件传输工具。它支持文件的上传和下载,所以是综合传输工具,但按传统,习惯称curl为下载工具。作为一款强力工具,curl支持包括HTTP、H...
- go语言http服务入门详解(go语言http服务器)
-
当你在浏览器中输入URL时,实际上是在发送一个对Web页面的请求。该请求被发送到服务器。服务器的工作是获取适当的页面并将其作为响应发送回浏览器。在Web的早期,服务器通常读取服务器硬盘上HTML文件的...
你 发表评论:
欢迎- 一周热门
-
-
前端面试:iframe 的优缺点? iframe有那些缺点
-
带斜线的表头制作好了,如何填充内容?这几种方法你更喜欢哪个?
-
漫学笔记之PHP.ini常用的配置信息
-
推荐7个模板代码和其他游戏源码下载的网址
-
其实模版网站在开发工作中很重要,推荐几个参考站给大家
-
[干货] JAVA - JVM - 2 内存两分 [干货]+java+-+jvm+-+2+内存两分吗
-
正在学习使用python搭建自动化测试框架?这个系统包你可能会用到
-
织梦(Dedecms)建站教程 织梦建站详细步骤
-
【开源分享】2024PHP在线客服系统源码(搭建教程+终身使用)
-
2024PHP在线客服系统源码+完全开源 带详细搭建教程
-
- 最近发表
-
- 高一高二第一次月考认真作答(高二第一次月考的重要性)
- 山清水秀,盛世今朝(山清水秀出处)
- 我校二模成绩已新鲜出炉(二模考试成绩)
- Argon Design向瑞萨电子有限公司提供Argon Streams VP9许可证
- 高考倒计时75天(高考倒计时75天励志语)
- 期中考试正在进行(期中考试在即)
- 不要浪费了你NAS上的HDMI接口!详解华硕NAS上HDMI接口的妙用
- Java通过Kafka Streams库来实现数据流处理
- From abandoned mines to limpid streams waters: how banks profit from EOD
- SPSS与Streams的集成实现实时预测
- 标签列表
-
- mybatis plus (70)
- scheduledtask (71)
- css滚动条 (60)
- java学生成绩管理系统 (59)
- 结构体数组 (69)
- databasemetadata (64)
- javastatic (68)
- jsp实用教程 (53)
- fontawesome (57)
- widget开发 (57)
- vb net教程 (62)
- hibernate 教程 (63)
- case语句 (57)
- svn连接 (74)
- directoryindex (69)
- session timeout (58)
- textbox换行 (67)
- extension_dir (64)
- linearlayout (58)
- vba高级教程 (75)
- iframe用法 (58)
- sqlparameter (59)
- trim函数 (59)
- flex布局 (63)
- contextloaderlistener (56)