重庆分公司,新征程启航
为企业提供网站建设、域名注册、服务器等服务
小编给大家分享一下python数据爬虫基本流程是什么,希望大家阅读完这篇文章后大所收获,下面让我们一起去探讨吧!
成都创新互联公司是一家专注网站建设、网络营销策划、小程序制作、电子商务建设、网络推广、移动互联开发、研究、服务为一体的技术型公司。公司成立十余年以来,已经为近1000家成都公路钻孔机各业的企业公司提供互联网服务。现在,服务的近1000家客户与我们一路同行,见证我们的成长;未来,我们一起分享成功的喜悦。
爬虫基本流程
1、发起请求
通过url向服务器发送requests请求,请求可以包含额外的header信息。
2、获取响应内容
如果服务器正常响应,那么将受到一个response,response即为我们所请求的网页内容,可能包含html\json\二进制数据(图片、视频)等。
3、解析内容
如果是html代码则可以使用网页解析器进行解析;如果是json数据则可以转换成json对象进行解析;如果是二进制数据则可以保存到文件进行进一步的处理。
4、保存数据
可以保存到本地文件,也可以保存到数据库(MySQL\redis\MongoDB等)。
5、requests请求
当我们通过浏览器向服务器发送requests请求时,这个request包含什么内容?可以通过chrome浏览器的开发人员工具(F12)查看。
6、请求方式
最常用的请求方式包括get请求和post请求。
7、uri统一资源定位符
一个网址、一个视频、一个图片都可以用uri去定义
8、requests headers
请求头,包括这次请求的类型,cookie信息以及浏览器类型等。
请求头在我们进行网页抓取的时候,服务器会通过解析请求头来进行信息的审核,判断请求是否为合法请求。所以当我们通过程序伪装浏览器进行请求的时候可以设置请求头的信息。
9、请求体
post请求会把用户信息包装在form-data里面进行提交,因此相比于get请求,post请求的Headers标签的内容会多出Form Data这个信息包。
10、response
响应状态:Headers中的General可以看到status code,使用数字代码表示对于状态,200表示成功,301跳转,404找不到网页,502服务器错误等。
11、响应头
包括内容的类型,cookie信息等。
12、响应体
请求的目的就是为了得到响应体,包括html代码,json及二进制数据等。
13、requests模块
安装使用pip install requests即可。
看完了这篇文章,相信你对python数据爬虫基本流程是什么有了一定的了解,想了解更多相关知识,欢迎关注创新互联行业资讯频道,感谢各位的阅读!