Josiah的小园子 Python开发简单爬虫（一）

发布时间：2017年07月13日作者：IT网络文摘

Python开发简单爬虫（一）

一、简单爬虫架构：

爬虫调度端：启动爬虫，停止爬虫，监视爬虫运行情况
URL管理器：对将要爬取的和已经爬取过的URL进行管理；可取出带爬取的URL，将其传送给“网页下载器”
网页下载器：将URL指定的网页下载，存储成一个字符串，在传送给“网页解析器”
网页解析器：解析网页可解析出 ①有价值的数据 ②另一方面，每个网页都包含有指向其他网页的URL，解析出来后可补充进“URL管理器”，不断循环。

二、简单爬虫架构的动态运行流程

三、爬虫URL管理

URL管理器：管理待抓取URL集合和已抓取URL集合防止重复抓取。

url: 添加新url到爬取集合中, 判断待添加url是否在容器中, 判断是否还有待爬取的url, 获取待爬取url, 将url从待爬移动到已爬

电脑培训,计算机培训,平面设计培训,网页设计培训,美工培训,Web培训,Web前端开发培训

四、爬虫URL管理器的实现方式

URL管理器的三种实现方式：内存、关系数据库、缓存数据库

电脑培训,计算机培训,平面设计培训,网页设计培训,美工培训,Web培训,Web前端开发培训

存放在内存中是利用set()集合，可以去除重复元素，利用MySQL里的is_crawled参数是用来标记已爬取还是未爬取，redis数据库同样利用set集合。

五、爬虫网页下载器

分类导航

Josiah的小园子 Python开发简单爬虫（一）

Python开发简单爬虫（一）

网友评论

更多精彩分享