Python爬虫从入门到放弃（十六）之 Scrapy框架中Item Pipeline用法

发布时间：2017年07月18日作者：IT网络文摘

当Item 在Spider中被收集之后，就会被传递到Item Pipeline中进行处理

每个item pipeline组件是实现了简单的方法的python类，负责接收到item并通过它执行一些行为，同时也决定此Item是否继续通过pipeline,或者被丢弃而不再进行处理

item pipeline的主要作用：

清理html数据
验证爬取的数据
去重并丢弃
讲爬取的结果保存到数据库中或文件中

编写自己的item pipeline

process_item(self,item,spider)

每个item piple组件是一个独立的pyhton类，必须实现以process_item(self,item,spider)方法
每个item pipeline组件都需要调用该方法，这个方法必须返回一个具有数据的dict,或者item对象，或者抛出DropItem异常，被丢弃的item将不会被之后的pipeline组件所处理

下面的方法也可以选择实现

open_spider(self,spider)
表示当spider被开启的时候调用这个方法

close_spider(self,spider)
当spider挂去年比时候这个方法被调用

from_crawler(cls,crawler)
这个和我们在前面说spider的时候的用法是一样的，可以用于获取settings配置文件中的信息，需要注意的这个是一个类方法，用法例子如下：

Android培训,安卓培训,手机开发培训,移动开发培训,云培训培训

一些item pipeline的使用例子（官网说明）

例子1
这个例子实现的是判断item中是否包含price以及price_excludes_vat，如果存在则调整了price属性，都让item['price'] = item['price'] * self.vat_factor，如果不存在则返回DropItem

分类导航

Python爬虫从入门到放弃（十六）之 Scrapy框架中Item Pipeline用法

编写自己的item pipeline

下面的方法也可以选择实现

一些item pipeline的使用例子（官网说明）

网友评论

更多精彩分享