最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

scrapy框架ItemPipeline的使用

 更新時間:2022年08月15日 11:37:59   作者:卑微小鐘  
本文主要介紹了scrapy框架ItemPipeline的使用,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧

Item Pipeline簡介

Item管道的主要責(zé)任是負(fù)責(zé)處理有蜘蛛從網(wǎng)頁中抽取的Item,他的主要任務(wù)是清晰、驗證和存儲數(shù)據(jù)。
當(dāng)頁面被蜘蛛解析后,將被發(fā)送到Item管道,并經(jīng)過幾個特定的次序處理數(shù)據(jù)。
每個Item管道的組件都是有一個簡單的方法組成的Python類。
他們獲取了Item并執(zhí)行他們的方法,同時他們還需要確定的是是否需要在Item管道中繼續(xù)執(zhí)行下一步或是直接丟棄掉不處理。

調(diào)用時間: 當(dāng)Item在Spider中被收集之后,它將會被傳遞到Item Pipeline,一些組件會按照一定的順序執(zhí)行對Item的處理。

功能:

  • 清理HTML數(shù)據(jù)
  • 驗證爬取的數(shù)據(jù)(檢查item包含某些字段)
  • 查重(并丟棄)
  • 將爬取結(jié)果保存到數(shù)據(jù)庫中

一、一個自己的Pipeline類

必須實現(xiàn)以下方法:

process_item(self, item**,** spider**)**

每個item pipeline組件都需要調(diào)用該方法,這個方法必須返回一個具有數(shù)據(jù)的dict,或是 Item(或任何繼承類)對象, 或是拋出 DropItem 異常,被丟棄的item將不會被之后的pipeline組件所處理。

參數(shù):

  • item (Item 對象或者一個dict) – 被爬取的item
  • spider (Spider 對象) – 爬取該item的spider

open_spider(self, spider)

當(dāng)spider被開啟時,這個方法被調(diào)用。參數(shù):spider (Spider對象) – 被開啟的spider

from_crawler(cls,crawler)

如果存在,則調(diào)用該類方法以從中創(chuàng)建管道實例Crawler。它必須返回管道的新實例。搜尋器對象提供對所有Scrapy核心組件(如設(shè)置和信號)的訪問;這是管道訪問它們并將其功能掛鉤到Scrapy中的一種方法。

close_spider(self, spider)

當(dāng)spider被關(guān)閉時,這個方法被調(diào)用參數(shù):spider (Spider對象) – 被關(guān)閉的spider

二、啟用一個Item Pipeline組件

為了啟用一個Item Pipeline組件,你必須將它的類添加到 ITEM_PIPELINES 配置,就像下面這個例子:

ITEM_PIPELINES = {
    'myproject.pipelines.PricePipeline': 300,
    'myproject.pipelines.JsonWriterPipeline': 800,
}

分配給每個類的整型值,確定了他們運行的順序,item按數(shù)字從低到高的順序,通過pipeline,通常將這些數(shù)字定義在0-1000范圍內(nèi)。

將item寫入JSON文件

以下pipeline將所有爬取到的item,存儲到一個獨立地items.json 文件,每行包含一個序列化為'JSON'格式的'item':

import json
class JsonWriterPipeline(object):
    def __init__(self):
        self.file = open('items.json', 'wb')
    def process_item(self, item, spider):
        line = json.dumps(dict(item),ensure_ascii=False) + "\n"
        self.file.write(line)
        return item

在這里優(yōu)化:

以下pipeline將所有爬取到的item,存儲到一個獨立地items.json 文件,每行包含一個序列化為'JSON'格式的'item':

import json
import codecs
class JsonWriterPipeline(object):
    def __init__(self):
        self.file = codecs.open('items.json', 'w', encoding='utf-8')
    def process_item(self, item, spider):
        line = json.dumps(dict(item), ensure_ascii=False) + "\n"
        self.file.write(line)
        return item
    def spider_closed(self, spider):
        self.file.close()

針對spider里面的utf-8編碼格式去掉.encode('utf-8')

item = RecruitItem()
item['name']=name.encode('utf-8')
item['detailLink']=detailLink.encode('utf-8')
item['catalog']=catalog.encode('utf-8')
item['recruitNumber']=recruitNumber.encode('utf-8')
item['workLocation']=workLocation.encode('utf-8')
item['publishTime']=publishTime.encode('utf-8')

將item寫入MongoDB

from_crawler(cls, crawler)

如果使用,這類方法被調(diào)用創(chuàng)建爬蟲管道實例。必須返回管道的一個新實例。crawler提供存取所有Scrapy核心組件配置和信號管理器;對于pipelines這是一種訪問配置和信號管理器 的方式。

在這個例子中,我們將使用pymongo將Item寫到MongoDB。MongoDB的地址和數(shù)據(jù)庫名稱在Scrapy setttings.py配置文件中;

這個例子主要是說明如何使用from_crawler()方法

import pymongo
class MongoPipeline(object):
    collection_name = 'scrapy_items'
    def __init__(self, mongo_uri, mongo_db):
        self.mongo_uri = mongo_uri
        self.mongo_db = mongo_db
    @classmethod
    def from_crawler(cls, crawler):
        return cls(
            mongo_uri=crawler.settings.get('MONGO_URI'),
            mongo_db=crawler.settings.get('MONGO_DATABASE', 'items')
        )
    def open_spider(self, spider):
        self.client = pymongo.MongoClient(self.mongo_uri)
        self.db = self.client[self.mongo_db]
    def close_spider(self, spider):
        self.client.close()
    def process_item(self, item, spider):
        self.db[self.collection_name].insert(dict(item))
        return item

到此這篇關(guān)于scrapy框架ItemPipeline的使用的文章就介紹到這了,更多相關(guān)scrapy ItemPipeline內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • pytorch中transform.Compose()用法詳解

    pytorch中transform.Compose()用法詳解

    PyTorch是一個開源的Python機器學(xué)習(xí)庫,基于Torch,用于自然語言處理等應(yīng)用程序,這篇文章主要介紹了pytorch中transform.Compose()用法,需要的朋友可以參考下
    2023-10-10
  • Python圖像處理之幾何變換

    Python圖像處理之幾何變換

    這篇文章將詳細(xì)講解圖像幾何變換,包括圖像平移、圖像縮放和圖像旋轉(zhuǎn)。文中的示例代碼講解詳細(xì),感興趣的小伙伴可以跟隨小編學(xué)習(xí)一下
    2022-01-01
  • 簡化Python的Django框架代碼的一些示例

    簡化Python的Django框架代碼的一些示例

    這篇文章主要介紹了簡化Python的Django框架代碼的一些示例,實際上文中只是抽取了一些Django中最基本的功能用于簡化入門者的上手復(fù)雜度,下,需要的朋友可以參考下
    2015-04-04
  • python 模擬網(wǎng)站登錄——滑塊驗證碼的識別

    python 模擬網(wǎng)站登錄——滑塊驗證碼的識別

    這篇文章主要介紹了python 模擬網(wǎng)站登錄——滑塊驗證碼的識別,幫助大家更好的理解和學(xué)習(xí)使用python的爬蟲技術(shù),感興趣的朋友可以了解下
    2021-03-03
  • postman和python mock測試過程圖解

    postman和python mock測試過程圖解

    這篇文章主要介紹了postman和python mock測試過程圖解,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下
    2020-02-02
  • Django中template for如何使用方法

    Django中template for如何使用方法

    這篇文章主要介紹了Django中template for如何使用方法,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2021-01-01
  • python遍歷 truple list dictionary的幾種方法總結(jié)

    python遍歷 truple list dictionary的幾種方法總結(jié)

    下面小編就為大家?guī)硪黄猵ython遍歷 truple list dictionary的幾種方法總結(jié)。小編覺得挺不錯的,現(xiàn)在就分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2016-09-09
  • Python基礎(chǔ)之注釋的用法

    Python基礎(chǔ)之注釋的用法

    今天給大家?guī)淼氖顷P(guān)于Python的相關(guān)知識,文章圍繞著Python注釋的用法展開,文中有非常詳細(xì)的介紹及代碼示例,需要的朋友可以參考下
    2021-06-06
  • python使用matplotlib定制繪圖的線型、標(biāo)記類型

    python使用matplotlib定制繪圖的線型、標(biāo)記類型

    這篇文章主要給大家詳細(xì)介紹了python使用matplotlib定制繪圖的線型、標(biāo)記類型,文中有詳細(xì)的代碼示例,具有一定的參考價值,需要的朋友可以參考下
    2023-07-07
  • python多線程和多進程關(guān)系詳解

    python多線程和多進程關(guān)系詳解

    在本篇文章里小編給大家整理的是一篇關(guān)于python多線程和多進程之間的聯(lián)系的基礎(chǔ)內(nèi)容,有興趣的朋友們可以學(xué)習(xí)下。
    2020-12-12

最新評論

岚皋县| 永顺县| 曲靖市| 南开区| 安泽县| 随州市| 长宁区| 深水埗区| 平利县| 巴南区| 清丰县| 禹州市| 石楼县| 吉林市| 来凤县| 浦北县| 福鼎市| 马鞍山市| 龙陵县| 天祝| 威宁| 福泉市| 淳安县| 孟连| 郑州市| 喀喇| 长岭县| 陇南市| 洮南市| 邵东县| 文安县| 建水县| 长岛县| 安国市| 兴城市| 洪湖市| 台南市| 左权县| 东至县| 隆回县| 宜黄县|