最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Scrapy爬蟲文件批量運行的實現(xiàn)

 更新時間:2020年09月30日 10:31:15   作者:SteveForever  
這篇文章主要介紹了Scrapy爬蟲文件批量運行的實現(xiàn),文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧

Scrapy批量運行爬蟲文件的兩種方法:

1、使用CrawProcess實現(xiàn)

https://doc.scrapy.org/en/latest/topics/practices.html

2、修改craw源碼+自定義命令的方式實現(xiàn)

(1)我們打開scrapy.commands.crawl.py 文件可以看到:

 def run(self, args, opts):
    if len(args) < 1:
      raise UsageError()
    elif len(args) > 1:
      raise UsageError("running 'scrapy crawl' with more than one spider is no longer supported")
    spname = args[0]

    self.crawler_process.crawl(spname, **opts.spargs)
    self.crawler_process.start()

這是crawl.py 文件中的run() 方法,在此可以指定運行哪個爬蟲,要運行所有的爬蟲,則需要更改這個方法。

run() 方法中通過crawler_process.crawl(spname, **opts.spargs) 實現(xiàn)了爬蟲文件的運行,spname代表爬蟲名。要運行多個爬蟲文件,首先要獲取所有的爬蟲文件,可以通過crawler_process.spider_loader.list() 實現(xiàn)。

(2)實現(xiàn)過程:

a、在spider目錄的同級目錄下創(chuàng)建存放源代碼的文件夾mycmd,并在該目錄下創(chuàng)建文件mycrawl.py;

b、將crawl.py 中的代碼復制到mycrawl.py 文件中,然后進行修改:

#修改后的run() 方法
  def run(self, args, opts):
    #獲取爬蟲列表
    spd_loader_list = self.crawler_process.spider_loader.list()
    #遍歷各爬蟲
    for spname in spd_loader_list or args:
      self.crawler_process.crawl(spname, **opts.spargs)
      print("此時啟動的爬蟲:"+spname)
    self.crawler_process.start()

同時可以修改:

 def short_desc(self):
    return "Run all spider"

c、在mycmd文件夾下添加一個初始化文件__init__.py,在項目配置文件(setting.py)中添加格式為“COMMANDS_MODULES='項目核心目錄.自定義命令源碼目錄'”的配置;

例如:COMMANDS_MODULE = 'firstpjt.mycmd'

隨后通過命令“scrapy -h”,可以查看到我們添加的命令mycrawl

這樣,我們就可以同時啟動多個爬蟲文件了,使用命令:

scrapy mycrawl --nolog

到此這篇關于Scrapy爬蟲文件批量運行的實現(xiàn)的文章就介紹到這了,更多相關Scrapy 批量運行內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!

相關文章

  • Django在Win7下的安裝及創(chuàng)建項目hello word簡明教程

    Django在Win7下的安裝及創(chuàng)建項目hello word簡明教程

    這篇文章主要介紹了Django在Win7下的安裝及創(chuàng)建項目hello word,需要的朋友可以參考下
    2014-07-07
  • python主線程捕獲子線程的方法

    python主線程捕獲子線程的方法

    這篇文章主要為大家詳細介紹了python主線程捕獲子線程的方法,具有一定的參考價值,感興趣的朋友可以參考一下
    2018-06-06
  • python中的測試框架

    python中的測試框架

    這篇文章主要介紹了python中測試框架的相關資料,幫助大家更好的理解和使用python進行測試,感興趣的朋友可以了解下
    2020-11-11
  • Python設計模式編程中Adapter適配器模式的使用實例

    Python設計模式編程中Adapter適配器模式的使用實例

    這篇文章主要介紹了Python設計模式編程中Adapter適配器模式的使用實例,一般來說適配器模式可以細分為類適配器和對象適配器模式,需要的朋友可以參考下
    2016-03-03
  • flask入門之表單的實現(xiàn)

    flask入門之表單的實現(xiàn)

    這篇文章主要介紹了flask入門之表單的實現(xiàn),小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2018-07-07
  • 深入了解Django View(視圖系統(tǒng))

    深入了解Django View(視圖系統(tǒng))

    這篇文章主要介紹了簡單了解Django View(視圖系統(tǒng)),文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2019-07-07
  • Python中read,readline和readlines的區(qū)別案例詳解

    Python中read,readline和readlines的區(qū)別案例詳解

    這篇文章主要介紹了Python中read,readline和readlines的區(qū)別案例詳解,本篇文章通過簡要的案例,講解了該項技術(shù)的了解與使用,以下就是詳細內(nèi)容,需要的朋友可以參考下
    2021-09-09
  • PyTorch零基礎入門之邏輯斯蒂回歸

    PyTorch零基礎入門之邏輯斯蒂回歸

    PyTorch是一個開源的Python機器學習庫,基于Torch,用于自然語言處理等應用程序,它是一個可續(xù)計算包,提供兩個高級功能:1、具有強大的GPU加速的張量計算(如NumPy)。2、包含自動求導系統(tǒng)的深度神經(jīng)網(wǎng)絡
    2021-10-10
  • 淺談python下含中文字符串正則表達式的編碼問題

    淺談python下含中文字符串正則表達式的編碼問題

    今天小編就為大家分享一篇淺談python下含中文字符串正則表達式的編碼問題,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-12-12
  • 詳解selenium + chromedriver 被反爬的解決方法

    詳解selenium + chromedriver 被反爬的解決方法

    這篇文章主要介紹了詳解selenium + chromedriver 被反爬的解決方法,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2020-10-10

最新評論

万山特区| 台北县| 三原县| 宣武区| 梅州市| 平武县| 华容县| 南丹县| 桂平市| 内乡县| 上杭县| 湖北省| 嫩江县| 新营市| 三穗县| 高密市| 财经| 泸定县| 许昌县| 正蓝旗| 江达县| 吉安县| 台东县| 太和县| 本溪| 翁源县| 鸡西市| 南川市| 秦皇岛市| 望谟县| 汪清县| 禹城市| 昌宁县| 淮南市| 和田县| 措美县| 曲麻莱县| 焦作市| 凤冈县| 甘谷县| 张家港市|