記錄一下scrapy中settings的一些配置小結(jié)
本文主要介紹了scrapy settings配置,分享給大家,具體如下:
# 字符編碼 FEED_EXPORT_ENCODING = 'utf-8'
# redis寫法一
# REDIS_URL = 'redis://localhost:6379'
# redis寫法二
REDIS_HOST = '192.168.10.223'
REDIS_PORT = 6379
# 默認(rèn)的 scrapy redis 會(huì)讀取下面的密碼和db
REDIS_PARAMS = {
'password': '123456',
'db': redis_db
}
# 對(duì)于失敗的HTTP請(qǐng)求(如超時(shí))進(jìn)行重試會(huì)降低爬取效率,當(dāng)爬取目標(biāo)基數(shù)很大時(shí),舍棄部分?jǐn)?shù)據(jù)不影響大局,提高效率 # RETRY_ENABLED = False # 請(qǐng)求下載超時(shí)時(shí)間,默認(rèn)180秒 DOWNLOAD_TIMEOUT = 10
# 1:設(shè)置去重組件,使用的是scrapy_redis的去重組件,而不是scrapy自己的去重組件了 DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter" # 2:設(shè)置調(diào)度器,使用scrapy——redis重寫的調(diào)度器, # 而不再使用scrapy內(nèi)部的調(diào)度器了 SCHEDULER = "scrapy_redis.scheduler.Scheduler" # 3:可以實(shí)現(xiàn)斷點(diǎn)爬取=jondir,(請(qǐng)求的記錄不會(huì)丟失,會(huì)存儲(chǔ)在redis數(shù)據(jù)庫(kù)中, # 不會(huì)清除redis的隊(duì)列,下次直接從redis的隊(duì)列中爬取) SCHEDULER_PERSIST = True # 4:設(shè)置任務(wù)隊(duì)列的模式(三選一): # SpiderPriorityQueue數(shù)據(jù)scrapy-redis默認(rèn)使用的隊(duì)列模式( # 有自己的優(yōu)先級(jí))默認(rèn)第一種 SCHEDULER_QUEUE_CLASS = "scrapy_redis.queue.SpiderPriorityQueue" # 使用了隊(duì)列的形式,任務(wù)先進(jìn)先出。 # SCHEDULER_QUEUE_CLASS = "scrapy_redis.queue.SpiderQueue" # 采用了棧的形式:任務(wù)先進(jìn)后出 # SCHEDULER_QUEUE_CLASS = "scrapy_redis.queue.SpiderStack" ''' 用來(lái)控制當(dāng)接收到的 response 頭信息中的 Content-Length 和內(nèi)容不匹配或者response chunk 未正確結(jié)束時(shí)的時(shí)所采取的操作。 當(dāng) DOWNLOAD_FAIL_ON_DATALOSS 為 True 的時(shí)候拋出 ResponseFailed([_DataLoss]) 錯(cuò)誤 當(dāng)設(shè)置為 False 時(shí), 校驗(yàn)未通過(guò)的 response 將被忽略并且添加一個(gè)名為 dataloss 的 flag 到 response.flag ''' DOWNLOAD_FAIL_ON_DATALOSS = False MONGO_URI = 'mongodb://用戶名:密碼@ip:port'
到此這篇關(guān)于記錄一下scrapy中settings的一些配置小結(jié)的文章就介紹到這了,更多相關(guān)scrapy settings配置內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
Python基于Hypothesis測(cè)試庫(kù)生成測(cè)試數(shù)據(jù)
這篇文章主要介紹了Python基于Hypothesis測(cè)試庫(kù)生成測(cè)試數(shù)據(jù),文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-04-04
python base64 decode incorrect padding錯(cuò)誤解決方法
這篇文章主要介紹了python base64 decode incorrect padding錯(cuò)誤解決方法,本文使用把string補(bǔ)齊等號(hào)的方法解決了這個(gè)錯(cuò)誤,需要的朋友可以參考下2015-01-01
Python爬蟲(chóng)爬取王者榮耀英雄信息并保存到圖數(shù)據(jù)庫(kù)的操作方法
本文介紹了如何使用Python爬蟲(chóng)技術(shù)從王者榮耀官方獲取英雄信息,并將數(shù)據(jù)保存到圖數(shù)據(jù)庫(kù)中,文章詳細(xì)說(shuō)明了爬取英雄名稱、類型及皮膚名稱的過(guò)程,并展示了創(chuàng)建英雄類型節(jié)點(diǎn)和英雄信息節(jié)點(diǎn)的方法2024-09-09
win7上python2.7連接mysql數(shù)據(jù)庫(kù)的方法
這篇文章主要介紹了win7上python2.7連接mysql數(shù)據(jù)庫(kù)的方法,小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧2017-01-01
python取均勻不重復(fù)的隨機(jī)數(shù)方式
今天小編就為大家分享一篇python取均勻不重復(fù)的隨機(jī)數(shù)方式,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2019-11-11
python GUI庫(kù)圖形界面開(kāi)發(fā)之PyQt5多線程中信號(hào)與槽的詳細(xì)使用方法與實(shí)例
這篇文章主要介紹了python GUI庫(kù)圖形界面開(kāi)發(fā)之PyQt5多線程中信號(hào)與槽的詳細(xì)使用方法與實(shí)例,需要的朋友可以參考下2020-03-03
pandas取dataframe特定行列的實(shí)現(xiàn)方法
大家在使用Python進(jìn)行數(shù)據(jù)分析時(shí),經(jīng)常要使用到的一個(gè)數(shù)據(jù)結(jié)構(gòu)就是pandas的DataFrame,本文介紹了pandas取dataframe特定行列的實(shí)現(xiàn)方法,具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下2021-05-05

