最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

scrapy-splash簡單使用詳解

 更新時間:2021年02月21日 08:53:12   作者:zhu6201976-朱華龍  
這篇文章主要介紹了scrapy-splash簡單使用詳解,文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧

1.scrapy_splash是scrapy的一個組件

scrapy_splash加載js數(shù)據(jù)基于Splash來實現(xiàn)的

Splash是一個Javascrapy渲染服務(wù),它是一個實現(xiàn)HTTP API的輕量級瀏覽器,Splash是用Python和Lua語言實現(xiàn)的,基于Twisted和QT等模塊構(gòu)建

使用scrapy-splash最終拿到的response相當(dāng)于是在瀏覽器全部渲染完成以后的網(wǎng)頁源代碼

2.scrapy_splash的作用

scrpay_splash能夠模擬瀏覽器加載js,并返回js運行后的數(shù)據(jù)

3.scrapy_splash的環(huán)境安裝

3.1 使用splash的docker鏡像

docker info 查看docker信息

docker images  查看所有鏡像

docker pull scrapinghub/splash  安裝scrapinghub/splash

docker run -p 8050:8050 scrapinghub/splash &  指定8050端口運行

3.2.pip install scrapy-splash

3.3.scrapy 配置:

  SPLASH_URL = 'http://localhost:8050'
  DOWNLOADER_MIDDLEWARES = {
    'scrapy_splash.SplashCookiesMiddleware': 723,
    'scrapy_splash.SplashMiddleware': 725,
    'scrapy.downloadermiddlewares.httpcompression.HttpCompressionMiddleware': 810,
  }
  SPIDER_MIDDLEWARES = {
    'scrapy_splash.SplashDeduplicateArgsMiddleware': 100,
  }
  DUPEFILTER_CLASS = 'scrapy_splash.SplashAwareDupeFilter'
  HTTPCACHE_STORAGE = 'scrapy_splash.SplashAwareFSCacheStorage'

3.4.scrapy 使用

from scrapy_splash import SplashRequest
yield SplashRequest(self.start_urls[0], callback=self.parse, args={'wait': 0.5})

4.測試代碼:

import datetime
import os
 
import scrapy
from scrapy_splash import SplashRequest
 
from ..settings import LOG_DIR
 
 
class SplashSpider(scrapy.Spider):
  name = 'splash'
  allowed_domains = ['biqugedu.com']
  start_urls = ['http://www.biqugedu.com/0_25/']
 
  custom_settings = {
    'LOG_FILE': os.path.join(LOG_DIR, '%s_%s.log' % (name, datetime.date.today().strftime('%Y-%m-%d'))),
    'LOG_LEVEL': 'INFO',
    'CONCURRENT_REQUESTS': 8,
    'AUTOTHROTTLE_ENABLED': True,
    'AUTOTHROTTLE_TARGET_CONCURRENCY': 8,
 
    'SPLASH_URL': 'http://localhost:8050',
    'DOWNLOADER_MIDDLEWARES': {
      'scrapy_splash.SplashCookiesMiddleware': 723,
      'scrapy_splash.SplashMiddleware': 725,
      'scrapy.downloadermiddlewares.httpcompression.HttpCompressionMiddleware': 810,
    },
    'SPIDER_MIDDLEWARES': {
      'scrapy_splash.SplashDeduplicateArgsMiddleware': 100,
    },
    'DUPEFILTER_CLASS': 'scrapy_splash.SplashAwareDupeFilter',
    'HTTPCACHE_STORAGE': 'scrapy_splash.SplashAwareFSCacheStorage',
 
  }
 
  def start_requests(self):
    yield SplashRequest(self.start_urls[0], callback=self.parse, args={'wait': 0.5})
 
  def parse(self, response):
    """
    :param response:
    :return:
    """
    response_str = response.body.decode('utf-8', 'ignore')
    self.logger.info(response_str)
    self.logger.info(response_str.find('http://www.biqugedu.com/files/article/image/0/25/25s.jpg'))

scrapy-splash接收到j(luò)s請求:

到此這篇關(guān)于scrapy-splash簡單使用詳解的文章就介紹到這了,更多相關(guān)scrapy-splash 使用內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • 基于Python實現(xiàn)web網(wǎng)頁內(nèi)容爬取的方法

    基于Python實現(xiàn)web網(wǎng)頁內(nèi)容爬取的方法

    在日常學(xué)習(xí)和工作中,我們經(jīng)常會遇到需要爬取網(wǎng)頁內(nèi)容的需求,今天就如何基于Python實現(xiàn)web網(wǎng)頁內(nèi)容爬取進行講解,感興趣的朋友一起看看吧
    2024-12-12
  • Python在字符串中處理html和xml的方法

    Python在字符串中處理html和xml的方法

    這篇文章主要介紹了Python在字符串中處理html和xml的方法,文中講解非常細致,代碼幫助大家更好的理解和學(xué)習(xí),感興趣的朋友可以了解下
    2020-07-07
  • Python實現(xiàn)解析參數(shù)的三種方法詳解

    Python實現(xiàn)解析參數(shù)的三種方法詳解

    這篇文章主要介紹了python解析參數(shù)的三種方法,文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下
    2022-07-07
  • Python日期時間模塊arrow的具體使用

    Python日期時間模塊arrow的具體使用

    Python中有很多時間和日期處理的庫,有time、datetime等,本文主要介紹了一下arrow,arrow是一個專門處理時間和日期的輕量級Python庫,感興趣的可以了解一下
    2021-09-09
  • python使用numpy計算兩個框的iou方法示例

    python使用numpy計算兩個框的iou方法示例

    這篇文章主要介紹了python使用numpy計算兩個框的iou方法示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪
    2023-08-08
  • pytorch快速搭建神經(jīng)網(wǎng)絡(luò)_Sequential操作

    pytorch快速搭建神經(jīng)網(wǎng)絡(luò)_Sequential操作

    這篇文章主要介紹了pytorch快速搭建神經(jīng)網(wǎng)絡(luò)_Sequential操作,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-06-06
  • 解析Python中while true的使用

    解析Python中while true的使用

    這篇文章主要介紹了解析Python中while true的使用,while true即用來制造一個無限循環(huán),需要的朋友可以參考下
    2015-10-10
  • 利用python獲得時間的實例說明

    利用python獲得時間的實例說明

    在python中,它的time模塊功能十分強大,我們今天就來學(xué)習(xí)下,廢話少說,我們來看下實際的效果,下面貼出代碼:
    2013-03-03
  • 詳解Django 中是否使用時區(qū)的區(qū)別

    詳解Django 中是否使用時區(qū)的區(qū)別

    本篇文章主要介紹了詳解Django 中是否使用時區(qū)的區(qū)別,小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2018-06-06
  • Python Pandas的簡單使用教程

    Python Pandas的簡單使用教程

    Pandas 是python的一個數(shù)據(jù)分析包,最初由AQR Capital Management于2008年4月開發(fā),并于2009年底開源出來,目前由專注于Python數(shù)據(jù)包開發(fā)的PyData開發(fā)team繼續(xù)開發(fā)和維護,今天通過本文給大家介紹Python Pandas的簡單使用教程,感興趣的朋友一起看看吧
    2021-08-08

最新評論

颍上县| 江安县| 宁海县| 抚州市| 新邵县| 湖州市| 当阳市| 永福县| 安乡县| 邵武市| 舞钢市| 德江县| 马边| 腾冲县| 筠连县| 莱州市| 获嘉县| 离岛区| 耒阳市| 奉新县| 新源县| 始兴县| 德惠市| 永德县| 郑州市| 娱乐| 孟州市| 米林县| 靖江市| 岫岩| 英山县| 普洱| 安化县| 来宾市| 蛟河市| 海盐县| 高唐县| 红河县| 台北市| 双辽市| 邹平县|