最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python爬蟲教程使用Scrapy框架爬取小說代碼示例

 更新時間:2021年09月10日 17:07:24   作者:霖hero  
相信學Python爬蟲的小伙伴聽說過Scrapy框架,也用過Scrapy框架,今天我們邊學習Scrapy框架邊爬取整部小說,讓大家在不知不覺的學習過程中使用Scrapy框架完成整部小說的爬取

Scrapy框架簡單介紹

Scrapy框架是一個基于Twisted的異步處理框架,是純Python實現(xiàn)的爬蟲框架,是提取結構性數(shù)據(jù)而編寫的應用框架,其架構清晰,模塊之間的耦合程度低,可擴展性極強,我們只需要少量的代碼就能夠快速抓取數(shù)據(jù)。

其框架如下圖所示:

Scrapy Engine是整個框架的核心,而涉及到我們編寫代碼的模塊一般只有Item Pipeline模塊和Spiders模塊。

創(chuàng)建Scrapy項目

首先我們通過以下代碼來創(chuàng)建Scrapy項目,執(zhí)行代碼如下圖所示:

Scrapy startproject Fiction

運行結果如下圖所示:

通過上圖可知,我們在C盤創(chuàng)建了一個新的Scrapy項目,項目名為Fiction,而且還提示我們可以通過以下命令創(chuàng)建第一個Spider爬蟲,命令如下所示:

cd Fiction          #進入目錄
scrapy genspider example example.com    #創(chuàng)建spider爬蟲

其中example是我們爬蟲名,example.com是爬蟲爬取的范圍,也就是網(wǎng)站的域名。

Fiction文件夾內(nèi)容如下圖所示:

創(chuàng)建Spider爬蟲

在上面的步驟我們成功創(chuàng)建了一個Scrapy項目,而且知道如何創(chuàng)建Spider爬蟲,接下來我們創(chuàng)建名為fiction的Spider爬蟲,其域名為www.17k.com,代碼如下所示:

scrapy genspider fiction www.17k.com

運行后,spiders文件夾中多了我們剛才創(chuàng)建fiction.py,這個就是我們創(chuàng)建的Spider爬蟲。

如下圖所示:

看到這么多py文件是不是慌了,其實不用慌,一般情況我們主要在剛創(chuàng)建的spider爬蟲文件、items.py和pipelines.py進行編寫代碼,其中:

  • fiction.py:主要編寫代碼定義爬取的邏輯,解析響應并生成提取結果和新的請求;
  • items.py:主要先定義好爬取數(shù)據(jù)的字段,避免拼寫錯誤或者定義字段錯誤,當然我們可以不先定義好字段,而在fiction.py中直接定義;
  • pipelines.py:主要是編寫數(shù)據(jù)清洗、驗證和存儲數(shù)據(jù)的代碼,當我們把數(shù)據(jù)存儲在csv、xml、pickle、marshal、json等文件時,就不需要在pipelines.py中編寫代碼了,只需要執(zhí)行以下代碼即可:
scrapy crawl fiction 文件名.后綴

當數(shù)據(jù)需要保存在MongoDB數(shù)據(jù)庫時,則編寫以下代碼即可:

from pymongo import  MongoClient
client=MongoClient()
collection=client["Fiction"]["fiction"]
​class Test1Pipeline:
    def process_item(self, item, spider):
        collection.insert(item)
        return item

Spider爬蟲提取數(shù)據(jù)

在提取數(shù)據(jù)前,首先我們進入要爬取小說網(wǎng)站并打開開發(fā)者工具,如下圖所示:

我們通過上圖可以發(fā)現(xiàn),<dl class="Volume">存放著我們所有小說章節(jié)名,點擊該章節(jié)就可以跳轉(zhuǎn)到對應的章節(jié)頁面,所以可以使用Xpath來通過這個div作為我們的xpath爬取范圍,通過for循環(huán)來遍歷獲取每個章節(jié)的名和URL鏈接。

跳轉(zhuǎn)章節(jié)內(nèi)容頁面后,打開開發(fā)者工具,如下圖所示:

通過上圖可以發(fā)現(xiàn),小說內(nèi)容存儲在<div class="readAreaBox">里面,我們可以通過for循環(huán)來遍歷該dl中的<div class="p">獲取到章節(jié)的全部內(nèi)容,當然也是通過使用Xpath來獲取。

items.py代碼定義字段

細心的小伙伴就發(fā)現(xiàn)了,我們所需要提前的字段有章節(jié)名、章節(jié)URL鏈接和章節(jié)內(nèi)容,其中章節(jié)名和章節(jié)內(nèi)容是需要進行數(shù)據(jù)保存的,所以可以先在items.py文件中定義好字段名,具體代碼如下所示:

import scrapy
​class FictionItem(scrapy.Item):
    # define the fields for your item here like:
    name = scrapy.Field()
    text = scrapy.Field()

定義字段很簡單,字段名=scrapy.Field()即可。

對了,在items.py定義好字段有個最好的好處是當我們在獲取到數(shù)據(jù)的時候,使用不同的item來存放不同的數(shù)據(jù),在把數(shù)據(jù)交給pipeline的時候,可以通過isinstance(item,FictionItem)來判斷數(shù)據(jù)屬于哪個item,進行不同的數(shù)據(jù)(item)處理。

定義好字段后,這是我們通過在pipeline.py文件中編寫代碼,對不同的item數(shù)據(jù)進行區(qū)分,具體代碼如下:

from Fiction.items import FictionItem
class FictionPipeline:
    def process_item(self, item, spider):
        if isinstance(item,FictionItem):
            print(item)

當然,在我們爬取的項目中,只需要一個class類,在上面的代碼只是為了展示如何判斷區(qū)分數(shù)據(jù)屬于哪個item。

fiction.py代碼提取數(shù)據(jù)

fiction.py文件也就是我們創(chuàng)建的spider爬蟲,打開fiction.py文件,其代碼內(nèi)容如下所示:

import scrapy
class FictionSpider(scrapy.Spider):
    name = 'fiction'
    allowed_domains = ['www.17k.com']
    start_urls = ['http://www.17k.com/']
​    def parse(self, response):
        pass

其中:

  • name是定義此爬蟲名稱的字符串,每個項目唯一的名字,用來區(qū)分不同的Spider,啟動爬蟲時使用scrapy crawl +該爬蟲名字;
  • allowed_domains是允許爬取的域名,防止爬蟲爬到其他網(wǎng)站;
  • start_urls是最開始爬取的url;
  • parse()方法是負責解析返回響應、提取數(shù)據(jù)或進一步生成要處理的請求,注意:不能修改這個方法的名字。

大致了解該文件內(nèi)容的各個部分后,我們開始提取首頁的章節(jié)名和章節(jié)URL鏈接,具體代碼如下所示:

import scrapy
from Fiction.items import FictionItem
​class FictionSpider(scrapy.Spider):
    name = 'fiction'
    allowed_domains = ['www.17k.com']
    start_urls = ['https://www.17k.com/list/2536069.html']
​    def parse(self, response):
        html = response.xpath('//dl[@class="Volume"]')
        books = html.xpath('./dd/a')
        for book in books:
            item =FictionItem()
            item['name'] = []
            name = book.xpath('./span/text()').extract()
            for i in name:
                item['name'].append(i.replace('\n', '').replace('\t', ''))
            href = book.xpath('./@href').extract_first()
             + href
            yield scrapy.Request(url=href, callback=self.parse_detail, meta={'item': item})

首先導入FictionItem,再我們把start_urls鏈接修改為待會要爬的URL鏈接,在parse()方法中,使用xpath獲取章節(jié)名和章節(jié)URL鏈接,通過for循環(huán)調(diào)用FictionItem(),再把章節(jié)名存放在item里面。

通過生成器yield 返回調(diào)用scrapy.Request()方法,其中:

  • url=href:表示下一個爬取的URL鏈接;
  • callback:表示指定parse_detail函數(shù)作為解析處理;
  • meta:實現(xiàn)在不同的解析函數(shù)中傳遞數(shù)據(jù)。

在上一步中我們指定了parse_detail函數(shù)作為解析處理,接下來將編寫parse_detail函數(shù)來獲取章節(jié)內(nèi)容,具體代碼如下所示:

    def parse_detail(self,response):
        string=""
        item=response.meta['item']
        content=response.xpath('//*[@id="readArea"]/div[1]/div[2]//p/text()').extract()
        for i in content:
            string=string+i+'\n'
        item['text']=string
        yield item

首先我們定義了一個空變量string,在通過response.meta[]來接收item數(shù)據(jù),其參數(shù)為上一步中的meta={'item': item}的item,接下來獲取章節(jié)內(nèi)容,最后將章節(jié)內(nèi)容存儲在item['text']中,并通過生成器yield返回數(shù)據(jù)給引擎。

pipelines.py代碼保存數(shù)據(jù)

章節(jié)名和章節(jié)內(nèi)容已經(jīng)全部獲取下來了,接下來我們把獲取下來的數(shù)據(jù)保存為txt文件,具體代碼如下所示:

from Fiction.items import FictionItem
import time
class FictionPipeline:
    def open_spider(self, spider):
        print(time.time())
    def process_item(self, item, spider):
        if isinstance(item, FictionItem):
            title = item['name']
            content = item['text']
            with open(f'小說/{title[0]}.txt', 'w', encoding='utf-8')as f:
                f.write(content)
    def close_spider(self, spider):
        print(time.time())

首先我們導入FictionItem、time,在open_spider()和close_spider()方法編寫代碼調(diào)用time.time()來獲取爬取的開始時間和結束時間,再在process_item()方法中,把引擎返回的item['name']和item['text']分別存放在title和content中,并通過open打開txt文件,調(diào)用write()把章節(jié)內(nèi)容寫入在txt文件中。

settings.py代碼啟動爬蟲

在啟動爬蟲前,我們先要在settings.py文件中啟動引擎,啟動方式很簡單,只要找到下圖中的代碼,并取消代碼的注釋即可:

有人可能問:那User-Agent在哪里設置?我們可以在settings.py文件中,設置User-Agent,具體代碼如下:

好了,所有代碼已經(jīng)編寫完畢了,接下來將啟動爬蟲了,執(zhí)行代碼如下:

scrapy crawl fiction

啟動爬蟲后,發(fā)現(xiàn)我們控制臺里面多了很多l(xiāng)og日志數(shù)據(jù)的輸出,這時可以通過在settings.py添加以下代碼,就可以屏蔽這些log日志:

LOG_LEVEL="WARNING"

結果展示

好了,scrapy框架爬取小說就講到這里了,感覺大家的觀看!?。?/p>

更多關于Python爬蟲教程Scrapy框架爬取的資料請關注腳本之家其它相關文章!

相關文章

  • python中的屬性管理機制詳解

    python中的屬性管理機制詳解

    這篇文章主要介紹了python中的屬性管理機制,主要包括私有屬性和屬性限制-__slots__方法,文中詳細介紹了python中如何去聲明變量的相關知識,需要的朋友可以參考下
    2022-06-06
  • Python+Qt相片更換背景顏色窗體程序的步驟詳解

    Python+Qt相片更換背景顏色窗體程序的步驟詳解

    QT+Python是非常經(jīng)典的窗體編程組合,功能完善,可視化界面美觀易維護,這篇博客針對相片更換背景顏色方面編寫代碼,代碼整潔,規(guī)則,易讀,對學習與使用Python有較好的幫助,需要的朋友可以參考下
    2022-12-12
  • 解決Django生產(chǎn)環(huán)境無法加載靜態(tài)文件問題的解決

    解決Django生產(chǎn)環(huán)境無法加載靜態(tài)文件問題的解決

    這篇文章主要介紹了解決Django生產(chǎn)環(huán)境無法加載靜態(tài)文件問題的解決,小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2019-04-04
  • Python操作Elasticsearch處理timeout超時

    Python操作Elasticsearch處理timeout超時

    這篇文章主要介紹了Python操作Elasticsearch處理timeout超時,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-07-07
  • Python檢測一個對象是否為字符串類的方法

    Python檢測一個對象是否為字符串類的方法

    這篇文章主要介紹了Python檢測一個對象是否為字符串類的方法,即檢測是一個對象是否是字符串對象,本文還講解了一個有趣的判斷方法,需要的朋友可以參考下
    2015-05-05
  • Python模塊、包和發(fā)布模塊示例代碼

    Python模塊、包和發(fā)布模塊示例代碼

    模塊是python程序架構的一個核心概念,模塊名同樣也是一個標識符,需要符合標識符的命名規(guī)則,接下來通過本文給大家講解Python模塊、包和發(fā)布模塊,需要的朋友可以參考下
    2023-01-01
  • SpringMVC和SpringBoot接收參數(shù)的幾種方式詳解

    SpringMVC和SpringBoot接收參數(shù)的幾種方式詳解

    這篇文章主要介紹了SpringMVC和SpringBoot接收參數(shù)的幾種方式詳解,Spring是分層的JavaSE/EE應用輕量級開源框架,以IoC和AOP為內(nèi)核,提供了展現(xiàn)層 Spring MVC和持久層Spring JDBC以及業(yè)務層事務管理等眾多的企業(yè)級應用技術,需要的朋友可以參考下
    2023-07-07
  • pytorch tensorboard可視化的使用詳解

    pytorch tensorboard可視化的使用詳解

    tensorboard是tensorflow用來可視化訓練和測試過程的模塊,而pytorch并沒有可視化模塊,但是pytoch=1.2.0版本以上開始支持tensorboard
    2022-10-10
  • 使用Plotly Dash進行儀表板設計的步驟和技巧

    使用Plotly Dash進行儀表板設計的步驟和技巧

    Plotly Dash 是一個基于 Python 的開源框架,可以幫助你快速而靈活地構建交互式儀表板,本文將介紹使用 Plotly Dash 創(chuàng)建儀表板的步驟和一些技巧,并附上代碼實例來演示每個步驟,需要的朋友可以參考下
    2024-05-05
  • 解決django同步數(shù)據(jù)庫的時候app models表沒有成功創(chuàng)建的問題

    解決django同步數(shù)據(jù)庫的時候app models表沒有成功創(chuàng)建的問題

    今天小編就為大家分享一篇解決django同步數(shù)據(jù)庫的時候app models表沒有成功創(chuàng)建的問題,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-08-08

最新評論

凌云县| 安达市| 宁夏| 新余市| 蚌埠市| 太保市| 祁阳县| 象山县| 清徐县| 文山县| 桂东县| 股票| 龙口市| 永寿县| 邳州市| 乐业县| 伊宁市| 庆元县| 时尚| 旬邑县| 滁州市| 新津县| 聂荣县| 额济纳旗| 罗定市| 金川县| 九寨沟县| 岚皋县| 临潭县| 吉林省| 乌海市| 彩票| 新疆| 柯坪县| 汪清县| 双鸭山市| 凤台县| 永嘉县| 河津市| 康乐县| 民权县|