最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python爬蟲之scrapy框架詳解

 更新時間:2021年11月24日 08:39:47   作者:可小v.  
這篇文章主要為大家介紹了python爬蟲之scrapy框架,具有一定的參考價值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助
1.在pycharm下安裝scrapy函數(shù)庫
2.將安裝好scrapy函數(shù)庫下的路徑配置到系統(tǒng)path的環(huán)境變量中
3.打開cmd終端輸入:scrapy.exe檢查是否安裝成功
4.創(chuàng)建一個項目:scrapy startproject 項目名字
5.cd進入該目錄下,創(chuàng)建一個spider:scrapy genspider 項目名字 網(wǎng)址
6.編輯settings.py文件中的USER_AGENT選項為正常的瀏覽器頭部
7.執(zhí)行這個spider:scrapy crawl 項目名字
8.如果遇到因pip版本太低導(dǎo)致安裝不了scarpy函數(shù)庫,可以先在cmd窗口輸入py -m pip install --upgrade pip升級命令(前提是你的python環(huán)境下得有pip,可通過輸入pip命令查看是否已安裝,如未安裝得去官網(wǎng)下載并解壓至相應(yīng)路徑)

代碼示例命令截圖:

在這里插入圖片描述

項目文件截圖:

在這里插入圖片描述

settings.py文件截圖:(需要修改爬取網(wǎng)站的USER_AGENT)

在這里插入圖片描述

scrapy運行工作流程圖:

Spiders(爬蟲):它負(fù)責(zé)處理所有Responses,從中分析提取數(shù)據(jù),獲取Item字段需要的數(shù)據(jù),并將需要跟進的URL提交給引擎,再次進入Scheduler(調(diào)度器)

Engine(引擎):負(fù)責(zé)Spider、ItemPipeline、DownloaderScheduler中間的通訊,信號、數(shù)據(jù)傳遞等。

Scheduler(調(diào)度器):它負(fù)責(zé)接受引擎發(fā)送過來的Request請求,并按照一定的方式進行整理排列,入隊,當(dāng)引擎需要時,交還給引擎。

Downloader(下載器):負(fù)責(zé)下載Scrapy Engine(引擎)發(fā)送的所有Requests請求,并將其獲取到的Responses交還給Scrapy Engine(引擎),由引擎交給Spider來處理

ItemPipeline(管道):它負(fù)責(zé)處理Spider中獲取到的Item,并進行進行后期處理(詳細分析、過濾、存儲等)的地方.

Downloader Middlewares(下載中間件):你可以當(dāng)作是一個可以自定義擴展下載功能的組件。

Spider MiddlewaresSpider中間件):你可以理解為是一個可以自定擴展和操作引擎和Spider中間

通信的功能組件(比如進入Spider的Responses;和從Spider出去的Requests)
在這里插入圖片描述

總結(jié)

本篇文章就到這里了,希望能夠給你帶來幫助,也希望您能夠多多關(guān)注腳本之家的更多內(nèi)容!

相關(guān)文章

最新評論

博野县| 靖江市| 普洱| 大田县| 鄂州市| 绥宁县| 东乌珠穆沁旗| 平谷区| 裕民县| 南宁市| 普陀区| 谷城县| 陕西省| 香港| 株洲县| 监利县| 蕲春县| 涿州市| 峨眉山市| 南阳市| 延长县| 隆子县| 上犹县| 广东省| 嘉荫县| 大悟县| 千阳县| 武功县| 双柏县| 榆林市| 哈巴河县| 宁晋县| 东海县| 五常市| 刚察县| 新蔡县| 谷城县| 天水市| 星座| 湘阴县| 郯城县|