最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python實(shí)戰(zhàn)scrapy操作cookie爬取博客涉及browsercookie

 更新時(shí)間:2021年11月13日 16:40:56   作者:夢(mèng)想橡皮擦  
這篇文章主要為大家介紹了python實(shí)戰(zhàn)scrapy操作cookie爬取博客涉及browsercookie,下面來學(xué)習(xí)一下 scrapy 操作 Cookie來爬取博客吧

browsercookie 知識(shí)鋪墊

第一個(gè)要了解的知識(shí)點(diǎn)是使用 browsercookie 獲取瀏覽器 cookie ,該庫使用命令 pip install browsercookie 安裝即可。

接下來獲取 firefox 瀏覽器的 cookie,不使用 chrome 谷歌瀏覽器的原因是在 80 版本之后,其 cookie 的加密方式進(jìn)行了修改,所以使用 browsercookie 模塊會(huì)出現(xiàn)如下錯(cuò)誤

win32crypt must be available to decrypt Chrome cookie on Windows

獲取 cookie 的代碼如下所示:

import browsercookie

firefox_cookiejar = browsercookie.firefox()

for c in firefox_cookiejar:
    print(c)

運(yùn)行代碼,輸出如下格式內(nèi)容。

Python 爬蟲 cookie 實(shí)戰(zhàn)博客,涉及 browsercookie 與 scrapy

獲取了 cookies 之后,就可以訪問之后登錄后才能訪問的頁面了(前提是在火狐瀏覽器登錄過一次)。

下面拿 某管理中心舉例,在火狐瀏覽器登錄過之后,使用 browsercookie 獲取 cookie 之后,就可以直接訪問后臺(tái)接口。

import browsercookie
import requests

firefox_cookiejar = browsercookie.firefox()

# for c in firefox_cookiejar:
#     print(c)

res = requests.get("https://img-home.csdnimg.cn/data_json/jsconfig/menu_path.json", cookies=firefox_cookiejar)
print(res.text)

可以直接獲取到后臺(tái)菜單。

Python 爬蟲 cookie 實(shí)戰(zhàn)博客,涉及 browsercookie 與 scrapy

使用 browsercookie 實(shí)現(xiàn) 自動(dòng)化點(diǎn)贊

在 scrapy 框架中,已經(jīng)內(nèi)置了一個(gè) CookiesMiddleware 用于處理 cookies,我們這次通過繼承 CookiesMiddleware ,然后使用 browsercookie 庫完成點(diǎn)贊器的研發(fā)(僅做了一個(gè)測試案例,沒有使用并發(fā)哦)

打開 middlewares.py 文件,編寫自定義的類:

from scrapy.downloadermiddlewares.cookies import CookiesMiddleware
import browsercookie
class BrowserCookiesDownloaderMiddleware(CookiesMiddleware):
    def __init__(self, debug=False):
        super().__init__(debug)
        self.load_browser_cookies()

    def load_browser_cookies(self):
        # 注意這個(gè)地方的名字叫做 firefox
        jar = self.jars['firefox']
        firefox_cookiejar = browsercookie.firefox()
        for cookie in firefox_cookiejar:
            jar.set_cookie(cookie)

上述類的核心內(nèi)容是使用 browsercookie 對(duì)瀏覽器的 cookie 進(jìn)行提取,存儲(chǔ)到 CookieJar 類型的字典 jars 中,后續(xù)請(qǐng)求的時(shí)候,在進(jìn)行調(diào)用。

同步在 settings.py 文件中禁用默認(rèn)的 CookiesMiddleware,啟用咱們自定義的新類。

DOWNLOADER_MIDDLEWARES = {
    'scrapy.downloadermiddlewares.cookies.CookiesMiddleware': None,
    'csdn.middlewares.BrowserCookiesDownloaderMiddleware': 543,
}

在編寫爬蟲核心函數(shù),重點(diǎn)修改 Request 請(qǐng)求為 POST 請(qǐng)求,并且攜帶相關(guān)參數(shù),meta={'cookiejar':COOKIEJAR}
代碼如下所示:

import scrapy
class ClikeSpider(scrapy.Spider):
    name = 'clike'
    allowed_domains = ['csdn.net']
    like_url = 'https://blog.csdn.net/phoenix/web/v1/article/like'
    def start_requests(self):
        data = {
            "articleId": "120845464",
        }
        yield scrapy.FormRequest(url=self.like_url, formdata=data, meta={'cookiejar': 'firefox'})
    def parse(self, response):
        print(response.json())

運(yùn)行爬蟲之后,在日志中可以發(fā)現(xiàn)成功的點(diǎn)贊了。

Python 爬蟲 cookie 實(shí)戰(zhàn)博客,涉及 browsercookie 與 scrapy

以上就是python實(shí)戰(zhàn)scrapy操作cookie爬取博客涉及browsercookie的詳細(xì)內(nèi)容,更多關(guān)于scrapy操作cookie爬取博客的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • 如何在Win10系統(tǒng)使用Python3連接Hive

    如何在Win10系統(tǒng)使用Python3連接Hive

    這篇文章主要介紹了如何在Win10系統(tǒng)使用Python3連接Hive,幫助大家更好的利用python讀取數(shù)據(jù),進(jìn)行探索、分析和挖掘工作。感興趣的朋友可以了解下
    2020-10-10
  • Python wordcloud庫安裝方法

    Python wordcloud庫安裝方法

    Wordcloud庫的基本使用非常簡單,只需要導(dǎo)入庫并調(diào)用WordCloud類即可,這篇文章主要介紹了Python wordcloud庫,需要的朋友可以參考下
    2024-01-01
  • PyautoGui常用教程(一篇掌握)

    PyautoGui常用教程(一篇掌握)

    這篇文章主要介紹了PyautoGui常用教程(一篇掌握),文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2021-04-04
  • python接口自動(dòng)化之ConfigParser配置文件的使用詳解

    python接口自動(dòng)化之ConfigParser配置文件的使用詳解

    這篇文章主要介紹了python接口自動(dòng)化之ConfigParser配置文件的使用,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2020-08-08
  • python制作花瓣網(wǎng)美女圖片爬蟲

    python制作花瓣網(wǎng)美女圖片爬蟲

    本文通過python 來實(shí)現(xiàn)這樣一個(gè)簡單的爬蟲功能,把我們想要的圖片爬取到本地,需要的朋友可以參考下
    2015-10-10
  • Python 虛擬環(huán)境venv詳解

    Python 虛擬環(huán)境venv詳解

    Python 虛擬環(huán)境主要是為不同 Python 項(xiàng)目創(chuàng)建一個(gè)隔離的環(huán)境,每個(gè)項(xiàng)目都可以擁有獨(dú)立的依賴包環(huán)境,而項(xiàng)目間的依賴包互不影響,對(duì)Python 虛擬環(huán)境venv相關(guān)知識(shí)感興趣的朋友一起看看吧
    2021-09-09
  • Python Mysql自動(dòng)備份腳本

    Python Mysql自動(dòng)備份腳本

    測試系統(tǒng)環(huán)境 Windows 2003 python 2.5.1 mysql 5.0.1 應(yīng)該只適用于Win,因?yàn)檎{(diào)用了CMD。 增量備份,因?yàn)樽杂?,?shù)據(jù)庫不大。
    2008-07-07
  • centos7中安裝python3.6.4的教程

    centos7中安裝python3.6.4的教程

    Python3.6.4官方版是一款在適合開發(fā)人員使用的windows系統(tǒng)上運(yùn)行的腳本語言工具,Python3.6.4官方版是目前程序設(shè)計(jì)從業(yè)者必學(xué)的語言之一。這篇文章給大家介紹了centos7中安裝python3.6.4的教程,感興趣的朋友一起看看吧
    2019-12-12
  • Python中time庫的使用(日期時(shí)間)

    Python中time庫的使用(日期時(shí)間)

    time庫是python中處理時(shí)間的標(biāo)準(zhǔn)庫,這篇文章主要介紹了Python中time庫的使用(日期時(shí)間),本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2023-02-02
  • Python調(diào)用olmOCR大模型實(shí)現(xiàn)提取復(fù)雜PDF文件內(nèi)容

    Python調(diào)用olmOCR大模型實(shí)現(xiàn)提取復(fù)雜PDF文件內(nèi)容

    olmocr是由Allen人工智能研究所(AI2)開發(fā)的一個(gè)開源工具包,旨在高效地將PDF和其他文檔轉(zhuǎn)換為結(jié)構(gòu)化的純文本,同時(shí)保持自然閱讀順序,下面我們來看看如何使用olmOCR大模型實(shí)現(xiàn)提取復(fù)雜PDF文件內(nèi)容吧
    2025-03-03

最新評(píng)論

建昌县| 新干县| 灵川县| 侯马市| 吴江市| 沅江市| 湖口县| 右玉县| 车险| 湟源县| 方山县| 天镇县| 仁寿县| 浙江省| 玉屏| 随州市| 项城市| 壶关县| 东乡县| 邢台市| 化州市| 巴彦县| 开平市| 汕头市| 郎溪县| 唐山市| 龙陵县| 隆安县| 永宁县| 麻阳| 岑巩县| 本溪| 乐陵市| 鹤岗市| 和顺县| 新和县| 平山县| 兴化市| 汉中市| 夏邑县| 潍坊市|