最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python爬取英雄聯(lián)盟MSI直播間彈幕并生成詞云圖

 更新時(shí)間:2021年06月01日 09:53:48   作者:小菜雞也會(huì)有春天  
很開心RNG最近在英雄聯(lián)盟季中賽奪冠了,特地爬取了直播間彈幕并生成詞云圖,大家一起開心一下,看看奪冠時(shí)大家都在說什么,需要的朋友可以參考下

一、環(huán)境準(zhǔn)備

安裝相關(guān)第三方庫

pip install jieba
pip install wordcloud

二、數(shù)據(jù)準(zhǔn)備

爬取對(duì)象:2021年5月23號(hào),RNG奪冠直播間的彈幕信息

爬取對(duì)象路徑:

方式1、根據(jù)開發(fā)者工具(F12),獲取請(qǐng)求url、請(qǐng)求頭、cookie等信息;
方式2:根據(jù)直播地址url,前+字符i

我們這里演示的是,采用方式2。

三、代碼如下

import requests, re
import jieba, wordcloud

"""
# 以下是練習(xí)代碼
def get_f12_barrage(url, headers, file_path):
    
    #通過f12中的,請(qǐng)求地址,獲取彈幕數(shù)據(jù)
    #:param url:  通過彈幕地址(通過開發(fā)者工具,從請(qǐng)求數(shù)據(jù)中獲取的)
    #:param headers:   請(qǐng)求頭信息
    #:param file_path:  響應(yīng)數(shù)據(jù)存儲(chǔ)路徑
    #:return:    無返回?cái)?shù)據(jù)
    
    # 1、發(fā)送請(qǐng)求,接受響應(yīng)數(shù)據(jù)
    response = requests.get(url=url, headers=headers)
    # 2、獲取響應(yīng)數(shù)據(jù)
    # 返回的響應(yīng)可能是亂碼的,需要先轉(zhuǎn)成響應(yīng)的編碼格式
    # apparent_encoding的作用:會(huì)從網(wǎng)頁的內(nèi)容中分析網(wǎng)頁編碼的方式
    response.encoding = response.apparent_encoding
    # 3、解析響應(yīng)數(shù)據(jù)
    content = response.text
    content_list = re.findall(":(.*?)@", content)
    # 4、存儲(chǔ)響應(yīng)數(shù)據(jù), ”w+格式“,即文件存在則,先清空再寫,不存在則新建文件
    with open(file_path, mode="w+", encoding="utf-8") as fp:
        for line in content_list:
            # 分析每一行,發(fā)現(xiàn)第一個(gè)字符元素不是想要的,先去除第一個(gè)字符
            fp.write(line[1:] + "\n")
    return file_path

"""
# ******************8********************執(zhí)行代碼如下******************************************
# 算法:先爬取數(shù)據(jù),再根據(jù)爬取的數(shù)據(jù),生成詞云圖
def get_barrage(url, headers, file_path):
    """
    通過請(qǐng)求網(wǎng)頁前面+i的彈幕地址,獲取彈幕數(shù)據(jù)
    :param url:  通過彈幕地址(網(wǎng)址前面+i)
    :param headers:   請(qǐng)求頭信息
    :param file_path:  響應(yīng)數(shù)據(jù)存儲(chǔ)路徑
    :return:    無返回?cái)?shù)據(jù)
    """
    # 1、發(fā)送請(qǐng)求,接受響應(yīng)數(shù)據(jù)
    response = requests.get(url=url, headers=headers)
    # 2、獲取響應(yīng)數(shù)據(jù)
    # 返回的響應(yīng)可能是亂碼的,需要先轉(zhuǎn)成響應(yīng)的編碼格式
    # apparent_encoding的作用:會(huì)從網(wǎng)頁的內(nèi)容中分析網(wǎng)頁編碼的方式
    response.encoding = response.apparent_encoding
    # 3、解析響應(yīng)數(shù)據(jù)
    # 此時(shí)response.text可能是亂碼的
    content = response.text
    # 正則匹配響應(yīng)數(shù)據(jù),取數(shù)目標(biāo)是(.*?)中的數(shù)據(jù)
    content_list = re.findall("<d p=\".*?\">(.*?)</d>", content)
    # 4、存儲(chǔ)響應(yīng)數(shù)據(jù), ”w+格式“,即文件存在則,先清空再寫,不存在則新建文件
    with open(file_path, mode="w+", encoding="utf-8") as fp:
        for line in content_list:
            fp.write(line + "\n")
    return file_path

# https://api.bilibili.com/x/v1/dm/list.so?oid=343174354
# https://api.bilibili.com/x/v2/dm/web/history/seg.so?type=1&oid=343174354&date=2021-05-23


def make_word_cloud(word_file_path):
    # 1、打開文件,默認(rèn)是gbk格式打開,這里指定utf-8打開
    with open(word_file_path, encoding="utf-8") as fp:
        content = fp.read()   # read方法返回的是一個(gè)字符串

    # 2、利用結(jié)巴,分割詞,得到的是一個(gè)列表
    content_list = jieba.lcut(content)
    # 再用空格,拼接字符串
    content_str = " ".join(content_list)

    # 3、設(shè)置詞云圖
    wc_config = wordcloud.WordCloud(
        width=700,   # 寬度
        height=500,  # 高度
        background_color='black',  # 背景色
        font_path='msyh.ttc',   # 找字體的配置路徑C:\Windows\Fonts\微軟雅黑,然后雙擊(出現(xiàn)3個(gè)),選擇【常規(guī)-屬性】
        scale=15,   # 顏色像素
        stopwords={'了', '的'},  # 詞云圖中過濾掉一些字眼
        contour_width=5,  # 輪廓寬度
        contour_color='red'  # 輪廓顏色
    )

    # 4、根據(jù)輸入文字內(nèi)容,形成一個(gè)詞云圖,并存儲(chǔ)在指定路徑
    wc_config.generate(content_str)
    wc_config.to_file("e:\\reg_cloud.png")
    return word_file_path







if __name__ == "__main__":
    """
    # 從開發(fā)者工具或者抓包工具中獲取url地址
    f12_url = 'https://api.bilibili.com/x/v2/dm/web/history/seg.so?type=1&oid=343174354&date=2021-05-23'
    # 從開發(fā)者工具或者抓包工具中,獲取請(qǐng)求頭信息,主要包括cookie、user-agent
    header = {
        'cookie': 'bsource=search_baidu; _uuid=BBD44BE2-5DAA-A13A-A593-FD3A83C3929423721infoc; buvid3=18335C4D-A3A0-48D5-973A-7943D63AC73E34756infoc; CURRENT_FNVAL=80; blackside_state=1; rpdid=|(um|u)klum~0J\'uYkkJJkJJu; fingerprint=be684c13c90e4279aaaa3e2694da4285; buvid_fp=18335C4D-A3A0-48D5-973A-7943D63AC73E34756infoc; buvid_fp_plain=96D5E0EF-41D9-4A32-BE47-DFF96C44DB9F155821infoc; SESSDATA=f90082f7%2C1637884658%2C008f9%2A51; bili_jct=2f17a04a5651fb1c6579b73aeb640f7f; DedeUserID=1153205015; DedeUserID__ckMd5=b6f334f0a2d86238; sid=6vb9j9nl; bfe_id=6f285c892d9d3c1f8f020adad8bed553',
        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/90.0.4430.212 Safari/537.36'
    }
    # 申明存儲(chǔ)文件的路徑
    f12_file_path = "e:\\RNG.txt"
    """


    # 請(qǐng)求路徑,是網(wǎng)頁前面+i
    url = 'https://api.bilibili.com/x/v1/dm/list.so?oid=343174354'
    file_path = "e:\\RNG_1.txt"
    # 請(qǐng)求頭中需要包含cookie 和 user-agent,這些信息都可以用f12獲取到,注意有些字符需要轉(zhuǎn)義
    # 為了個(gè)人信息安全,這里的cookIe加密顯示
    header = {
        'cookie': '********',
        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/90.0.4430.212 Safari/537.36'
    }
    # 調(diào)用方法
    get_barrage(url=url, headers=header, file_path=file_path)
    word_file_path = get_barrage(url=url, headers=header, file_path=file_path)
    make_word_cloud(word_file_path)

四、詞云圖效果展示

在這里插入圖片描述

到此這篇關(guān)于Python爬取英雄聯(lián)盟MSI直播間彈幕并生成詞云圖的文章就介紹到這了,更多相關(guān)Python爬取彈幕并生成詞云圖內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python tkinter圖形界面代碼統(tǒng)計(jì)工具(更新)

    python tkinter圖形界面代碼統(tǒng)計(jì)工具(更新)

    這篇文章主要為大家詳細(xì)介紹了python tkinter圖形界面代碼統(tǒng)計(jì)工具,具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2019-09-09
  • 圖解Python中淺拷貝copy()和深拷貝deepcopy()的區(qū)別

    圖解Python中淺拷貝copy()和深拷貝deepcopy()的區(qū)別

    這篇文章主要介紹了Python中淺拷貝copy()和深拷貝deepcopy()的區(qū)別,淺拷貝和深拷貝想必大家在學(xué)習(xí)中遇到很多次,這也是面試中常常被問到的問題,本文就帶你詳細(xì)了解一下
    2023-05-05
  • Python selenium爬取微信公眾號(hào)文章代碼詳解

    Python selenium爬取微信公眾號(hào)文章代碼詳解

    這篇文章主要介紹了Python selenium爬取微信公眾號(hào)歷史文章代碼詳解,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2020-08-08
  • python 獲取剪切板內(nèi)容的兩種方法

    python 獲取剪切板內(nèi)容的兩種方法

    這篇文章主要介紹了python 獲取剪切板內(nèi)容的兩種方法,幫助大家更好的理解和學(xué)習(xí)python,感興趣的朋友可以了解下
    2020-11-11
  • Python 實(shí)現(xiàn)圖片色彩轉(zhuǎn)換案例

    Python 實(shí)現(xiàn)圖片色彩轉(zhuǎn)換案例

    我們?cè)诳磩?dòng)漫、影視作品中,當(dāng)人物在回憶過程中,體現(xiàn)出來的畫面一般都是黑白或者褐色的。本文將提供將圖片色彩轉(zhuǎn)為黑白或者褐色風(fēng)格的案例詳解,感興趣的小伙伴可以了解一下。
    2021-11-11
  • python scipy.spatial.distance 距離計(jì)算函數(shù) ?

    python scipy.spatial.distance 距離計(jì)算函數(shù) ?

    本文主要介紹了python scipy.spatial.distance 距離計(jì)算函數(shù),文中通過示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2022-03-03
  • Python常用小技巧總結(jié)

    Python常用小技巧總結(jié)

    這篇文章主要介紹了Python常用小技巧,實(shí)例總結(jié)了Python關(guān)于字典、字符串、隨機(jī)數(shù)等操作技巧,非常簡(jiǎn)單實(shí)用,需要的朋友可以參考下
    2015-06-06
  • Python Requests訪問網(wǎng)絡(luò)更方便

    Python Requests訪問網(wǎng)絡(luò)更方便

    這篇文章主要介紹了使用Python Requests訪問網(wǎng)絡(luò),Python Requests 是一個(gè)非常強(qiáng)大的 HTTP 客戶端庫,用于發(fā)送 HTTP 請(qǐng)求,獲取響應(yīng)等操作,通過這個(gè)庫,你可以輕松地與 Web 服務(wù)進(jìn)行交互,實(shí)現(xiàn)各種網(wǎng)絡(luò)請(qǐng)求
    2024-01-01
  • Python全局鎖中如何合理運(yùn)用多線程(多進(jìn)程)

    Python全局鎖中如何合理運(yùn)用多線程(多進(jìn)程)

    這篇文章主要介紹了Python全局鎖中如何合理運(yùn)用多線程(多進(jìn)程),需要的朋友可以參考下
    2019-11-11
  • Python 使用 docopt 解析json參數(shù)文件過程講解

    Python 使用 docopt 解析json參數(shù)文件過程講解

    這篇文章主要介紹了Python 使用 docopt 解析json參數(shù)文件過程講解,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2019-08-08

最新評(píng)論

连平县| 锡林郭勒盟| 开封县| 苍溪县| 札达县| 尤溪县| 秭归县| 高青县| 莱阳市| 锡林郭勒盟| 宁津县| 睢宁县| 长宁区| 加查县| 长顺县| 常山县| 伊宁市| 得荣县| 东阳市| 桂平市| 怀仁县| 莲花县| 荥经县| 普兰店市| 大悟县| 滦平县| 营山县| 黔东| 多伦县| 东乌珠穆沁旗| 万盛区| 沅江市| 洪泽县| 巴林左旗| 南投县| 西藏| 扶沟县| 怀来县| 巍山| 海安县| 察雅县|