最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python實現(xiàn)Wordcloud生成詞云圖的示例

 更新時間:2020年03月30日 11:32:46   作者:merlin&  
這篇文章主要介紹了Python實現(xiàn)Wordcloud生成詞云圖的示例,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧

wordcloud是Python擴(kuò)展庫中一種將詞語用圖片表達(dá)出來的一種形式,通過詞云生成的圖片,我們可以更加直觀的看出某篇文章的故事梗概。

首先貼出一張詞云圖(以哈利波特小說為例):

在生成詞云圖之前,首先要做一些準(zhǔn)備工作

1.安裝結(jié)巴分詞庫

pip install jieba

Python中的分詞模塊有很多,他們的功能也都是大同小異,我們安裝的結(jié)巴分詞 是當(dāng)前使用的最多的類型。

下面我來簡單介紹一下結(jié)巴分詞的用法

結(jié)巴分詞的分詞模式分為三種:

(1)全模式:把句子中所有的可以成詞的詞語都掃描出來, 速度快,但是不能解決歧義問題

(2)精確模式:將句子最精確地切開,適合文本分析

(3)搜索引擎模式:在精確模式的基礎(chǔ)上,對長詞再次切分,提高召回率,適合用于搜索引擎分詞

下面用一個簡單的例子來看一下三種模式的分詞區(qū)別:

import jieba
 
 # 全模式:把句子中所有的可以成詞的詞語都掃描出來, 速度快,但是不能解決歧義問題
 text = "哈利波特是一常優(yōu)秀的文學(xué)作品"
 seg_list = jieba.cut(text, cut_all=True)
 print(u"[全模式]: ", "/ ".join(seg_list))
 
 # 精確模式:將句子最精確地切開,適合文本分析
 seg_list = jieba.cut(text, cut_all=False)
 print(u"[精確模式]: ", "/ ".join(seg_list))
 
 # 默認(rèn)是精確模式
 seg_list = jieba.cut(text)
 print(u"[默認(rèn)模式]: ", "/ ".join(seg_list))
 
 # 搜索引擎模式:在精確模式的基礎(chǔ)上,對長詞再次切分,提高召回率,適合用于搜索引擎分詞
seg_list = jieba.cut_for_search(text)
print(u"[搜索引擎模式]: ", "/ ".join(seg_list))

下面是對這句話的分詞方式:

通過這三種分詞模式可以看出,這些分詞模式并沒有很好的劃分出“哈利波特”這個專有名詞,這是因為在結(jié)巴分詞的字典中并沒有記錄這個名詞,所以需要我們手動添加自定義字典

添加自定義字典:找一個方便引用的位置              (下圖的路徑是我安裝的位置),新建文本文檔(后綴名為.txt),將想添加的詞輸入進(jìn)去(注意輸入格式),保存并退出

在上面的代碼中加入自定義字典的路徑,再點擊運行

jieba.load_userdict("/home/jmhao/anaconda3/lib/python3.7/site-packages/jieba/mydict.txt")

分詞結(jié)果,可以看出“哈利波特”這個詞已經(jīng)被識別出來了

結(jié)巴分詞還有另一個禁用詞的輸出結(jié)果

 stopwords = {}.fromkeys(['優(yōu)秀', '文學(xué)作品'])
 
 #添加禁用詞之后
 seg_list = jieba.cut(text)
 final = ''
 for seg in seg_list:
   if seg not in stopwords:
       final += seg
 seg_list_new = jieba.cut(final)
 print(u"[切割之后]: ", "/ ".join(seg_list_new))

可以看到輸出結(jié)果中并沒有“優(yōu)秀”和“文學(xué)作品”兩個詞

結(jié)巴分詞還有很多比較復(fù)雜的操作,具體的可以去官網(wǎng)查看,我就不再過多的贅述了

下面我們正式開始詞云的制作

首先下載模塊,這里我所使用的環(huán)境是Anaconda,由于Anaconda中包含很多常用的擴(kuò)展包,所以這里只需要下載wordcloud。若使用的環(huán)境不是Anaconda,則另需安裝numpy和PIL模塊

pip install wordcloud

然后我們需要找一篇文章并使用結(jié)巴分詞將文章分成詞語的形式

# 分詞模塊
 def cut(text):
   # 選擇分詞模式
   word_list = jieba.cut(text,cut_all= True)
   # 分詞后在單獨個體之間加上空格
   result = " ".join(word_list)
   # 返回分詞結(jié)果
   return result

這里我在當(dāng)前文件夾下創(chuàng)建了一個文本文檔“xiaoshuo.txt”,并復(fù)制了一章的小說作為詞云的主體文字

使用代碼控制,打開并讀取小說的內(nèi)容

 #導(dǎo)入文本文件,進(jìn)行分詞,制作詞云
 with open("xiaoshuo.txt") as fp:
   text = fp.read()
   # 將讀取的中文文檔進(jìn)行分詞
   text = cut(text)

在網(wǎng)上找到一張白色背景的圖片下載到當(dāng)前文件夾,作為詞云的背景圖(若不指定圖片,則默認(rèn)生成矩形詞云)

#設(shè)置詞云形狀,若設(shè)置了詞云的形狀,生成的詞云與圖片保持一致,后面設(shè)置的寬度和高度將默認(rèn)無效
  mask = np.array(image.open("monkey.jpeg"))

接下來可以根據(jù)喜好來定義詞云的顏色、輪廓等參數(shù) 下面為常用的參數(shù)設(shè)置方法

font_path : "字體路徑" 詞云的字體樣式,若要輸出中文,則跟隨中文的字體
width =  n 畫布寬度,默認(rèn)為400像素
height =  n 畫布高度,默認(rèn)為400像素
scale = n 按比例放大或縮小畫布
min_font_size = n 設(shè)置最小的字體大小
max_font_size = n 設(shè)置最大的字體大小
stopwords = 'words' 設(shè)置要屏蔽的詞語
background_color = ''color 設(shè)置背景板顏色
relative_scaling = n 設(shè)置字體大小與詞頻的關(guān)聯(lián)性
contour_width = n 設(shè)置輪廓寬度
contour_color = 'color' 設(shè)置輪廓顏色

完整代碼

#導(dǎo)入詞云庫
 from wordcloud import WordCloud
 #導(dǎo)入圖像處理庫
 import PIL.Image as image
 #導(dǎo)入數(shù)據(jù)處理庫
 import numpy as np
 #導(dǎo)入結(jié)巴分詞庫
 import jieba
 
 # 分詞模塊
 def cut(text):
   # 選擇分詞模式
   word_list = jieba.cut(text,cut_all= True)
   # 分詞后在單獨個體之間加上空格
   result = " ".join(word_list)
   return result
 
 #導(dǎo)入文本文件,進(jìn)行分詞,制作詞云
 with open("xiaoshuo.txt") as fp:
   text = fp.read()
   # 將讀取的中文文檔進(jìn)行分詞
   text = cut(text)
   #設(shè)置詞云形狀
   mask = np.array(image.open("monkey.jpeg"))
   #自定義詞云
   wordcloud = WordCloud(
     # 遮罩層,除白色背景外,其余圖層全部繪制(之前設(shè)置的寬高無效)
     mask=mask,
     #默認(rèn)黑色背景,更改為白色
     background_color='#FFFFFF',
     #按照比例擴(kuò)大或縮小畫布
     scale=,
     # 若想生成中文字體,需添加中文字體路徑
     font_path="/usr/share/fonts/bb5828/逐浪雅宋體.otf"
   ).generate(text)
   #返回對象
   image_produce = wordcloud.to_image()
   #保存圖片
   wordcloud.to_file("new_wordcloud.jpg")
   #顯示圖像
   image_produce.show()

注:若想要生成圖片樣式的詞云圖,找到的圖片背景必須為白色,或者使用Photoshop摳圖替換成白色背景,否則生成的詞云為矩形

我的詞云原圖:

生成的詞云圖:

 

到此這篇關(guān)于Python實現(xiàn)Wordcloud生成詞云圖的示例的文章就介紹到這了,更多相關(guān)Python Wordcloud生成詞云圖內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • 使用celery和Django處理異步任務(wù)的流程分析

    使用celery和Django處理異步任務(wù)的流程分析

    Celery是 一個專注于實時處理的任務(wù)隊列,它還支持任務(wù)調(diào)度。 Celery快速,簡單,高度可用且靈活。這篇文章主要介紹了使用celery和Django處理異步任務(wù)的流程分析,需要的朋友可以參考下
    2020-02-02
  • TF-IDF算法解析與Python實現(xiàn)方法詳解

    TF-IDF算法解析與Python實現(xiàn)方法詳解

    這篇文章主要介紹了TF-IDF算法解析與Python實現(xiàn)方法詳解,文章介紹了tf-idf算法的主要思想,分享了Python實現(xiàn)tr-idf算法所必要的預(yù)處理過程,以及具體實現(xiàn)代碼等相關(guān)內(nèi)容,具有一定參考價值,需要的朋友可以了解下。
    2017-11-11
  • Python 保存加載mat格式文件的示例代碼

    Python 保存加載mat格式文件的示例代碼

    這篇文章主要介紹了Python 保存加載mat格式文件的示例代碼,本文給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2020-08-08
  • Python生成器generator原理及用法解析

    Python生成器generator原理及用法解析

    這篇文章主要介紹了Python生成器generator原理及用法解析,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下
    2020-07-07
  • Python類屬性與實例屬性用法分析

    Python類屬性與實例屬性用法分析

    這篇文章主要介紹了Python類屬性與實例屬性用法,實例分析了Python類屬性與實例屬性的功能、定義與使用技巧,需要的朋友可以參考下
    2015-05-05
  • Pytorch中的 torch.distributions庫詳解

    Pytorch中的 torch.distributions庫詳解

    這篇文章主要介紹了Pytorch中的 torch.distributions庫,本文通過實例代碼給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2023-02-02
  • 使用Python制作一個簡易的遠(yuǎn)控終端

    使用Python制作一個簡易的遠(yuǎn)控終端

    這篇文章主要為大家詳細(xì)介紹了如何使用Python語言制作一個簡易的遠(yuǎn)控終端,文中的示例代碼講解詳細(xì),具有一定的學(xué)習(xí)價值,感興趣的可以了解一下
    2023-04-04
  • Python全棧之學(xué)習(xí)JS(2)

    Python全棧之學(xué)習(xí)JS(2)

    這篇文章主要為大家介紹了Python全棧之JS,具有一定的參考價值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助
    2022-01-01
  • Python3.7 讀取音頻根據(jù)文件名生成腳本的代碼

    Python3.7 讀取音頻根據(jù)文件名生成腳本的代碼

    這篇文章主要介紹了Python3.7 讀取音頻根據(jù)文件名生成字幕腳本的方法,本文通過實例代碼給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2020-04-04
  • python dataframe列應(yīng)用正則表達(dá)式篩選方式

    python dataframe列應(yīng)用正則表達(dá)式篩選方式

    這篇文章主要介紹了python dataframe列應(yīng)用正則表達(dá)式篩選方式,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2024-02-02

最新評論

临夏县| 屯门区| 赣榆县| 兴仁县| 长子县| 内丘县| 金沙县| 雷州市| 太保市| 牡丹江市| 得荣县| 绥德县| 永善县| 嵩明县| 宜州市| 高密市| 乌拉特前旗| 贡嘎县| 大同县| 凤翔县| 长沙市| 利川市| 淮安市| 洛浦县| 溆浦县| 浮山县| 九龙县| 南安市| 马公市| 临湘市| 涞源县| 贺州市| 康平县| 红安县| 政和县| 福海县| 永丰县| 昆明市| 报价| 乌恰县| 万载县|