最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

關(guān)于Python中jieba庫(kù)的使用

 更新時(shí)間:2023年04月11日 11:28:26   作者:程序喵正在路上  
這篇文章主要介紹了關(guān)于Python中jieba庫(kù)的使用,jieba (“結(jié)巴”) 是 Python 中一個(gè)重要的第三方中文分詞函數(shù)庫(kù),除了分詞,jieba 還提供增加自定義中文單詞的功能,需要的朋友可以參考下

jieba庫(kù)概述

jieba 庫(kù)演示

對(duì)于一段英文文本, 例如 “China is a great country”,如果希望提取其中的單詞,只需要使用字符串處理的 split() 方法即可,例如:

print("China is a great country".split())

程序執(zhí)行結(jié)果如下:

[‘China’, ‘is’, ‘a’, ‘great’, ‘country’]

然而,對(duì)于一段中文文本,例如,“中國(guó)是一個(gè)偉大的國(guó)家”,獲得其中的單詞 (不是字符) 十分困難,因?yàn)橛⑽奈谋究梢酝ㄟ^空格或者標(biāo)點(diǎn)符號(hào)分隔,而中文單詞之間缺少分隔符,這是中文及類似語(yǔ)言獨(dú)有的“分詞”問題。

上例中, 分詞能夠?qū)?“中國(guó)是一個(gè)偉大的國(guó)家” 分為"中國(guó)”、“是”、 “一個(gè)”、“偉大”、“的”、 "國(guó)家"等一系列詞語(yǔ)。

jieba (“結(jié)巴”) 是 Python 中一個(gè)重要的第三方中文分詞函數(shù)庫(kù),例如:

import jiebapr
int(jieba.lcut("中國(guó)是一個(gè)偉大的國(guó)家"))

程序執(zhí)行結(jié)果如下:

[‘中國(guó)’, ‘是’, ‘一個(gè)’, ‘偉大’, ‘的’, ‘國(guó)家’]

jieba 庫(kù)的分詞原理是利用一個(gè)中文詞庫(kù),將待分詞的內(nèi)容與分詞詞庫(kù)進(jìn)行比對(duì),通過圖結(jié)構(gòu)和動(dòng)態(tài)規(guī)劃方法找到最大概率的詞組。

除了分詞,jieba 還提供增加自定義中文單詞的功能。

jieba 庫(kù)支持 3 種分詞模式:

  • 精確模式,將句子最精確地切開,適合文本分析
  • 全模式,把句子中所有可以成詞的詞語(yǔ)都掃描出來,速度非??欤?strong>不能消除歧義;
  • 搜索引擎模式,在精確模式的基礎(chǔ)上,對(duì)長(zhǎng)詞再次切分,提高召回率,適合用于搜索引擎分詞。

在 PyCharm 中添加 jieba 庫(kù)

jieba 庫(kù)是第三方庫(kù),不是 Python 安裝包自帶的,因此,需要進(jìn)行安裝,因?yàn)槲覀兝玫氖?PyCharm 進(jìn)行開發(fā),所以只要簡(jiǎn)單地把 jieba 庫(kù)添加進(jìn)來就行,下面是具體步驟。

(1) 在菜單欄中點(diǎn)擊【File】——【Settings】

在這里插入圖片描述

(2) 在接下來的界面中找到【Project: pythonProject】——【Project Interpreter】,點(diǎn)擊界面中的加號(hào)

在這里插入圖片描述

(3) 輸入 “jieba"搜索,找到 jieba,然后點(diǎn)擊 ”Install Package“,等待一會(huì)兒即可

在這里插入圖片描述

(4) 安裝完可以返回之前的界面查看

在這里插入圖片描述

使用jieba 庫(kù)

jieba 庫(kù)支持 3 種分詞模式:

  • 精確模式,將句子最精確地切開,適合文本分析;
  • 全模式,把句子中所有可以成詞的詞語(yǔ)都掃描出來,速度非???,但是不能消除歧義
  • 搜索引擎模式,在精確模式的基礎(chǔ)上,對(duì)長(zhǎng)詞再次切分,提高召回率,適合用于搜索引擎分詞。

jieba 庫(kù)主要提供分詞功能,可以輔助自定義分詞詞典。

jieba 庫(kù)中包含的主要函數(shù)如下表所示:

函數(shù)描述
jieba.cut(s)精確模式,返回一個(gè)可迭代的數(shù)據(jù)類型
jieba.cut(s, cut_all=True)全模式,輸出文本 s 中所有可能的單詞
jieba.cut_for_ search(s)搜索引擎模式,適合搜索引擎建立索引的分詞結(jié)果
jieba.lcut(s)精確模式,返回一個(gè)列表類型,建議使用
jieba.lcut(s, cut_all=True)全模式,返回一個(gè)列表類型,建議使用
jieba.lcut_for_search(s)搜索引擎模式,返回一個(gè)列表類型,建議使用
jieba.add_word(w)向分詞詞典中增加新詞 w

代碼如下:

import jieba

print(jieba.lcut("中華人民共和國(guó)是一個(gè)偉大的國(guó)家"))

print(jieba.lcut("中華人民共和國(guó)是一個(gè)偉大的國(guó)家", cut_all=True))

print(jieba.lcut_for_search("中華人民共和國(guó)是一個(gè)偉大的國(guó)家"))

程序執(zhí)行結(jié)果如下:

[‘中華人民共和國(guó)’, ‘是’, ‘一個(gè)’, ‘偉大’, ‘的’, ‘國(guó)家’]
[‘中華’, ‘中華人民’, ‘中華人民共和國(guó)’, ‘華人’, ‘人民’, ‘人民共和國(guó)’, ‘共和’, ‘共和國(guó)’, ‘國(guó)是’, ‘一個(gè)’, ‘偉大’, ‘的’, ‘國(guó)家’]
[‘中華’, ‘華人’, ‘人民’, ‘共和’, ‘共和國(guó)’, ‘中華人民共和國(guó)’, ‘是’, ‘一個(gè)’, ‘偉大’, ‘的’, ‘國(guó)家’]

jieba. lcut() 函數(shù)返回精確模式,輸出的分詞能夠完整且不多余地組成原始文本;

jieba. lcut(,True) 函數(shù)返回全模式,輸出原始文本中可能產(chǎn)生的所有問題,冗余性最大;

jieba.lcut_ for_search() 函數(shù)返回搜索引擎模式,該模式首先執(zhí)行精確模式,然后再對(duì)其中的長(zhǎng)詞進(jìn)一步切分獲得結(jié)果。

由于列表類型通用且靈活,建議讀者使用上述 3 個(gè)能夠返回列表類型的分詞函數(shù)。

默認(rèn)情況下,jieba.cut()6 個(gè)分詞函數(shù)能夠較高概率識(shí)別自定義的新詞,比如名字或縮寫。對(duì)于無法識(shí)別的分詞,也可以通過 jieba.add_ word() 函 數(shù)向分詞庫(kù)添加,例如:

import jieba
print(jieba.lcut("程序喵正在路上"))
jieba.add_word("程序喵")
print(jieba.lcut("程序喵正在路上"))

程序執(zhí)行結(jié)果如下:

[‘程序’, ‘喵’, ‘正在’, ‘路上’]
[‘程序喵’, ‘正在’, ‘路上’]

第三方庫(kù)

Python 語(yǔ)言的第三方庫(kù)指不在 Python 安裝包中的函數(shù)庫(kù),也是非標(biāo)準(zhǔn)函數(shù)、庫(kù)。這類函數(shù)庫(kù)一般由全球各領(lǐng)域?qū)I(yè)人士結(jié)合專業(yè)特點(diǎn)和興趣開發(fā)。Python 語(yǔ)言構(gòu)建了一個(gè)開放和自由的生態(tài)環(huán)境,對(duì)第三方庫(kù)的開發(fā)沒有強(qiáng)制要求,因此,Python 語(yǔ)言的第三方庫(kù)發(fā)展十分迅速。截至 20169 月,Python 官方網(wǎng)站注冊(cè)的第三方庫(kù)已經(jīng)達(dá)到 9 萬多個(gè)。如果說強(qiáng)大的標(biāo)準(zhǔn)庫(kù)奠定了 Python 語(yǔ)言發(fā)展的基石,豐富的第三方庫(kù)則是 Python 不斷發(fā)展的保證。隨著 Python 語(yǔ)言的發(fā)展,一些穩(wěn)定的第三方庫(kù)不斷被加入標(biāo)準(zhǔn)庫(kù)。

到此這篇關(guān)于關(guān)于Python中jieba庫(kù)的使用的文章就介紹到這了,更多相關(guān)Python jieba庫(kù)內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • 基于Python實(shí)現(xiàn)加強(qiáng)版煙花

    基于Python實(shí)現(xiàn)加強(qiáng)版煙花

    這篇文章主要為大家詳細(xì)介紹了如何利用Python制作一個(gè)加強(qiáng)版煙花景,文中的示例代碼講解詳細(xì),對(duì)我們學(xué)習(xí)Python有一定幫助,需要的可以參考一下
    2022-02-02
  • Matplotlib繪圖基礎(chǔ)之文本標(biāo)注詳解

    Matplotlib繪圖基礎(chǔ)之文本標(biāo)注詳解

    Matplotlib?文本和標(biāo)注可以為數(shù)據(jù)和圖形之間提供額外的信息,幫助觀察者更好地理解數(shù)據(jù)和圖形的含義,下面就將通過示例依次介紹文本和標(biāo)注的常用使用方式
    2023-08-08
  • Python命令行click參數(shù)用法解析

    Python命令行click參數(shù)用法解析

    這篇文章主要介紹了Python命令行click參數(shù)用法解析,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2019-12-12
  • Python對(duì)列表排序的方法實(shí)例分析

    Python對(duì)列表排序的方法實(shí)例分析

    這篇文章主要介紹了Python對(duì)列表排序的方法,實(shí)例分析了Python列表排序函數(shù)的相關(guān)使用技巧,非常簡(jiǎn)單實(shí)用,需要的朋友可以參考下
    2015-05-05
  • python繪制堆疊條形圖介紹

    python繪制堆疊條形圖介紹

    大家好,本篇文章主要講的是python繪制堆疊條形圖介紹,感興趣的同學(xué)趕快來看一看吧,對(duì)你有幫助的話記得收藏一下,方便下次瀏覽
    2021-12-12
  • Python學(xué)習(xí)之迭代器的使用教程詳解

    Python學(xué)習(xí)之迭代器的使用教程詳解

    迭代器是一種對(duì)象,該對(duì)象包含值的可計(jì)數(shù)數(shù)字。從技術(shù)上講,在?Python?中,迭代器是實(shí)現(xiàn)迭代器協(xié)議的對(duì)象,它包含方法?iter()?和?next()。本文就來聊聊迭代器的具體使用吧
    2023-03-03
  • python的tkinter、socket庫(kù)開發(fā)tcp的客戶端和服務(wù)端詳解

    python的tkinter、socket庫(kù)開發(fā)tcp的客戶端和服務(wù)端詳解

    本文介紹了TCP通訊流程和開發(fā)步驟,包括客戶端和服務(wù)端的實(shí)現(xiàn),客戶端使用Python的tkinter庫(kù)實(shí)現(xiàn)圖形化界面,服務(wù)端使用socket庫(kù)監(jiān)聽連接并處理消息,文章還提供了客戶端和服務(wù)端的代碼示例
    2025-01-01
  • python實(shí)現(xiàn)八大排序算法(1)

    python實(shí)現(xiàn)八大排序算法(1)

    這篇文章主要為大家詳細(xì)介紹了python實(shí)現(xiàn)八大排序算法的第一篇,具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2017-09-09
  • 一篇文章看懂python如何執(zhí)行cmd命令

    一篇文章看懂python如何執(zhí)行cmd命令

    這篇文章主要給大家介紹了關(guān)于如何通過一篇文章看懂python如何執(zhí)行cmd命令的相關(guān)資料,在Python中可以使用多種方法執(zhí)行cmd命令,文中通過代碼示例將每種方法都介紹的非常詳細(xì),需要的朋友可以參考下
    2023-09-09
  • Python get獲取頁(yè)面cookie代碼實(shí)例

    Python get獲取頁(yè)面cookie代碼實(shí)例

    利用Python get獲取頁(yè)面cookie代碼實(shí)例,簡(jiǎn)單易懂
    2018-09-09

最新評(píng)論

若尔盖县| 吉安市| 浠水县| 汤原县| 河源市| 大关县| 和平区| 上杭县| 曲阳县| 长治县| 富裕县| 高碑店市| 含山县| 南丰县| 柳江县| 高要市| 田林县| 井研县| 瑞金市| 来安县| 高阳县| 昂仁县| 黑水县| 明光市| 绿春县| 微山县| 玉树县| 安化县| 房山区| 丁青县| 台安县| 阳春市| 革吉县| 辽阳县| 鹤峰县| 金塔县| 建宁县| 汕尾市| 高陵县| 五寨县| 泰兴市|