最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python機器學習NLP自然語言處理基本操作精確分詞

 更新時間:2021年09月21日 13:22:21   作者:我是小白呀  
本文是Python機器學習NLP自然語言處理系列文章,帶大家開啟一段學習自然語言處理 (NLP) 的旅程. 本文主要學習NLP自然語言處理基本操作之如何精確分詞

概述

從今天開始我們將開啟一段自然語言處理 (NLP) 的旅程. 自然語言處理可以讓來處理, 理解, 以及運用人類的語言, 實現(xiàn)機器語言和人類語言之間的溝通橋梁.

在這里插入圖片描述

分詞器 jieba

jieba 算法基于前綴詞典實現(xiàn)高效的詞圖掃描, 生成句子中漢字所有可能成詞的情況所構成的有向無環(huán)圖. 通過動態(tài)規(guī)劃查找最大概率路徑, 找出基于詞頻的最大切分組合. 對于未登錄詞采用了基于漢字成詞能力的 HMM 模型, 使用 Viterbi 算法.

在這里插入圖片描述

安裝

pip install jieba

在這里插入圖片描述

查看是否安裝成功:

import jieba
print(jieba.__version__)

輸出結果:

0.42.1

精確分詞

精確分詞: 精確模式試圖將句子最精確地切開, 精確分詞也是默認分詞.

在這里插入圖片描述

格式:

jieba.cut(content, cut_all=False)

參數(shù):

  • content: 需要分詞的內容
  • cut_all: 如果為 True 則為全模式, False 為精確模式

例子:

import jieba
# 定義文本
content = "自然語言處理是人工智能和語言學領域的分支學科。此領域探討如何處理及運用自然語言;自然語言處理包括多方面和步驟,基本有認知、理解、生成等部分。"
# 精確分詞
seg = jieba.cut(content, cut_all=False)
# 調試輸出
print([word for word in seg])

輸出結果:

Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
Loading model cost 0.984 seconds.
Prefix dict has been built successfully.
['自然語言', '處理', '是', '人工智能', '和', '語言學', '領域', '的', '分支', '學科', '。', '此', '領域', '探討', '如何', '處理', '及', '運用', '自然語言', ';', '自然語言', '處理', '包括', '多方面', '和', '步驟', ',', '基本', '有', '認知', '、', '理解', '、', '生成', '等', '部分', '。']

全模式

全模式分詞: 全模式會把句子中所有可能是詞語的都掃出來. 速度非??? 但不能解決歧義問題.

例子:

C:\Users\Windows\Anaconda3\pythonw.exe "C:/Users/Windows/Desktop/project/NLP 基礎/結巴.py"
Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
['自然', '自然語言', '語言', '處理', '是', '人工', '人工智能', '智能', '和', '語言', '語言學', '領域', '的', '分支', '學科', '。', '此', '領域', '探討', '如何', '何處', '處理', '及', '運用', '自然', '自然語言', '語言', ';', '自然', '自然語言', '語言', '處理', '包括', '多方', '多方面', '方面', '和', '步驟', ',', '基本', '有', '認知', '、', '理解', '、', '生成', '等', '部分', '。']
Loading model cost 0.999 seconds.
Prefix dict has been built successfully.

輸出結果:

Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
['自然', '自然語言', '語言', '處理', '是', '人工', '人工智能', '智能', '和', '語言', '語言學', '領域', '的', '分支', '學科', '。', '此', '領域', '探討', '如何', '何處', '處理', '及', '運用', '自然', '自然語言', '語言', ';', '自然', '自然語言', '語言', '處理', '包括', '多方', '多方面', '方面', '和', '步驟', ',', '基本', '有', '認知', '、', '理解', '、', '生成', '等', '部分', '。']
Loading model cost 0.999 seconds.
Prefix dict has been built successfully.

搜索引擎模式

搜索引擎模式: 在精確模式的基礎上, 對長詞再次切分. 提高召回率, 適合用于搜索引擎分詞.

在這里插入圖片描述

例子:

import jieba
# 定義文本
content = "自然語言處理是人工智能和語言學領域的分支學科。此領域探討如何處理及運用自然語言;自然語言處理包括多方面和步驟,基本有認知、理解、生成等部分。"
# 搜索引擎模式
seg = jieba.cut_for_search(content)
# 調試輸出
print([word for word in seg])

輸出結果:

Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
[('自然語言', 'l'), ('處理', 'v'), ('是', 'v'), ('人工智能', 'n'), ('和', 'c'), ('語言學', 'n'), ('領域', 'n'), ('的', 'uj'), ('分支', 'n'), ('學科', 'n'), ('。', 'x'), ('此', 'zg'), ('領域', 'n'), ('探討', 'v'), ('如何', 'r'), ('處理', 'v'), ('及', 'c'), ('運用', 'vn'), ('自然語言', 'l'), (';', 'x'), ('自然語言', 'l'), ('處理', 'v'), ('包括', 'v'), ('多方面', 'm'), ('和', 'c'), ('步驟', 'n'), (',', 'x'), ('基本', 'n'), ('有', 'v'), ('認知', 'v'), ('、', 'x'), ('理解', 'v'), ('、', 'x'), ('生成', 'v'), ('等', 'u'), ('部分', 'n'), ('。', 'x')]
Loading model cost 1.500 seconds.
Prefix dict has been built successfully.

獲取詞性

通過 jieba.posseg 模式實現(xiàn)詞性標注.

import jieba.posseg as psg
# 定義文本
content = "自然語言處理是人工智能和語言學領域的分支學科。此領域探討如何處理及運用自然語言;自然語言處理包括多方面和步驟,基本有認知、理解、生成等部分。"
# 分詞
seg = psg.lcut(content)
# 獲取詞性
part_of_speech = [(x.word, x.flag) for x in seg]
# 調試輸出
print(part_of_speech)

輸出結果:

Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
[('自然語言', 'l'), ('處理', 'v'), ('是', 'v'), ('人工智能', 'n'), ('和', 'c'), ('語言學', 'n'), ('領域', 'n'), ('的', 'uj'), ('分支', 'n'), ('學科', 'n'), ('。', 'x'), ('此', 'zg'), ('領域', 'n'), ('探討', 'v'), ('如何', 'r'), ('處理', 'v'), ('及', 'c'), ('運用', 'vn'), ('自然語言', 'l'), (';', 'x'), ('自然語言', 'l'), ('處理', 'v'), ('包括', 'v'), ('多方面', 'm'), ('和', 'c'), ('步驟', 'n'), (',', 'x'), ('基本', 'n'), ('有', 'v'), ('認知', 'v'), ('、', 'x'), ('理解', 'v'), ('、', 'x'), ('生成', 'v'), ('等', 'u'), ('部分', 'n'), ('。', 'x')]
Loading model cost 1.500 seconds.
Prefix dict has been built successfully.

以上就是Python機器學習NLP自然語言處理基本操作之精確分詞的詳細內容,更多關于Python機器學習NLP自然語言處理的資料請關注腳本之家其它相關文章!

相關文章

  • 淺析python中SQLAlchemy排序的一個坑

    淺析python中SQLAlchemy排序的一個坑

    這篇文章主要介紹了關于python中SQLAlchemy排序的一個坑,文中給出了詳細的示例代碼,需要的朋友可以參考借鑒,感興趣的朋友們下面來一起學習學習吧。
    2017-02-02
  • 解決hive中導入text文件遇到的坑

    解決hive中導入text文件遇到的坑

    這篇文章主要介紹了解決hive中導入text文件遇到的坑,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2021-04-04
  • Python的Django框架中settings文件的部署建議

    Python的Django框架中settings文件的部署建議

    這篇文章主要介紹了Python的Django框架中settings文件的部署建議,包括對local_settings的弊病的一些簡單分析,需要的朋友可以參考下
    2015-05-05
  • python實現(xiàn)三子棋游戲

    python實現(xiàn)三子棋游戲

    這篇文章主要為大家詳細介紹了python實現(xiàn)三子棋游戲,文中示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2022-05-05
  • Python編程在flask中模擬進行Restful的CRUD操作

    Python編程在flask中模擬進行Restful的CRUD操作

    今天小編就為大家分享一篇關于Python編程在flask中模擬進行Restful的CRUD操作,小編覺得內容挺不錯的,現(xiàn)在分享給大家,具有很好的參考價值,需要的朋友一起跟隨小編來看看吧
    2018-12-12
  • Python調用命令行進度條的方法

    Python調用命令行進度條的方法

    這篇文章主要介紹了Python調用命令行進度條的方法,涉及Python進度條的調用技巧,具有一定參考借鑒價值,需要的朋友可以參考下
    2015-05-05
  • python利用opencv實現(xiàn)顏色檢測

    python利用opencv實現(xiàn)顏色檢測

    這篇文章主要為大家詳細介紹了python利用opencv實現(xiàn)顏色檢測,文中示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2021-02-02
  • NumPy之矩陣向量線性代數(shù)等操作示例

    NumPy之矩陣向量線性代數(shù)等操作示例

    這篇文章主要為大家介紹了NumPy之矩陣向量線性代數(shù)等操作示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪
    2023-04-04
  • Python實現(xiàn)變量數(shù)值交換及判斷數(shù)組是否含有某個元素的方法

    Python實現(xiàn)變量數(shù)值交換及判斷數(shù)組是否含有某個元素的方法

    這篇文章主要介紹了Python實現(xiàn)變量數(shù)值交換及判斷數(shù)組是否含有某個元素的方法,涉及Python字符串與數(shù)組的相關賦值、判斷操作技巧,需要的朋友可以參考下
    2017-09-09
  • django有外鍵關系的兩張表如何相互查找

    django有外鍵關系的兩張表如何相互查找

    這篇文章主要介紹了django有外鍵關系的兩張表如何相互查找,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-02-02

最新評論

靖宇县| 南康市| 海南省| 云和县| 富阳市| 襄垣县| 岚皋县| 彭水| 修武县| 淮南市| 当阳市| 雷山县| 南宫市| 东辽县| 大田县| 马山县| 新邵县| 珠海市| 开阳县| 博湖县| 江津市| 黄浦区| 达孜县| 永德县| 留坝县| 湘潭县| 颍上县| 阿坝| 天峨县| 文山县| 普宁市| 东宁县| 深州市| 天全县| 东港市| 于都县| 交口县| 甘孜县| 景东| 无为县| 滕州市|