最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python機(jī)器學(xué)習(xí)NLP自然語(yǔ)言處理基本操作關(guān)鍵詞

 更新時(shí)間:2021年09月21日 13:51:09   作者:我是小白呀  
本文是Python機(jī)器學(xué)習(xí)NLP自然語(yǔ)言處理系列文章,帶大家開(kāi)啟一段學(xué)習(xí)自然語(yǔ)言處理 (NLP) 的旅程. 本文主要學(xué)習(xí)NLP自然語(yǔ)言處理關(guān)鍵詞的操作

概述

從今天開(kāi)始我們將開(kāi)啟一段自然語(yǔ)言處理 (NLP) 的旅程. 自然語(yǔ)言處理可以讓來(lái)處理, 理解, 以及運(yùn)用人類的語(yǔ)言, 實(shí)現(xiàn)機(jī)器語(yǔ)言和人類語(yǔ)言之間的溝通橋梁.

在這里插入圖片描述

關(guān)鍵詞

關(guān)鍵詞 (keywords), 即關(guān)鍵詞語(yǔ). 關(guān)鍵詞能描述文章的本質(zhì), 在文獻(xiàn)檢索, 自動(dòng)文摘, 文本聚類 / 分類等方面有著重要的應(yīng)用.

在這里插入圖片描述

關(guān)鍵詞抽取的方法

關(guān)鍵詞提取: 針對(duì)新文檔, 通過(guò)算法分析. 提取文檔中一些詞語(yǔ)作為該文檔的關(guān)鍵詞

關(guān)鍵詞分配: 給定已有的關(guān)鍵詞庫(kù), 對(duì)于新來(lái)的文檔從該詞庫(kù)里面分配幾個(gè)詞語(yǔ)作為這篇文檔的關(guān)鍵詞

TF-IDF 關(guān)鍵詞提取

TF-IDF (Term Frequency-Inverse Document Frequency), 即詞頻-逆文件頻率是一種用于信息檢索與數(shù)據(jù)挖掘的常用加權(quán)技術(shù). TF-IDF 可以幫助我們挖掘文章中的關(guān)鍵詞. 通過(guò)數(shù)值統(tǒng)計(jì), 反映一個(gè)詞對(duì)于語(yǔ)料庫(kù)中某篇文章的重要性.

TF

TF (Term Frequency), 即詞頻. 表示詞在文本中出現(xiàn)的頻率.

公式:

在這里插入圖片描述

IDF

IDF (Inverse Document Frequency), 即逆文檔頻率. 表示語(yǔ)料庫(kù)中包含詞的文檔的數(shù)目的倒數(shù).

公式:

在這里插入圖片描述

TF-IDF

公式:

在這里插入圖片描述

TF-IDF = (詞的頻率 / 句子總字?jǐn)?shù)) × (總文檔數(shù) / 包含該詞的文檔數(shù))

如果一個(gè)詞非常常見(jiàn), 那么 IDF 就會(huì)很低, 反之就會(huì)很高. TF-IDF 可以幫助我們過(guò)濾常見(jiàn)詞語(yǔ), 提取關(guān)鍵詞.

jieba TF-IDF 關(guān)鍵詞抽取

格式:

jieba.analyse.extract_tags(sentence, topK=20, withWeight=False, allowPOS=())

參數(shù):

sentence: 待提取的文本語(yǔ)料

topK: 返回的關(guān)鍵詞個(gè)數(shù), 默認(rèn)為 20

withWeight: 是否需要返回關(guān)鍵詞權(quán)重, 默認(rèn)為 False

allowPOS: 僅包括指定詞性的詞, 默認(rèn)為空, 即不篩選

jieba 詞性

編號(hào) 詞性 描述
Ag 形語(yǔ)素 形容詞性語(yǔ)素。形容詞代碼為 a,語(yǔ)素代碼g前面置以A。
a 形容詞 取英語(yǔ)形容詞 adjective的第1個(gè)字母。
ad 副形詞 直接作狀語(yǔ)的形容詞。形容詞代碼 a和副詞代碼d并在一起。
an 名形詞 具有名詞功能的形容詞。形容詞代碼 a和名詞代碼n并在一起。
b 區(qū)別詞 取漢字“別”的聲母。
c 連詞 取英語(yǔ)連詞 conjunction的第1個(gè)字母。
dg 副語(yǔ)素 副詞性語(yǔ)素。副詞代碼為 d,語(yǔ)素代碼g前面置以D。
d 副詞 取 adverb的第2個(gè)字母,因其第1個(gè)字母已用于形容詞。
e 嘆詞 取英語(yǔ)嘆詞 exclamation的第1個(gè)字母。
f 方位詞 取漢字“方”
g 語(yǔ)素 絕大多數(shù)語(yǔ)素都能作為合成詞的“詞根”,取漢字“根”的聲母。
h 前接成分 取英語(yǔ) head的第1個(gè)字母。
i 成語(yǔ) 取英語(yǔ)成語(yǔ) idiom的第1個(gè)字母。
j 簡(jiǎn)稱略語(yǔ) 取漢字“簡(jiǎn)”的聲母。
k 后接成分
l 習(xí)用語(yǔ) 習(xí)用語(yǔ)尚未成為成語(yǔ),有點(diǎn)“臨時(shí)性”,取“臨”的聲母。
m 數(shù)詞 取英語(yǔ) numeral的第3個(gè)字母,n,u已有他用。
Ng 名語(yǔ)素 名詞性語(yǔ)素。名詞代碼為 n,語(yǔ)素代碼g前面置以N。
n 名詞 取英語(yǔ)名詞 noun的第1個(gè)字母。
nr 人名 名詞代碼 n和“人(ren)”的聲母并在一起。
ns 地名 名詞代碼 n和處所詞代碼s并在一起。
nt 機(jī)構(gòu)團(tuán)體 “團(tuán)”的聲母為 t,名詞代碼n和t并在一起。
nz 其他專名 “?!钡穆暷傅牡?1個(gè)字母為z,名詞代碼n和z并在一起。
o 擬聲詞 取英語(yǔ)擬聲詞 onomatopoeia的第1個(gè)字母。
p 介詞 取英語(yǔ)介詞 prepositional的第1個(gè)字母。
q 量詞 取英語(yǔ) quantity的第1個(gè)字母。
r 代詞 取英語(yǔ)代詞 pronoun的第2個(gè)字母,因p已用于介詞。
s 處所詞 取英語(yǔ) space的第1個(gè)字母。
tg 時(shí)語(yǔ)素 時(shí)間詞性語(yǔ)素。時(shí)間詞代碼為 t,在語(yǔ)素的代碼g前面置以T。
t 時(shí)間詞 取英語(yǔ) time的第1個(gè)字母。
u 助詞 取英語(yǔ)助詞 auxiliary
vg 動(dòng)語(yǔ)素 動(dòng)詞性語(yǔ)素。動(dòng)詞代碼為 v。在語(yǔ)素的代碼g前面置以V。
v 動(dòng)詞 取英語(yǔ)動(dòng)詞 verb的第一個(gè)字母。
vd 副動(dòng)詞 直接作狀語(yǔ)的動(dòng)詞。動(dòng)詞和副詞的代碼并在一起。
vn 名動(dòng)詞 指具有名詞功能的動(dòng)詞。動(dòng)詞和名詞的代碼并在一起。
w 標(biāo)點(diǎn)符號(hào)
x 非語(yǔ)素字 非語(yǔ)素字只是一個(gè)符號(hào),字母 x通常用于代表未知數(shù)、符號(hào)。
y 語(yǔ)氣詞 取漢字“語(yǔ)”的聲母。
z 狀態(tài)詞 取漢字“狀”的聲母的前一個(gè)字母。
un 未知詞

不帶關(guān)鍵詞權(quán)重

例子:

import jieba.analyse
# 定義文本
text = "自然語(yǔ)言處理是計(jì)算機(jī)科學(xué)領(lǐng)域與人工智能領(lǐng)域中的一個(gè)重要方向。" \
       "它研究能實(shí)現(xiàn)人與計(jì)算機(jī)之間用自然語(yǔ)言進(jìn)行有效通信的各種理論和方法。" \
       "自然語(yǔ)言處理是一門融語(yǔ)言學(xué)、計(jì)算機(jī)科學(xué)、數(shù)學(xué)于一體的科學(xué)。" \
       "因此,這一領(lǐng)域的研究將涉及自然語(yǔ)言,即人們?nèi)粘J褂玫恼Z(yǔ)言," \
       "所以它與語(yǔ)言學(xué)的研究有著密切的聯(lián)系,但又有重要的區(qū)別。" \
       "自然語(yǔ)言處理并不是一般地研究自然語(yǔ)言," \
       "而在于研制能有效地實(shí)現(xiàn)自然語(yǔ)言通信的計(jì)算機(jī)系統(tǒng),特別是其中的軟件系統(tǒng)。" \
       "因而它是計(jì)算機(jī)科學(xué)的一部分"
# 提取關(guān)鍵詞
keywords = jieba.analyse.extract_tags(text, topK=20, withWeight=False)
# 調(diào)試輸出
print([i for i in keywords])

輸出結(jié)果:

Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
Loading model cost 0.890 seconds.
Prefix dict has been built successfully.
['自然語(yǔ)言', '計(jì)算機(jī)科學(xué)', '語(yǔ)言學(xué)', '研究', '領(lǐng)域', '處理', '通信', '有效', '軟件系統(tǒng)', '人工智能', '實(shí)現(xiàn)', '計(jì)算機(jī)系統(tǒng)', '重要', '一體', '一門', '日常', '計(jì)算機(jī)', '密切', '數(shù)學(xué)', '研制']

附帶關(guān)鍵詞權(quán)重

import jieba.analyse
# 定義文本
content = "自然語(yǔ)言處理是人工智能和語(yǔ)言學(xué)領(lǐng)域的分支學(xué)科。此領(lǐng)域探討如何處理及運(yùn)用自然語(yǔ)言;自然語(yǔ)言處理包括多方面和步驟,基本有認(rèn)知、理解、生成等部分。"
# 定義文本
text = "自然語(yǔ)言處理是計(jì)算機(jī)科學(xué)領(lǐng)域與人工智能領(lǐng)域中的一個(gè)重要方向。" \
       "它研究能實(shí)現(xiàn)人與計(jì)算機(jī)之間用自然語(yǔ)言進(jìn)行有效通信的各種理論和方法。" \
       "自然語(yǔ)言處理是一門融語(yǔ)言學(xué)、計(jì)算機(jī)科學(xué)、數(shù)學(xué)于一體的科學(xué)。" \
       "因此,這一領(lǐng)域的研究將涉及自然語(yǔ)言,即人們?nèi)粘J褂玫恼Z(yǔ)言," \
       "所以它與語(yǔ)言學(xué)的研究有著密切的聯(lián)系,但又有重要的區(qū)別。" \
       "自然語(yǔ)言處理并不是一般地研究自然語(yǔ)言," \
       "而在于研制能有效地實(shí)現(xiàn)自然語(yǔ)言通信的計(jì)算機(jī)系統(tǒng),特別是其中的軟件系統(tǒng)。" \
       "因而它是計(jì)算機(jī)科學(xué)的一部分"
# 提取關(guān)鍵詞 (帶權(quán)重)
keywords = jieba.analyse.extract_tags(text, topK=20, withWeight=True)
# 調(diào)試輸出
print([i for i in keywords])

輸出結(jié)果:

Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
Loading model cost 1.110 seconds.
Prefix dict has been built successfully.
[('自然語(yǔ)言', 1.1237629576061539), ('計(jì)算機(jī)科學(xué)', 0.4503481350267692), ('語(yǔ)言學(xué)', 0.27566262244215384), ('研究', 0.2660770221507693), ('領(lǐng)域', 0.24979825580353845), ('處理', 0.24973179957046154), ('通信', 0.2043557391963077), ('有效', 0.16296019853692306), ('軟件系統(tǒng)', 0.16102600688461538), ('人工智能', 0.14550809839215384), ('實(shí)現(xiàn)', 0.14389939312584615), ('計(jì)算機(jī)系統(tǒng)', 0.1402028601413846), ('重要', 0.12347581087876922), ('一體', 0.11349408224353846), ('一門', 0.11300493477184616), ('日常', 0.10913612756276922), ('計(jì)算機(jī)', 0.1046889912443077), ('密切', 0.10181409957492307), ('數(shù)學(xué)', 0.10166677655076924), ('研制', 0.09868653898630769)]

TextRank

TextRank 通過(guò)詞之間的相鄰關(guān)系構(gòu)建網(wǎng)絡(luò),然后用PageRank 迭代計(jì)算每個(gè)節(jié)點(diǎn)的 rank 值. 排序 rank值即可得到關(guān)鍵詞.

import jieba.analyse
# 定義文本
content = "自然語(yǔ)言處理是人工智能和語(yǔ)言學(xué)領(lǐng)域的分支學(xué)科。此領(lǐng)域探討如何處理及運(yùn)用自然語(yǔ)言;自然語(yǔ)言處理包括多方面和步驟,基本有認(rèn)知、理解、生成等部分。"
# 定義文本
text = "自然語(yǔ)言處理是計(jì)算機(jī)科學(xué)領(lǐng)域與人工智能領(lǐng)域中的一個(gè)重要方向。" \
       "它研究能實(shí)現(xiàn)人與計(jì)算機(jī)之間用自然語(yǔ)言進(jìn)行有效通信的各種理論和方法。" \
       "自然語(yǔ)言處理是一門融語(yǔ)言學(xué)、計(jì)算機(jī)科學(xué)、數(shù)學(xué)于一體的科學(xué)。" \
       "因此,這一領(lǐng)域的研究將涉及自然語(yǔ)言,即人們?nèi)粘J褂玫恼Z(yǔ)言," \
       "所以它與語(yǔ)言學(xué)的研究有著密切的聯(lián)系,但又有重要的區(qū)別。" \
       "自然語(yǔ)言處理并不是一般地研究自然語(yǔ)言," \
       "而在于研制能有效地實(shí)現(xiàn)自然語(yǔ)言通信的計(jì)算機(jī)系統(tǒng),特別是其中的軟件系統(tǒng)。" \
       "因而它是計(jì)算機(jī)科學(xué)的一部分"
# TextRank提取關(guān)鍵詞
keywords = jieba.analyse.textrank(text, topK=20, withWeight=False)
# 調(diào)試輸出
print([i for i in keywords])

調(diào)試輸出:

Building prefix dict from the default dictionary ...
Loading model from cache C:\Users\Windows\AppData\Local\Temp\jieba.cache
['研究', '領(lǐng)域', '計(jì)算機(jī)科學(xué)', '實(shí)現(xiàn)', '處理', '語(yǔ)言學(xué)', '數(shù)學(xué)', '人們', '計(jì)算機(jī)', '涉及', '有著', '一體', '方法', '語(yǔ)言', '研制', '使用', '人工智能', '在于', '聯(lián)系', '科學(xué)']
Loading model cost 1.062 seconds.
Prefix dict has been built successfully.

在這里插入圖片描述

以上就是Python機(jī)器學(xué)習(xí)NLP自然語(yǔ)言處理基本操作關(guān)鍵詞的詳細(xì)內(nèi)容,更多關(guān)于Python機(jī)器學(xué)習(xí)NLP自然語(yǔ)言處理的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • Python對(duì)PDF文檔和PPT文檔的操作詳解

    Python對(duì)PDF文檔和PPT文檔的操作詳解

    Python辦公?動(dòng)化是利?Python編程語(yǔ)?來(lái)創(chuàng)建腳本和程序,以簡(jiǎn)化、加速和?動(dòng)化?常辦公任務(wù)和?作流程的過(guò)程,它基于Python的強(qiáng)?功能和豐富的第三?庫(kù),使得能夠處理各種辦公任務(wù),本文給大家介紹了Python對(duì)PDF文檔和PPT文檔的操作,需要的朋友可以參考下
    2023-12-12
  • Python?DPED機(jī)器學(xué)習(xí)之實(shí)現(xiàn)照片美化

    Python?DPED機(jī)器學(xué)習(xí)之實(shí)現(xiàn)照片美化

    本篇文章主要介紹了利用Python中的DPED工具實(shí)現(xiàn)照片一鍵美化,可以實(shí)現(xiàn)照片亮度提高和色彩鮮明度提高,代碼簡(jiǎn)潔易懂,具有一定學(xué)習(xí)價(jià)值,感興趣的小伙伴可以了解一下
    2021-11-11
  • Python中sklearn實(shí)現(xiàn)交叉驗(yàn)證示例分析

    Python中sklearn實(shí)現(xiàn)交叉驗(yàn)證示例分析

    這篇文章主要介紹了Python中sklearn實(shí)現(xiàn)交叉驗(yàn)證,本文python的版本為3.8,各個(gè)版本之間函數(shù)名字略有不同,但是原理都是一樣的,集成開(kāi)發(fā)環(huán)境使用的是Anaconda的Spyder,需要的朋友可以參考下
    2023-08-08
  • python利用datetime模塊計(jì)算程序運(yùn)行時(shí)間問(wèn)題

    python利用datetime模塊計(jì)算程序運(yùn)行時(shí)間問(wèn)題

    這篇文章主要介紹了python利用datetime模塊計(jì)算程序運(yùn)行時(shí)間,本文通過(guò)實(shí)例代碼給大家介紹的非常詳細(xì),具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2020-02-02
  • python中os和sys模塊的區(qū)別與常用方法總結(jié)

    python中os和sys模塊的區(qū)別與常用方法總結(jié)

    這篇文章主要給大家介紹了關(guān)于python中os和sys模塊的區(qū)別與常用方法的相關(guān)資料,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面來(lái)一起學(xué)習(xí)學(xué)習(xí)吧。
    2017-11-11
  • python 實(shí)現(xiàn)循環(huán)定義、賦值多個(gè)變量的操作

    python 實(shí)現(xiàn)循環(huán)定義、賦值多個(gè)變量的操作

    這篇文章主要介紹了python 實(shí)現(xiàn)循環(huán)定義、賦值多個(gè)變量的操作,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2021-03-03
  • Python?hug庫(kù)構(gòu)建快速可擴(kuò)展的Web API框架使用詳解

    Python?hug庫(kù)構(gòu)建快速可擴(kuò)展的Web API框架使用詳解

    這篇文章主要介紹了Python?hug庫(kù)構(gòu)建快速可擴(kuò)展的Web API框架使用詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2024-02-02
  • Python 如何測(cè)試文件是否存在

    Python 如何測(cè)試文件是否存在

    這篇文章主要介紹了Python 如何測(cè)試文件是否存在,文中講解非常細(xì)致,代碼幫助大家更好的理解和學(xué)習(xí),感興趣的朋友可以了解下
    2020-07-07
  • Windows下Anaconda2安裝NLTK教程

    Windows下Anaconda2安裝NLTK教程

    這篇文章主要為大家詳細(xì)介紹了Windows下Anaconda2安裝NLTK的教程,具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2018-09-09
  • python爬取各類文檔方法歸類匯總

    python爬取各類文檔方法歸類匯總

    網(wǎng)絡(luò)爬蟲(chóng)不僅需要能夠抓取HTML中的敏感信息,也需要有抓取其他類型文檔的能力這篇文章主要為大家匯總了python爬取各類文檔方法,具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2018-03-03

最新評(píng)論

青川县| 利津县| 苍梧县| 罗江县| 右玉县| 连云港市| 大理市| 进贤县| 泗水县| 江西省| 元谋县| 木兰县| 肥乡县| 斗六市| 南涧| 会宁县| 永春县| 芜湖市| 大石桥市| 洱源县| 高碑店市| 天等县| 青冈县| 遂平县| 德阳市| 临江市| 德清县| 双江| 安阳县| 北宁市| 兴和县| 东乡族自治县| 九龙坡区| 安宁市| 嘉兴市| 开平市| 垣曲县| 焦作市| 贞丰县| 巧家县| 阿克陶县|