最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python中文分詞+詞頻統(tǒng)計的實現(xiàn)步驟

 更新時間:2022年06月11日 15:05:33   作者:愛吃糖的月妖妖  
詞頻統(tǒng)計就是輸入一段句子或者一篇文章,然后統(tǒng)計句子中每個單詞出現(xiàn)的次數(shù),下面這篇文章主要給大家介紹了關于python中文分詞+詞頻統(tǒng)計的相關資料,需要的朋友可以參考下

提示:文章寫完后,目錄可以自動生成,如何生成可參考右邊的幫助文檔

前言

本文記錄了一下Python在文本處理時的一些過程+代碼

一、文本導入

我準備了一個名為abstract.txt的文本文件

接著是在網(wǎng)上下載了stopword.txt(用于結巴分詞時的停用詞)

有一些是自己覺得沒有用加上去的 

另外建立了自己的詞典extraDict.txt

準備工作做好了,就來看看怎么使用吧!

二、使用步驟

1.引入庫

代碼如下:

import jieba
from jieba.analyse import extract_tags
from sklearn.feature_extraction.text import TfidfVectorizer

2.讀入數(shù)據(jù)

代碼如下:

jieba.load_userdict('extraDict.txt')  # 導入自己建立詞典

3.取出停用詞表

def stopwordlist():
    stopwords = [line.strip() for line in open('chinesestopwords.txt', encoding='UTF-8').readlines()]
    # ---停用詞補充,視具體情況而定---
    i = 0
    for i in range(19):
        stopwords.append(str(10 + i))
    # ----------------------
 
    return stopwords

4.分詞并去停用詞(此時可以直接利用python原有的函數(shù)進行詞頻統(tǒng)計)

def seg_word(line):
    # seg=jieba.cut_for_search(line.strip())
    seg = jieba.cut(line.strip())
    temp = ""
    counts = {}
    wordstop = stopwordlist()
    for word in seg:
        if word not in wordstop:
            if word != ' ':
                temp += word
                temp += '\n'
                counts[word] = counts.get(word, 0) + 1#統(tǒng)計每個詞出現(xiàn)的次數(shù)
    return  temp #顯示分詞結果
    #return str(sorted(counts.items(), key=lambda x: x[1], reverse=True)[:20])  # 統(tǒng)計出現(xiàn)前二十最多的詞及次數(shù)

5. 輸出分詞并去停用詞的有用的詞到txt

def output(inputfilename, outputfilename):
    inputfile = open(inputfilename, encoding='UTF-8', mode='r')
    outputfile = open(outputfilename, encoding='UTF-8', mode='w')
    for line in inputfile.readlines():
        line_seg = seg_word(line)
        outputfile.write(line_seg)
    inputfile.close()
    outputfile.close()
    return outputfile

6.函數(shù)調用

if __name__ == '__main__':
    print("__name__", __name__)
    inputfilename = 'abstract.txt'
    outputfilename = 'a1.txt'
    output(inputfilename, outputfilename)

7.結果  

附:輸入一段話,統(tǒng)計每個字母出現(xiàn)的次數(shù)

先來講一下思路:

例如給出下面這樣一句話

Love is more than a word
it says so much.
When I see these four letters,
I almost feel your touch.
This is only happened since
I fell in love with you.
Why this word does this,
I haven’t got a clue.

那么想要統(tǒng)計里面每一個單詞出現(xiàn)的次數(shù),思路很簡單,遍歷一遍這個字符串,再定義一個空字典count_dict,看每一個單詞在這個用于統(tǒng)計的空字典count_dict中的key中存在否,不存在則將這個單詞當做count_dict的鍵加入字典內,然后值就為1,若這個單詞在count_dict里面已經(jīng)存在,那就將它對應的鍵的值+1就行

下面來看代碼:

#定義字符串
sentences = """           # 字符串很長時用三個引號
Love is more than a word
it says so much.
When I see these four letters,
I almost feel your touch.
This is only happened since
I fell in love with you.
Why this word does this,
I haven't got a clue.
"""
#具體實現(xiàn)
#  將句子里面的逗號去掉,去掉多種符號時請用循環(huán),這里我就這樣吧
sentences=sentences.replace(',','')   
sentences=sentences.replace('.','')   #  將句子里面的.去掉
sentences = sentences.split()         # 將句子分開為單個的單詞,分開后產(chǎn)生的是一個列表sentences
# print(sentences)
count_dict = {}
for sentence in sentences:
    if sentence not in count_dict:    # 判斷是否不在統(tǒng)計的字典中
        count_dict[sentence] = 1
    else:                              # 判斷是否不在統(tǒng)計的字典中
        count_dict[sentence] += 1
for key,value in count_dict.items():
    print(f"{key}出現(xiàn)了{value}次")

輸出結果是這樣:

總結

以上就是今天要講的內容,本文僅僅簡單介紹了python的中文分詞及詞頻統(tǒng)計!

到此這篇關于python中文分詞+詞頻統(tǒng)計的實現(xiàn)步驟的文章就介紹到這了,更多相關python中文分詞 詞頻統(tǒng)計內容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!

相關文章

  • python3中@dataclass的實現(xiàn)示例

    python3中@dataclass的實現(xiàn)示例

    @dataclass?是 Python 3.7 引入的一個裝飾器,用于方便地定義符合數(shù)據(jù)類協(xié)議的類,本文主要介紹了python3中@dataclass的實現(xiàn)示例,感興趣的可以了解一下
    2024-02-02
  • Python機器學習庫Scikit-learn實戰(zhàn)教程

    Python機器學習庫Scikit-learn實戰(zhàn)教程

    文章介紹了Python在機器學習領域的應用,重點介紹了Scikit-learn庫的使用方法,并通過實際案例展示了如何使用Scikit-learn進行分類、回歸、聚類和文本挖掘等任務,同時,文章還討論了特征工程、超參數(shù)調整、避免過擬合和交叉驗證等進階技巧
    2025-01-01
  • Python裝飾器結合遞歸原理解析

    Python裝飾器結合遞歸原理解析

    這篇文章主要介紹了Python裝飾器結合遞歸原理解析,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-07-07
  • 使用Python抓取豆瓣影評數(shù)據(jù)的方法

    使用Python抓取豆瓣影評數(shù)據(jù)的方法

    今天小編就為大家分享一篇關于使用Python抓取豆瓣影評數(shù)據(jù)的方法,小編覺得內容挺不錯的,現(xiàn)在分享給大家,具有很好的參考價值,需要的朋友一起跟隨小編來看看吧
    2018-10-10
  • Python 中 and, or, &, |, ^ 的使用小結

    Python 中 and, or, &, |, ^ 

    這篇文章主要介紹了Python 中 and, or, &, |, ^ 的使用小結,本文給大家介紹的非常詳細,對大家的學習或工作具有一定的參考借鑒價值,需要的朋友參考下吧
    2024-01-01
  • 通過OpenCV實現(xiàn)對指定顏色的物體追蹤

    通過OpenCV實現(xiàn)對指定顏色的物體追蹤

    這篇文章主要介紹的是通過OpenCV實現(xiàn)對特定顏色的物體追蹤,文中實驗用的是綠蘿的樹葉。本文的示例代碼講解詳細,對學習OPenCV有一定的幫助,感興趣的小伙伴可以了解一下
    2021-12-12
  • python程序中斷然后接著中斷代碼繼續(xù)運行問題

    python程序中斷然后接著中斷代碼繼續(xù)運行問題

    這篇文章主要介紹了python程序中斷然后接著中斷代碼繼續(xù)運行問題,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2024-02-02
  • Python多線程Threading、子線程與守護線程實例詳解

    Python多線程Threading、子線程與守護線程實例詳解

    這篇文章主要介紹了Python多線程Threading、子線程與守護線程,結合實例形式詳細分析了Python多線程Threading、子線程與守護線程相關概念、原理、用法與操作注意事項,需要的朋友可以參考下
    2020-03-03
  • Python繪制1000響大地紅鞭炮動態(tài)效果

    Python繪制1000響大地紅鞭炮動態(tài)效果

    俗話說得好,這所謂放鞭炮就是來壓邪祟,除惡的,但是近幾年來都不讓放炮了,這篇文章主要介紹了Python來繪制1000響大地紅鞭炮動態(tài)效果
    2023-01-01
  • pytorch1.60 torch.nn在pycharm中無法自動智能提示的解決

    pytorch1.60 torch.nn在pycharm中無法自動智能提示的解決

    這篇文章主要介紹了pytorch1.60 torch.nn在pycharm中無法自動智能提示的解決方案,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2024-02-02

最新評論

宁安市| 梨树县| 临海市| 孟村| 通山县| 霍州市| 大方县| 岢岚县| 赣榆县| 吉水县| 天等县| 潮州市| 井研县| 云浮市| 年辖:市辖区| 松桃| 阳原县| 静乐县| 丰宁| 鲁甸县| 德格县| 金川县| 鹤山市| 威海市| 大田县| 秭归县| 芜湖市| 辽宁省| 高雄市| 恩平市| 明光市| 宁波市| 宝山区| 英吉沙县| 富蕴县| 罗平县| 阳信县| 佛教| 城口县| 祁门县| 富宁县|