最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python sklearn對文本數(shù)據(jù)進行特征化提取

 更新時間:2023年04月25日 08:39:35   作者:瘋狂的小強呀  
這篇文章主要介紹了Python sklearn對文本數(shù)據(jù)進行特征化提取,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習吧

文本特征提取

作用:對文本數(shù)據(jù)進行特征化

(句子、短語、單詞、字母)一般選用單詞作為特征值

方法一:CountVectorizer

sklearn.feature_extraction.text.CountVectorizer(stop_words=[])

返回詞頻矩陣(統(tǒng)計每個樣本特征詞出現(xiàn)的個數(shù))

CountVectorizer.fit_transform(X)

X:文本或者包含文本字符串的可迭代對象

返回值:返回sparse矩陣

CountVectorizer.inverse_transform(X)

X:array數(shù)組或者sparse矩陣

返回值:轉換之前的數(shù)據(jù)格式

CountVectorizer.get_feature_names()

返回值:單詞列表

代碼展示:

from sklearn.feature_extraction.text import CountVectorizer
def count_demo():
    #文本特征抽取
    data=["life is short, i like like python","life is too long,i dislike python"]
    #1、實例化一個轉換器類
    transfer=CountVectorizer()
    #2、調(diào)用fit_transform()
    result=transfer.fit_transform(data)
    print("result:\n",result.toarray())
    print("特征名字:\n", transfer.get_feature_names())
    return None

方法二:TfidfVectorizer

關鍵詞:在某一個類別的文章中,出現(xiàn)的次數(shù)很多,但是在其他類別的文章中出現(xiàn)的次數(shù)很少稱為關鍵詞

Tf-idf文本特征提取

①TF-IDF的主要思想是:如果某個詞或短語在一篇文章中出現(xiàn)的概率高,并且在其他文章中很少出現(xiàn),則認為此詞或者短語具有很好的類別區(qū)分能力,適合用來分類。

②TF-IDF作用:用以評估一字詞對于一個文件集或一個語料庫中的其中一份文件的重要程度。

公式

①詞頻(term frequency,tf)指的是某一個給定的詞語在該文件中出現(xiàn)的頻率

②逆向文檔頻率(inverse document frequency,idf)是一個詞語普遍重要性的度量。某一特定詞語的idf,可以由總文件數(shù)目除以包含該詞語之文件數(shù)目,再將得到的商取以10為底的對數(shù)得到

tfidf = tf * idf

輸出的結果可以理解為重要程度

API

sklearn.feature_extraction.text.TfidfVectorizer(stop_words=None,...)

返回詞的權重矩陣

TfidfVectorizer.fit_transform(X)

X:文本或者包含文本字符串的可迭代對象

返回值:返回sparse矩陣

TfidfVectorizer.inverse_transform(X)

X:array數(shù)組或者sparse矩陣

返回值:轉換之前數(shù)據(jù)格式

TfidfVectorizer.get_feature_names()

返回值:單詞列表

中文分詞+特征提取

from sklearn.feature_extraction.text import TfidfVectorizer
import jieba
def cut_word(text):
    #中文分詞
    #jieba.cut(text)返回的是生成器對象,用list強轉成列表
    word=list(jieba.cut(text))
    #轉成字符串
    words=" ".join(word)
    return words
def tfidf_demo():
    data = ["今天很殘酷,明天更殘酷,后天會很美好,但絕大多數(shù)人都死在明天晚上,卻見不到后天的太陽,所以我們干什么都要堅持",
            "注重自己的名聲,努力工作、與人為善、遵守諾言,這樣對你們的事業(yè)非常有幫助",
            "服務是全世界最貴的產(chǎn)品,所以最佳的服務就是不要服務,最好的服務就是不需要服務"]
    data_new = []
    # 將中文文本進行分詞
    for sentence in data:
        data_new.append(cut_word(sentence))
    # 1、實例化一個轉換器類
    transfer = TfidfVectorizer()
    # 2、調(diào)用fit_transform()
    result = transfer.fit_transform(data_new)  # 得到詞頻矩陣 是一個sparse矩陣
    print("result:\n", result.toarray())  # 將sparse矩陣轉化為二維數(shù)組
    print("特征名字:\n", transfer.get_feature_names())
    return None

到此這篇關于Python sklearn對文本數(shù)據(jù)進行特征化提取的文章就介紹到這了,更多相關Python sklearn文本特征提取內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!

相關文章

  • Python輸入正負10進制,轉4位16進制問題

    Python輸入正負10進制,轉4位16進制問題

    這篇文章主要介紹了Python輸入正負10進制,轉4位16進制問題,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2023-06-06
  • Python批處理刪除和重命名文件夾的實例

    Python批處理刪除和重命名文件夾的實例

    今天小編就為大家分享一篇Python批處理刪除和重命名文件夾的實例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-07-07
  • spark: RDD與DataFrame之間的相互轉換方法

    spark: RDD與DataFrame之間的相互轉換方法

    今天小編就為大家分享一篇spark: RDD與DataFrame之間的相互轉換方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-06-06
  • Python入門:認識列表和元組

    Python入門:認識列表和元組

    這篇文章主要介紹了簡單了解python列表和元組的入門,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2021-10-10
  • 一篇文章快速理解python中的yield關鍵字

    一篇文章快速理解python中的yield關鍵字

    Python中的yield關鍵字可以讓函數(shù)變成生成器,產(chǎn)生一個值后暫停,下次調(diào)用時從上次停下的地方繼續(xù)執(zhí)行,從而節(jié)省內(nèi)存并提高效率,這篇文章主要介紹了python中yield關鍵字的相關資料,需要的朋友可以參考下
    2024-11-11
  • Python中requests庫的概念及使用詳解

    Python中requests庫的概念及使用詳解

    這篇文章主要介紹了Python中requests庫的概念及使用詳解,urllib庫使用繁瑣,比如處理網(wǎng)頁驗證和Cookies時,需要編寫Opener和Handler來處理。為了更加方便的實現(xiàn)這些操作,就有了更為強大的requests庫,需要的朋友可以參考下
    2023-05-05
  • Pycharm 如何設置HTML文件自動補全代碼或標簽

    Pycharm 如何設置HTML文件自動補全代碼或標簽

    這篇文章主要介紹了Pycharm 如何設置HTML文件自動補全代碼或標簽,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2021-05-05
  • Python初識邏輯與if語句及用法大全

    Python初識邏輯與if語句及用法大全

    這篇文章主要介紹了Python初識邏輯與if語句,文中給大家提到了if語句功能及用法講解,需要的朋友可以參考下
    2021-08-08
  • 詳解Python 模擬實現(xiàn)生產(chǎn)者消費者模式的實例

    詳解Python 模擬實現(xiàn)生產(chǎn)者消費者模式的實例

    這篇文章主要介紹了詳解Python 模擬實現(xiàn)生產(chǎn)者消費者模式的實例的相關資料,這里使用了線程知識,隊列知識及循環(huán)的知識,需要的朋友可以參考下
    2017-08-08
  • python Cartopy的基礎使用詳解

    python Cartopy的基礎使用詳解

    這篇文章主要介紹了python Cartopy的基礎使用詳解,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2020-11-11

最新評論

灵宝市| 弥渡县| 闵行区| 新丰县| 乌兰县| 清水县| 松桃| 镇赉县| 汪清县| 抚顺县| 三河市| 庆阳市| 泸水县| 上高县| 陈巴尔虎旗| 龙里县| 分宜县| 邵武市| 慈溪市| 寿阳县| 水城县| 洪泽县| 榆中县| 宜章县| SHOW| 桃江县| 嘉义市| 昌图县| 眉山市| 吉隆县| 咸丰县| 江孜县| 高平市| 淮滨县| 宜昌市| 黑水县| 柞水县| 波密县| 布尔津县| 平阴县| 廉江市|