python機(jī)器學(xué)習(xí)基礎(chǔ)特征工程算法詳解
一、機(jī)器學(xué)習(xí)概述
機(jī)器學(xué)習(xí)是從數(shù)據(jù)中,自動(dòng)分析獲得規(guī)律(模型),并利用規(guī)律對(duì)未知數(shù)據(jù)進(jìn)行預(yù)測(cè)。
二、數(shù)據(jù)集的構(gòu)成
1.數(shù)據(jù)集存儲(chǔ)
機(jī)器學(xué)習(xí)的歷史數(shù)據(jù)通常使用csv文件存儲(chǔ)。
不用mysql的原因:
1、文件大的話讀取速度慢;
2、格式不符合機(jī)器學(xué)習(xí)要求的格式
2.可用的數(shù)據(jù)集
Kaggle:大數(shù)據(jù)競(jìng)賽平臺(tái)、80萬(wàn)科學(xué)家、真實(shí)數(shù)據(jù)、數(shù)據(jù)量巨大
Kaggle網(wǎng)址:https://www.kaggle.com/datasets
UCI:360個(gè)數(shù)據(jù)集、覆蓋科學(xué)生活經(jīng)濟(jì)等領(lǐng)域、數(shù)據(jù)量幾十萬(wàn)
UCI數(shù)據(jù)集網(wǎng)址: http://archive.ics.uci.edu/ml/
scikit-learn:數(shù)據(jù)量較小、方便學(xué)習(xí)
scikit-learn網(wǎng)址:http://scikit-learn.org/stable/datasets/index.html#datasets
3.常用數(shù)據(jù)集的結(jié)構(gòu)
特征值(用以判斷目標(biāo)值所用的條件:比如房子的面積朝向等)+目標(biāo)值(希望實(shí)現(xiàn)的目標(biāo):比如房子價(jià)格)
有些數(shù)據(jù)集可以沒(méi)有目標(biāo)值。
三、特征工程
”將原始數(shù)據(jù)轉(zhuǎn)換為能更好地代表預(yù)測(cè)模型的潛在問(wèn)題的特征“的過(guò)程,叫做特征工程,能夠提高對(duì)未知數(shù)據(jù)的預(yù)測(cè)準(zhǔn)確性。特征如果不好,很可能即使算法好,結(jié)果也不會(huì)盡如人意。
pandas可用于數(shù)據(jù)讀取、對(duì)數(shù)據(jù)的基本處理
sklearn有更多對(duì)于特征的處理的強(qiáng)大的接口
特征抽?。?/p>
特征抽取API:sklearn.feature_extraction
1.字典數(shù)據(jù)特征抽取
API:sklearn.feature_extraction.DictVectorizer
語(yǔ)法如下:

字典數(shù)據(jù)抽?。簩⒆值渲械念悇e數(shù)據(jù)分別進(jìn)行轉(zhuǎn)換為特征數(shù)據(jù)。因此,如果輸入的是數(shù)組形式,并且有類別的這些特征,需要先轉(zhuǎn)換成字典數(shù)據(jù),然后進(jìn)行抽取。
2.文本特征抽取
Count
類:sklearn.feature_extraction.text.CountVectorizer
用法:
1.統(tǒng)計(jì)所有文章當(dāng)中所有的詞,重復(fù)的只看做一次
2.對(duì)每篇文章,在詞的列表里面,統(tǒng)計(jì)每個(gè)詞出現(xiàn)的次數(shù)
3.單個(gè)字母不統(tǒng)計(jì)
注意:該方法默認(rèn)不支持中文,每個(gè)中文漢字被視為一個(gè)英文字母,中間有空格或者逗號(hào)就會(huì)被分開,同樣的,一個(gè)漢字不予統(tǒng)計(jì)。(中文可使用jieba分詞:pip install jieba,使用:jieba.cut("我是一個(gè)程序員"))
3.文本特征抽?。簍f-idf
上面的countvec不能處理中性詞比如“明天,中午,因?yàn)椤钡?。于是可以使用tfidf方法。
tf:term frequency詞頻(和countvec方法一樣)
idf:inverse document frequency逆文檔頻率 log(總文檔數(shù)量/該詞出現(xiàn)的文檔數(shù))
tf * idf 重要性程度
類:sklearn.feature_extraction.text.TfidfVectorizer
4.特征預(yù)處理:歸一化
特征預(yù)處理:通過(guò)特定的統(tǒng)計(jì)方法,將數(shù)據(jù)轉(zhuǎn)換為算法要求的數(shù)據(jù)
特征預(yù)處理API:sklearn.preprocessing

歸一化API:sklearn.preprocessing.MinMaxScaler

多個(gè)特征同等重要并且特征數(shù)據(jù)之間差距較大的時(shí)候,進(jìn)行歸一化。但歸一化容易受異常點(diǎn)的影響,因此該方法魯棒性較差,只適合傳統(tǒng)精確小數(shù)據(jù)場(chǎng)景。
5.特征預(yù)處理:標(biāo)準(zhǔn)化
將原始數(shù)據(jù)變換到均值為0,標(biāo)準(zhǔn)差為1的范圍內(nèi)

標(biāo)準(zhǔn)化API:
sklearn.preprocessing.StandardScaler

標(biāo)準(zhǔn)化適合現(xiàn)代嘈雜大數(shù)據(jù)場(chǎng)景,在已有樣本足夠多的情況下比較穩(wěn)定。
6.特征預(yù)處理:缺失值處理
插補(bǔ):通過(guò)缺失值每行或每列的平均值、中位數(shù)來(lái)填補(bǔ)(一般按列填補(bǔ))
API:sklearn.impute.SimpleImputer
數(shù)據(jù)當(dāng)中的缺失值標(biāo)記:默認(rèn)為np.nan

以上就是python機(jī)器學(xué)習(xí)基礎(chǔ)特征工程算法詳解的詳細(xì)內(nèi)容,更多關(guān)于python機(jī)器學(xué)習(xí)特征工程的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!
- Python分析特征數(shù)據(jù)類別與預(yù)處理方法速學(xué)
- python?OpenCV實(shí)現(xiàn)圖像特征匹配示例詳解
- python深度學(xué)習(xí)tensorflow1.0參數(shù)和特征提取
- caffe的python接口caffemodel參數(shù)及特征抽取示例
- Python計(jì)算機(jī)視覺(jué)SIFT尺度不變的圖像特征變換
- python神經(jīng)網(wǎng)絡(luò)特征金字塔FPN原理
- Python機(jī)器學(xué)習(xí)利用隨機(jī)森林對(duì)特征重要性計(jì)算評(píng)估
- Python機(jī)器學(xué)習(xí)特征重要性分析的8個(gè)常用方法實(shí)例探究
相關(guān)文章
在Linux系統(tǒng)上安裝Python的Scrapy框架的教程
這篇文章主要介紹了在Linux系統(tǒng)上安裝Python的Scrapy框架的教程,Scrapy是著名的專門針對(duì)搜索引擎的爬蟲制作而研發(fā)的Python框架,需要的朋友可以參考下2015-06-06
python高階函數(shù)functools模塊的具體使用
本文主要介紹了python高階函數(shù)functools模塊的具體使用,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2023-03-03
用python簡(jiǎn)單實(shí)現(xiàn)mysql數(shù)據(jù)同步到ElasticSearch的教程
今天小編就為大家分享一篇用python簡(jiǎn)單實(shí)現(xiàn)mysql數(shù)據(jù)同步到ElasticSearch的教程,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2018-05-05
python中如何使用xml.dom.minidom模塊讀取解析xml文件
xml.dom.minidom模塊應(yīng)該是內(nèi)置模塊不用下載安裝,本文給大家介紹python中如何使用xml.dom.minidom模塊讀取解析xml文件,感興趣的朋友一起看看吧2023-10-10
Pycharm添加虛擬解釋器報(bào)錯(cuò)問(wèn)題解決方案
這篇文章主要介紹了Pycharm添加虛擬解釋器報(bào)錯(cuò)問(wèn)題解決方案,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-10-10
Python實(shí)現(xiàn)OFD文件轉(zhuǎn)PDF
OFD 文件是由中國(guó)國(guó)家標(biāo)準(zhǔn)化管理委員會(huì)制定的國(guó)家標(biāo)準(zhǔn),是一種開放式文檔格式,具有高度可擴(kuò)展性和可編輯性,本文主要介紹了如何利用Python實(shí)現(xiàn)OFD文件轉(zhuǎn)PDF,需要的可以參考下2024-10-10

