最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python機器學習算法與數據降維分析詳解

 更新時間:2021年11月12日 16:41:58   作者:Swayzzu  
這篇文章主要為大家介紹了python機器學習算法與數據降維的分析詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步

一、數據降維

機器學習中的維度就是特征的數量,降維即減少特征數量。降維方式有:特征選擇、主成分分析。

1.特征選擇

當出現以下情況時,可選擇該方式降維:

①冗余:部分特征的相關度高,容易消耗計算性能

②噪聲:部分特征對預測結果有影響

特征選擇主要方法:過濾式(VarianceThreshold)、嵌入式(正則化、決策樹)

過濾式:

sklearn特征選擇API

sklearn.feature_selection.VarianceThreshold

注意:沒有最好的方差選擇,需要根據實際效果選擇方差。

2.主成分分析(PCA)

API:sklearn.decomposition

主成分分析會盡可能降低原數據的維數,損失少量信息。當特征數量達到上百的時候,就需要考慮主成分分析。可以削減回歸分析或者聚類分析中特征的數量。

PCA語法:

里面的n_components通常填0-1的小數,代表保留百分之多少的數據,比如0.95意思是保留95%的數據。通常在0.9-0.95之間

3.降維方法使用流程

例如:研究用戶和購買物品類別的關系,數據有不同的表格存儲,均為csv文件,但所需的兩者“用戶”和“購買物品類別”,存在于不同的表中。則可以按照以下流程進行:

1.觀察各個表格的鍵,通過相同的鍵對表格進行合并,使用pandas.merge(表1,表2,鍵1,鍵2)方法,其中鍵1和鍵2相同。經過多次合并,最終將兩個目標合并到一張表中。

2.通過交叉表pd.crosstab(合并后的表['用戶'], 合并后的表['物品類別']),建立一個以用戶為行,以物品類別為列的數據表。

3.對表格進行數據的降維,可以使用PCA(n_components=0.9),保留90%的有效信息,輸出降維后的數據。即可有效減少維度,并確保留存90%的有效信息。

二、機器學習開發(fā)流程

1.機器學習算法分類

數據類型:

離散型:區(qū)間內不可分,通常是在分類型問題中。

連續(xù)型:區(qū)間內可分,通常是在預測型問題中。

算法分類:

算法總體分為兩類,監(jiān)督學習和無監(jiān)督學習。

①監(jiān)督學習包含特征值+目標值,算法又分為兩小類,分類算法和回歸算法。

分類算法:k-近鄰算法、貝葉斯分類、決策樹與隨機森林、邏輯回歸、神經網絡

回歸算法:線性回歸、嶺回歸

②無監(jiān)督學習只有特征值,通常是聚類算法:k-means

2.機器學習開發(fā)流程

機器學習開發(fā)首先需要有數據,數據來源可能有以下幾種:公司本身有數據、合作過來的數據、購買的數據。

具體開發(fā)流程如下:

①明確實際問題做什么:根據目標值數據類型,建立模型,劃分應用種類??纯词欠诸悊栴}還是預測問題。

②數據的基本處理:使用pandas處理數據,缺失值,合并表等等。

③特征工程:對數據特征進行處理(重要)。

④找到合適的算法去進行預測。

⑤模型的評估,判定效果→上線使用,以API形式提供;若模型評估沒有合格:換算法、參數,特征工程

sklearn數據集的使用:

通常在使用前會對數據集進行劃分,從數據中拿出約75%作為訓練集、25%作為測試集。也可以0.8/0.2等。通常0.75/0.25是使用最多的。

sklearn數據集劃分API:sklearn.model_selection.train_set_split

sklearn數據集API:

獲取數據集返回的類型:

數據集進行分割:

用于分類的大數據集:

sklearn回歸數據集:

三、轉換器與估計器

1.轉換器

在數據處理中用到的fit_tansform方法中,其實可以拆分為fit方法和transform方法。

fit_transform() = fit() + transform()

若直接使用fit_transform(),則是對輸入的數據進行求平均值、標準差,并使用它們進行數據處理最終輸出結果。

如果拆開的話:

fit():輸入數據,計算平均值,標準差等,不進行后續(xù)工作。

transform():使用fit計算好的內容進行轉換。

也就是說可以通過fit()方法,生成1個數據對應的標準,使用這個標準,對其他數據,通過transform方法進行轉換。

2.估計器

估計器就是已經實現了的算法的API,可以直接調用,輸入相關數據,對結果進行預測等。

估計器工作流程:

1.調用fit(x_train, y_train),輸入訓練集

2.輸入測試集的數據(x_test, y_test),調用不同接口可得不同結果

API①:y_predict = predict(x_test),該接口可獲得算法對y的預測值。

API②:score(x_test, y_test) ,該接口可獲得預測的準確率。

以上就是python機器學習算法與數據降維分析詳解的詳細內容,更多關于python機器學習算法與數據降維的資料請關注腳本之家其它相關文章!

相關文章

  • Python代碼模擬CPU工作原理

    Python代碼模擬CPU工作原理

    Python代碼來實現一個最簡單的CPU。用代碼模擬大的部件,使大家從原理上理解CPU工作。使它可編程,支持加減法運算、讀寫內存、無條件跳轉、條件跳轉的功能。
    2023-01-01
  • pyhon如何把程序打包為whl

    pyhon如何把程序打包為whl

    這篇文章主要介紹了pyhon如何把程序打包為whl問題,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2023-03-03
  • Python實現上傳Minio和阿里Oss文件

    Python實現上傳Minio和阿里Oss文件

    這篇文章主要介紹了如何通過Python上傳Minio和阿里OSS文件,文中的示例代碼介紹得很詳細,對我們的工作和學習都有一定的價值,感興趣的小伙伴可以了解一下
    2021-12-12
  • python 集合set中 add與update區(qū)別介紹

    python 集合set中 add與update區(qū)別介紹

    這篇文章主要介紹了python 集合set中 add與update區(qū)別介紹,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2021-03-03
  • python實現簡單購物商城

    python實現簡單購物商城

    這篇文章主要為大家詳細介紹了python實現簡單購物商城的相關資料,具有實用性和一定的參考價值,感興趣的朋友可以參考一下
    2016-05-05
  • python繪制圓柱體的方法

    python繪制圓柱體的方法

    這篇文章主要為大家詳細介紹了python繪制圓柱體的方法,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2018-07-07
  • 使用python?scrapy爬取天氣并導出csv文件

    使用python?scrapy爬取天氣并導出csv文件

    由于工作需要,將爬蟲的文件要保存為csv,以前只是保存為json,下面這篇文章主要給大家介紹了關于如何使用python?scrapy爬取天氣并導出csv文件的相關資料,需要的朋友可以參考下
    2022-08-08
  • python文件開頭聲明UTF-8編碼的幾種常用方式匯總

    python文件開頭聲明UTF-8編碼的幾種常用方式匯總

    這篇文章主要介紹了python文件開頭聲明UTF-8編碼的幾種常用方式匯總,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2024-06-06
  • 對python文件讀寫的緩沖行為詳解

    對python文件讀寫的緩沖行為詳解

    今天小編就為大家分享一篇對python文件讀寫的緩沖行為詳解,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-02-02
  • Python jieba結巴分詞原理及用法解析

    Python jieba結巴分詞原理及用法解析

    這篇文章主要介紹了Python jieba結巴分詞原理及用法解析,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-11-11

最新評論

金秀| 潢川县| 宣恩县| 裕民县| 峡江县| 牙克石市| 洞口县| 宝鸡市| 门头沟区| 崇仁县| 社会| 仙桃市| 淄博市| 科技| 渭源县| 黄大仙区| 万宁市| 巴楚县| 原平市| 永清县| 长兴县| 长子县| 红河县| 麟游县| 吉首市| 津市市| 镇江市| 呼玛县| 靖江市| 苗栗市| 铁力市| 惠水县| 济源市| 岳阳市| 百色市| 新郑市| 三台县| 大名县| 宝坻区| 旅游| 宁强县|