Pandas數(shù)據(jù)離散化原理及實(shí)例解析
這篇文章主要介紹了Pandas數(shù)據(jù)離散化原理及實(shí)例解析,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
為什么要離散化
- 連續(xù)屬性離散化的目的是為了簡(jiǎn)化數(shù)據(jù)結(jié)構(gòu),數(shù)據(jù)離散化技術(shù)可以用來(lái)減少給定連續(xù)屬性值的個(gè)數(shù)。離散化方法經(jīng)常作為數(shù)據(jù)挖掘的工具
- 扔掉一些信息,可以讓模型更健壯,泛化能力更強(qiáng)
什么是數(shù)據(jù)的離散化
連續(xù)屬性的離散化就是在連續(xù)屬性的值域上,將值域劃分為若干個(gè)離散的區(qū)間,最后用不同的符號(hào)或整數(shù) 值代表落在每個(gè)子區(qū)間中的屬性值
分箱

案例
1.先讀取股票的數(shù)據(jù),篩選出p_change數(shù)據(jù)
data = pd.read_csv("./data/stock_day.csv")
p_change= data['p_change']
2.將股票漲跌幅數(shù)據(jù)進(jìn)行分組
使用的工具:
- pd.qcut(data, bins)——等深分箱:
- 對(duì)數(shù)據(jù)進(jìn)行分組將數(shù)據(jù)分組 一般會(huì)與value_counts搭配使用,統(tǒng)計(jì)每組的個(gè)數(shù)
- series.value_counts():統(tǒng)計(jì)分組次數(shù)
# 自行分組 qcut = pd.qcut(p_change, 10) # 計(jì)算分到每個(gè)組數(shù)據(jù)個(gè)數(shù) qcut.value_counts()
自定義區(qū)間分組:
- pd.cut(data, bins)——等寬分箱:
- bins是整數(shù)—等寬
- bins是列表--自定義分箱
# 自己指定分組區(qū)間 bins = [-100, -7, -5, -3, 0, 3, 5, 7, 100] p_counts = pd.cut(p_change, bins)

以上就是本文的全部?jī)?nèi)容,希望對(duì)大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。
相關(guān)文章
基于Python實(shí)現(xiàn)圖像文字識(shí)別OCR工具
在工作、生活中常常會(huì)用到,比如票據(jù)、漫畫(huà)、掃描件、照片的文本提取。本文主要介紹了基于PyQt + PaddleOCR實(shí)現(xiàn)的一個(gè)桌面端的OCR工具,用于快速實(shí)現(xiàn)圖片中文本區(qū)域自動(dòng)檢測(cè)+文本自動(dòng)識(shí)別,需要的朋友可以參考一下2021-12-12
pandas中的DataFrame按指定順序輸出所有列的方法
下面小編就為大家分享一篇pandas中的DataFrame按指定順序輸出所有列的方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2018-04-04
SpringBoot調(diào)用python接口的實(shí)現(xiàn)步驟
本文主要介紹如何利用Springboot框架調(diào)用python腳本,文中通過(guò)示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下2021-12-12
解決Pycharm運(yùn)行時(shí)找不到文件的問(wèn)題
今天小編就為大家分享一篇解決Pycharm運(yùn)行時(shí)找不到文件的問(wèn)題,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2018-10-10
python3獲取控制臺(tái)輸入的數(shù)據(jù)的具體實(shí)例
在本篇內(nèi)容里小編給大家分享的是一篇關(guān)于python3獲取控制臺(tái)輸入的數(shù)據(jù)的具體實(shí)例內(nèi)容,需要的朋友們可以學(xué)習(xí)下。2020-08-08

