pandas groupby()的使用小結(jié)
在數(shù)據(jù)分析中,經(jīng)常會(huì)用到分組,可用函數(shù) pandas 中的groupby()。
groupby()主要的分組統(tǒng)計(jì)方向:
1、分組匯總
2、分組描述性統(tǒng)計(jì)分析
3、分組計(jì)算均值等統(tǒng)計(jì)量
4、分組去重
5、分組排序取樣本
6、分組匯總,然后再分組計(jì)算
Date Latitude Longitude Depth Type 01/02/1965 19.246 145.616 131.6 Earthquake 01/04/1965 1.863 127.352 80.0 Earthquake 01/05/1965 -20.579 -173.972 20.0 Earthquake 01/08/1965 -59.076 -23.557 15.0 Earthquake 01/09/1965 11.938 126.427 15.0 Earthquake
#1、分組統(tǒng)計(jì)組內(nèi)個(gè)數(shù)
df.groupby(['date','Type'])
.size()
#2、分組統(tǒng)計(jì)計(jì)算‘Depth'的基本數(shù)據(jù)分布
df.groupby(['date','type'])['Depth']
.describe()
#3、分組統(tǒng)計(jì)計(jì)算‘Latitude'的均值
df.groupby(['date','type'])
.agg({'Latitude':'mean'})
#分組統(tǒng)計(jì)計(jì)算兩列數(shù)據(jù)的均值
df.groupby(['date','type'])
.agg(la_mean = ('Latitude','mean'),
lo_mean = ('Longitude','mean'),
la_range = ('depth',lambda x:x.max() - x.min()))
#4、分組然后對(duì)每組去重,然后匯總?cè)ブ睾蟮膫€(gè)數(shù)
df.groupby('date')
.apply(lambda x: x.drop_duplicates('Type')['Type']
.count())
#5、分組,然后按照‘Latitude'降序,并取出每組的前3個(gè)樣本。
df.groupby(['date'])
.apply(lambda x: x.sort_values('Latitude',ascending = False)
.head(3))
#6、分組,然后匯總計(jì)算兩列數(shù)據(jù),再進(jìn)行分組,取出每一組‘la_sum'的最大值
df.groupby(['date','type'])
.agg(la_sum = ('Latitude','sum'),
lo_sum = ('Longitude','sum'))
.groupby(['date'])
.apply(lambda x:x.sort_values('la_sum ',ascending = False).head(1))
#分組,然后按照type排序,再分組,取出前10匯總和后10匯總,然后再計(jì)算兩者的比率
df.groupby('date')
.apply(lambda x:x.sort_values('type'))
.reset_index(drop = True).groupby('date')
.agg(tail10 = ('depth',lambda x:x.head(10).sum()),
top10 = ('depth',lambda x:x.tail(10).sum()))
.apply(lambda x:x['top10']/x['tail10'],axis = 1)
groupby()結(jié)合agg()和apply(),可以解決很多復(fù)雜的分組計(jì)算問(wèn)題。
到此這篇關(guān)于pandas groupby()的使用小結(jié)的文章就介紹到這了,更多相關(guān)pandas groupby()使用內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
Python實(shí)現(xiàn)動(dòng)態(tài)循環(huán)輸出文字功能
這篇文章主要介紹了Python實(shí)現(xiàn)動(dòng)態(tài)循環(huán)輸出文字功能,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-05-05
關(guān)于python2 csv寫入空白行的問(wèn)題
今天小編就為大家分享一篇關(guān)于python 2 csv寫入空白行的問(wèn)題,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2018-06-06
pandas與pyspark計(jì)算效率對(duì)比分析
這篇文章主要介紹了pandas與pyspark計(jì)算效率對(duì)比,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2023-06-06
Python腳本提取fasta文件單序列信息實(shí)現(xiàn)
這篇文章主要為大家介紹了Python腳本提取fasta文件單序列信息實(shí)現(xiàn)示例,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2022-07-07
python一行sql太長(zhǎng)折成多行并且有多個(gè)參數(shù)的方法
今天小編就為大家分享一篇python一行sql太長(zhǎng)折成多行并且有多個(gè)參數(shù)的方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2018-07-07
python自動(dòng)化測(cè)試通過(guò)日志3分鐘定位bug
軟件開(kāi)發(fā)中通過(guò)日志記錄程序的運(yùn)行情況是一個(gè)開(kāi)發(fā)的好習(xí)慣,對(duì)于錯(cuò)誤排查和系統(tǒng)運(yùn)維都有很大幫助,Python標(biāo)準(zhǔn)庫(kù)自帶了強(qiáng)大的logging日志模塊,在各種python模塊中得到廣泛應(yīng)用2021-11-11
python3通過(guò)subprocess模塊調(diào)用腳本并和腳本交互的操作
這篇文章主要介紹了python3通過(guò)subprocess模塊調(diào)用腳本并和腳本交互的操作,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2020-12-12
Python中property函數(shù)用法實(shí)例分析
這篇文章主要介紹了Python中property函數(shù)用法,結(jié)合實(shí)例形式分析了property函數(shù)的功能、參數(shù)、使用方法及相關(guān)操作注意事項(xiàng),需要的朋友可以參考下2018-06-06

