Pandas去除重復(fù)項函數(shù)詳解drop_duplicates()
drop_duplicates函數(shù)用途
pandas中的drop_duplicates()函數(shù)
可以通過SQL中關(guān)鍵字distinct的用法來理解
根據(jù)指定的字段對數(shù)據(jù)集進(jìn)行去重處理
drop_duplicates()函數(shù)的具體參數(shù)
用法:
DataFrame.drop_duplicates(subset=None, keep=‘first', inplace=False)
參數(shù)說明:
| 參數(shù) | 說明 |
|---|---|
| subset | 根據(jù)指定的列名進(jìn)行去重,默認(rèn)整個數(shù)據(jù)集 |
| keep | 可選{‘first’, ‘last’, False},默認(rèn)first,即默認(rèn)保留第一次出現(xiàn)的重復(fù)值,并刪去其他重復(fù)的數(shù)據(jù),F(xiàn)alse是指刪去所有重復(fù)數(shù)據(jù)。 |
| inplace | 是否對數(shù)據(jù)集本身進(jìn)行修改,默認(rèn)False |
drop_duplicates用法舉例
根據(jù)指定字段進(jìn)行去重
保留第一次出現(xiàn)的數(shù)據(jù)
import pandas as pd
#創(chuàng)建數(shù)據(jù)框
df=pd.DataFrame({
'a':[1,2,4,3,3,3,4],
'b':[2,3,3,4,4,5,3]
})
print('去重前:\n',df)
#根據(jù)字段a進(jìn)行去重,保留第一次出現(xiàn)的數(shù)據(jù)
df.drop_duplicates(['a'],keep='first',inplace=True)
print('去重后:\n',df)
>>>
去重前:
a b
0 1 2
1 2 3
2 4 3
3 3 4
4 3 4
5 3 5
6 4 3
去重后:
a b
0 1 2
1 2 3
2 4 3
3 3 4
總結(jié)
以上為個人經(jīng)驗,希望能給大家一個參考,也希望大家多多支持腳本之家。
相關(guān)文章
使用rpclib進(jìn)行Python網(wǎng)絡(luò)編程時的注釋問題
這篇文章主要介紹了使用rpclib進(jìn)行Python網(wǎng)絡(luò)編程時的注釋問題,作者講到了自己在編寫服務(wù)器時要用unicode注釋等需要注意的地方,需要的朋友可以參考下2015-05-05
詳解Python編程中對Monkey Patch猴子補丁開發(fā)方式的運用
Monkey Patch猴子補丁方式是指在不修改程序原本代碼的前提下,通過添加類或模塊等方式在程序運行過程中加入代碼,下面就來進(jìn)一步詳解Python編程中對Monkey Patch猴子補丁開發(fā)方式的運用2016-05-05
Python實現(xiàn)購物系統(tǒng)(示例講解)
下面小編就為大家?guī)硪黄狿ython實現(xiàn)購物系統(tǒng)(示例講解)。小編覺得挺不錯的,現(xiàn)在就分享給大家,也給大家做個參考。一起跟隨小編過來看看吧2017-09-09
Windows系統(tǒng)下cython_bbox庫的正確安裝步驟
Cython-bbox一般無法直接通過pip直接安裝,那么如何安裝呢?下面這篇文章主要給大家介紹了關(guān)于Windows系統(tǒng)下cython_bbox庫的正確安裝步驟,文中通過圖文介紹的非常詳細(xì),需要的朋友可以參考下2023-05-05
Python數(shù)據(jù)分析之Numpy庫的使用詳解
NumPy(Numerical Python)是Python的一種開源的數(shù)值計算擴(kuò)展。這種工具可用來存儲和處理大型矩陣,比Python自身的嵌套列表結(jié)構(gòu)要高效的多(該結(jié)構(gòu)也可以用來表示矩陣(matrix)),支持大量的維度數(shù)組與矩陣運算,此外也針對數(shù)組運算提供大量的數(shù)學(xué)函數(shù)庫2021-11-11

