pandas中的數(shù)據(jù)去重處理的實現(xiàn)方法
數(shù)據(jù)去重可以使用duplicated()和drop_duplicates()兩個方法。
DataFrame.duplicated(subset = None,keep =‘first' )返回boolean Series表示重復行
參數(shù):
subset:列標簽或標簽序列,可選
僅考慮用于標識重復項的某些列,默認情況下使用所有列
keep:{‘first',‘last',F(xiàn)alse},默認'first'
- first:標記重復,True除了第一次出現(xiàn)。
- last:標記重復,True除了最后一次出現(xiàn)。
- 錯誤:將所有重復項標記為True。
import numpy as np
import pandas as pd
from pandas import Series, DataFrame
df = pd.read_csv('./demo_duplicate.csv')
print(df)
print(df['Seqno'].unique()) # [0. 1.]
# 使用duplicated 查看 重復值
# 參數(shù) keep 可以標記重復值 {'first','last',F(xiàn)alse}
print(df['Seqno'].duplicated())
'''
0 False
1 True
2 True
3 True
4 False
Name: Seqno, dtype: bool
'''
# 刪除 series 重復數(shù)據(jù)
print(df['Seqno'].drop_duplicates())
'''
0 0.0
4 1.0
Name: Seqno, dtype: float64
'''
# 刪除 dataframe 重復數(shù)據(jù)
print(df.drop_duplicates(['Seqno'])) # 按照 Seqno 來 去重
'''
Price Seqno Symbol time
0 1623.0 0.0 APPL 1473411962
4 1649.0 1.0 APPL 1473411963
'''
# drop_dujplicates() 第二個參數(shù) keep 包含的值 有: first、last、False
print(df.drop_duplicates(['Seqno'], keep='last')) # 保存最后一個
'''
Price Seqno Symbol time
3 1623.0 0.0 APPL 1473411963
4 1649.0 1.0 APPL 1473411963
'''
pandas 去除重復行
DataFrame.drop_duplicates(subset = None,keep ='first',inplace = False )
subset : 指定列,默認情況下使用所有列
keep : {'first','last',F(xiàn)alse},默認'first'
first :刪除重復項保留第一次出現(xiàn)的。last :刪除重復項保留最后一次出現(xiàn)的。false:刪除所有重復項。
inplace : 布爾值,默認為False 是否刪除重復項或返回副本
栗子:

到此這篇關(guān)于pandas中的數(shù)據(jù)去重處理的實現(xiàn)方法的文章就介紹到這了,更多相關(guān)Pandas 數(shù)據(jù)去重內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
Python設(shè)計模式中的結(jié)構(gòu)型適配器模式
這篇文章主要介紹了Python設(shè)計中的結(jié)構(gòu)型適配器模式,適配器模式即Adapter?Pattern,將一個類的接口轉(zhuǎn)換成為客戶希望的另外一個接口,下文內(nèi)容具有一定的參考價值,需要的小伙伴可以參考一下2022-02-02
基于Python的網(wǎng)頁自動化工具DrissionPage的使用詳解
DrissionPage 是一個基于 python 的網(wǎng)頁自動化工具,它既能控制瀏覽器,也能收發(fā)數(shù)據(jù)包,還能把兩者合而為一,下面就跟隨小編一起來學習一下它的具體使用吧2024-01-01
python一行代碼就能實現(xiàn)數(shù)據(jù)分析的pandas-profiling庫
這篇文章主要為大家介紹了python一行代碼就能實現(xiàn)數(shù)據(jù)分析的pandas-profiling庫,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪2024-01-01
Python?pandas?DataFrame基礎(chǔ)運算及空值填充詳解
pandas除了可以drop含有空值的數(shù)據(jù)之外,當然也可以用來填充空值,下面這篇文章主要給大家介紹了關(guān)于Python?pandas?DataFrame基礎(chǔ)運算及空值填充的相關(guān)資料,文中通過實例代碼介紹的非常詳細,需要的朋友可以參考下2022-07-07
pytorch中交叉熵損失(nn.CrossEntropyLoss())的計算過程詳解
今天小編就為大家分享一篇pytorch中交叉熵損失(nn.CrossEntropyLoss())的計算過程詳解,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧2020-01-01

