最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

pandas的drop_duplicates無法去重問題解決

 更新時間:2024年03月28日 11:25:26   作者:羸弱的窮酸書生  
在我們利用Pandas進行數據清洗的時候,往往會用到drop_duplicates()進行去重,本文主要介紹了pandas的drop_duplicates無法去重問題解決,具有一定的參考價值,感興趣的可以了解一下

之前沒研究過pandas的去重方法,今天用了一下,發(fā)現(xiàn)這個方法并不是那么好用,我的需求是去除所有列的重復值,并保留第一個重復的值,按我的想法應該是下面這樣寫

import pandas as pd
import numpy as np

df1 = pd.DataFrame({
    'a':[1,1,float('nan'),1,4,5],
    'b':[3,3,4,4,5,6],
    'c':[4,4,5,5,6,7],
})
df1 = df1.drop_duplicates(keep='first')
df1

但是結果卻不盡如人意,

    a    b    c
0    1.0    3    4
2    NaN    4    5
3    1.0    4    5
4    4.0    5    6
5    5.0    6    7

如圖所示,并沒有刪除重復值,所以我只能一個一個列的刪,刪完在重新拼接在一起,

import pandas as pd
import numpy as np

df1 = pd.DataFrame({
    'a':[1,1,float('nan'),1,4,5],
    'b':[3,3,4,4,5,6],
    'c':[4,4,5,5,6,7],
})

cols = df1.columns.to_list()
series_list = []
for col in cols:
    tmp_s = df1[col].drop_duplicates(keep='first')
    tmp_s = tmp_s.dropna()
    tmp_s = tmp_s.reset_index(drop=True)
    print(tmp_s)
    series_list.append(tmp_s)

new_df = pd.concat(series_list,axis=1)
new_df

結果

     a    b    c
0    1.0    3    4
1    4.0    4    5
2    5.0    5    6
3    NaN    6    7

當然這樣數據的索引是無法跟之前的對應起來了,所以我猜pandas是想保留之前的數據的對應關系的,一旦有操作要破壞這種對應,它就不會執(zhí)行

drop_duplicates()官方的函數說明

解釋一下各個參數:

  • subset:表示要去重的列名,默認為 None。

  • keep:有三個可選參數,分別是 first、last、False,默認為 first,表示只保留第一次出現(xiàn)的重復項,刪除其余重復項,last 表示只保留最后一次出現(xiàn)的重復項,F(xiàn)alse 則表示刪除所有重復項。

  • inplace:布爾值參數,默認為 False 表示刪除重復項后返回一個副本,若為 Ture 則表示直接在原數據上刪除重復項,改變了原來的數據框。

  • ignore_index:布爾值參數,默認為False,表示保留原來的行索引,若為True,則表示重新設置行索引。

到此這篇關于pandas的drop_duplicates無法去重問題解決的文章就介紹到這了,更多相關pandas的drop_duplicates無法去重內容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!

相關文章

  • Django多數據庫聯(lián)用實現(xiàn)方法解析

    Django多數據庫聯(lián)用實現(xiàn)方法解析

    這篇文章主要介紹了Django多數據庫聯(lián)用實現(xiàn)方法解析,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-11-11
  • Python Pandas分組聚合的實現(xiàn)方法

    Python Pandas分組聚合的實現(xiàn)方法

    這篇文章主要介紹了Python Pandas分組聚合的實現(xiàn)方法,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2019-07-07
  • python中playwright截屏API的實現(xiàn)

    python中playwright截屏API的實現(xiàn)

    無論是屏幕錄制,還是屏幕截圖,Playwright都提供了簡潔的方法實現(xiàn),本文就來詳細的介紹一下python中playwright截屏API的實現(xiàn),具有一定的參考價值,感興趣的可以了解一下
    2026-01-01
  • Python實現(xiàn)base64編碼

    Python實現(xiàn)base64編碼

    這篇文章介紹了Python實現(xiàn)base64編碼的方法,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2022-06-06
  • Python字符串匹配之6種方法的使用詳解

    Python字符串匹配之6種方法的使用詳解

    這篇文章主要介紹了Python字符串匹配之6種方法的使用詳解,在文末給大家提到了python正則表達的說明,感興趣的朋友跟隨小編一起學習吧
    2019-04-04
  • Python去除PDF水印的實現(xiàn)示例

    Python去除PDF水印的實現(xiàn)示例

    本文主要介紹了Python去除PDF水印的實現(xiàn)示例,思路很簡單,代碼也很簡潔。具有一定的參考價值,感興趣的可以了解一下
    2021-11-11
  • Python操作json的方法實例分析

    Python操作json的方法實例分析

    這篇文章主要介紹了Python操作json的方法,結合實例形式簡單分析了Python針對json數據使用解碼loads()和編碼dumps()相關操作技巧,需要的朋友可以參考下
    2018-12-12
  • python中數字列表轉化為數字字符串的實例代碼

    python中數字列表轉化為數字字符串的實例代碼

    先前學習過,數字和字符串都可以存儲到變量當中,下面這篇文章主要給大家介紹了關于python中數字列表轉化為數字字符串的相關資料,文中通過實例代碼介紹的非常詳細,需要的朋友可以參考下
    2023-02-02
  • 使用python快速獲取PDF文件頁數的辦法

    使用python快速獲取PDF文件頁數的辦法

    有時在處理或打印一個PDF文檔之前,你可能需要先知道該文檔包含多少頁,對于程序員來說,編寫腳本來完成這項工作會更加高效,本文就介紹一個使用Python快速獲取PDF文件頁數的辦法,需要的朋友可以參考下
    2024-03-03
  • 詳解如何用Python登錄豆瓣并爬取影評

    詳解如何用Python登錄豆瓣并爬取影評

    這篇文章主要介紹了如何用Python登錄豆瓣并爬取影評,本文給大家介紹的非常詳細,對大家的學習或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2021-08-08

最新評論

海淀区| 阜南县| 来安县| 崇阳县| 张北县| 莆田市| 高州市| 富源县| 西昌市| 固阳县| 高青县| 同仁县| 和硕县| 平和县| 攀枝花市| 永靖县| 德钦县| 天峨县| 仙游县| 泸水县| 永仁县| 达日县| 耿马| 桦甸市| 莆田市| 宁都县| 青浦区| 襄汾县| 称多县| 漳平市| 莱阳市| 舟山市| 岢岚县| 山西省| 湾仔区| 广安市| 蓬莱市| 凤庆县| 东乡族自治县| 乌兰浩特市| 三原县|