最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python教程pandas數(shù)據(jù)分析去重復(fù)值

 更新時間:2021年09月16日 10:29:32   作者:sharon@zhang  
Pandas指定行進(jìn)行去重更新值,加載數(shù)據(jù)sample抽樣函數(shù),指定需要更新的值append直接添加append函數(shù)用法,根據(jù)某一列key值進(jìn)行去重key唯一

加載數(shù)據(jù)

首先,我們需要加載到所需要的數(shù)據(jù),這里我們所需要的數(shù)據(jù)是同過sample函數(shù)采樣過來的。

import pandas as pd 
#這里說明一下,clean_beer.csv數(shù)據(jù)有兩千多行數(shù)據(jù)
#所以從其中采樣一部分,來進(jìn)行演示,當(dāng)然可以簡單實(shí)用data.head()也可以做練習(xí)
data = pd.read_csv('clean_beer.csv')
data_sam = data.sample(frac=0.1,weights=data['ounces'].values)
data_sam1 = data_sam
data_sam

我們采用data[‘ounces']列為權(quán)重對數(shù)據(jù)進(jìn)行采樣,并將結(jié)果賦值給data_sam1,其中data_sam和data_sam1是后續(xù)我們需要用到的兩個數(shù)據(jù)(因?yàn)樾枰獙蓚€數(shù)據(jù)合并,并去除重復(fù))

此時,data_sam和data_sam1的數(shù)據(jù)是一樣的。

data_sam數(shù)據(jù)

data_sam

data_sam

data_sam1數(shù)據(jù)

data_sam1

在這里插入圖片描述

sample抽樣函數(shù)

簡要介紹一下sample函數(shù)

df.sample()就是抽樣函數(shù),參數(shù)如下:

df.sample(n=None,frac=None,replace=Flase,weights=None,random_state=None,axis=None)

參數(shù)說明:

n:就是樣本量,如果不寫,就是抽一條數(shù)據(jù)

frac:抽樣比,就是樣本量占全樣本的比例,如frac=0.3 ,注意n和frac不能共存

replace:是否放回,默認(rèn)是不放回,如果有放回(replace=True)可以選擇比df長度更多的元素回來

weights:樣本權(quán)重,自動歸一化,可以以某一列為權(quán)重

random_state:隨機(jī)狀態(tài)。就是為了保證程序每次運(yùn)行得到的結(jié)果都一樣

axis:抽樣維度,0是行,1是列,默認(rèn)為0

指定需要更新的值

接下來,我們對data_sam1的值進(jìn)行更新,主要是將data_sam1的ounces屬性列值加上后綴'.0 oz',具體代碼如下:

data_sam1['ounces'] = data_sam1['ounces'].astype('str') + '.0 oz'
data_sam1

對data_sam1的值進(jìn)行顯示,其中我們可以看到,ounces的值已經(jīng)全部加上了我們所指定的后綴:

在這里插入圖片描述

現(xiàn)在,我們已經(jīng)得到的新的值,接下來的目標(biāo)就是如何將我們已經(jīng)得到的新值,更新到data_sam中

append直接添加

從標(biāo)題可以看到,我們使用的是append方法進(jìn)行直接添加。

data_sam = data_sam.append(data_sam1,ignore_index=True)
data_sam

我們將data_sam1使用append方法添加到data_sam最后一行的后面。下面展示其結(jié)果,并詳細(xì)介紹append的用法。

append

可以看到,行數(shù)已經(jīng)有原來的241改為現(xiàn)在的482rows,顯然我們此時已經(jīng)成功使用append添加數(shù)據(jù)成功。不過我們想要的不止是簡簡單單的添加數(shù)據(jù)在最后一行,而是想要把我們增加后綴的那一列更新到原來的數(shù)據(jù)中,所以最后一步就是去重。

append函數(shù)用法

append()函數(shù)的語法為:

DataFrame.append(other,ignore_index=False,verify_integrity=False,sort=None)

參數(shù)說明:
other: DataFrame,Series或Dict式對象,其行將添加到調(diào)用方DataFrame中。

ignore_index: 如果為True,則將忽略源DataFrame對象中的索引。

verify_integrity:如果為True,則在創(chuàng)建具有重復(fù)項(xiàng)的索引時引發(fā)ValueError 。

sort: 如果源DataFrame列未對齊,則對列進(jìn)行排序。 不建議使用此功能。 因此,我們必須傳遞sort=True來排序和靜音警告消息。 如果傳遞了sort=False ,則不會對列進(jìn)行排序,并且會忽略警告。

根據(jù)某一列key值進(jìn)行去重(key唯一)

接下來,就是最后一個步驟,也就是根據(jù)ounces列對數(shù)據(jù)進(jìn)行去重。
通過duplicated()函數(shù)可以看到數(shù)據(jù)還是有很多重復(fù)的。

data_sam.duplicated(['id'],keep='first')

在這里插入圖片描述

DataFrame.drop_duplicated(self,subset = None,keep ='first')
subset : 列標(biāo)簽或標(biāo)簽序列,可選僅考慮某些列來標(biāo)識重復(fù)項(xiàng),默認(rèn)情況下使用所有列
keep : {'first','last',F(xiàn)alse},默認(rèn)為'first'
		first:將重復(fù)項(xiàng)標(biāo)記True為第一次出現(xiàn)的除外。
		last:將重復(fù)項(xiàng)標(biāo)記True為最后一次除外。
		False:將所有重復(fù)項(xiàng)標(biāo)記為True。

既然知道數(shù)據(jù)中是有重復(fù)項(xiàng)的,通過對數(shù)據(jù)的觀察可以看到,數(shù)據(jù)的id是唯一的,所以我們以id這一列為契機(jī),來進(jìn)行我們的去重操作。具體代碼如下:

data_sam = data_sam.drop_duplicates(subset = 'id')
data_sam

最后來看一看,我們最后的結(jié)果是不是已經(jīng)成功去重,或者說是不是我們想要的最終結(jié)果呢???

在這里插入圖片描述

根據(jù)上面的圖片結(jié)果,可以看到我們已經(jīng)執(zhí)行成功,得到的確實(shí)是我們起初想要的一個數(shù)據(jù)結(jié)果。有興趣的也可以去試一下merge和update聯(lián)合的操作進(jìn)行更新數(shù)據(jù),看看是不是也能成功。

以上就是Python教程pandas數(shù)據(jù)分析的詳細(xì)內(nèi)容,希望通過記錄能夠加強(qiáng)記憶,并幫到和我一樣正在學(xué)習(xí)的你,更多關(guān)于pandas數(shù)據(jù)分析去重復(fù)值的資料請關(guān)注腳本之家其它相關(guān)文章!感謝閱讀~

相關(guān)文章

  • python list是否包含另一個list所有元素的實(shí)例

    python list是否包含另一個list所有元素的實(shí)例

    今天小編就為大家分享一篇python list是否包含另一個list所有元素的實(shí)例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-05-05
  • Python學(xué)生成績管理系統(tǒng)簡潔版

    Python學(xué)生成績管理系統(tǒng)簡潔版

    這篇文章主要為大家詳細(xì)介紹了簡潔版的Python學(xué)生成績管理系統(tǒng),文中示例代碼介紹的非常詳細(xì),具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2018-01-01
  • Python萬字深入內(nèi)存管理講解

    Python萬字深入內(nèi)存管理講解

    內(nèi)存管理是指在程序的運(yùn)行過程中,分配內(nèi)容和回收內(nèi)存的過程。如果只分配,不回收,電腦上那點(diǎn)內(nèi)存很快就被用光。幸運(yùn)的是,Python和Java等高級語言會自動管理內(nèi)存的分配和回收
    2022-07-07
  • Python?CNN卷積神經(jīng)網(wǎng)絡(luò)實(shí)戰(zhàn)教程深入講解

    Python?CNN卷積神經(jīng)網(wǎng)絡(luò)實(shí)戰(zhàn)教程深入講解

    CNN,即卷積神經(jīng)網(wǎng)絡(luò),主要用于圖像識別,分類。由輸入層,卷積層,池化層,全連接層(Affline層),Softmax層疊加而成。卷積神經(jīng)網(wǎng)絡(luò)中還有一個非常重要的結(jié)構(gòu):過濾器,它作用于層與層之間(卷積層與池化層),決定了怎樣對數(shù)據(jù)進(jìn)行卷積和池化
    2022-12-12
  • 使用Django搭建web服務(wù)器的例子(最最正確的方式)

    使用Django搭建web服務(wù)器的例子(最最正確的方式)

    今天小編就為大家分享一篇使用Django搭建web服務(wù)器的例子(最最正確的方式),具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-08-08
  • python實(shí)現(xiàn)求最長回文子串長度

    python實(shí)現(xiàn)求最長回文子串長度

    最長回文子串問題:給定一個字符串,求它的最長回文子串長度。如果一個字符串正著讀和反著讀是一樣的,那它就是回文串。今天我們就來探討下這個問題
    2018-01-01
  • 2023最新pytorch快速安裝指南(超詳細(xì)版)

    2023最新pytorch快速安裝指南(超詳細(xì)版)

    這篇文章主要給大家介紹了2023年最新pytorch快速安裝指南的相關(guān)資料,PyTorch是一個開源的深度學(xué)習(xí)框架,提供了各種張量操作并通過自動求導(dǎo)可以自動進(jìn)行梯度計(jì)算,方便構(gòu)建各種動態(tài)神經(jīng)網(wǎng)絡(luò),需要的朋友可以參考下
    2023-10-10
  • python實(shí)現(xiàn)探測socket和web服務(wù)示例

    python實(shí)現(xiàn)探測socket和web服務(wù)示例

    這篇文章主要介紹了python實(shí)現(xiàn)探測socket和web服務(wù)示例,需要的朋友可以參考下
    2014-03-03
  • python文件操作的基礎(chǔ)詳細(xì)講解(write、read、readlines、readline)

    python文件操作的基礎(chǔ)詳細(xì)講解(write、read、readlines、readline)

    使用python來讀寫文件是非常簡單的操作,下面這篇文章主要給大家介紹了關(guān)于python文件操作的基礎(chǔ)詳細(xì)資料,包括write、read、readlines、readline等相關(guān)操作,文中通過示例代碼介紹的非常詳細(xì),需要的朋友可以參考下
    2022-04-04
  • 探索Python?Slice函數(shù)靈活而強(qiáng)大的序列切片技術(shù)

    探索Python?Slice函數(shù)靈活而強(qiáng)大的序列切片技術(shù)

    Python中的Slice函數(shù)是一種強(qiáng)大且靈活的序列切片技術(shù),用于從字符串、列表、元組等序列類型中提取子集,本文將深入研究Slice函數(shù)的功能和用法,提供詳細(xì)的示例代碼和解釋,幫助讀者更全面地了解和應(yīng)用這一功能
    2024-01-01

最新評論

渭源县| 漳浦县| 虹口区| 平原县| 自贡市| 双牌县| 华宁县| 潜山县| 呼图壁县| 海兴县| 广平县| 手游| 土默特左旗| 科技| 罗定市| 图片| 平度市| 开封县| 青川县| 兴和县| 淮北市| 佛山市| 象州县| 长治县| 冀州市| 永胜县| 甘肃省| 西宁市| 青神县| 大理市| 荆门市| 青浦区| 长宁区| 同心县| 长武县| 襄城县| 屏南县| 宁海县| 定安县| 陈巴尔虎旗| 湟中县|