最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python實現(xiàn)數(shù)據(jù)清洗的示例詳解

 更新時間:2022年08月09日 08:54:31   作者:IT邦德  
這篇文章主要通過五個示例帶大家深入了解下Python實現(xiàn)數(shù)據(jù)清洗的具體方法,文中的示例代碼講解詳細(xì),對我們學(xué)習(xí)Python有一定幫助,需要的可以參考一下

前言

Python實際針對數(shù)據(jù)分析的學(xué)習(xí)是庫,用庫來解決一系列的數(shù)據(jù)分析問題

去掉信息不全的用戶

描述

現(xiàn)有一個Nowcoder.csv文件,它記錄了??途W(wǎng)的部分用戶數(shù)據(jù),包含如下字段(字段與字段之間以逗號間隔):

  • Nowcoder_ID:用戶ID
  • Level:等級
  • Achievement_value:成就值
  • Num_of_exercise:刷題量
  • Graduate_year:畢業(yè)年份
  • Language:常用語言
  • Continuous_check_in_days:最近連續(xù)簽到天數(shù)
  • Number_of_submissions:提交代碼次數(shù)
  • Last_submission_time:最后一次提交題目日期

運營同學(xué)正在做用戶調(diào)研,為了保證調(diào)研的可靠性,想要去掉那些信息不全的用戶,即去掉有缺失數(shù)據(jù)的行,請你幫助他去掉后輸出全部數(shù)據(jù)。

輸入描述

數(shù)據(jù)集直接從當(dāng)前目錄下的Nowcoder.csv文件中讀取。

輸出描述:

直接輸出清洗后的全部數(shù)據(jù)。

答案

import pandas as pd

Nowcoder = pd.read_csv('Nowcoder.csv', sep=',', dtype=object)
pd.set_option('display.width', 300)  # 設(shè)置字符顯示寬度
pd.set_option('display.max_rows', None)  # 設(shè)置顯示最大行
pd.set_option('display.max_columns', None)
print(Nowcoder[Nowcoder.isna() == False])

修補缺失的用戶數(shù)據(jù)

描述

現(xiàn)有一個Nowcoder.csv文件,它記錄了??途W(wǎng)的部分用戶數(shù)據(jù),包含如下字段(字段與字段之間以逗號間隔):

  • Nowcoder_ID:用戶ID
  • Level:等級
  • Achievement_value:成就值
  • Num_of_exercise:刷題量
  • Graduate_year:畢業(yè)年份
  • Language:常用語言
  • Continuous_check_in_days:最近連續(xù)簽到天數(shù)
  • Number_of_submissions:提交代碼次數(shù)
  • Last_submission_time:最后一次提交題目日期

運營同學(xué)拿到了這份用戶文件,但是由于系統(tǒng)BUG,出現(xiàn)了部分缺失的值,請你使用當(dāng)前的最大年份填充缺失的畢業(yè)年份(“Graduate_year”),用Python填充缺失的常用語言(“Language”),用成就值的均值(四舍五入保留整數(shù))填充缺失的成就值(“Achievement_value”)。

輸入描述

數(shù)據(jù)集直接從當(dāng)前目錄下的Nowcoder.csv文件中讀取。

輸出描述:

輸出修改后的全部數(shù)據(jù),不用處理輸出時年份與成就值的小數(shù)點問題。

答案

import pandas as pd

Nowcoder = pd.read_csv('Nowcoder.csv', sep=',')
pd.set_option('display.width', 300)  # 設(shè)置字符顯示寬度
pd.set_option('display.max_rows', None)  # 設(shè)置顯示最大行
pd.set_option('display.max_columns', None)
Nowcoder["Graduate_year"].fillna(Nowcoder["Graduate_year"].max())
Nowcoder["Language"].fillna("Python")
Nowcoder["Achievement_value"].fillna(Nowcoder["Achievement_value"].mean().round(0))
print(Nowcoder)

解決??途W(wǎng)用戶重復(fù)的數(shù)據(jù)

描述

現(xiàn)有一個Nowcoder.csv文件,它記錄了牛客網(wǎng)的部分用戶數(shù)據(jù),包含如下字段(字段與字段之間以逗號間隔):

  • Nowcoder_ID:用戶ID
  • Level:等級
  • Achievement_value:成就值
  • Num_of_exercise:刷題量
  • Graduate_year:畢業(yè)年份
  • Language:常用語言
  • Continuous_check_in_days:最近連續(xù)簽到天數(shù)
  • Number_of_submissions:提交代碼次數(shù)
  • Last_submission_time:最后一次提交題目日期

牛牛拿到這份文件的時候一臉懵逼,因為系統(tǒng)錯誤將很多相同用戶的數(shù)據(jù)輸出了多條,導(dǎo)致文件中有很多重復(fù)的行,請先檢查每一行是否重復(fù),然后輸出刪除重復(fù)行后的全部數(shù)據(jù)。

輸入描述

數(shù)據(jù)集直接從當(dāng)前目錄下的Nowcoder.csv文件中讀取。

輸出描述

先輸出每一行是否重復(fù),再輸出去重后的文件全部數(shù)據(jù)

答案

import pandas as pd

Nowcoder = pd.read_csv('Nowcoder.csv', sep=',', dtype=object)
pd.set_option('display.width', 1000)
pd.set_option('display.max_rows', None)
print(Nowcoder.duplicated())
print(Nowcoder.drop_duplicates(0))

統(tǒng)一最后刷題日期的格式

描述

現(xiàn)有一個Nowcoder.csv文件,它記錄了牛客網(wǎng)的部分用戶數(shù)據(jù),包含如下字段(字段與字段之間以逗號間隔):

  • Nowcoder_ID:用戶ID
  • Level:等級
  • Achievement_value:成就值
  • Num_of_exercise:刷題量
  • Graduate_year:畢業(yè)年份
  • Language:常用語言
  • Continuous_check_in_days:最近連續(xù)簽到天數(shù)
  • Number_of_submissions:提交代碼次數(shù)
  • Last_submission_time:最后一次提交題目日期

運營同學(xué)發(fā)現(xiàn)最后一次提交題目日期這一列有各種各樣的日期格式,這對于他分析用戶十分不友好,你能夠幫他輸出用戶ID、等級以及統(tǒng)一后的日期嗎?(日期格式統(tǒng)一為yyyy-mm-dd)

輸入描述

數(shù)據(jù)集直接從當(dāng)前目錄下的Nowcoder.csv文件中讀取。

輸出描述

輸出用戶ID、等級與最后提交日期三列,包括行號。

答案

import pandas as pd
Nowcoder = pd.read_csv('Nowcoder.csv',sep=',',dtype=object)
Nowcoder['Last_submission_time'] = pd.to_datetime(Nowcoder["Last_submission_time"],format="%Y-%m-%d")
print(Nowcoder[['Nowcoder_ID','Level','Last_submission_time']])

將用戶的json文件轉(zhuǎn)換為表格形式

描述

現(xiàn)有一個Nowcoder.json文件,它記錄了??途W(wǎng)的部分用戶數(shù)據(jù),包含如下字段(字段與字段之間以逗號間隔):

  • Nowcoder_ID:用戶ID
  • Level:等級
  • Achievement_value:成就值
  • Graduate_year:畢業(yè)年份
  • Language:常用語言

如果你讀入了這個json文件,能將其轉(zhuǎn)換為pandas的DataFrame格式嗎?

輸入描述:

數(shù)據(jù)集直接從當(dāng)前目錄下的Nowcoder.json文件中讀取。

輸出描述:

輸出轉(zhuǎn)換為DataFrame的全部數(shù)據(jù),包括行號。

答案

import pandas as pd
import json

pd.set_option('display.width', 300)  # 設(shè)置字符顯示寬度
pd.set_option('display.max_rows', None)  # 設(shè)置顯示最大行
pd.set_option('display.max_columns', None)
with open('Nowcoder.json', 'r') as f:
    data = json.loads(f.read())
     
    df = pd.DataFrame.from_dict(data)
    print(df)

以上就是Python實現(xiàn)數(shù)據(jù)清洗的示例詳解的詳細(xì)內(nèi)容,更多關(guān)于Python數(shù)據(jù)清洗的資料請關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • Python用selenium實現(xiàn)自動登錄和下單的項目實戰(zhàn)

    Python用selenium實現(xiàn)自動登錄和下單的項目實戰(zhàn)

    本文主要介紹了Python用selenium實現(xiàn)自動登錄和下單的項目實戰(zhàn),文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2023-02-02
  • Python OpenCV學(xué)習(xí)之特征點檢測與匹配詳解

    Python OpenCV學(xué)習(xí)之特征點檢測與匹配詳解

    提取圖像的特征點是圖像領(lǐng)域中的關(guān)鍵任務(wù),不管在傳統(tǒng)還是在深度學(xué)習(xí)的領(lǐng)域中,特征代表著圖像的信息,對于分類、檢測任務(wù)都是至關(guān)重要的。這篇文章主要為大家詳細(xì)介紹了OpenCV特征點檢測與匹配,需要的可以參考一下
    2022-01-01
  • python實現(xiàn)批量修改文件名

    python實現(xiàn)批量修改文件名

    這篇文章主要為大家詳細(xì)介紹了python實現(xiàn)批量修改文件名,文中示例代碼介紹的非常詳細(xì),具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2020-03-03
  • 詳解python進(jìn)行mp3格式判斷

    詳解python進(jìn)行mp3格式判斷

    這篇文章主要介紹了詳解python進(jìn)行mp3格式判斷,具有一定的參考價值,有興趣的可以了解一下。
    2016-12-12
  • pandas聚合分組的具體使用

    pandas聚合分組的具體使用

    使用數(shù)據(jù)庫時,我們利用查詢操作對各列或各行中的數(shù)據(jù)進(jìn)行分組,可以針對其中的每一組數(shù)據(jù)進(jìn)行各種不同的操作,本文主要介紹了pandas聚合分組,感興趣的可以了解一下
    2024-03-03
  • 使用Bazel編譯TensorBoard教程

    使用Bazel編譯TensorBoard教程

    今天小編就為大家分享一篇使用Bazel編譯TensorBoard教程,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-02-02
  • 將python安裝信息加入注冊表的示例

    將python安裝信息加入注冊表的示例

    今天小編就為大家分享一篇將python安裝信息加入注冊表的示例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-11-11
  • 使用TensorFlow直接獲取處理MNIST數(shù)據(jù)方式

    使用TensorFlow直接獲取處理MNIST數(shù)據(jù)方式

    今天小編就為大家分享一篇使用TensorFlow直接獲取處理MNIST數(shù)據(jù)方式,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-02-02
  • pytorch分類模型繪制混淆矩陣以及可視化詳解

    pytorch分類模型繪制混淆矩陣以及可視化詳解

    混淆矩陣是ROC曲線繪制的基礎(chǔ),同時它也是衡量分類型模型準(zhǔn)確度中最基本,最直觀,計算最簡單的方法,下面這篇文章主要給大家介紹了關(guān)于pytorch分類模型繪制混淆矩陣以及可視化的相關(guān)資料,需要的朋友可以參考下
    2022-04-04
  • python 實現(xiàn)有道翻譯功能

    python 實現(xiàn)有道翻譯功能

    這篇文章主要介紹了python 實現(xiàn)有道翻譯的方法,幫助大家更好的理解和學(xué)習(xí)使用python,感興趣的朋友可以了解下
    2021-02-02

最新評論

揭西县| 西藏| 南京市| 长垣县| 滦南县| 海丰县| 南丹县| 长岭县| 毕节市| 灵丘县| 久治县| 娄烦县| 侯马市| 博客| 五指山市| 南宁市| 富顺县| 米脂县| 尉犁县| 长白| 芜湖县| 睢宁县| 威远县| 漯河市| 浦县| 承德市| 岐山县| 五寨县| 桓台县| 莱阳市| 古蔺县| 阿勒泰市| 丹寨县| 石林| 荆门市| 阜城县| 含山县| 灌阳县| 兴仁县| 梁河县| 宽城|