最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

五個簡單有效的Python清理數(shù)據(jù)腳本分享

 更新時間:2022年09月14日 09:13:14   作者:佚名  
通常情況下,在機器學習中的數(shù)據(jù)清理往往是一件令人頭疼的事情,本文整理了一份清單,列出了5個常用的Python腳本,用于自動化數(shù)據(jù)清理,需要的可以參考一下

將 PDF 轉(zhuǎn)換為 CSV

在機器學習中,我們應(yīng)該少一些“數(shù)據(jù)清理”,多一些“數(shù)據(jù)準備”。當我們需要從白皮書、電子書或其他PDF文檔中抓取數(shù)據(jù)時,這個腳本為我節(jié)省了很多時間。

import tabula
#獲取文件
pdf_filename = input ("Enter the full path and filename: ")
# 提取PDF的內(nèi)容
frame = tabula.read_pdf(pdf_filename,  encoding = 'utf-8', pages='all')
#根據(jù)內(nèi)容創(chuàng)建CSV文件
frame.to_csv('pdf_conversion.csv')

這是一種相對簡單的快速提取數(shù)據(jù)的方法,可以在將數(shù)據(jù)導入機器學習數(shù)據(jù)庫、Tableau或Count等工具。

合并 CSV 文件

許多系統(tǒng)會提供導出到CSV選項,但是沒有辦法在導出數(shù)據(jù)之前首先合并數(shù)據(jù)。這可能導致5個以上的文件導出到一個文件夾,這些文件包含相同的數(shù)據(jù)類型。該Python腳本通過獲取這些文件)并將它們合并到一個文件中來解決這個問題。

from time import strftime
import pandas as pd
import glob
# 定義包含CSV文件的文件夾的路徑
path = input('Please enter the full folder path: ')
#確保后面有一個斜杠
if path[:-1] != "/":
    path = path + "/"
#以列表形式獲取CSV文件
csv_files = glob.glob(path + '*.csv')
#打開每個CSV文件并合并為一個文件
merged_file = pd.concat( [ pd.read_csv(c) for c in csv_files ] )
#創(chuàng)建新文件
merged_file.to_csv(path + 'merged_{}.csv'.format(strftime("%m-%d-%yT%H:%M:%S")), index=False)
print('Merge complete.')

最終輸出將為您提供一個 CSV 文件,其中包含您從源系統(tǒng)導出的 CSV 列表中的所有數(shù)據(jù)。

從 CSV 文件中刪除重復的行

如果您需要從CSV文件中刪除重復的數(shù)據(jù)行,這可以幫助您快速執(zhí)行清理操作。當機器學習數(shù)據(jù)集中擁有重復數(shù)據(jù)時,這會直接影響可視化工具或機器學習項目中的結(jié)果。

import pandas as pd
# 獲取文件名
filename = input('filename: ')
#定義要檢查是否重復的CSV列名
duplicate_header = input('header name: ')
#獲取文件的內(nèi)容
file_contents = pd.read_csv(filename)
# 刪除重復的行
deduplicated_data = file_contents.drop_duplicates(subset=[duplicate_header], keep="last", inplace=True)
#創(chuàng)建新文件
deduplicated_data.to_csv('deduplicated_data.csv')

拆分 CSV 列

當從其他系統(tǒng)導出文件時,它有時會包含一列數(shù)據(jù),而我們需要將其作為兩列。

import pandas as pd
#獲取文件名并定義列
filename = input('filename: ')
col_to_split = input('column name: ')
col_name_one = input('first new column: ')
col_name_two = input('second new column: ')
#將CSV數(shù)據(jù)添加到dataframe中
df = pd.read_csv(filename)
# 拆分列
df[[col_name_one,col_name_two]] = df[col_to_split].str.split(",", expand=True)
#創(chuàng)建新csv文件
df.to_csv('split_data.csv')

合并不同的數(shù)據(jù)集

假設(shè)您有一個帳戶列表和與其關(guān)聯(lián)的訂單,并希望查看訂單歷史以及關(guān)聯(lián)的帳戶詳細信息。一個很好的方法就是通過合并數(shù)據(jù)到一個CSV文件。

import pandas as pd
#獲取文件名并定義用戶輸入
left_filename = input('LEFT filename: ')
right_filename = input('RIGHT filename: ')
join_type = input('join type (outer, inner, left, right): ')
join_column_name = input('column name(i.e. Account_ID): ')
#讀取文件到dataframes
df_left = pd.read_csv(left_filename)
df_right = pd.read_csv(right_filename)
#加入dataframes
joined_data = pd.merge(left = df_left, right = df_right, how = join_type, on = join_column_name)
#創(chuàng)建新的csv文件
joined_data.to_csv('joined_data.csv')

最后

這些腳本可以有效幫助我們進行自動化清理數(shù)據(jù),然后可以將清理后的數(shù)據(jù)加載到機器學習模型中進行處理。Pandas是操作數(shù)據(jù)的首選庫,因為它提供了許多的選項。

以上就是五個簡單有效的Python清理數(shù)據(jù)腳本分享的詳細內(nèi)容,更多關(guān)于Python清理數(shù)據(jù)的資料請關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • Matplotlib繪圖基礎(chǔ)之配置參數(shù)詳解

    Matplotlib繪圖基礎(chǔ)之配置參數(shù)詳解

    Matplotlib?提供了大量配置參數(shù),這些參數(shù)可以但不限于讓我們從整體上調(diào)整通過?Matplotlib?繪制的圖形樣式,下面我們就來看看如何巧妙的運用這些參數(shù)吧
    2023-08-08
  • Python實現(xiàn)目錄自動清洗

    Python實現(xiàn)目錄自動清洗

    這篇文章主要為大家詳細介紹了Python實現(xiàn)目錄自動清洗的相關(guān)知識,文中的示例代碼講解詳細,具有一定的借鑒價值,感興趣的小伙伴可以跟隨小編一起學習一下
    2023-11-11
  • Django配置kafka消息隊列的實現(xiàn)

    Django配置kafka消息隊列的實現(xiàn)

    本文主要介紹了Django配置kafka消息隊列的實現(xiàn),文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2023-05-05
  • Python入門教程(十一)Python中的運算符

    Python入門教程(十一)Python中的運算符

    這篇文章主要介紹了Python入門教程(十一)Python中的運算符,Python是一門非常強大好用的語言,也有著易上手的特性,本文為入門教程,需要的朋友可以參考下
    2023-04-04
  • Python數(shù)據(jù)分析中常見統(tǒng)計方法詳解

    Python數(shù)據(jù)分析中常見統(tǒng)計方法詳解

    數(shù)據(jù)分析是現(xiàn)代社會中不可或缺的一部分,通過對數(shù)據(jù)的統(tǒng)計和分析,我們可以得出有用的信息和見解,本文將介紹在?Python?中常見的數(shù)據(jù)統(tǒng)計方法,希望對大家有所幫助
    2024-02-02
  • 詳解tensorflow實現(xiàn)遷移學習實例

    詳解tensorflow實現(xiàn)遷移學習實例

    本篇文章主要介紹了詳解tensorflow實現(xiàn)遷移學習實例,小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2018-02-02
  • tkinter動態(tài)顯示時間的兩種實現(xiàn)方法

    tkinter動態(tài)顯示時間的兩種實現(xiàn)方法

    這篇文章主要介紹了tkinter動態(tài)顯示時間的兩種實現(xiàn)方法,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2023-01-01
  • Python中的復制操作及copy模塊中的淺拷貝與深拷貝方法

    Python中的復制操作及copy模塊中的淺拷貝與深拷貝方法

    淺拷貝和深拷貝是Python基礎(chǔ)學習中必須辨析的知識點,這里我們將為大家解析Python中的復制操作及copy模塊中的淺拷貝與深拷貝方法:
    2016-07-07
  • 詳解python并發(fā)獲取snmp信息及性能測試

    詳解python并發(fā)獲取snmp信息及性能測試

    本篇文章主要介紹了詳解python并發(fā)獲取snmp信息及性能測試,小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2017-03-03
  • python使用lxml xpath模塊解析XML遇到的坑及解決

    python使用lxml xpath模塊解析XML遇到的坑及解決

    這篇文章主要介紹了python使用lxml xpath模塊解析XML遇到的坑及解決,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2024-05-05

最新評論

二手房| 汉阴县| 洱源县| 鄂尔多斯市| 宜良县| 来凤县| 桂平市| 定州市| 灵武市| 柳林县| 达拉特旗| 肥城市| 墨玉县| 满城县| 喀什市| 百色市| 南平市| 贡山| 名山县| 隆子县| 荔波县| 昭觉县| 康马县| 绥化市| 阿尔山市| 成都市| 临武县| 仁化县| 九江市| 惠水县| 星座| 堆龙德庆县| 京山县| 丽江市| 招远市| 唐海县| 察哈| 陕西省| 津南区| 长治市| 台南市|