最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

如何將一個(gè)CSV格式的文件分割成兩個(gè)CSV文件

 更新時(shí)間:2022年07月31日 14:13:16   作者:酷酷的橙007  
這篇文章主要介紹了如何將一個(gè)CSV格式的文件分割成兩個(gè)CSV文件,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教

將一個(gè)CSV格式的文件分割成兩個(gè)CSV文件

本項(xiàng)目可以按照比例將一個(gè)csv文件分割成兩個(gè)csv文件,效果是:在C:\algo_file文件夾下,將該文件夾下的data.csv文件分成train.csv和vali.csv

完整代碼:

定義split_csv函數(shù)

import csv
import os
def split_csv(path, total_len, per):
    # 如果train.csv和vali.csv存在就刪除
    if os.path.exists('C:\\algo_file\\train.csv'):
        os.remove('C:\\algo_file\\train.csv')
    if os.path.exists('C:\\algo_file\\vali.csv'):
        os.remove('C:\\algo_file\\vali.csv')
    with open(path, 'r', newline='') as file:
        csvreader = csv.reader(file)
        i = 0
        for row in csvreader:
            if i < round(total_len * per/100):
                # train.csv存放路徑
                csv_path = os.path.join("C:\\algo_file", 'train.csv')
                print(csv_path)
                # 不存在此文件的時(shí)候,就創(chuàng)建
                if not os.path.exists(csv_path):
                    with open(csv_path, 'w', newline='') as file:
                        csvwriter = csv.writer(file)
                        csvwriter.writerow(row)
                    i += 1
                # 存在的時(shí)候就往里面添加
                else:
                    with open(csv_path, 'a', newline='') as file:
                        csvwriter = csv.writer(file)
                        csvwriter.writerow(row)
                    i += 1
            elif (i >= round(total_len * per/100)) and (i < total_len):
            	# vali.csv存放路徑
                csv_path = os.path.join("C:\\algo_file", 'vali.csv')
                print(csv_path)
                # 不存在此文件的時(shí)候,就創(chuàng)建
                if not os.path.exists(csv_path):
                    with open(csv_path, 'w', newline='') as file:
                        csvwriter = csv.writer(file)
                        csvwriter.writerow(row)
                    i += 1
                # 存在的時(shí)候就往里面添加
                else:
                    with open(csv_path, 'a', newline='') as file:
                        csvwriter = csv.writer(file)
                        csvwriter.writerow(row)
                    i += 1
            else:
                break
    print("訓(xùn)練集和驗(yàn)證集分離成功")
    return

調(diào)用上述函數(shù)

if __name__ == '__main__':
? ? path = 'C:\\algo_file\\data.csv'
? ? total_len = len(open(path, 'r').readlines())# csv文件行數(shù)
? ? per = 80 # 分割比例%
? ? split_csv(path, total_len, per)

按照訓(xùn)練集占80%(驗(yàn)證集20%)比例,對(duì)C:\algo_file文件夾下的data.csv進(jìn)行分割,在該文件下得到train.csv 和 vali.csv。

最后

本項(xiàng)目只是以C:\algo_file文件夾為例,實(shí)際上data.csv所在路徑,train.csv所在路徑,vali.csv所在路徑包括文件名都可以更改。 

將CSV文件以某列為條件分類切割

項(xiàng)目中有一個(gè)數(shù)據(jù)文件數(shù)量龐大,一個(gè)文件中按照年月日分成幾十萬條數(shù)據(jù),想試試能不能用python把它簡(jiǎn)單切割一下,按照日期分類切成小的csv文件。

于是在網(wǎng)上找了很多資料,結(jié)合自己的一些修改,整理了一下,方便以后再用。

大概步驟

1、讀取文件

2、找出需要分類的列

3、將此列中重復(fù)的內(nèi)容刪除,每類剩余一條

4、把該列所有符合某一類的內(nèi)容存入一個(gè)csv文件中

上代碼 

import pandas as pd
# 讀取文件數(shù)據(jù)
df=pd.read_csv('D:\\接收的文件\\lqf.csv', sep=',',engine='python',header=[0])
# 列csv文件中所有列
df.columns = ['year', 'date', 'statefips', 'countyfips', 'ctfips', 'latitude', 'longitude', 'DS_PM_pred', 'DS_PM_stdd']
#  刪除date列中的重復(fù)項(xiàng),也就是說剩下的date都是已經(jīng)分好的類別
date_cate = df.drop_duplicates(subset=['date'])
print(date_cate.date)
print(range(len(date_cate)))    # date中的所有類,也就是文件數(shù)
for name in date_cate.date:
    print(name)
    # 當(dāng)date為某一個(gè)類時(shí),存入一個(gè)小的csv文件中,文件名為類名
    df[df.date == name].to_csv("D:\\接收的文件\\data\\"+u"%s" %name+".csv") 

header=[0] #代表第一行為表頭不計(jì)入其中,可根據(jù)表格修改。

?。。。。。。?)?。。。。?!遍歷文件夾中所有的文件然后進(jìn)行切割,沒啥用,自己做個(gè)存檔而已 ↓↓↓↓↓ 

import pandas as pd
import os
j = 347
for info in os.listdir('D:\\接收的文件\year_02'):
    domain = os.path.abspath(r'D:\\接收的文件\year_02') # 獲取文件夾的路徑
    info = os.path.join(domain, info) # 將路徑與文件名結(jié)合起來就是每個(gè)文件的完整路徑
    # 讀取文件數(shù)據(jù)
    df = pd.read_csv(info, sep=',', engine='python', header=[0])
    # 列csv文件中所有列
    df.columns = ['year', 'date', 'statefips', 'countyfips', 'ctfips', 'latitude', 'longitude', 'DS_PM_pred', 'DS_PM_stdd']
    grouped = df.groupby('date')
    # delete duplicated data
    ind_frame = df.drop_duplicates(subset=['date'])
    # print(ind_frame.date)
    # print(range(len(ind_frame)))
    for name in ind_frame.date:
        # print(name)
        j += 1
        print("已經(jīng)掃描到第" + '{}'.format(j)+'個(gè)文件')
        df[df.date == name].to_csv("D:\\接收的文件\\data2\\" + u"%s" %name+".csv")

以上為個(gè)人經(jīng)驗(yàn),希望能給大家一個(gè)參考,也希望大家多多支持腳本之家。

相關(guān)文章

  • 在Django中Pyecharts生成圖表實(shí)現(xiàn)

    在Django中Pyecharts生成圖表實(shí)現(xiàn)

    pyecharts是支持python的一種可視化,那么在Django中Pyecharts如何生成圖表,主要有兩種方法,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2021-05-05
  • python實(shí)現(xiàn)保存網(wǎng)頁到本地示例

    python實(shí)現(xiàn)保存網(wǎng)頁到本地示例

    這篇文章主要介紹了python實(shí)現(xiàn)保存網(wǎng)頁到本地示例,需要的朋友可以參考下
    2014-03-03
  • Python鍵盤輸入轉(zhuǎn)換為列表的實(shí)例

    Python鍵盤輸入轉(zhuǎn)換為列表的實(shí)例

    今天小編就為大家分享一篇Python鍵盤輸入轉(zhuǎn)換為列表的實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2018-06-06
  • 用python處理圖片實(shí)現(xiàn)圖像中的像素訪問

    用python處理圖片實(shí)現(xiàn)圖像中的像素訪問

    本篇文章主要介紹了用python處理圖片實(shí)現(xiàn)圖像中的像素訪問,小編覺得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過來看看吧
    2018-05-05
  • Python遠(yuǎn)程linux執(zhí)行命令實(shí)現(xiàn)

    Python遠(yuǎn)程linux執(zhí)行命令實(shí)現(xiàn)

    這篇文章主要介紹了Python遠(yuǎn)程linux執(zhí)行命令實(shí)現(xiàn),文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2020-11-11
  • Python圖像處理之二值化處理

    Python圖像處理之二值化處理

    所謂”二值化處理“就是將矩陣中每個(gè)點(diǎn)的RGB值(0,0,0)[黑色]或者(255,255,255)[白色],這篇文章主要介紹了Python圖像處理之二值化處理,需要的朋友可以參考下
    2024-05-05
  • Flask路由尾部有沒有斜杠有什么區(qū)別

    Flask路由尾部有沒有斜杠有什么區(qū)別

    這篇文章主要介紹了Flask路由尾部加不加斜杠有什么區(qū)別,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2022-09-09
  • 對(duì)python中if語句的真假判斷實(shí)例詳解

    對(duì)python中if語句的真假判斷實(shí)例詳解

    今天小編就為大家分享一篇對(duì)python中if語句的真假判斷實(shí)例詳解,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2019-02-02
  • selenium+python 去除啟動(dòng)的黑色cmd窗口方法

    selenium+python 去除啟動(dòng)的黑色cmd窗口方法

    今天小編就為大家分享一篇selenium+python 去除啟動(dòng)的黑色cmd窗口方法。具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2018-05-05
  • yolov5使用flask部署至前端實(shí)現(xiàn)照片\視頻識(shí)別功能

    yolov5使用flask部署至前端實(shí)現(xiàn)照片\視頻識(shí)別功能

    初學(xué)者在使用YOLO和Flask構(gòu)建應(yīng)用時(shí),往往需要實(shí)現(xiàn)上傳圖片和視頻的識(shí)別功能,本文介紹了如何在Flask框架中實(shí)現(xiàn)這一功能,包括文件上傳、圖片放大查看、視頻識(shí)別以及識(shí)別后的文件下載,文中通過代碼介紹的非常詳細(xì),需要的朋友可以參考下
    2024-09-09

最新評(píng)論

花莲县| 视频| 勃利县| 宽甸| 贵州省| 客服| 宜昌市| 临猗县| 晋中市| 出国| 桃源县| 阿尔山市| 麟游县| 西乌珠穆沁旗| 长海县| 泗洪县| 安阳县| 九寨沟县| 银川市| 秀山| 金阳县| 旺苍县| 武夷山市| 城固县| 东阿县| 乌拉特中旗| 黔江区| 荔波县| 东乌珠穆沁旗| 西盟| 冷水江市| 广汉市| 龙川县| 晋州市| 栾川县| 宕昌县| 商城县| 大名县| 溧阳市| 汉川市| 城口县|