python如何將數(shù)據(jù)集按比例隨機(jī)切分
python將數(shù)據(jù)集按比例隨機(jī)切分
# -*- coding: utf-8 -*-
"""
將數(shù)據(jù)按比例切分
"""
from sklearn import model_selection
c = []
j = 0
#filename = r'E:\NER\CCKS2020\Data\ccks2020_2_task1_train\task1_train.txt'
filename = open(r'task1_train.txt','r',encoding='utf-8')
out_train = open(r'train.txt', 'w',encoding='utf-8')
out_test = open(r'temp.txt', 'w',encoding='utf-8')
for line in filename:
# items = line.strip().split()
c.append(line)
c_train, c_test = model_selection.train_test_split(c, test_size=0.2)
for i in c_train:
out_train.write(i)
for i in c_test:
out_test.write(i)sklearn數(shù)據(jù)集隨機(jī)切分(train_test_split)
sklearn學(xué)習(xí)
給定數(shù)據(jù)集X和類(lèi)別標(biāo)簽y,將數(shù)據(jù)集按一定比例隨機(jī)切分為訓(xùn)練集和測(cè)試集。
代碼
#!/usr/bin/env python
# -*- coding: utf-8 -*-
"""
功能:數(shù)據(jù)集按比例切分為訓(xùn)練集和測(cè)試集
時(shí)間:2017年3月11日 12:48:57
"""
# from sklearn.cross_validation import train_test_split
from sklearn.model_selection import train_test_split # 更新
# 生成200個(gè)句子,前100個(gè)和后100個(gè)類(lèi)別分別對(duì)應(yīng)1和2
X = [[u"這是", u"第1個(gè)", u"測(cè)試"]] * 100 + [[u"這是", u"第2個(gè)", u"測(cè)試"]] * 100
y = [1] * 100 + [2] * 100
# 隨機(jī)抽取20%的測(cè)試集
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)
print len(X_train), len(X_test)
# 查看句子和標(biāo)簽是否仍然對(duì)應(yīng)
for i in range(len(X_test)):
print "".join(X_test[i]), y_test[i]
if __name__ == "__main__":
pass實(shí)驗(yàn)結(jié)果
切分后的訓(xùn)練集和測(cè)試集標(biāo)簽仍然一一對(duì)應(yīng)。

更新
由于sklearn更新,代碼應(yīng)改為:
from sklearn.model_selection import train_test_split
總結(jié)
以上為個(gè)人經(jīng)驗(yàn),希望能給大家一個(gè)參考,也希望大家多多支持腳本之家。
相關(guān)文章
Python?OpenCV超詳細(xì)講解讀取圖像視頻和網(wǎng)絡(luò)攝像頭
OpenCV用C++語(yǔ)言編寫(xiě),它具有C?++,Python,Java和MATLAB接口,并支持Windows,Linux,Android和Mac?OS,OpenCV主要傾向于實(shí)時(shí)視覺(jué)應(yīng)用,并在可用時(shí)利用MMX和SSE指令,本篇文章帶你了解OpenCV讀取圖像視頻與網(wǎng)絡(luò)攝像頭的方法2022-04-04
python刪除列表元素的三種方法(remove,pop,del)
這篇文章主要介紹了python刪除列表元素的三種方法(remove,pop,del),文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2019-07-07
anaconda jupyter不能導(dǎo)入安裝的lightgbm解決方案
這篇文章主要介紹了anaconda jupyter不能導(dǎo)入安裝的lightgbm解決方案,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2021-03-03
python ctypes庫(kù)2_指定參數(shù)類(lèi)型和返回類(lèi)型詳解
今天小編就為大家分享一篇python ctypes庫(kù)2_指定參數(shù)類(lèi)型和返回類(lèi)型詳解,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2019-11-11
控制Python浮點(diǎn)數(shù)輸出位數(shù)的操作方法
在python的輸出結(jié)果中,尤其是浮點(diǎn)數(shù)的輸出,當(dāng)我們需要寫(xiě)入文本文件時(shí),最好是采用統(tǒng)一的輸出格式,這樣也能夠增強(qiáng)結(jié)果的可讀性,這篇文章主要介紹了控制Python浮點(diǎn)數(shù)輸出位數(shù)的方法,需要的朋友可以參考下2022-04-04
python接口自動(dòng)化之使用token傳入到header消息頭中
這篇文章主要介紹了python接口自動(dòng)化之使用token傳入到header消息頭中問(wèn)題,具有很好的參考價(jià)值,希望對(duì)大家有所幫助,如有錯(cuò)誤或未考慮完全的地方,望不吝賜教2023-08-08
Python爬蟲(chóng) 批量爬取下載抖音視頻代碼實(shí)例
這篇文章主要介紹了Python爬蟲(chóng) 批量爬取下載抖音視頻代碼實(shí)例,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2019-08-08
使用Python的Twisted框架構(gòu)建非阻塞下載程序的實(shí)例教程
Twisted的異步工作模式使其在非阻塞情況下可以擁有較高的性能,這里我們來(lái)看一下使用Python的Twisted框架構(gòu)建非阻塞下載程序的實(shí)例教程,包括服務(wù)器端與客戶端的實(shí)踐.2016-05-05

