最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python讀取mnist數(shù)據(jù)集方法案例詳解

 更新時間:2021年09月03日 14:45:30   作者:Luna2137  
這篇文章主要介紹了python讀取mnist數(shù)據(jù)集方法案例詳解,本篇文章通過簡要的案例,講解了該項技術(shù)的了解與使用,以下就是詳細內(nèi)容,需要的朋友可以參考下

mnist手寫數(shù)字數(shù)據(jù)集在機器學(xué)習(xí)中非常常見,這里記錄一下用python從本地讀取mnist數(shù)據(jù)集的方法。

數(shù)據(jù)集格式介紹

這部分內(nèi)容網(wǎng)絡(luò)上很常見,這里還是簡明介紹一下。網(wǎng)絡(luò)上下載的mnist數(shù)據(jù)集包含4個文件:

在這里插入圖片描述

前兩個分別是測試集的image和label,包含10000個樣本。后兩個是訓(xùn)練集的,包含60000個樣本。.gz表示這個一個壓縮包,如果進行解壓的話,會得到.ubyte格式的二進制文件。

在這里插入圖片描述

上圖是訓(xùn)練集的label和image數(shù)據(jù)的存儲格式。兩個文件最開始都有magic number和number of images/items兩個數(shù)據(jù),有用的是第二個,表示文件中存儲的樣本個數(shù)。另外要注意的是數(shù)據(jù)的位數(shù),有32位整型和8位整型兩種。

讀取方法

.gz格式的文件讀取

需要import gzip
讀取訓(xùn)練集的代碼如下:

def load_mnist_train(path, kind='train'): 
'‘'
path:數(shù)據(jù)集的路徑
kind:值為train,代表讀取訓(xùn)練集
‘'‘   
    labels_path = os.path.join(path,'%s-labels-idx1-ubyte.gz'% kind)
    images_path = os.path.join(path,'%s-images-idx3-ubyte.gz'% kind)
    #使用gzip打開文件
    with gzip.open(labels_path, 'rb') as lbpath:
	    #使用struct.unpack方法讀取前兩個數(shù)據(jù),>代表高位在前,I代表32位整型。lbpath.read(8)表示一次從文件中讀取8個字節(jié)
	    #這樣讀到的前兩個數(shù)據(jù)分別是magic number和樣本個數(shù)
        magic, n = struct.unpack('>II',lbpath.read(8))
        #使用np.fromstring讀取剩下的數(shù)據(jù),lbpath.read()表示讀取所有的數(shù)據(jù)
        labels = np.fromstring(lbpath.read(),dtype=np.uint8)
    with gzip.open(images_path, 'rb') as imgpath:
        magic, num, rows, cols = struct.unpack('>IIII',imgpath.read(16))
        images = np.fromstring(imgpath.read(),dtype=np.uint8).reshape(len(labels), 784)
    return images, labels

讀取測試集的代碼類似。

非壓縮文件的讀取

如果在本地對四個文件解壓縮之后,得到的就是.ubyte格式的文件,這時讀取的代碼有所變化。

def load_mnist_train(path, kind='train'): 
'‘'
path:數(shù)據(jù)集的路徑
kind:值為train,代表讀取訓(xùn)練集
‘'‘   
    labels_path = os.path.join(path,'%s-labels-idx1-ubyte'% kind)
    images_path = os.path.join(path,'%s-images-idx3-ubyte'% kind)
    #不再用gzip打開文件
    with open(labels_path, 'rb') as lbpath:
	    #使用struct.unpack方法讀取前兩個數(shù)據(jù),>代表高位在前,I代表32位整型。lbpath.read(8)表示一次從文件中讀取8個字節(jié)
	    #這樣讀到的前兩個數(shù)據(jù)分別是magic number和樣本個數(shù)
        magic, n = struct.unpack('>II',lbpath.read(8))
        #使用np.fromfile讀取剩下的數(shù)據(jù)
        labels = np.fromfile(lbpath,dtype=np.uint8)
    with gzip.open(images_path, 'rb') as imgpath:
        magic, num, rows, cols = struct.unpack('>IIII',imgpath.read(16))
        images = np.fromfile(imgpath,dtype=np.uint8).reshape(len(labels), 784)
    return images, labels

讀取之后可以查看images和labels的長度,確認讀取是否正確。

到此這篇關(guān)于python讀取mnist數(shù)據(jù)集方法案例詳解的文章就介紹到這了,更多相關(guān)python讀取mnist數(shù)據(jù)集方法內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

最新評論

沙洋县| 罗山县| 乐亭县| 邮箱| 调兵山市| 五指山市| 台安县| 桐庐县| 金山区| 弥渡县| 宕昌县| 开鲁县| 绥芬河市| 花垣县| 教育| 敦煌市| 卓资县| 阿巴嘎旗| 竹山县| 清丰县| 宁陵县| 岳阳市| 阿拉善右旗| 民勤县| 岚皋县| 天镇县| 江安县| 思南县| 黄浦区| 武山县| 资中县| 疏勒县| 兰溪市| 镇平县| 宁安市| 石阡县| 门源| 太原市| 修水县| 嘉祥县| 安仁县|