最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

AMP?Tensor?Cores節(jié)省內存PyTorch模型詳解

 更新時間:2022年10月24日 11:14:58   作者:ronghuaiyang  
這篇文章主要為大家介紹了AMP?Tensor?Cores節(jié)省內存PyTorch模型詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪

導讀

只需要添加幾行代碼,就可以得到更快速,更省顯存的PyTorch模型。

你知道嗎,在1986年Geoffrey Hinton就在Nature論文中給出了反向傳播算法?

此外,卷積網(wǎng)絡最早是由Yann le cun在1998年提出的,用于數(shù)字分類,他使用了一個卷積層。但是直到2012年晚些時候,Alexnet才通過使用多個卷積層來實現(xiàn)最先進的imagenet。

那么,是什么讓他們現(xiàn)在如此出名,而不是之前呢?

只有在我們擁有大量計算資源的情況下,我們才能夠在最近的過去試驗和充分利用深度學習的潛力。

但是,我們是否已經足夠好地使用了我們的計算資源呢?我們能做得更好嗎?

這篇文章的主要內容是關于如何利用Tensor Cores和自動混合精度更快地訓練深度學習網(wǎng)絡。

什么是Tensor Cores?

根據(jù)NVIDIA的網(wǎng)站:

NVIDIA Turing和Volta GPUs都是由Tensor Cores驅動的,這是一項突破性的技術,提供了突破性的AI性能。Tensor Cores可以加速AI核心的大矩陣運算,在一次運算中就可以完成混合精度的矩陣乘法和累加運算。在一個NVIDIA GPU上有數(shù)百個Tensor Cores并行運行,這大大提高了吞吐量和效率。

簡單地說,它們是專門的cores,非常適合特定類型的矩陣操作。

我們可以將兩個FP16矩陣相乘,并將其添加到一個FP16/FP32矩陣中,從而得到一個FP16/FP32矩陣。Tensor cores支持混合精度數(shù)學,即以半精度(FP16)進行輸入,以全精度(FP32)進行輸出。上述類型的操作對許多深度學習任務具有內在價值,而Tensor cores為這種操作提供了專門的硬件。

現(xiàn)在,使用FP16和FP32主要有兩個好處。

  • FP16需要更少的內存,因此更容易訓練和部署大型神經網(wǎng)絡。它還只需要較少的數(shù)據(jù)移動。
  • 數(shù)學運算在降低精度的Tensor cores運行得更快。NVIDIA給出的Volta GPU的確切數(shù)字是:FP16的125 TFlops vs FP32的15.7 TFlops(8倍加速)。

但也有缺點。當我們從FP32轉到FP16時,我們需要降低精度。

FP32 vs FP16: FP32 有8個指數(shù)位和23個分數(shù)位,而FP16有5個指數(shù)位和10個分數(shù)位。

但是FP32真的有必要嗎?

實際上,F(xiàn)P16可以很好地表示大多數(shù)權重和梯度。所以存儲和使用FP32是很浪費的。

那么,我們如何使用Tensor Cores?

我檢查了一下我的Titan RTX GPU有576個tensor cores和4608個NVIDIA CUDA核心。但是我如何使用這些tensor cores呢?

坦白地說,NVIDIA用幾行代碼就能提供自動混合精度,因此使用tensor cores很簡單。我們需要在代碼中做兩件事:

  • 需要用到FP32的運算比如Softmax之類的就分配用FP32,而Conv之類的操作可以用FP16的則被自動分配用FP16。

  • 使用損失縮放 為了保留小的梯度值。梯度值可能落在FP16的范圍之外。在這種情況下,梯度值被縮放,使它們落在FP16范圍內。

如果你還不了解背景細節(jié)也沒關系,代碼實現(xiàn)相對簡單。

使用PyTorch進行混合精度訓練:

讓我們從PyTorch中的一個基本網(wǎng)絡開始。

N, D_in, D_out = 64, 1024, 512
x = torch.randn(N, D_in, device="cuda")
y = torch.randn(N, D_out, device="cuda")
model = torch.nn.Linear(D_in, D_out).cuda()
optimizer = torch.optim.SGD(model.parameters(), lr=1e-3)
for to in range(500):
   y_pred = model(x)
   loss = torch.nn.functional.mse_loss(y_pred, y)
   optimizer.zero_grad()
   loss.backward()
   optimizer.step()

為了充分利用自動混合精度訓練的優(yōu)勢,我們首先需要安裝apex庫。只需在終端中運行以下命令。

$ git clone https://github.com/NVIDIA/apex
$ cd apex
$ pip install -v --no-cache-dir --global-option="--cpp_ext" --global-option="--cuda_ext" ./

然后,我們只需向神經網(wǎng)絡代碼中添加幾行代碼,就可以利用自動混合精度(AMP)。

from apex import amp
N, D_in, D_out = 64, 1024, 512
x = torch.randn(N, D_in, device="cuda")
y = torch.randn(N, D_out, device="cuda")
model = torch.nn.Linear(D_in, D_out).cuda()
optimizer = torch.optim.SGD(model.parameters(), lr=1e-3)
model, optimizer = amp.initialize(model, optimizer, opt_level="O1")
for to in range(500):
   y_pred = model(x)
   loss = torch.nn.functional.mse_loss(y_pred, y)
   optimizer.zero_grad()
   with amp.scale_loss(loss, optimizer) as scaled_loss:
      scaled_loss.backward()
   optimizer.step()

在這里你可以看到我們用amp.initialize初始化了我們的模型。我們還使用amp.scale_loss來指定損失縮放。

基準測試

git clone https://github.com/MLWhiz/data_science_blogs
cd data_science_blogs/amp/pytorch-apex-experiment/
python run_benchmark.py
python make_plot.py --GPU 'RTX' --method 'FP32' 'FP16' 'amp' --batch 128 256 512 1024 2048

這會在home目錄中生成下面的圖:

在這里,我使用不同的精度和批大小設置訓練了同一個模型的多個實例。我們可以看到,從FP32到amp,內存需求減少,而精度保持大致相同。時間也會減少,但不會減少那么多。這可能是由于數(shù)據(jù)集或模型太簡單。

根據(jù)NVIDIA給出的基準測試,AMP比標準的FP32快3倍左右,如下圖所示。

在單精度和自動混合精度兩種精度下,加速比為固定周期訓練的時間比。

以上就是AMP Tensor Cores節(jié)省內存PyTorch模型詳解的詳細內容,更多關于AMP Tensor Cores 內存模型PyTorch的資料請關注腳本之家其它相關文章!

相關文章

  • Python 使用SMTP發(fā)送郵件的代碼小結

    Python 使用SMTP發(fā)送郵件的代碼小結

    python的smtplib提供了一種很方便的途徑發(fā)送電子郵件。它對smtp協(xié)議進行了簡單的封裝,需要的朋友可以參考下
    2016-09-09
  • Python創(chuàng)建對稱矩陣的方法示例【基于numpy模塊】

    Python創(chuàng)建對稱矩陣的方法示例【基于numpy模塊】

    這篇文章主要介紹了Python創(chuàng)建對稱矩陣的方法,結合實例形式分析了Python基于numpy模塊實現(xiàn)矩陣運算的相關操作技巧,需要的朋友可以參考下
    2017-10-10
  • 詳解基于django實現(xiàn)的webssh簡單例子

    詳解基于django實現(xiàn)的webssh簡單例子

    這篇文章主要介紹了基于 django 實現(xiàn)的 webssh 簡單例子,小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2018-07-07
  • tensorflow使用指定gpu的方法

    tensorflow使用指定gpu的方法

    TensorFlow是一個基于數(shù)據(jù)流編程(dataflow programming)的符號數(shù)學系統(tǒng),被廣泛應用于各類機器學習,這篇文章主要介紹了tensorflow使用指定gpu的方法,需要的朋友可以參考下
    2020-02-02
  • 在Python下嘗試多線程編程

    在Python下嘗試多線程編程

    這篇文章主要介紹了在Python下多線程編程的嘗試,由于GIL的存在,多線程在Python開發(fā)領域一直是個熱門問題,需要的朋友可以參考下
    2015-04-04
  • python 切片和range()用法說明

    python 切片和range()用法說明

    首先需要明白,可迭代對象,按照正數(shù)索引(正序)是從0開始的,按照負數(shù)索引(逆序)是從-1開始的
    2013-03-03
  • 總結用Pdb庫調試Python的方式及常用的命令

    總結用Pdb庫調試Python的方式及常用的命令

    大家都知道Python是自帶Pdb庫,使用Pdb調試Python程序還是很方便的。但是遠程調試、多線程,Pdb是搞不定的,下面一起來看看用Pdb庫調試Python的方式及常用的命令。
    2016-08-08
  • 500行python代碼實現(xiàn)飛機大戰(zhàn)

    500行python代碼實現(xiàn)飛機大戰(zhàn)

    這篇文章主要為大家詳細介紹了500行python代碼實現(xiàn)飛機大戰(zhàn),文中示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2020-04-04
  • Python使用pylab庫實現(xiàn)畫線功能的方法詳解

    Python使用pylab庫實現(xiàn)畫線功能的方法詳解

    這篇文章主要介紹了Python使用pylab庫實現(xiàn)畫線功能的方法,結合具體實例分析了Python使用pylab庫的相關函數(shù)實現(xiàn)畫線功能的操作技巧,并附帶說明了相關函數(shù)與參數(shù)功能,需要的朋友可以參考下
    2017-06-06
  • Python3實現(xiàn)從指定路徑查找文件的方法

    Python3實現(xiàn)從指定路徑查找文件的方法

    這篇文章主要介紹了Python3實現(xiàn)從指定路徑查找文件的方法,涉及Python目錄與文件的相關操作技巧,需要的朋友可以參考下
    2015-05-05

最新評論

绥德县| 开封市| 西乌珠穆沁旗| 黄冈市| 澳门| 韶山市| 囊谦县| 黄石市| 古交市| 沙洋县| 监利县| 贞丰县| 莒南县| 曲沃县| 乳山市| 交口县| 招远市| 阿克苏市| 小金县| 嘉祥县| 阳朔县| 吉林省| 安宁市| 云霄县| 田东县| 岗巴县| 灌阳县| 宁明县| 冷水江市| 神木县| 神木县| 三台县| 商洛市| 那坡县| 凉城县| 错那县| 蓬安县| 嘉鱼县| 南和县| 元朗区| 普洱|