最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python獲取txt文件詞向量過程詳解

 更新時間:2019年07月05日 15:31:13   作者:Zhen大蝦  
這篇文章主要介紹了python獲取txt文件詞向量過程詳解,如何讀取完整的大文件,而不會出現(xiàn)內(nèi)存不足memery error等問題,將讀取出來的文件,保存為npy文件,根據(jù)詞找到對應的向量,需要的朋友可以參考下

在讀取https://github.com/Embedding/Chinese-Word-Vectors中的中文詞向量時,選擇了一個有3G多的txt文件,之前在做詞向量時用的是word2vec,所以直接導入模型然后indexword即可。

因為這是一個txt大文件,嘗試了DataFrame,np.loadtxt等,都沒有成功,其中主要遇到的問題是:

  • 如何讀取完整的大文件,而不會出現(xiàn)內(nèi)存不足memery error等問題
  • 將讀取出來的文件,保存為npy文件
  • 根據(jù)詞找到對應的向量

解決辦法

嘗試使用的代碼:

代碼1:
try:
lines=np.loadtxt(filepath)
catch:
感覺這塊不會寫了咦,,,
  print(ValueError)
但這樣的話,它就不會繼續(xù)循環(huán)去讀上邊的txt了呢
代碼2:
lines=[]
with open(filepath) as f:
  for line in f:
    lines.append(line)
np.save(filepath,lines)
代碼3
 
def readEmbedFile(embedFile):
#   embedId = {}
#   input = open(embedFile,'r',encoding="utf-8")
#   lines = []
#   a=0
#   for line in input:
#     lines.append(line)
#     a=a+1
#     print(a)
#   nwords = len(lines) - 1
#   splits = lines[1].strip().split(' ') # 因為第一行是統(tǒng)計信息,所以用第二行
#   dim = len(splits) - 1
#   embeddings=[]
#   # embeddings = [[0 for col in range(dim)] for row in range(nwords)]
#   b=0
#   for lineId in range(len(lines)):
#     b=b+1
#     print(b)
#     splits = lines[lineId].split(' ')
#     if len(splits) > 2:
#       # embedId賦值
#       embedId[splits[0]] = lineId
#       # embeddings賦值
#       emb = [float(splits[i]) for i in range(1, 300)]
#       embeddings.append(emb)
#   return embedId, embeddings
代碼4:
def load_txt(filename):
  lines=[]
  vec_dict={}
  with open(filename,r) as f:
    for line in f:
    list=line.strip()
    lines.append(line)
  for i, line in emuate(lines):
    if i=0:
      continue
    line=line.split(" ")
    wordID=line[0]
    wordvec=[float line[i] for i in range(1,300)]
  vec_dict[wordId]=np.array(wordvec)  
 
  return vec_dict

具體內(nèi)存不足主要的原因是:

我的虛擬機中確實內(nèi)存不太夠,后來使用實驗室32G的主機后,可以得到idvec,而得不到向量的,報的錯還是memory error.
另一個原因,是需要把詞向量轉(zhuǎn)換為float形式,在python中str 占的內(nèi)存>float類型,如代碼所示:

print("str",sys.getsizeof(""))
print("float",sys.getsizeof(1.1))
print("int",sys.getsizeof(1))
print("list",sys.getsizeof([]))
print("tuple",sys.getsizeof(()))
print("dic",sys.getsizeof([]))
str 49
float 24
int 28
list 64
tuple 48
dic 64

在我的電腦,64位操作系統(tǒng),64位的python, 所占內(nèi)存大小排序為:

dic=list>str>tuple>int>float

讀取時候可以用np.load().item就可以復原原來的字典,主要參照下述文件:

然后通過python的字典操作就可以遍歷得到每個詞的詞向量了,dic[vocab]

心得

距離完全解決項目的問題還有5~6的大關(guān)卡,但靜下心來,一步步地做總會突破的呀!

以上就是本文的全部內(nèi)容,希望對大家的學習有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

  • Python爬蟲之模擬知乎登錄的方法教程

    Python爬蟲之模擬知乎登錄的方法教程

    在爬蟲過程中,有些頁面在登錄之前是被禁止抓取的,這個時候就需要模擬登陸了,下面這篇文章主要給大家介紹了利用Python爬蟲模擬知乎登錄的方法教程,文中介紹的非常詳細,需要的朋友可以參考借鑒,下面來一起看看吧。
    2017-05-05
  • Pytorch之卷積層的使用詳解

    Pytorch之卷積層的使用詳解

    今天小編就為大家分享一篇Pytorch之卷積層的使用詳解,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-12-12
  • Python變量的作用域詳解

    Python變量的作用域詳解

    這篇文章主要為大家介紹了Python變量的作用域,具有一定的參考價值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助
    2021-12-12
  • 使用 Python 清理收藏夾里已失效的網(wǎng)站

    使用 Python 清理收藏夾里已失效的網(wǎng)站

    這篇文章主要介紹了用 Python 清理收藏夾里已失效的網(wǎng)站,本文通過截圖實例代碼的形式給大家介紹的非常詳細,具有一定的參考借鑒價值,需要的朋友可以參考下
    2019-12-12
  • python 將Excel轉(zhuǎn)Word的示例

    python 將Excel轉(zhuǎn)Word的示例

    這篇文章主要介紹了python 將Excel轉(zhuǎn)Word的示例,幫助大家更好的理解和學習使用python,感興趣的朋友可以了解下
    2021-03-03
  • 解決python tkinter界面卡死的問題

    解決python tkinter界面卡死的問題

    今天小編就為大家分享一篇解決python tkinter界面卡死的問題,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-07-07
  • python使用openpyxl讀取合并單元格的值

    python使用openpyxl讀取合并單元格的值

    本文主要介紹了python使用openpyxl讀取合并單元格的值,文中通過示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2021-07-07
  • Python?Prometheus接口揭秘數(shù)據(jù)科學新技巧

    Python?Prometheus接口揭秘數(shù)據(jù)科學新技巧

    本篇文章將分享Prometheus?API的基本概念到PromQL查詢語言的應用,再到如何通過Python與Prometheus?API進行無縫交互,通過豐富的示例代碼和詳細的講解,將解鎖使用Python進行實時監(jiān)控的奇妙世界,為讀者打開更廣闊的數(shù)據(jù)分析視野
    2024-01-01
  • Flask實現(xiàn)異步執(zhí)行任務

    Flask實現(xiàn)異步執(zhí)行任務

    在一些開發(fā)中,可能會遇到需要長時間處理的任務,此時就需要使用異步的方式來實現(xiàn),本文就介紹了Flask實現(xiàn)異步執(zhí)行任務的方法,感興趣的可以了解一下
    2021-05-05
  • Windows11使用Cpython?編譯文件報錯?error:?Unable?to?find?vcvarsall.bat?完美解決方法

    Windows11使用Cpython?編譯文件報錯?error:?Unable?to?find?vcvars

    這篇文章主要介紹了Windows11使用Cpython編譯文件報錯error:Unable?to find?vcvarsall.bat完美解決方法,本文通過圖文并茂的形式給大家介紹的非常詳細,對大家的學習或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2023-05-05

最新評論

旌德县| 汪清县| 江都市| 建德市| 蒙城县| 石阡县| 清水河县| 文安县| 江都市| 上犹县| 仁化县| 揭西县| 凤庆县| 曲水县| 九龙县| 新丰县| 金华市| 五常市| 边坝县| 同德县| 德化县| 黄浦区| 武宁县| 青冈县| 桃园市| 麻栗坡县| 贵定县| 浠水县| 北票市| 盐池县| 中江县| 延津县| 呼和浩特市| 西宁市| 宝兴县| 桐柏县| 文化| 石棉县| 苗栗县| 铁力市| 武山县|