最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python實(shí)現(xiàn)的爬取豆瓣電影信息功能案例

 更新時(shí)間:2019年09月15日 09:41:43   作者:爆炒小青蛙  
這篇文章主要介紹了Python實(shí)現(xiàn)的爬取豆瓣電影信息功能,結(jié)合具體實(shí)例形式分析了Python基于requests庫(kù)的爬蟲(chóng)使用技巧,需要的朋友可以參考下

本文實(shí)例講述了Python實(shí)現(xiàn)的爬取豆瓣電影信息功能。分享給大家供大家參考,具體如下:

本案例的任務(wù)為,爬取豆瓣電影top250的電影信息(包括序號(hào)、電影名稱(chēng)、導(dǎo)演和主演、評(píng)分以及經(jīng)典臺(tái)詞),并將信息作為字典形式保存進(jìn)txt文件。這里只用到requests庫(kù),沒(méi)有用到beautifulsoup庫(kù)

step1:首先獲取每一頁(yè)的源代碼,用requests.get函數(shù)獲取,為了防止請(qǐng)求錯(cuò)誤,使用try...except..

def getpage(url):
  try:
    res=requests.get(url)
    if res.status_code==200:
      return res.text
    return None
  except RequestException:
    return None

step2:做每一頁(yè)的網(wǎng)址解析,打開(kāi)原網(wǎng)址https://movie.douban.com/top250?,查看網(wǎng)頁(yè)源代碼,可以看到每一個(gè)電影的源代碼都是從<li>開(kāi)始,在</li>處結(jié)束,寫(xiě)好正則表達(dá)式以后爬到的列表的每一條item都有五個(gè)元素,因此將其寫(xiě)成字典的形式,這里用到y(tǒng)ield函數(shù)(關(guān)于yield函數(shù)的用法,廖老師的有一篇文章比較好懂https://www.ibm.com/developerworks/cn/opensource/os-cn-python-yield/)

對(duì)單個(gè)網(wǎng)頁(yè)的進(jìn)行解析的代碼如下:

def parsepage(html):
  pat=re.compile('<li>.*?<em class="">(.*?)</em>.*?<img width="100" alt="(.*?)" src=.*?<p class="">'
          +'(.*?)</p>.*?property="v:average">(.*?)</span>.*?<span class="inq">(.*?)</span>.*?</li>',re.S)
  items=re.findall(pat,html)
  for item in items:
    yield{
      'index':item[0],
      'title':item[1],
      'stars':item[2].strip(),
      'score':item[3],
      'concept':item[4]
    }

下面的代碼是將每一個(gè)item寫(xiě)入文件,這里encoding='utf-8' 和ensure_ascii=False都是使寫(xiě)入文件時(shí)中文能保持不變,json.dumps可以將(字典)對(duì)象轉(zhuǎn)化成字符串(但前面要先import json),with open的第二個(gè)參數(shù)為a,表示每次寫(xiě)入時(shí),是往后追加(續(xù)接),而不是后一次寫(xiě)入將之前內(nèi)容覆蓋,\n是指要每一次寫(xiě)入一個(gè)item之后要換行。

def write_tofile(content):
  with open('doubanfilms.txt','a',encoding='utf-8' ) as f:
    f.write(json.dumps(content,ensure_ascii=False)+'\n')
    f.close()

最后,需要用循環(huán)語(yǔ)句將每一頁(yè)(共10頁(yè))內(nèi)容都進(jìn)行以上操作。這里,第二頁(yè)的網(wǎng)址就是在第一頁(yè)的url上加上一個(gè)start=25, 第三頁(yè)是加上start=50,也就是每一頁(yè)的start=為25*i。最后一段代碼如下:

def main():
  url="https://movie.douban.com/top250?"
  for i in range(0,9):
    url_i=url+'start='+str(25*i)
    html_i=getpage(url_i)
    for item in parsepage(html_i):
      print(item)
      write_tofile(item)
if __name__ == '__main__':
  main()

當(dāng)然,這一段代碼還有一種寫(xiě)法:

def main(start):
  url="https://movie.douban.com/top250?start="+str(start)
  html=getpage(url)
  for item in parsepage(html):
    print(item)
    write_tofile(item)
if __name__ == '__main__':
  for i in range(10):
    main(i*10)

如果想讓你的程序跑的更快,可以用多線(xiàn)程爬蟲(chóng)(當(dāng)然這里其實(shí)沒(méi)有必要):

#在最開(kāi)始加載Pool包
from multiprocessing import Pool
#最后的執(zhí)行段改為:
if __name__ == '__main__':
  for i in range(10):
    main(i*10)
  pool=Pool() #在循環(huán)外寫(xiě)
  pool.map(main,[i*10 for i in range (10)])

更多關(guān)于Python相關(guān)內(nèi)容可查看本站專(zhuān)題:《Python Socket編程技巧總結(jié)》、《Python正則表達(dá)式用法總結(jié)》、《Python數(shù)據(jù)結(jié)構(gòu)與算法教程》、《Python函數(shù)使用技巧總結(jié)》、《Python字符串操作技巧匯總》、《Python入門(mén)與進(jìn)階經(jīng)典教程》及《Python文件與目錄操作技巧匯總

希望本文所述對(duì)大家Python程序設(shè)計(jì)有所幫助。

相關(guān)文章

  • Python自然語(yǔ)言處理庫(kù)之NLTK庫(kù)初級(jí)教程

    Python自然語(yǔ)言處理庫(kù)之NLTK庫(kù)初級(jí)教程

    NLTK(Natural Language Toolkit)是一個(gè)Python庫(kù),用于實(shí)現(xiàn)自然語(yǔ)言處理(NLP)的許多任務(wù),NLTK包括一些有用的工具和資源,如文本語(yǔ)料庫(kù)、詞性標(biāo)注器、語(yǔ)法分析器等,在這篇初級(jí)教程中,我們將了解NLTK的基礎(chǔ)功能,需要的朋友可以參考下
    2023-08-08
  • Python numpy數(shù)組轉(zhuǎn)置與軸變換

    Python numpy數(shù)組轉(zhuǎn)置與軸變換

    這篇文章主要介紹了Python numpy數(shù)組轉(zhuǎn)置與軸變換,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2019-11-11
  • 跟老齊學(xué)Python之通過(guò)Python連接數(shù)據(jù)庫(kù)

    跟老齊學(xué)Python之通過(guò)Python連接數(shù)據(jù)庫(kù)

    現(xiàn)在在做python的時(shí)候需要用到數(shù)據(jù)庫(kù),于是自己重新整理了一下數(shù)據(jù)庫(kù)的知識(shí),并且熟悉了python中MysqlDB模塊的功能和函數(shù)等接口,現(xiàn)在系統(tǒng)地來(lái)總結(jié)一下吧
    2014-10-10
  • python可變對(duì)象,不可變對(duì)象詳解

    python可變對(duì)象,不可變對(duì)象詳解

    這篇文章主要介紹了Python可變對(duì)象和不可變對(duì)象的相關(guān)資料,文中講解非常細(xì)致,代碼幫助大家更好的理解和學(xué)習(xí),感興趣的朋友可以了解下
    2021-09-09
  • python實(shí)現(xiàn)二叉排序樹(shù)

    python實(shí)現(xiàn)二叉排序樹(shù)

    這篇文章主要介紹了python實(shí)現(xiàn)二叉排序樹(shù),
    2022-01-01
  • Python分割指定頁(yè)數(shù)的pdf文件方法

    Python分割指定頁(yè)數(shù)的pdf文件方法

    今天小編就為大家分享一篇Python分割指定頁(yè)數(shù)的pdf文件方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2018-10-10
  • 淺談tensorflow 中的圖片讀取和裁剪方式

    淺談tensorflow 中的圖片讀取和裁剪方式

    這篇文章主要介紹了淺談tensorflow 中的圖片讀取和裁剪方式,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2020-06-06
  • python向企業(yè)微信發(fā)送文字和圖片消息的示例

    python向企業(yè)微信發(fā)送文字和圖片消息的示例

    這篇文章主要介紹了python向企業(yè)微信發(fā)送文字和圖片消息的示例,幫助大家更好的理解和使用python,感興趣的朋友可以了解下
    2020-09-09
  • 舉例講解Python的lambda語(yǔ)句聲明匿名函數(shù)的用法

    舉例講解Python的lambda語(yǔ)句聲明匿名函數(shù)的用法

    匿名函數(shù)現(xiàn)在已經(jīng)成了各大編程語(yǔ)言爭(zhēng)相標(biāo)配的熱門(mén)特性,無(wú)需用函數(shù)名來(lái)定義函數(shù)的方式在很多場(chǎng)合下書(shū)寫(xiě)起來(lái)十分炫酷,這里我們就來(lái)舉例講解Python的lambda語(yǔ)句聲明匿名函數(shù)的用法
    2016-07-07
  • pip安裝提示Twisted錯(cuò)誤問(wèn)題(Python3.6.4安裝Twisted錯(cuò)誤)

    pip安裝提示Twisted錯(cuò)誤問(wèn)題(Python3.6.4安裝Twisted錯(cuò)誤)

    這篇文章主要介紹了pip安裝提示Twisted錯(cuò)誤問(wèn)題(Python3.6.4安裝Twisted錯(cuò)誤),本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2020-05-05

最新評(píng)論

赫章县| 玉田县| 澎湖县| 厦门市| 瓦房店市| 徐闻县| 孝感市| 南部县| 新宾| 潮安县| 马关县| 时尚| 青浦区| 耒阳市| 广元市| 台山市| 青田县| 乐清市| 曲沃县| 通道| 屏东县| 定安县| 汨罗市| 淳安县| 三穗县| 桃江县| 新闻| 旬阳县| 绩溪县| 互助| 赣州市| 泸水县| 栾川县| 沽源县| 云浮市| 南郑县| 城市| 奉节县| 兴化市| 南靖县| 鲁山县|