最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python爬取愛奇藝電影信息代碼實(shí)例

 更新時(shí)間:2019年11月26日 09:36:09   作者:陳暢  
這篇文章主要介紹了Python爬取愛奇藝電影信息代碼實(shí)例,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下

這篇文章主要介紹了Python爬取愛奇藝電影信息代碼實(shí)例,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下

一,使用庫

  1.requests

  2.re

  3.json

二,抓取html文件

def get_page(url):
  response = requests.get(url)
  if response.status_code == 200:
    return response.text
  return None

三,解析html文件

我們需要的電影信息的部分如下圖(評(píng)分,片名,主演):

抓取到的html文件對(duì)應(yīng)的代碼:

可以分析出,每部電影的信息都在一個(gè)<li>標(biāo)簽內(nèi),用正則表達(dá)式解析:

def parse_page(html):
  pattern = re.compile('<li.*?qy-mod-li.*?text-score">(.*?)<.*?title.*?>(.*?)<.*?title.*?>(.*?)<', re.S)
  items = re.findall(pattern, html)
  for item in items:#轉(zhuǎn)換為字典形式保存
    yield {
      'score': item[0],
      'name': item[1],
      'actor': item[2].strip()[3:]#將‘主演:'去掉
    }

四,寫入文件

def write_to_file(content):
  with open('result.txt', 'a', encoding='utf-8')as f:
    f.write(json.dumps(content, ensure_ascii=False) + '\n')#將字典格式轉(zhuǎn)換為字符串加以保存,并設(shè)置中文格式
    f.close()

五,調(diào)用函數(shù)

def main():
  url = 'https://list.iqiyi.com/www/1/-------------8-1-1-iqiyi--.html'
  html = get_page(url)
  for item in parse_page(html):
    print(item)
    write_to_file(item)

六,運(yùn)行結(jié)果

七,完整代碼

import json
import requests
import re


# 抓取html文件
# 解析html文件
# 存儲(chǔ)文件


def get_page(url):
  response = requests.get(url)
  if response.status_code == 200:
    return response.text
  return None


def parse_page(html):
  pattern = re.compile('<li.*?qy-mod-li.*?text-score">(.*?)<.*?title.*?>(.*?)<.*?title.*?>(.*?)<', re.S)
  items = re.findall(pattern, html)
  for item in items:
    yield {
      'score': item[0],
      'name': item[1],
      'actor': item[2].strip()[3:]
    }


def write_to_file(content):
  with open('result.txt', 'a', encoding='utf-8')as f:
    f.write(json.dumps(content, ensure_ascii=False) + '\n')
    f.close()

def main():
  url = 'https://list.iqiyi.com/www/1/-------------8-1-1-iqiyi--.html'
  html = get_page(url)
  for item in parse_page(html):
    print(item)
    write_to_file(item)
if __name__ == '__main__':
  main()

以上就是本文的全部?jī)?nèi)容,希望對(duì)大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

最新評(píng)論

铅山县| 安丘市| 万安县| 承德县| 肥城市| 遂溪县| 汉阴县| 高尔夫| 山阴县| 洛川县| 防城港市| 英超| 湄潭县| 淮滨县| 宁晋县| 石泉县| 普宁市| 大丰市| 莎车县| 云安县| 巴林右旗| 昂仁县| 公安县| 教育| 宝兴县| 嫩江县| 雷波县| 海林市| 聂荣县| 屯留县| 宜城市| 府谷县| 嵊泗县| 岑巩县| 资溪县| 延庆县| 张家界市| 洛扎县| 游戏| 苏州市| 遂川县|