最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python爬蟲開發(fā)之使用python爬蟲庫requests,urllib與今日頭條搜索功能爬取搜索內(nèi)容實(shí)例

 更新時(shí)間:2020年03月10日 14:45:04   作者:jia666666  
這篇文章主要介紹了python爬蟲開發(fā)之使用python爬蟲庫requests,urllib與今日頭條搜索功能爬取搜索內(nèi)容實(shí)例,需要的朋友可以參考下

使用python爬蟲庫requests,urllib爬取今日頭條街拍美圖

代碼均有注釋

import re,json,requests,os
from hashlib import md5
from urllib.parse import urlencode
from requests.exceptions import RequestException
from bs4 import BeautifulSoup
from multiprocessing import Pool
#請(qǐng)求索引頁
def get_page_index(offset,keyword):
  #傳送的數(shù)據(jù)
  data={
    'offset': offset,
    'format': 'json',
    'keyword': keyword,
    'autoload': 'true',
    'count': '20',
    'cur_tab': 1
  }
  #自動(dòng)編碼為服務(wù)器可識(shí)別的url
  url="https://www.toutiao.com/search_content/?"+urlencode(data)
  #異常處理
  try:
    #獲取返回的網(wǎng)頁
    response=requests.get(url)
    #判斷網(wǎng)頁的狀態(tài)碼是否正常獲取
    if response.status_code==200:
      #返回解碼后的網(wǎng)頁
      return response.text
    #不正常獲取,返回None
    return None
  except RequestException:
    #提示信息
    print("請(qǐng)求索引頁出錯(cuò)")
    return None
#解析請(qǐng)求的索引網(wǎng)頁數(shù)據(jù)
def parse_page_index(html):
  #json加載轉(zhuǎn)換
  data=json.loads(html)
  #數(shù)據(jù)為真,并且data鍵值存在與數(shù)據(jù)中
  if data and 'data' in data.keys():
    #遍歷返回圖集所在的url
    for item in data.get('data'):
      yield item.get('article_url')
#圖集詳情頁請(qǐng)求
def get_page_detail(url):
  #設(shè)置UA,模擬瀏覽器正常訪問
  head = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}
  #異常處理
  try:
    response=requests.get(url,headers=head)
    if response.status_code==200:
      return response.text
    return None
  except RequestException:
    print("請(qǐng)求詳情頁出錯(cuò)")
    return None
#解析圖集詳情頁的數(shù)據(jù)
def parse_page_detail(html,url):
  #異常處理
  try:
    #格式轉(zhuǎn)換與圖集標(biāo)題提取
    soup=BeautifulSoup(html,'lxml')
    title=soup.select('title')[0].get_text()
    print(title)
    #正則查找圖集鏈接
    image_pattern = re.compile('gallery: (.*?),\n', re.S)
    result = re.search(image_pattern, html)
    if result:
      #數(shù)據(jù)的優(yōu)化
      result=result.group(1)
      result = result[12:]
      result = result[:-2]
      #替換
      result = re.sub(r'\\', '', result)
      #json加載
      data = json.loads(result)
      #判斷數(shù)據(jù)不為空,并確保sub——images在其中
      if data and 'sub_images' in data.keys():
        #sub_images數(shù)據(jù)提取
        sub_images=data.get('sub_images')
        #列表數(shù)據(jù)提取
        images=[item.get('url') for item in sub_images]
        #圖片下載
        for image in images:download_images(image)
        #返回字典
        return {
          'title':title,
          'url':url,
          'images':images
        }
  except Exception:
    pass
#圖片url請(qǐng)求
def download_images(url):
  #提示信息
  print('正在下載',url)
  #瀏覽器模擬
  head = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}
  #異常處理
  try:
    response = requests.get(url, headers=head)
    if response.status_code == 200:
      #圖片保存
      save_image(response.content)
    return None
  except RequestException:
    print("請(qǐng)求圖片出錯(cuò)")
    return None
#圖片保存
def save_image(content):
  #判斷文件夾是否存在,不存在則創(chuàng)建
  if '街拍' not in os.listdir():
    os.makedirs('街拍')
  #設(shè)置寫入文件所在文件夾位置
  os.chdir('E:\python寫網(wǎng)路爬蟲\CSDN爬蟲學(xué)習(xí)\街拍')
  #路徑,名稱,后綴
  file_path='{0}/{1}.{2}'.format(os.getcwd(),md5(content).hexdigest(),'jpg')
  #圖片保存
  with open(file_path,'wb') as f:
      f.write(content)
      f.close()
#主函數(shù)
def mian(offset):
  #網(wǎng)頁獲取
  html=get_page_index(offset,'街拍')
  #圖集url
  for url in parse_page_index(html):
    if url!=None:
      #圖集網(wǎng)頁詳情
      html=get_page_detail(url)
      #圖集內(nèi)容
      result=parse_page_detail(html,url)
if __name__ == '__main__':
  #創(chuàng)建訪問的列表(0-9)頁
  group=[i*10 for i in range(10)]
  #創(chuàng)建多線程進(jìn)程池
  pool=Pool()
  #進(jìn)程池啟動(dòng),傳入的數(shù)據(jù)
  pool.map(mian,group)

爬取圖片如下

本文主要講解了python爬蟲庫requests、urllib與OS模塊結(jié)合使用爬取今日頭條搜索內(nèi)容的實(shí)例,更多關(guān)于python爬蟲相關(guān)知識(shí)請(qǐng)查看下面的相關(guān)鏈接

相關(guān)文章

  • python神經(jīng)網(wǎng)絡(luò)facenet人臉檢測(cè)及keras實(shí)現(xiàn)

    python神經(jīng)網(wǎng)絡(luò)facenet人臉檢測(cè)及keras實(shí)現(xiàn)

    這篇文章主要為大家介紹了python神經(jīng)網(wǎng)絡(luò)facenet人臉檢測(cè)及keras實(shí)現(xiàn),有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2022-05-05
  • Python3 利用requests 庫進(jìn)行post攜帶賬號(hào)密碼請(qǐng)求數(shù)據(jù)的方法

    Python3 利用requests 庫進(jìn)行post攜帶賬號(hào)密碼請(qǐng)求數(shù)據(jù)的方法

    今天小編就為大家分享一篇Python3 利用requests 庫進(jìn)行post攜帶賬號(hào)密碼請(qǐng)求數(shù)據(jù)的方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2018-10-10
  • Python OpenCV 基于圖像邊緣提取的輪廓發(fā)現(xiàn)函數(shù)

    Python OpenCV 基于圖像邊緣提取的輪廓發(fā)現(xiàn)函數(shù)

    這篇文章主要介紹了Python OpenCV 基于圖像邊緣提取的輪廓發(fā)現(xiàn)函數(shù),文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2021-03-03
  • python 內(nèi)置模塊詳解

    python 內(nèi)置模塊詳解

    模塊是一個(gè)保存了Python代碼的文件。模塊能定義函數(shù),類和變量。模塊里也能包含可執(zhí)行的代碼,今天我們就來詳細(xì)探討下python內(nèi)置的一些常用模塊
    2019-01-01
  • Pytorch+PyG實(shí)現(xiàn)GraphSAGE過程示例詳解

    Pytorch+PyG實(shí)現(xiàn)GraphSAGE過程示例詳解

    這篇文章主要為大家介紹了Pytorch+PyG實(shí)現(xiàn)GraphSAGE過程示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2023-04-04
  • python爬蟲URL重試機(jī)制的實(shí)現(xiàn)方法(python2.7以及python3.5)

    python爬蟲URL重試機(jī)制的實(shí)現(xiàn)方法(python2.7以及python3.5)

    今天小編就為大家分享一篇python爬蟲URL重試機(jī)制的實(shí)現(xiàn)方法(python2.7以及python3.5),具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2018-12-12
  • Python使用Pandas和Matplotlib按中值對(duì)箱形圖進(jìn)行排序

    Python使用Pandas和Matplotlib按中值對(duì)箱形圖進(jìn)行排序

    箱形圖是可視化數(shù)據(jù)分布的強(qiáng)大工具,因?yàn)樗鼈兲峁┝藢?duì)數(shù)據(jù)集內(nèi)的散布、四分位數(shù)和離群值的洞察,在本文中,我們將探索如何在Python中使用Pandas和Matplotlib按中值對(duì)箱形圖進(jìn)行排序,需要的朋友可以參考下
    2025-04-04
  • Python生成8位隨機(jī)字符串的方法分析

    Python生成8位隨機(jī)字符串的方法分析

    這篇文章主要介紹了Python生成8位隨機(jī)字符串的方法,結(jié)合實(shí)例形式對(duì)比分析了2種比較常用的隨機(jī)字符串生成技巧,具有一定參考借鑒價(jià)值,需要的朋友可以參考下
    2017-12-12
  • 20行Python代碼實(shí)現(xiàn)視頻字符化功能

    20行Python代碼實(shí)現(xiàn)視頻字符化功能

    這篇文章主要介紹了20行Python代碼實(shí)現(xiàn)視頻字符化功能,本文通過實(shí)例代碼截圖的形式給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2020-04-04
  • Python反射機(jī)制案例超詳細(xì)講解

    Python反射機(jī)制案例超詳細(xì)講解

    反射就是通過字符串的形式,導(dǎo)入模塊;通過字符串的形式,去模塊尋找指定函數(shù),并執(zhí)行。利用字符串的形式去對(duì)象(模塊)中操作(查找/獲取/刪除/添加)成員,一種基于字符串的事件驅(qū)動(dòng)
    2022-09-09

最新評(píng)論

莱西市| 石家庄市| 宝山区| 靖江市| 大方县| 盐源县| 英德市| 阿克陶县| 南陵县| 宽甸| 铜鼓县| 涪陵区| 合肥市| 和静县| 台州市| 嵊泗县| 搜索| 元江| 囊谦县| 阿克苏市| 资讯 | 迁安市| 固原市| 海阳市| 伽师县| 奎屯市| 毕节市| 曲周县| 隆德县| 平乡县| 疏勒县| 杭锦旗| 招远市| 蒲江县| 贵定县| 东乌| 辽阳县| 弋阳县| 东丽区| 乾安县| 九江市|