最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Scrapy框架爬取Boss直聘網(wǎng)Python職位信息的源碼

 更新時間:2019年02月22日 11:39:53   作者:topleeyap  
今天小編就為大家分享一篇關(guān)于Scrapy框架爬取Boss直聘網(wǎng)Python職位信息的源碼,小編覺得內(nèi)容挺不錯的,現(xiàn)在分享給大家,具有很好的參考價值,需要的朋友一起跟隨小編來看看吧

分析

使用CrawlSpider結(jié)合LinkExtractor和Rule爬取網(wǎng)頁信息

LinkExtractor用于定義鏈接提取規(guī)則,一般使用allow參數(shù)即可

LinkExtractor(allow=(), # 使用正則定義提取規(guī)則
       deny=(), # 排除規(guī)則
       allow_domains=(), # 限定域名范圍
       deny_domains=(), # 排除域名范圍
       restrict_xpaths=(), # 使用xpath定義提取隊則
       tags=('a', 'area'), 
       attrs=('href',), 
       canonicalize=False,
       unique=True, 
       process_value=None,
       deny_extensions=None, 
       restrict_css=(), # 使用css選擇器定義提取規(guī)則
       strip=True):

Rule用于定義CrawlSpider的爬取規(guī)則,由Spider內(nèi)部自動識別,提交請求、獲取響應(yīng),交給callback指定的回調(diào)方法處理response

如果指定了callback,參數(shù)follow默認為False;如果callback為None,follow默認為True

Rule(link_extractor, # LinkExtractor對象,必選參數(shù)
   callback=None, # 回調(diào)方法,可選
   cb_kwargs=None, 
   follow=None, # 是否進行深度爬取,True、False
   process_links=None, # 用于處理鏈接(有些反爬策略是返回假的url)
   process_request=identity)

源碼

items.py

class BosszhipinItem(scrapy.Item):
  """Boss直聘Pytho職位爬蟲Item"""
  # 職位名稱
  position=scrapy.Field()
  # 公司名稱
  company=scrapy.Field()
  # 薪資
  salary=scrapy.Field()
  # 工作地點
  location=scrapy.Field()
  # 學(xué)歷要求
  education=scrapy.Field()
  # 工作時間
  year=scrapy.Field()

spiders/bosszhipin_spider.py

# !/usr/bin/env python
# -*- coding:utf-8 -*-
import scrapy
from scrapy.spider import CrawlSpider,Rule
from scrapy.linkextractors import LinkExtractor
from myscrapy.items import BosszhipinItem
class BosszhipinSpider(CrawlSpider):
  """
  Boss直聘Python職位爬蟲Spider
    使用CrawlSpider基類實現(xiàn)
  """
  name = 'bosszhipin'
  allowed_domains=['zhipin.com',]
  start_urls=['http://www.zhipin.com/c100010000/h_100010000/?query=Python&page=1',]
  # 鏈接提取器對象(規(guī)定鏈接提取規(guī)則)
  link_extractor=LinkExtractor(allow=(r'page=\d+'))
  # 鏈接提取規(guī)則對象列表
  # 自動調(diào)用callback指定的方法,去取爬取由link_extractor指定的鏈接提取規(guī)則匹配到的url
  # 原理:link_extractor.extract_links(response)返回匹配到的鏈接
  rules = [
    Rule(link_extractor=link_extractor,callback='parse_page',follow=True),
  ]
  def parse_page(self,response):
    """定義回調(diào)方法,用于解析每個response對象"""
    job_list=response.xpath('//div[@class="job-list"]//li')
    for job in job_list:
      position = job.xpath('.//div[@class="info-primary"]//h3[@class="name"]/a/text()')[0].extract()
      salary =job.xpath('.//div[@class="info-primary"]//h3[@class="name"]//span/text()')[0].extract()
      company =job.xpath('.//div[@class="company-text"]//a/text()')[0].extract()
      location =job.xpath('.//div[@class="info-primary"]/p/text()[1]')[0].extract()
      year =job.xpath('.//div[@class="info-primary"]/p/text()[2]')[0].extract()
      education =job.xpath('.//div[@class="info-primary"]/p/text()[3]')[0].extract()
      item=BosszhipinItem()
      item['position']=position
      item['salary']=salary
      item['company']=company
      item['location']=location
      item['year']=year
      item['education']=education
      yield item

pipelines.py

class BosszhipinPipeline(object):
  """Boss直聘Python職位爬蟲Item Pipeline"""
  def __init__(self):
    self.f=open('data/bosszhipin.json',mode='wb')
    self.f.write(b'[')
  def process_item(self,item,spider):
    data=json.dumps(dict(item),ensure_ascii=False,indent=4)
    self.f.write(data.encode('utf-8'))
    self.f.write(b',')
    return item
  def close_spider(self,spider):
    self.f.write(b']')
    self.f.close()

settings.py

ITEM_PIPELINES = {
  'myscrapy.pipelines.BosszhipinPipeline': 1,
}

運行結(jié)果

總結(jié)

以上就是這篇文章的全部內(nèi)容了,希望本文的內(nèi)容對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,謝謝大家對腳本之家的支持。如果你想了解更多相關(guān)內(nèi)容請查看下面相關(guān)鏈接

相關(guān)文章

  • Python中的一些陷阱與技巧小結(jié)

    Python中的一些陷阱與技巧小結(jié)

    這篇文章主要介紹了Python中的一些陷阱與技巧小結(jié),包括生成器等高級用法,和Python2.x與3版本換代帶來的兼容性問題等,需要的朋友可以參考下
    2015-07-07
  • python配置grpc環(huán)境

    python配置grpc環(huán)境

    gRPC 是一款高性能、開源的 RPC 框架,產(chǎn)自 Google,基于 ProtoBuf 序列化協(xié)議進行開發(fā),支持多種語言(Golang、Python、Java等),本篇只介紹 Python 的 gRPC 安裝使用
    2019-01-01
  • Python+OpenCV實現(xiàn)邊緣檢測與角點檢測詳解

    Python+OpenCV實現(xiàn)邊緣檢測與角點檢測詳解

    這篇文章主要為大家詳細介紹了如何通過Python+OpenCV實現(xiàn)邊緣檢測與角點檢測,文中的示例代碼講解詳細,對我們學(xué)習(xí)Python與OpenCV有一定的幫助,需要的可以參考一下
    2023-02-02
  • python實現(xiàn)簡單遺傳算法

    python實現(xiàn)簡單遺傳算法

    這篇文章主要介紹了python如何實現(xiàn)簡單遺傳算法,幫助大家更好的利用python進行數(shù)據(jù)分析,感興趣的朋友可以了解下
    2020-09-09
  • Python繪制心形曲線完整代碼實現(xiàn)

    Python繪制心形曲線完整代碼實現(xiàn)

    這篇文章主要介紹了Python繪制心形曲線的相關(guān)資料,通過numpy和matplotlib庫計算坐標并繪圖,代碼包含導(dǎo)入庫、定義函數(shù)、生成參數(shù)、計算坐標、繪圖和顯示圖形等步驟,展示了數(shù)學(xué)與編程的結(jié)合美感,需要的朋友可以參考下
    2024-10-10
  • Python?安裝教程以及快速入門

    Python?安裝教程以及快速入門

    Python是一種簡單易學(xué)的編程語言,適合初學(xué)者入門。本文將介紹Python的安裝教程以及快速入門,幫助讀者快速上手Python編程。
    2023-09-09
  • Matplotlib scatter繪制散點圖的方法實現(xiàn)

    Matplotlib scatter繪制散點圖的方法實現(xiàn)

    這篇文章主要介紹了Matplotlib scatter繪制散點圖的方法實現(xiàn),文中通過示例代碼介紹的非常詳細,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2020-01-01
  • django模板結(jié)構(gòu)優(yōu)化的方法

    django模板結(jié)構(gòu)優(yōu)化的方法

    這篇文章主要介紹了django模板結(jié)構(gòu)優(yōu)化的方法,小編覺得挺不錯的,現(xiàn)在分享給大家,也給大家做個參考。一起跟隨小編過來看看吧
    2019-02-02
  • Python將大量遙感數(shù)據(jù)的值縮放指定倍數(shù)的方法(推薦)

    Python將大量遙感數(shù)據(jù)的值縮放指定倍數(shù)的方法(推薦)

    本文介紹基于Python中的gdal模塊,批量讀取大量多波段遙感影像文件,分別對各波段數(shù)據(jù)加以數(shù)值處理,并將所得處理后數(shù)據(jù)保存為新的遙感影像文件的方法,感興趣的朋友一起看看吧
    2025-01-01
  • Python模塊相關(guān)知識點小結(jié)

    Python模塊相關(guān)知識點小結(jié)

    這篇文章主要介紹了Python模塊相關(guān)知識點,總結(jié)分析了Python模塊的功能、原理、使用方法與操作注意事項,需要的朋友可以參考下
    2020-03-03

最新評論

吉木萨尔县| 申扎县| 那曲县| 新蔡县| 土默特右旗| 商城县| 崇信县| 合肥市| 天柱县| 襄汾县| 邛崃市| 天津市| 郧西县| 眉山市| 寻乌县| 开远市| 双桥区| 普定县| 竹溪县| 顺昌县| 昌黎县| 右玉县| 棋牌| 霍林郭勒市| 兴山县| 盱眙县| 略阳县| 冕宁县| 吴江市| 贵州省| 高清| 东乡族自治县| 临沂市| 海林市| 洛隆县| 图们市| 石阡县| SHOW| 崇仁县| 凤翔县| 嵩明县|