最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python爬蟲框架Scrapy安裝使用步驟

 更新時間:2014年04月01日 14:49:28   作者:  
這篇文章主要介紹了Python爬蟲框架Scrapy的安裝和使用步驟,重點(diǎn)在解決依賴問題上,需要的朋友可以參考下

一、爬蟲框架Scarpy簡介
Scrapy 是一個快速的高層次的屏幕抓取和網(wǎng)頁爬蟲框架,爬取網(wǎng)站,從網(wǎng)站頁面得到結(jié)構(gòu)化的數(shù)據(jù),它有著廣泛的用途,從數(shù)據(jù)挖掘到監(jiān)測和自動測試,Scrapy完全用Python實(shí)現(xiàn),完全開源,代碼托管在Github上,可運(yùn)行在Linux,Windows,Mac和BSD平臺上,基于Twisted的異步網(wǎng)絡(luò)庫來處理網(wǎng)絡(luò)通訊,用戶只需要定制開發(fā)幾個模塊就可以輕松的實(shí)現(xiàn)一個爬蟲,用來抓取網(wǎng)頁內(nèi)容以及各種圖片。

二、Scrapy安裝指南

我們的安裝步驟假設(shè)你已經(jīng)安裝一下內(nèi)容:<1>Python2.7<2>lxml<3>OpenSSL,我們使用Python的包管理工具pip或者easy_install來安裝Scrapy。
pip的安裝方式:

復(fù)制代碼 代碼如下:
pip install Scrapy

easy_install的安裝方式:
復(fù)制代碼 代碼如下:
easy_install Scrapy

三、Ubuntu平臺上環(huán)境配置

1、python的包管理工具
當(dāng)前的包管理工具鏈?zhǔn)?easy_install/pip + distribute/setuptools
distutils : Python 自帶的基本安裝工具, 適用于非常簡單的應(yīng)用場景;
setuptools : 針對 distutils 做了大量擴(kuò)展, 尤其是加入了包依賴機(jī)制. 在部分 Python 子社區(qū)已然是事實(shí)上的標(biāo)準(zhǔn);
distribute : 由于 setuptools 開發(fā)進(jìn)度緩慢, 不支持 Python 3, 代碼混亂, 一幫程序員另起爐灶, 重構(gòu)代碼, 增加功能, 希望能夠取代 setuptools 并被接納為官方標(biāo)準(zhǔn)庫, 他們非常努力, 在很短的時間便讓社區(qū)接受了 distribute;,setuptools / distribute 都只是擴(kuò)展了 distutils;
easy_install : setuptools 和 distribute 自帶的安裝腳本, 也就是一旦 setuptools 或 distribute 安裝完畢, easy_install 也便可用. 最大的特點(diǎn)是自動查找 Python 官方維護(hù)的包源 PyPI , 安裝第三方 Python 包非常方便; 使用:
pip : pip 的目標(biāo)非常明確 – 取代 easy_install. easy_install 有很多不足: 安裝事務(wù)是非原子操作, 只支持 svn, 沒有提供卸載命令, 安裝一系列包時需要寫腳本; pip 解決了以上問題, 已儼然成為新的事實(shí)標(biāo)準(zhǔn), virtualenv 與它已經(jīng)成為一對好搭檔;

安裝過程:
安裝distribute  

復(fù)制代碼 代碼如下:
$ curl -O http://python-distribute.org/distribute_setup.py 
$ python distribute_setup.py

安裝pip:
復(fù)制代碼 代碼如下:
$ curl -O https://raw.github.com/pypa/pip/master/contrib/get-pip.py 
$ [sudo] python get-pip.py

2、Scrapy的安裝
在Windows平臺上,可以通過包管理工具或者手動下載各種依賴的二進(jìn)制包:pywin32,Twisted,zope.interface,lxml,pyOpenSSL,在Ubuntu9.10以后的版本上,官方推薦不用使用Ubuntu提供的python-scrapy包,它們要么太老要么太慢,無法匹配最新的Scrapy,解決方案是,使用官方的Ubuntu Packages,它提供了所有的依賴庫,并且對于最新的bug提供持續(xù)的更新,穩(wěn)定性更高,它們持續(xù)的從Github倉庫(master和stable branches)構(gòu)建,Scrapy在Ubuntu9.10之后的版本上的安裝方法如下:
<1>輸入GPG密鑰

復(fù)制代碼 代碼如下:
sudo apt-key adv --keyserver hkp://keyserver.ubuntu.com:80 --recv 627220E7

<2>創(chuàng)建/etc/apt/sources.list.d/scrapy.list 文件
復(fù)制代碼 代碼如下:
echo 'deb http://archive.scrapy.org/ubuntu scrapy main' | sudo tee /etc/apt/sources.list.d/scrapy.list

<3>更新包列表,安裝scrapy版本,其中VERSION用實(shí)際的版本代替,如scrapy-0.22
復(fù)制代碼 代碼如下:
sudo apt-get update && sudo apt-get install scrapy-VERSION

3、Scrapy依賴庫的安裝
ubuntu12.04下scrapy依賴庫的安裝
ImportError: No module named w3lib.http

復(fù)制代碼 代碼如下:
pip install w3lib

ImportError: No module named twisted
復(fù)制代碼 代碼如下:
pip install twisted

ImportError: No module named lxml.html
復(fù)制代碼 代碼如下:
pip install lxml

解決:error: libxml/xmlversion.h: No such file or directory

復(fù)制代碼 代碼如下:
apt-get install libxml2-dev libxslt-dev 
apt-get install python-lxml

解決:ImportError: No module named cssselect

復(fù)制代碼 代碼如下:
pip install cssselect 

ImportError: No module named OpenSSL
復(fù)制代碼 代碼如下:
pip install pyOpenSSL 

4、定制自己的爬蟲開發(fā)
切換到文件目錄,開啟新的工程

復(fù)制代碼 代碼如下:
scrapy startproject test

 

相關(guān)文章

  • Pytorch訓(xùn)練過程出現(xiàn)nan的解決方式

    Pytorch訓(xùn)練過程出現(xiàn)nan的解決方式

    今天小編就為大家分享一篇Pytorch訓(xùn)練過程出現(xiàn)nan的解決方式,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-01-01
  • 使用python接受tgam的腦波數(shù)據(jù)實(shí)例

    使用python接受tgam的腦波數(shù)據(jù)實(shí)例

    這篇文章主要介紹了使用python接受tgam的腦波數(shù)據(jù)實(shí)例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-04-04
  • python實(shí)現(xiàn)字符串加密成純數(shù)字

    python實(shí)現(xiàn)字符串加密成純數(shù)字

    這篇文章主要為大家詳細(xì)介紹了python實(shí)現(xiàn)字符串加密成純數(shù)字,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2019-03-03
  • Python使用sigthief簽發(fā)證書的實(shí)現(xiàn)步驟

    Python使用sigthief簽發(fā)證書的實(shí)現(xiàn)步驟

    Windows 系統(tǒng)中的一些非常重要文件通常會被添加數(shù)字簽名,其目的是用來防止被篡改,能確保用戶通過互聯(lián)網(wǎng)下載時能確信此代碼沒有被非法篡改和來源可信,從而保護(hù)了代碼的完整性、保護(hù)了用戶不會被病毒、惡意代碼和間諜軟件所侵害,本章將演示證書的簽發(fā)與偽造
    2021-06-06
  • Python Docx庫完美操作word文檔實(shí)例探究

    Python Docx庫完美操作word文檔實(shí)例探究

    這篇文章主要為大家介紹了Python Docx庫完美操作word文檔,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2024-01-01
  • python異常的傳遞知識點(diǎn)總結(jié)

    python異常的傳遞知識點(diǎn)總結(jié)

    在本篇文章里小編給大家整理的是一篇關(guān)于python異常的傳遞知識點(diǎn)總結(jié),有興趣的朋友們可以學(xué)習(xí)下。
    2021-06-06
  • 手把手教你用322行Python代碼編寫貪吃蛇游戲

    手把手教你用322行Python代碼編寫貪吃蛇游戲

    最近在學(xué)Python,想做點(diǎn)什么來練練手,命令行的貪吃蛇一般是C的練手項(xiàng)目,但是一時之間找不到別的,就先做個貪吃蛇來練練簡單的語法,下面這篇文章主要給大家介紹了關(guān)于如何用322行Python代碼編寫貪吃蛇游戲的相關(guān)資料,需要的朋友可以參考下
    2023-02-02
  • python使用pandas庫導(dǎo)入并保存excel、csv格式文件數(shù)據(jù)

    python使用pandas庫導(dǎo)入并保存excel、csv格式文件數(shù)據(jù)

    CSV格式文件很方便各種工具之間傳遞數(shù)據(jù),平時工作過程之中會將數(shù)據(jù)保存為CSV格式,這篇文章主要介紹了python使用pandas庫導(dǎo)入并保存excel、csv格式文件數(shù)據(jù)的相關(guān)資料,需要的朋友可以參考下
    2017-12-12
  • 基于python的MD5腳本開發(fā)思路

    基于python的MD5腳本開發(fā)思路

    這篇文章主要介紹了基于python的MD5腳本,通過 string模塊自動生成字典,使用permutations()函數(shù),對字典進(jìn)行全排列,本文通過實(shí)例代碼給大家介紹的非常詳細(xì),需要的朋友可以參考下
    2022-03-03
  • python網(wǎng)絡(luò)爬蟲精解之pyquery的使用說明

    python網(wǎng)絡(luò)爬蟲精解之pyquery的使用說明

    PyQuery是一個類似于jQuery的解析網(wǎng)頁工具,使用lxml操作xml和html文檔,它的語法和jQuery很像。和XPATH,Beautiful Soup比起來,PyQuery更加靈活,提供增加節(jié)點(diǎn)的class信息,移除某個節(jié)點(diǎn),提取文本信息等功能
    2021-09-09

最新評論

南皮县| 安阳市| 九寨沟县| 平远县| 河北省| 嘉荫县| 鹿泉市| 阿合奇县| 三河市| 德令哈市| 辽中县| 绥中县| 墨脱县| 临高县| 龙海市| 黑龙江省| 南江县| 淮北市| 台北市| 万州区| 梁河县| 凤城市| 开远市| 桐城市| 儋州市| 梁河县| 科技| 淮安市| 平乐县| 尚志市| 云霄县| 崇阳县| 砚山县| 沭阳县| 鄢陵县| 六枝特区| 辉南县| 宿迁市| 陈巴尔虎旗| 禹城市| 田阳县|