Python 通過requests實(shí)現(xiàn)騰訊新聞抓取爬蟲的方法
最近也是學(xué)習(xí)了一些爬蟲方面的知識。以我自己的理解,通常我們用瀏覽器查看網(wǎng)頁時(shí),是通過瀏覽器向服務(wù)器發(fā)送請求,然后服務(wù)器響應(yīng)以后返回一些代碼數(shù)據(jù),再經(jīng)過瀏覽器解析后呈現(xiàn)出來。而爬蟲則是通過程序向服務(wù)器發(fā)送請求,并且將服務(wù)器返回的信息,通過一些處理后,就能得到我們想要的數(shù)據(jù)了。
以下是前段時(shí)間我用python寫的一個(gè)爬取TX新聞標(biāo)題及其網(wǎng)址的一個(gè)簡單爬蟲:
首先需要用到python中requests(方便全面的http請求庫)和 BeautifulSoup(html解析庫)。
通過pip來安裝這兩個(gè)庫,命令分別是:pip install requests 和 pip install bs4 (如下圖)

先放上完整的代碼
# coding:utf-8
import requests
from bs4 import BeautifulSoup
url = "http://news.qq.com/"
# 請求騰訊新聞的URL,獲取其text文本
wbdata = requests.get(url).text
# 對獲取到的文本進(jìn)行解析
soup = BeautifulSoup(wbdata,'lxml')
# 從解析文件中通過select選擇器定位指定的元素,返回一個(gè)列表
news_titles = soup.select("div.text > em.f14 > a.linkto")
# 對返回的列表進(jìn)行遍歷
for n in news_titles:
title = n.get_text()
link = n.get("href")
data = {
'標(biāo)題':title,
'鏈接':link
}
print(data)首先引入上述兩個(gè)庫
import requests from bs4 import BeautifulSoup
然后get請求騰訊新聞網(wǎng)url,返回的字符串實(shí)質(zhì)上就是我們手動(dòng)打開這個(gè)網(wǎng)站,然后查看網(wǎng)頁源代碼所看到的html代碼。
wbdata = requests.get(url).text
我們需要的僅僅是某些特定標(biāo)簽里的內(nèi)容:


可以看出,每條新聞鏈接、標(biāo)題都在<div class="text">標(biāo)簽的<em class="f14 124">標(biāo)簽下
之后我們將剛剛請求得到的html代碼進(jìn)行處理,這時(shí)候就需要用到BeautifulSoap庫了
soup = BeautifulSoup(wbdata,'lxml')
這一行的意思是對獲取的信息進(jìn)行解析處理,也可以將lxml庫換成html.parser庫,效果是相同的
news_titles = soup.select("div.text > em.f14 > a.linkto")這一行是利用剛剛經(jīng)過解析獲取的soup對象,選擇我們需要的標(biāo)簽,返回值是一個(gè)列表。列表中存放了我們需要的所有標(biāo)簽內(nèi)容。也可以使用BeautifulSoup中的find()方法或findall()方法來對標(biāo)簽進(jìn)行選擇。
最后用 for in 對列表進(jìn)行遍歷,分別取出標(biāo)簽中的內(nèi)容(新聞標(biāo)題)和標(biāo)簽中href的值(新聞網(wǎng)址),存放在data字典中
for n in news_titles:
title = n.get_text()
link = n.get("href")
data = {
'標(biāo)題':title,
'鏈接':link
}data存放的就是所有的新聞標(biāo)題和鏈接了,下圖是部分結(jié)果

這樣一個(gè)爬蟲就完成了,當(dāng)然這只是一個(gè)最簡單的爬蟲。深入爬蟲的話還有許多模擬瀏覽器行為、安全問題、效率優(yōu)化、多線程等等需要考慮,不得不說爬蟲是一個(gè)很深的坑。
python中爬蟲可以通過各種庫或者框架來完成,requests只是比較常用的一種而已。其他語言中也會(huì)有許多爬蟲方面的庫,例如php可以使用curl庫。爬蟲的原理都是一樣的,只是用不同語言、不同庫來實(shí)現(xiàn)的方法不一樣。
以上這篇Python 通過requests實(shí)現(xiàn)騰訊新聞抓取爬蟲的方法就是小編分享給大家的全部內(nèi)容了,希望能給大家一個(gè)參考,也希望大家多多支持腳本之家。
相關(guān)文章
Python+Tkinter簡單實(shí)現(xiàn)注冊登錄功能
這篇文章主要為大家詳細(xì)介紹了Python+Tkinter簡單實(shí)現(xiàn)注冊登錄功能,連接本地MySQL數(shù)據(jù)庫,文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下2022-02-02
詳解python的網(wǎng)絡(luò)編程基礎(chǔ)
這篇文章主要為大家介紹了python網(wǎng)絡(luò)編程的基礎(chǔ),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助2022-01-01
python實(shí)現(xiàn)的二叉樹定義與遍歷算法實(shí)例
這篇文章主要介紹了python實(shí)現(xiàn)的二叉樹定義與遍歷算法,結(jié)合具體實(shí)例形式分析了基于Python定義的二叉樹及其常用遍歷操作實(shí)現(xiàn)技巧,需要的朋友可以參考下2017-06-06
Python圖形用戶界面與游戲開發(fā)實(shí)例詳解
GUI是圖形用戶界面的縮寫,圖形化的用戶界面對使用過計(jì)算機(jī)的人來說應(yīng)該都不陌生,下面這篇文章主要給大家介紹了關(guān)于Python圖形用戶界面與游戲開發(fā)的相關(guān)資料,文中通過實(shí)例代碼介紹的非常詳細(xì),需要的朋友可以參考下2022-09-09
詳解appium+python 啟動(dòng)一個(gè)app步驟
這篇文章主要介紹了詳解appium+python 啟動(dòng)一個(gè)app步驟,小編覺得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過來看看吧2017-12-12

