從零開始的 Python 爬蟲速成指南

知識 04-21

來源：舞鶴

序

本文主要內容：以最短的時間寫一個最簡單的爬蟲，可以抓取論壇的帖子標題和帖子內容。

本文受眾：沒寫過爬蟲的萌新。

入門

0.準備工作

需要準備的東西： Python、scrapy、一個IDE或者隨便什麼文本編輯工具。

1.技術部已經研究決定了，你來寫爬蟲。

隨便建一個工作目錄，然後用命令行建立一個工程，工程名為miao，可以替換為你喜歡的名字。

scrapy startproject miao

隨後你會得到如下的一個由scrapy創建的目錄結構

從零開始的 Python 爬蟲速成指南

在spiders文件夾中創建一個python文件，比如miao.py，來作為爬蟲的腳本。

內容如下：

import scrapy

classNgaSpider(scrapy.Spider):

name="NgaSpider"

# start_urls是我們準備爬的初始頁

start_urls=[

]

# 這個是解析函數，如果不特別指明的話，scrapy抓回來的頁面會由這個函數進行解析。

# 對頁面的處理和分析工作都在此進行，這個示例里我們只是簡單地把頁面內容列印出來。

def parse(self,response):

printresponse.body

2.跑一個試試？

如果用命令行的話就這樣：

cd miao

scrapy crawlNgaSpider

你可以看到爬蟲君已經把你壇星際區第一頁列印出來了，當然由於沒有任何處理，所以混雜著html標籤和js腳本都一併列印出來了。

解析

接下來我們要把剛剛抓下來的頁面進行分析，從這坨html和js堆里把這一頁的帖子標題提煉出來。

其實解析頁面是個體力活，方法多的是，這裡只介紹xpath。

0.為什麼不試試神奇的xpath呢

看一下剛才抓下來的那坨東西，或者用chrome瀏覽器手動打開那個頁面然後按F12可以看到頁面結構。

每個標題其實都是由這麼一個html標籤包裹著的。舉個例子：

可以看到href就是這個帖子的地址（當然前面要拼上論壇地址），而這個標籤包裹的內容就是帖子的標題了。

於是我們用xpath的絕對定位方法，把class= topic 的部分摘出來。

1.看看xpath的效果

在最上面加上引用：

from scrapy import Selector

把parse函數改成：

def parse(self,response):

selector=Selector(response)

# 在此，xpath會將所有class=topic的標籤提取出來，當然這是個list

# 這個list里的每一個元素都是我們要找的html標籤

content_list=selector.xpath("//*[@class= topic ]")

# 遍歷這個list，處理每一個標籤

forcontentincontent_list:

# 此處解析標籤，提取出我們需要的帖子標題。

topic=content.xpath( string(.) ).extract_first()

printtopic

# 此處提取出帖子的url地址。

url=self.host+content.xpath( @href ).extract_first()

printurl

再次運行就可以看到輸出你壇星際區第一頁所有帖子的標題和url了。

遞歸

接下來我們要抓取每一個帖子的內容。

這裡需要用到python的yield。

yield Request(url=url, callback=self.parse_topic)

此處會告訴scrapy去抓取這個url，然後把抓回來的頁面用指定的parse_topic函數進行解析。

至此我們需要定義一個新的函數來分析一個帖子里的內容。

完整的代碼如下：

import scrapy

from scrapy import Selector

from scrapy import Request

classNgaSpider(scrapy.Spider):

name="NgaSpider"

# 這個例子中只指定了一個頁面作為爬取的起始url

# 當然從資料庫或者文件或者什麼其他地方讀取起始url也是可以的

start_urls=[

]

# 爬蟲的入口，可以在此進行一些初始化工作，比如從某個文件或者資料庫讀入起始url

def start_requests(self):

forurlinself.start_urls:

# 此處將起始url加入scrapy的待爬取隊列，並指定解析函數

# scrapy會自行調度，並訪問該url然後把內容拿回來

yield Request(url=url,callback=self.parse_page)

# 版面解析函數，解析一個版面上的帖子的標題和地址

def parse_page(self,response):

selector=Selector(response)

content_list=selector.xpath("//*[@class= topic ]")

forcontentincontent_list:

topic=content.xpath( string(.) ).extract_first()

print topic

url=self.host+content.xpath( @href ).extract_first()

printurl

# 此處，將解析出的帖子地址加入待爬取隊列，並指定解析函數

yield Request(url=url,callback=self.parse_topic)

# 可以在此處解析翻頁信息，從而實現爬取版區的多個頁面

# 帖子的解析函數，解析一個帖子的每一樓的內容

def parse_topic(self,response):

selector=Selector(response)

content_list=selector.xpath("//*[@class= postcontent ubbcode ]")

forcontentincontent_list:

content=content.xpath( string(.) ).extract_first()

printcontent

# 可以在此處解析翻頁信息，從而實現爬取帖子的多個頁面

到此為止，這個爬蟲可以爬取你壇第一頁所有的帖子的標題，並爬取每個帖子里第一頁的每一層樓的內容。

爬取多個頁面的原理相同，注意解析翻頁的url地址、設定終止條件、指定好對應的頁面解析函數即可。

Pipelines——管道

此處是對已抓取、解析後的內容的處理，可以通過管道寫入本地文件、資料庫。

0.定義一個Item

在miao文件夾中創建一個items.py文件。

from scrapy importItem,Field

classTopicItem(Item):

url=Field()

title=Field()

author=Field()

classContentItem(Item):

url=Field()

content=Field()

author=Field()

此處我們定義了兩個簡單的class來描述我們爬取的結果。

1. 寫一個處理方法

在miao文件夾下面找到那個pipelines.py文件，scrapy之前應該已經自動生成好了。

我們可以在此建一個處理方法。

classFilePipeline(object):

## 爬蟲的分析結果都會由scrapy交給此函數處理

def process_item(self,item,spider):

ifisinstance(item,TopicItem):

## 在此可進行文件寫入、資料庫寫入等操作

pass

ifisinstance(item,ContentItem):

## 在此可進行文件寫入、資料庫寫入等操作

pass

## ...

returnitem

2.在爬蟲中調用這個處理方法。

要調用這個方法我們只需在爬蟲中調用即可，例如原先的內容處理函數可改為：

def parse_topic(self,response):

selector=Selector(response)

content_list=selector.xpath("//*[@class= postcontent ubbcode ]")

forcontentincontent_list:

content=content.xpath( string(.) ).extract_first()

## 以上是原內容

## 創建個ContentItem對象把我們爬取的東西放進去

item=ContentItem()

item["url"]=response.url

item["content"]=content

item["author"]=""## 略

## 這樣調用就可以了

## scrapy會把這個item交給我們剛剛寫的FilePipeline來處理

yielditem

3.在配置文件里指定這個pipeline

找到settings.py文件，在裡面加入

ITEM_PIPELINES={

miao.pipelines.FilePipeline :400,

}

這樣在爬蟲里調用

yield item

的時候都會由經這個FilePipeline來處理。後面的數字400表示的是優先順序。

可以在此配置多個Pipeline，scrapy會根據優先順序，把item依次交給各個item來處理，每個處理完的結果會傳遞給下一個pipeline來處理。

可以這樣配置多個pipeline:

ITEM_PIPELINES={

miao.pipelines.Pipeline00 :400,

miao.pipelines.Pipeline01 :401,

miao.pipelines.Pipeline02 :402,

miao.pipelines.Pipeline03 :403,

## ...

}

Middleware——中間件

通過Middleware我們可以對請求信息作出一些修改，比如常用的設置UA、代理、登錄信息等等都可以通過Middleware來配置。

0.Middleware的配置

與pipeline的配置類似，在setting.py中加入Middleware的名字，例如

DOWNLOADER_MIDDLEWARES={

"miao.middleware.UserAgentMiddleware":401,

"miao.middleware.ProxyMiddleware":402,

}

1.破網站查UA, 我要換UA

某些網站不帶UA是不讓訪問的。

在miao文件夾下面建立一個middleware.py

import random

agents=[

"Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US) AppleWebKit/532.5 (KHTML, like Gecko) Chrome/4.0.249.0 Safari/532.5",

"Mozilla/5.0 (Windows; U; Windows NT 5.2; en-US) AppleWebKit/532.9 (KHTML, like Gecko) Chrome/5.0.310.0 Safari/532.9",

"Mozilla/5.0 (Windows; U; Windows NT 5.1; en-US) AppleWebKit/534.7 (KHTML, like Gecko) Chrome/7.0.514.0 Safari/534.7",

"Mozilla/5.0 (Windows; U; Windows NT 6.0; en-US) AppleWebKit/534.14 (KHTML, like Gecko) Chrome/9.0.601.0 Safari/534.14",

"Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US) AppleWebKit/534.14 (KHTML, like Gecko) Chrome/10.0.601.0 Safari/534.14",

"Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US) AppleWebKit/534.20 (KHTML, like Gecko) Chrome/11.0.672.2 Safari/534.20",

"Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/534.27 (KHTML, like Gecko) Chrome/12.0.712.0 Safari/534.27",

"Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/535.1 (KHTML, like Gecko) Chrome/13.0.782.24 Safari/535.1",

]

classUserAgentMiddleware(object):

def process_request(self,request,spider):

agent=random.choice(agents)

request.headers["User-Agent"]=agent

這裡就是一個簡單的隨機更換UA的中間件，agents的內容可以自行擴充。

2.破網站封IP，我要用代理

比如本地127.0.0.1開啟了一個8123埠的代理，同樣可以通過中間件配置讓爬蟲通過這個代理來對目標網站進行爬取。

同樣在middleware.py中加入：

classProxyMiddleware(object):

def process_request(self,request,spider):

# 此處填寫你自己的代理

# 如果是買的代理的話可以去用API獲取代理列表然後隨機選擇一個

request.meta["proxy"]=proxy

很多網站會對訪問次數進行限制，如果訪問頻率過高的話會臨時禁封IP。

如果需要的話可以從網上購買IP，一般服務商會提供一個API來獲取當前可用的IP池，選一個填到這裡就好。

一些常用配置

在settings.py中的一些常用配置

# 間隔時間，單位秒。指明scrapy每兩個請求之間的間隔。

DOWNLOAD_DELAY=5

# 當訪問異常時是否進行重試

RETRY_ENABLED=True

# 當遇到以下http狀態碼時進行重試

RETRY_HTTP_CODES=[500,502,503,504,400,403,404,408]

# 重試次數

RETRY_TIMES=5

# Pipeline的並發數。同時最多可以有多少個Pipeline來處理item

CONCURRENT_ITEMS=200

# 並發請求的最大數

CONCURRENT_REQUESTS=100

# 對一個網站的最大並發數

CONCURRENT_REQUESTS_PER_DOMAIN=50

# 對一個IP的最大並發數

CONCURRENT_REQUESTS_PER_IP=50

我就是要用Pycharm

如果非要用Pycharm作為開發調試工具的話可以在運行配置里進行如下配置：

Configuration頁面：

Script填你的scrapy的cmdline.py路徑，比如我的是

/usr/local/lib/python2.7/dist-packages/scrapy/cmdline.py

然後在Scrpit parameters中填爬蟲的名字，本例中即為：

crawl NgaSpider

最後是Working diretory，找到你的settings.py文件，填這個文件所在的目錄。

示例：

從零開始的 Python 爬蟲速成指南

按小綠箭頭就可以愉快地調試了。

參考

這裡提供了對scrapy非常詳細的介紹。

http://scrapy-chs.readthedocs.io/zh_CN/0.24/

以下是幾個比較重要的地方：

scrapy的架構:

http://scrapy-chs.readthedocs.io/zh_CN/0.24/topics/architecture.html

xpath語法：

http://www.w3school.com.cn/xpath/xpath_syntax.asp

Pipeline管道配置：

http://scrapy-chs.readthedocs.io/zh_CN/0.24/topics/item-pipeline.html

Middleware中間件的配置：

http://scrapy-chs.readthedocs.io/zh_CN/0.24/topics/downloader-middleware.html

settings.py的配置：

http://scrapy-chs.readthedocs.io/zh_CN/0.24/topics/settings.html

最近熱文：

1、邀你參加11期程序員專場相親活動

2、PHP高工/架構師，18-50K，深圳南山

3、JAVA/Web前端，深圳前海，15-30K

4、如何判斷是否到了該辭職的時候？

喜歡這篇文章嗎？立刻分享出去讓更多人知道吧！

本站內容充實豐富，博大精深，小編精選每日熱門資訊，隨時更新，點擊「搶先收到最新資訊」瀏覽吧！

請您繼續閱讀更多來自 程序源 的精彩文章:

TAG:程序源 |

您可能感興趣

※下午茶速成手冊，High Tea，Low Tea，Afternoon Tea，你分清了沒有？
※Spring Cloud 微服務實戰速成指南
※Home Bar速成攻略
※如何快速成功買到紅色版iPhone7 Plus？
※小白學CNN以及Keras的速成
※改進PC架構：Optane加速成常態
※wish運營精英，這裡有一條快速成為wish大賣的捷徑！
※iPhone X 引領消費電子創新，推動產業鏈快速成長（上）
※給怕麻煩的你一套穿衣速成法【SangLuo-176期】
※拍照Pose入門速成法！
※為了cosplay街霸男主角「隆」他半個月速成肌肉男！
※為什麼OPPO、vivo可以迅速成為國產手機的第一品牌？
※為什麼OPPO、vivo可以迅速成為國產手機第一品牌？
※攻略篇：NeuroMem簡單圖形識別訓練速成
※柯達最新印前科技亮相China Print 2017——全面提高產能，力助印企快速成長
※全國第一單iPhone8誕生！蘇寧易購開售77秒火速成交
※觀賞魚世界水草造景速成班 step by step，簡單的水族造景
※好書 | 馬克·扎克伯克、lady gaga、papi醬，在快速變化的世界如何加速成功？
※獻上一份Word優雅裝逼指南，迅速成為老司機