文章詳情頁

Python爬蟲之Spider類用法簡單介紹

瀏覽：76日期：2022-07-15 10:33:16

一、網(wǎng)絡(luò)爬蟲

網(wǎng)絡(luò)爬蟲又被稱為網(wǎng)絡(luò)蜘蛛（🕷️），我們可以把互聯(lián)網(wǎng)想象成一個(gè)蜘蛛網(wǎng)，每一個(gè)網(wǎng)站都是一個(gè)節(jié)點(diǎn)，我們可以使用一只蜘蛛去各個(gè)網(wǎng)頁抓取我們想要的資源。舉一個(gè)最簡單的例子，你在百度和谷歌中輸入‘Python’，會(huì)有大量和Python相關(guān)的網(wǎng)頁被檢索出來，百度和谷歌是如何從海量的網(wǎng)頁中檢索出你想要的資源，他們靠的就是派出大量蜘蛛去網(wǎng)頁上爬取，檢索關(guān)鍵字，建立索引數(shù)據(jù)庫，經(jīng)過復(fù)雜的排序算法，結(jié)果按照搜索關(guān)鍵字相關(guān)度的高低展現(xiàn)給你。

千里之行，始于足下，我們從最基礎(chǔ)的開始學(xué)習(xí)如何寫一個(gè)網(wǎng)絡(luò)爬蟲，實(shí)現(xiàn)語言使用Python。

二、Python如何訪問互聯(lián)網(wǎng)

想要寫網(wǎng)絡(luò)爬蟲，第一步是訪問互聯(lián)網(wǎng)，Python如何訪問互聯(lián)網(wǎng)呢？

在Python中，我們使用urllib包訪問互聯(lián)網(wǎng)。（在Python3中，對這個(gè)模塊做了比較大的調(diào)整，以前有urllib和urllib2,在3中對這兩個(gè)模塊做了統(tǒng)一合并，稱為urllib包。包下面包含了四個(gè)模塊，urllib.request，urllib.error，urllib.parse，urllib.robotparser），目前主要使用的是urllib.request。

我們首先舉一個(gè)最簡單的例子，如何獲取獲取網(wǎng)頁的源碼：

import urllib.requestresponse = urllib.request.urlopen(’https://docs.python.org/3/’)html = response.read()print(html.decode(’utf-8’))

三、Python網(wǎng)絡(luò)簡單使用

首先我們用兩個(gè)小demo練一下手，一個(gè)是使用python代碼下載一張圖片到本地，另一個(gè)是調(diào)用有道翻譯寫一個(gè)翻譯小軟件。

3.1根據(jù)圖片鏈接下載圖片，代碼如下：

import urllib.requestresponse = urllib.request.urlopen(’http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg’)image = response.read()with open(’123.jpg’,’wb’) as f: f.write(image)

其中response是一個(gè)對象

輸入：response.geturl()->’http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg’

輸入：response.info()-><http.client.HTTPMessage object at 0x10591c0b8>

輸入：print(response.info())->Content-Type: text/htmlLast-Modified: Mon, 27 Sep 2004 01:23:20 GMTAccept-Ranges: bytesETag: '0f4b59230a4c41:0'Server: Microsoft-IIS/8.0Date: Sun, 14 Aug 2016 07:16:01 GMTConnection: closeContent-Length: 2827

輸入：response.getcode()->200

3.2使用有道詞典實(shí)現(xiàn)翻譯功能

我們想實(shí)現(xiàn)翻譯功能，我們需要拿到請求鏈接。首先我們需要進(jìn)入有道首頁，點(diǎn)擊翻譯，在翻譯界面輸入要翻譯的內(nèi)容，點(diǎn)擊翻譯按鈕，就會(huì)向服務(wù)器發(fā)起一個(gè)請求，我們需要做的就是拿到請求地址和請求參數(shù)。

我在此使用谷歌瀏覽器實(shí)現(xiàn)拿到請求地址和請求參數(shù)。首先點(diǎn)擊右鍵，點(diǎn)擊檢查（不同瀏覽器點(diǎn)擊的選項(xiàng)可能不同，同一瀏覽器的不同版本也可能不同），進(jìn)入圖一所示，從中我們可以拿到請求請求地址和請求參數(shù)，在Header中的Form Data中我們可以拿到請求參數(shù)。

Python爬蟲之Spider類用法簡單介紹

（圖一）

代碼段如下：

import urllib.requestimport urllib.parseurl = ’http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index’data = {}data[’type’] = ’AUTO’data[’i’] = ’i love you’data[’doctype’] = ’json’data[’xmlVersion’] = ’1.8’data[’keyfrom’] = ’fanyi.web’data[’ue’] = ’UTF-8’data[’action’] = ’FY_BY_CLICKBUTTON’data[’typoResult’] = ’true’data = urllib.parse.urlencode(data).encode(’utf-8’)response = urllib.request.urlopen(url,data)html = response.read().decode(’utf-8’)print(html)

上述代碼執(zhí)行如下：

{'type':'EN2ZH_CN','errorCode':0,'elapsedTime':0,'translateResult':[[{'src':'i love you','tgt':'我愛你'}]],'smartResult':{'type':1,'entries':['','我愛你。']}}

對于上述結(jié)果，我們可以看到是一個(gè)json串，我們可以對此解析一下，并且對代碼進(jìn)行完善一下：

import urllib.requestimport urllib.parseimport jsonurl = ’http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index’data = {}data[’type’] = ’AUTO’data[’i’] = ’i love you’data[’doctype’] = ’json’data[’xmlVersion’] = ’1.8’data[’keyfrom’] = ’fanyi.web’data[’ue’] = ’UTF-8’data[’action’] = ’FY_BY_CLICKBUTTON’data[’typoResult’] = ’true’data = urllib.parse.urlencode(data).encode(’utf-8’)response = urllib.request.urlopen(url,data)html = response.read().decode(’utf-8’)target = json.loads(html)print(target[’translateResult’][0][0][’tgt’])

四、規(guī)避風(fēng)險(xiǎn)

服務(wù)器檢測出請求不是來自瀏覽器，可能會(huì)屏蔽掉請求，服務(wù)器判斷的依據(jù)是使用‘User-Agent’,我們可以修改改字段的值，來隱藏自己。代碼如下：

import urllib.requestimport urllib.parseimport jsonurl = ’http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index’data = {}data[’type’] = ’AUTO’data[’i’] = ’i love you’data[’doctype’] = ’json’data[’xmlVersion’] = ’1.8’data[’keyfrom’] = ’fanyi.web’data[’ue’] = ’UTF-8’data[’action’] = ’FY_BY_CLICKBUTTON’data[’typoResult’] = ’true’data = urllib.parse.urlencode(data).encode(’utf-8’)req = urllib.request.Request(url, data)req.add_header(’User-Agent’,’Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36’)response = urllib.request.urlopen(url, data)html = response.read().decode(’utf-8’)target = json.loads(html)print(target[’translateResult’][0][0][’tgt’])

上述做法雖然可以隱藏自己，但是還有很大問題，例如一個(gè)網(wǎng)絡(luò)爬蟲下載圖片軟件，在短時(shí)間內(nèi)大量下載圖片，服務(wù)器可以可以根據(jù)IP訪問次數(shù)判斷是否是正常訪問。所有上述做法還有很大的問題。我們可以通過兩種做法解決辦法，一是使用延遲，例如5秒內(nèi)訪問一次。另一種辦法是使用代理。

延遲訪問（休眠5秒，缺點(diǎn)是訪問效率低下）：

import urllib.requestimport urllib.parseimport jsonimport timewhile True: content = input(’please input content(input q exit program):’) if content == ’q’: break; url = ’http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index’ data = {} data[’type’] = ’AUTO’ data[’i’] = content data[’doctype’] = ’json’ data[’xmlVersion’] = ’1.8’ data[’keyfrom’] = ’fanyi.web’ data[’ue’] = ’UTF-8’ data[’action’] = ’FY_BY_CLICKBUTTON’ data[’typoResult’] = ’true’ data = urllib.parse.urlencode(data).encode(’utf-8’) req = urllib.request.Request(url, data) req.add_header(’User-Agent’,’Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36’) response = urllib.request.urlopen(url, data) html = response.read().decode(’utf-8’) target = json.loads(html) print(target[’translateResult’][0][0][’tgt’]) time.sleep(5)

代理訪問：讓代理訪問資源，然后講訪問到的資源返回。服務(wù)器看到的是代理的IP地址，不是自己地址，服務(wù)器就沒有辦法對你做限制。

步驟：

1，參數(shù)是一個(gè)字典｛’類型’ : ’代理IP：端口號(hào)’ ｝ //類型是http,https等proxy_support = urllib.request.ProxyHandler({})

2，定制、創(chuàng)建一個(gè)openeropener = urllib.request.build_opener(proxy_support)

3，安裝opener(永久安裝，一勞永逸)urllib.request.install_opener(opener)

4，調(diào)用opener（調(diào)用的時(shí)候使用）opener.open(url)

五、批量下載網(wǎng)絡(luò)圖片

圖片下載來源為煎蛋網(wǎng)（http://jandan.net)

圖片下載的關(guān)鍵是找到圖片的規(guī)律，如找到當(dāng)前頁，每一頁的圖片鏈接，然后使用循環(huán)下載圖片。下面是程序代碼（待優(yōu)化,正則表達(dá)式匹配，IP代理）：

import urllib.requestimport osdef url_open(url): req = urllib.request.Request(url) req.add_header(’User-Agent’,’Mozilla/5.0’) response = urllib.request.urlopen(req) html = response.read() return htmldef get_page(url): html = url_open(url).decode(’utf-8’) a = html.find(’current-comment-page’) + 23 b = html.find(’]’,a) return html[a:b]def find_image(url): html = url_open(url).decode(’utf-8’) image_addrs = [] a = html.find(’img src=’) while a != -1: b = html.find(’.jpg’,a,a + 150) if b != -1: image_addrs.append(html[a+9:b+4]) else: b = a + 9 a = html.find(’img src=’,b) for each in image_addrs: print(each) return image_addrsdef save_image(folder,image_addrs): for each in image_addrs: filename = each.split(’/’)[-1] with open(filename,’wb’) as f: img = url_open(each) f.write(img)def download_girls(folder = ’girlimage’,pages = 20): os.mkdir(folder) os.chdir(folder) url = ’http://jandan.net/ooxx/’ page_num = int(get_page(url)) for i in range(pages): page_num -= i page_url = url + ’page-’ + str(page_num) + ’#comments’ image_addrs = find_image(page_url) save_image(folder,image_addrs)if __name__ == ’__main__’: download_girls()

代碼運(yùn)行效果如下：

Python爬蟲之Spider類用法簡單介紹

到此這篇關(guān)于Python爬蟲之Spider類用法簡單介紹的文章就介紹到這了,更多相關(guān)Python爬蟲Spider類內(nèi)容請搜索好吧啦網(wǎng)以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持好吧啦網(wǎng)！

Python 編程

上一條：Python模塊zipfile原理及使用方法詳解下一條：Python連接Impala實(shí)現(xiàn)步驟解析

相關(guān)文章：

1. Jsp中request的3個(gè)基礎(chǔ)實(shí)踐2. 三個(gè)不常見的 HTML5 實(shí)用新特性簡介3. ASP基礎(chǔ)入門第三篇(ASP腳本基礎(chǔ))4. 得到XML文檔大小的方法5. 將properties文件的配置設(shè)置為整個(gè)Web應(yīng)用的全局變量實(shí)現(xiàn)方法6. CSS Hack大全-教你如何區(qū)分出IE6-IE10、FireFox、Chrome、Opera7. jsp網(wǎng)頁實(shí)現(xiàn)貪吃蛇小游戲8. XML解析錯(cuò)誤：未組織好的解決辦法9. React實(shí)現(xiàn)一個(gè)倒計(jì)時(shí)hook組件實(shí)戰(zhàn)示例10. 解析原生JS getComputedStyle

排行榜

					
					源碼解讀Spring-Integration執(zhí)行過程
IntelliJ IDEA創(chuàng)建web項(xiàng)目的方法
XML解析錯(cuò)誤：未組織好 的解決辦法
python小白切忌亂用表達(dá)式
Nginx+php配置文件及原理解析
vue路由切換時(shí)取消之前的所有請求操作
詳解JavaScript原型與原型鏈
如何在jsp界面中插入圖片
ASP基礎(chǔ)入門第三篇(ASP腳本基礎(chǔ))
得到XML文檔大小的方法
Ajax請求超時(shí)與網(wǎng)絡(luò)異常處理圖文詳解