站長(zhǎng)資訊網(wǎng)
        最全最豐富的資訊網(wǎng)站

        Python之Spider

        今天python視頻教程欄目為大家介紹Python的Spider (爬蟲(chóng))相關(guān)知識(shí)。

        Python之Spider

        一、網(wǎng)絡(luò)爬蟲(chóng)

        網(wǎng)絡(luò)爬蟲(chóng)又被稱(chēng)為網(wǎng)絡(luò)蜘蛛,我們可以把互聯(lián)網(wǎng)想象成一個(gè)蜘蛛網(wǎng),每一個(gè)網(wǎng)站都是一個(gè)節(jié)點(diǎn),我們可以使用一只蜘蛛去各個(gè)網(wǎng)頁(yè)抓取我們想要的資源。舉一個(gè)最簡(jiǎn)單的例子,你在百度和谷歌中輸入‘Python',會(huì)有大量和Python相關(guān)的網(wǎng)頁(yè)被檢索出來(lái),百度和谷歌是如何從海量的網(wǎng)頁(yè)中檢索出你想要的資源,他們靠的就是派出大量蜘蛛去網(wǎng)頁(yè)上爬取,檢索關(guān)鍵字,建立索引數(shù)據(jù)庫(kù),經(jīng)過(guò)復(fù)雜的排序算法,結(jié)果按照搜索關(guān)鍵字相關(guān)度的高低展現(xiàn)給你。

        千里之行,始于足下,我們從最基礎(chǔ)的開(kāi)始學(xué)習(xí)如何寫(xiě)一個(gè)網(wǎng)絡(luò)爬蟲(chóng),實(shí)現(xiàn)語(yǔ)言使用Python。

        二、Python如何訪(fǎng)問(wèn)互聯(lián)網(wǎng)

        想要寫(xiě)網(wǎng)絡(luò)爬蟲(chóng),第一步是訪(fǎng)問(wèn)互聯(lián)網(wǎng),Python如何訪(fǎng)問(wèn)互聯(lián)網(wǎng)呢?

        在Python中,我們使用urllib包訪(fǎng)問(wèn)互聯(lián)網(wǎng)。(在Python3中,對(duì)這個(gè)模塊做了比較大的調(diào)整,以前有urllib和urllib2,在3中對(duì)這兩個(gè)模塊做了統(tǒng)一合并,稱(chēng)為urllib包。包下面包含了四個(gè)模塊,urllib.request,urllib.error,urllib.parse,urllib.robotparser),目前主要使用的是urllib.request。

        我們首先舉一個(gè)最簡(jiǎn)單的例子,如何獲取獲取網(wǎng)頁(yè)的源碼:

        import urllib.request response = urllib.request.urlopen('https://docs.python.org/3/') html = response.read()print(html.decode('utf-8'))

        三、Python網(wǎng)絡(luò)簡(jiǎn)單使用

        首先我們用兩個(gè)小demo練一下手,一個(gè)是使用python代碼下載一張圖片到本地,另一個(gè)是調(diào)用有道翻譯寫(xiě)一個(gè)翻譯小軟件。

        3.1根據(jù)圖片鏈接下載圖片,代碼如下:

        import urllib.request  response = urllib.request.urlopen('http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg') image = response.read()  with open('123.jpg','wb') as f:     f.write(image)

        其中response是一個(gè)對(duì)象

        輸入:response.geturl()

        ->'http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg'
        輸入:response.info()

        -><http.client.HTTPMessage object at 0x10591c0b8>

        輸入:print(response.info())

        ->Content-Type: text/html
        Last-Modified: Mon, 27 Sep 2004 01:23:20 GMT
        Accept-Ranges: bytes
        ETag: "0f4b59230a4c41:0"
        Server: Microsoft-IIS/8.0
        Date: Sun, 14 Aug 2016 07:16:01 GMT
        Connection: close

        Content-Length: 2827

        輸入:response.getcode()

        ->200

        3.1使用有道詞典實(shí)現(xiàn)翻譯功能

        我們想實(shí)現(xiàn)翻譯功能,我們需要拿到請(qǐng)求鏈接。首先我們需要進(jìn)入有道首頁(yè),點(diǎn)擊翻譯,在翻譯界面輸入要翻譯的內(nèi)容,點(diǎn)擊翻譯按鈕,就會(huì)向服務(wù)器發(fā)起一個(gè)請(qǐng)求,我們需要做的就是拿到請(qǐng)求地址和請(qǐng)求參數(shù)。

        我在此使用谷歌瀏覽器實(shí)現(xiàn)拿到請(qǐng)求地址和請(qǐng)求參數(shù)。首先點(diǎn)擊右鍵,點(diǎn)擊檢查(不同瀏覽器點(diǎn)擊的選項(xiàng)可能不同,同一瀏覽器的不同版本也可能不同),進(jìn)入圖一所示,從中我們可以拿到請(qǐng)求請(qǐng)求地址和請(qǐng)求參數(shù),在Header中的Form Data中我們可以拿到請(qǐng)求參數(shù)。

        Python之Spider

        (圖一)

        代碼段如下:

        import urllib.requestimport urllib.parse  url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'data = {} data['type'] = 'AUTO'data['i'] = 'i love you'data['doctype'] = 'json'data['xmlVersion'] = '1.8'data['keyfrom'] = 'fanyi.web'data['ue'] = 'UTF-8'data['action'] = 'FY_BY_CLICKBUTTON'data['typoResult'] = 'true'data = urllib.parse.urlencode(data).encode('utf-8') response = urllib.request.urlopen(url,data) html = response.read().decode('utf-8')print(html)

        上述代碼執(zhí)行如下:

        {"type":"EN2ZH_CN","errorCode":0,"elapsedTime":0,"translateResult":[[{"src":"i love you","tgt":"我愛(ài)你"}]],"smartResult":{"type":1,"entries":["","我愛(ài)你。"]}}

        對(duì)于上述結(jié)果,我們可以看到是一個(gè)json串,我們可以對(duì)此解析一下,并且對(duì)代碼進(jìn)行完善一下:

        import urllib.requestimport urllib.parseimport json  url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'data = {} data['type'] = 'AUTO'data['i'] = 'i love you'data['doctype'] = 'json'data['xmlVersion'] = '1.8'data['keyfrom'] = 'fanyi.web'data['ue'] = 'UTF-8'data['action'] = 'FY_BY_CLICKBUTTON'data['typoResult'] = 'true'data = urllib.parse.urlencode(data).encode('utf-8') response = urllib.request.urlopen(url,data) html = response.read().decode('utf-8') target = json.loads(html)print(target['translateResult'][0][0]['tgt'])

        四、規(guī)避風(fēng)險(xiǎn)

        服務(wù)器檢測(cè)出請(qǐng)求不是來(lái)自瀏覽器,可能會(huì)屏蔽掉請(qǐng)求,服務(wù)器判斷的依據(jù)是使用‘User-Agent',我們可以修改改字段的值,來(lái)隱藏自己。代碼如下:

        import urllib.requestimport urllib.parseimport json  url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'data = {} data['type'] = 'AUTO'data['i'] = 'i love you'data['doctype'] = 'json'data['xmlVersion'] = '1.8'data['keyfrom'] = 'fanyi.web'data['ue'] = 'UTF-8'data['action'] = 'FY_BY_CLICKBUTTON'data['typoResult'] = 'true'data = urllib.parse.urlencode(data).encode('utf-8') req = urllib.request.Request(url, data) req.add_header('User-Agent','Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36') response = urllib.request.urlopen(url, data) html = response.read().decode('utf-8') target = json.loads(html)print(target['translateResult'][0][0]['tgt'])

        View Code

        上述做法雖然可以隱藏自己,但是還有很大問(wèn)題,例如一個(gè)網(wǎng)絡(luò)爬蟲(chóng)下載圖片軟件,在短時(shí)間內(nèi)大量下載圖片,服務(wù)器可以可以根據(jù)IP訪(fǎng)問(wèn)次數(shù)判斷是否是正常訪(fǎng)問(wèn)。所有上述做法還有很大的問(wèn)題。我們可以通過(guò)兩種做法解決辦法,一是使用延遲,例如5秒內(nèi)訪(fǎng)問(wèn)一次。另一種辦法是使用代理。

        延遲訪(fǎng)問(wèn)(休眠5秒,缺點(diǎn)是訪(fǎng)問(wèn)效率低下):

        import urllib.requestimport urllib.parseimport jsonimport timewhile True:     content = input('please input content(input q exit program):')    if content == 'q':        break;      url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'     data = {}     data['type'] = 'AUTO'     data['i'] = content     data['doctype'] = 'json'     data['xmlVersion'] = '1.8'     data['keyfrom'] = 'fanyi.web'     data['ue'] = 'UTF-8'     data['action'] = 'FY_BY_CLICKBUTTON'     data['typoResult'] = 'true'     data = urllib.parse.urlencode(data).encode('utf-8')     req = urllib.request.Request(url, data)     req.add_header('User-Agent','Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36')     response = urllib.request.urlopen(url, data)     html = response.read().decode('utf-8')     target = json.loads(html)    print(target['translateResult'][0][0]['tgt'])     time.sleep(5)

        View Code

        代理訪(fǎng)問(wèn):讓代理訪(fǎng)問(wèn)資源,然后講訪(fǎng)問(wèn)到的資源返回。服務(wù)器看到的是代理的IP地址,不是自己地址,服務(wù)器就沒(méi)有辦法對(duì)你做限制。

        步驟:

        1,參數(shù)是一個(gè)字典{'類(lèi)型' : '代理IP:端口號(hào)' } //類(lèi)型是http,https等

        proxy_support = urllib.request.ProxyHandler({})

        2,定制、創(chuàng)建一個(gè)opener

        opener = urllib.request.build_opener(proxy_support)

        3,安裝opener(永久安裝,一勞永逸)

        urllib.request.install_opener(opener)

        3,調(diào)用opener(調(diào)用的時(shí)候使用)

        opener.open(url)

        五、批量下載網(wǎng)絡(luò)圖片

        圖片下載來(lái)源為煎蛋網(wǎng)(http://jandan.net)

        圖片下載的關(guān)鍵是找到圖片的規(guī)律,如找到當(dāng)前頁(yè),每一頁(yè)的圖片鏈接,然后使用循環(huán)下載圖片。下面是程序代碼(待優(yōu)化,正則表達(dá)式匹配,IP代理):

        import urllib.requestimport osdef url_open(url):     req = urllib.request.Request(url)     req.add_header('User-Agent','Mozilla/5.0')     response = urllib.request.urlopen(req)     html = response.read()    return htmldef get_page(url):     html = url_open(url).decode('utf-8')     a = html.find('current-comment-page') + 23     b = html.find(']',a)    return html[a:b]def find_image(url):     html = url_open(url).decode('utf-8')     image_addrs = []     a = html.find('img src=')    while a != -1:         b = html.find('.jpg',a,a + 150)        if b != -1:             image_addrs.append(html[a+9:b+4])        else:             b = a + 9         a = html.find('img src=',b)    for each in image_addrs:        print(each)    return image_addrsdef save_image(folder,image_addrs):    for each in image_addrs:         filename = each.split('/')[-1]         with open(filename,'wb') as f:             img = url_open(each)             f.write(img)def download_girls(folder = 'girlimage',pages = 20):     os.mkdir(folder)     os.chdir(folder)     url = 'http://jandan.net/ooxx/'     page_num = int(get_page(url))    for i in range(pages):         page_num -= i         page_url = url + 'page-' + str(page_num) + '#comments'         image_addrs = find_image(page_url)         save_image(folder,image_addrs)if __name__ == '__main__':     download_girls()

        代碼運(yùn)行效果如下:Python之Spider

        贊(0)
        分享到: 更多 (0)
        網(wǎng)站地圖   滬ICP備18035694號(hào)-2    滬公網(wǎng)安備31011702889846號(hào)
        主站蜘蛛池模板: 国产精品亚洲日韩欧美色窝窝色欲| 99热门精品一区二区三区无码| 国产精品看高国产精品不卡| 久久精品国产精品亚洲人人 | 久久免费精品一区二区| 亚洲av无码精品网站| 久久久久久噜噜精品免费直播| 99久久精品免费看国产| 国产小视频国产精品| 国精无码欧精品亚洲一区| 无码人妻精品一区二区三区久久 | 亚洲欧美日韩精品久久亚洲区 | 成人国产精品动漫欧美一区| 精品免费人成视频app| 亚洲性日韩精品一区二区三区| 九九久久精品无码专区| 国产精品高清2021在线| 久久国产精品成人免费| 国产成人亚洲合集青青草原精品 | 国产精品一区在线观看你懂的| 精品视频一区二区三区免费| 9久久9久久精品| 精品国产一区二区三区免费| 国产精品手机在线| 国产精品久久久久9999高清| 国产精品莉莉欧美自在线线 | 四虎精品成人免费视频| 久久精品女人天堂AV麻| 精品久久人人妻人人做精品| 精品精品国产欧美在线小说区 | 亚洲精品成人片在线观看| 亚洲国产精品自在拍在线播放| 三级国产精品| 亚洲精品国产精品乱码在线观看| 亚洲精品国产精品乱码不卡√| 久久香综合精品久久伊人| 久久久久久亚洲精品成人| 国产精品无码AV一区二区三区| 99久久99这里只有免费费精品| 精品一区二区三区在线视频| wwwvr高清亚洲精品二区|