4.urllib庫(kù)的高級(jí)用法
有些網(wǎng)站不會(huì)同意程序直接用上面的方式進(jìn)行訪問,如果識(shí)別有問題,那么站點(diǎn)根本不會(huì)響應(yīng),所以為了完全模擬瀏覽器的工作
1.1 設(shè)置請(qǐng)求頭
其中User-Agent
代碼如下:
from urllib.request import urlopen
from urllib.request import Request
url = 'http://www.server.com/login'
user_agent = 'Mozilla/4.0 (compatible; MSIE 5.5; Windows NT)'
headers = { 'User-Agent' : user_agent } ?
request = Request(url, headers=headers) ?
response = urlopen(request) ?
page = response.read()
對(duì)付防盜鏈,服務(wù)器會(huì)識(shí)別headers中的referer是不是它自己,如果不是,有的服務(wù)器不會(huì)響應(yīng),所以我們還可以在headers中加入referer
代碼如下:
headers = {
? ? ? ? 'User-Agent' : 'Mozilla/4.0 (compatible; MSIE 5.5; Windows NT)',
? ? ? ? 'Referer':'http://www.zhihu.com/articles'
? ? ? ? ?}
提示
在此可以使用多個(gè)User_Agent:然后隨即選擇
import urllib.request
import random
ua_list = [
? ?"Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 6.0)",
? ?"Mozilla/5.0 (Windows; U; Windows NT 5.2) Gecko/2008070208 Firefox/3.0.1",
? ?"Mozilla/5.0 (Windows; U; Windows NT 5.2) AppleWebKit/525.13 (KHTML, like Gecko) Version/3.1",
? ?"Mozilla/5.0 (Windows; U; Windows NT 5.2) AppleWebKit/525.13 (KHTML, like Gecko) Chrome/0.2.149.27",
? ?"Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 5.1; Trident/4.0; Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; SV1) ; ?QIHU 360EE)"
]
user_agent = random.choice(ua_list)
request = urllib.request.Request("http://www.baidu.com")
request.add_header("User-Agent",user_agent)
#區(qū)分大小寫
print(request.get_header("User-agent"))
1.2 設(shè)置代理Proxy
假如一個(gè)網(wǎng)站它會(huì)檢測(cè)某一段時(shí)間某個(gè)IP 的訪問次數(shù),如果訪問次數(shù)過多,它會(huì)禁止你的訪問。所以你可以設(shè)置一些代理服務(wù)器來幫助你做工作,每隔一段時(shí)間換一個(gè)代理,網(wǎng)站君都不知道是誰在搗鬼了,這酸爽!
分類:
透明代理:目標(biāo)網(wǎng)站知道你使用了代理并且知道你的源IP地址,這種代理顯然不符合我們這里使用代理的初衷
匿名代理:匿名程度比較低,也就是網(wǎng)站知道你使用了代理,但是并不知道你的源IP地址
高匿代理:這是最保險(xiǎn)的方式,目標(biāo)網(wǎng)站既不知道你使用的代理更不知道你的源IP
代碼如下:
from urllib.request import ProxyHandler
from urllib.request import build_opener
proxy = ProxyHandler({"http": "119.109.197.195:80"})
opener = build_opener(proxy)
url = "http://www.baidu.com"
response = opener.open(url)
print(response.read().decode("utf-8"))
2 使用DebugLog
可以通過下面的方法把 Debug Log 打開,這樣收發(fā)包的內(nèi)容就會(huì)在屏幕上打印出來,方便調(diào)試,這個(gè)也不太常用,僅提一下
from urllib.request import HTTPHandler
from urllib.request import build_opener
from urllib.request import Request
handler = HTTPHandler(debuglevel=1)
opener = build_opener(handler)
url = "http://www.sohu.com"
request = Request(url)
response = opener.open(request)