日韩久久久精品,亚洲精品久久久久久久久久久,亚洲欧美一区二区三区国产精品 ,一区二区福利

25、Python快速開發(fā)分布式搜索引擎Scrapy精講—Requests請求

系統(tǒng) 1760 0

【百度云搜索,搜各種資料:http://www.lqkweb.com】

【搜網(wǎng)盤,搜各種資料:http://www.swpan.cn】

Requests請求

Requests請求就是我們在爬蟲文件寫的 Requests()方法,也就是提交一個請求地址, Requests請求是我們自定義的 * *

Requests()方法提交一個請求

  參數(shù):

  url= ?字符串類型url地址

  callback= 回調(diào)函數(shù)名稱

  method= 字符串類型請求方式,如果GET,POST

  headers= 字典類型的,瀏覽器用戶代理

  cookies= 設(shè)置cookies

  meta= 字典類型鍵值對,向回調(diào)函數(shù)直接傳一個指定值

  encoding= 設(shè)置網(wǎng)頁編碼

  priority= 默認為0,如果設(shè)置的越高,越優(yōu)先調(diào)度

  dont_filter= 默認為False,如果設(shè)置為真,會過濾掉當前url

          
            #?-*-?coding:?utf-8?-*-
import?scrapy
from?scrapy.http?import?Request,FormRequest
import?re

class?PachSpider(scrapy.Spider):????????????????????????????#定義爬蟲類,必須繼承scrapy.Spider
????name?=?'pach'???????????????????????????????????????????#設(shè)置爬蟲名稱
????allowed_domains?=?['www.luyin.org/']????????????????????#爬取域名
????#?start_urls?=?['']?????????????????????????????????????#爬取網(wǎng)址,只適于不需要登錄的請求,因為沒法設(shè)置cookie等信息

????header?=?{'User-Agent':'Mozilla/5.0?(Windows?NT?10.0;?WOW64;?rv:54.0)?Gecko/20100101?Firefox/54.0'}??#設(shè)置瀏覽器用戶代理

????def?start_requests(self):????#起始url函數(shù),會替換start_urls
????????"""第一次請求一下登錄頁面,設(shè)置開啟cookie使其得到cookie,設(shè)置回調(diào)函數(shù)"""
????????return?[Request(
????????????url='http://www.luyin.org/',
????????????headers=self.header,
????????????meta={'cookiejar':1},???????#開啟Cookies記錄,將Cookies傳給回調(diào)函數(shù)
????????????callback=self.parse
????????)]

????def?parse(self,?response):
????????title?=?response.xpath('/html/head/title/text()').extract()
????????print(title)
          
        

?

Response響應(yīng)

Response響應(yīng)是由downloader返回的響應(yīng)

Response響應(yīng)參數(shù)
  headers 返回響應(yīng)頭
  status 返回狀態(tài)嗎
  body 返回頁面內(nèi)容,字節(jié)類型
  url 返回抓取url

          
            #?-*-?coding:?utf-8?-*-
import?scrapy
from?scrapy.http?import?Request,FormRequest
import?re

class?PachSpider(scrapy.Spider):????????????????????????????#定義爬蟲類,必須繼承scrapy.Spider
????name?=?'pach'???????????????????????????????????????????#設(shè)置爬蟲名稱
????allowed_domains?=?['www.luyin.org/']????????????????????#爬取域名
????#?start_urls?=?['']?????????????????????????????????????#爬取網(wǎng)址,只適于不需要登錄的請求,因為沒法設(shè)置cookie等信息

????header?=?{'User-Agent':'Mozilla/5.0?(Windows?NT?10.0;?WOW64;?rv:54.0)?Gecko/20100101?Firefox/54.0'}??#設(shè)置瀏覽器用戶代理

????def?start_requests(self):????#起始url函數(shù),會替換start_urls
????????"""第一次請求一下登錄頁面,設(shè)置開啟cookie使其得到cookie,設(shè)置回調(diào)函數(shù)"""
????????return?[Request(
????????????url='http://www.luyin.org/',
????????????headers=self.header,
????????????meta={'cookiejar':1},???????#開啟Cookies記錄,將Cookies傳給回調(diào)函數(shù)
????????????callback=self.parse
????????)]

????def?parse(self,?response):
????????title?=?response.xpath('/html/head/title/text()').extract()
????????print(title)
????????print(response.headers)
????????print(response.status)
????????#?print(response.body)
????????print(response.url)
          
        


更多文章、技術(shù)交流、商務(wù)合作、聯(lián)系博主

微信掃碼或搜索:z360901061

微信掃一掃加我為好友

QQ號聯(lián)系: 360901061

您的支持是博主寫作最大的動力,如果您喜歡我的文章,感覺我的文章對您有幫助,請用微信掃描下面二維碼支持博主2元、5元、10元、20元等您想捐的金額吧,狠狠點擊下面給點支持吧,站長非常感激您!手機微信長按不能支付解決辦法:請將微信支付二維碼保存到相冊,切換到微信,然后點擊微信右上角掃一掃功能,選擇支付二維碼完成支付。

【本文對您有幫助就好】

您的支持是博主寫作最大的動力,如果您喜歡我的文章,感覺我的文章對您有幫助,請用微信掃描上面二維碼支持博主2元、5元、10元、自定義金額等您想捐的金額吧,站長會非常 感謝您的哦!!!

發(fā)表我的評論
最新評論 總共0條評論
主站蜘蛛池模板: 杭锦旗| 郴州市| 石棉县| 浑源县| 出国| 来宾市| 大足县| 仙游县| 夏邑县| 江孜县| 丰顺县| 高邑县| 海口市| 宁阳县| 民勤县| 莫力| 敖汉旗| 大渡口区| 广宗县| 巴林左旗| 敖汉旗| 英超| 视频| 大化| 井陉县| 炉霍县| 定南县| 夏津县| 思茅市| 璧山县| 太原市| 鹤山市| 深水埗区| 济阳县| 莆田市| 云龙县| 思茅市| 焦作市| 崇文区| 尤溪县| 固原市|